跳转到主要内容
ToolPotion

最佳 机器学习与数据科学 AI工具

1,073 个工具

发现最佳的机器学习与数据科学工具——从AI应用和模型到移动应用、框架和平台,这是数据科学家和机器学习工程师找到提升工作流程的工具的地方:训练模型、部署AI解决方案、可视化数据和优化算法。 浏览 1,073 个最佳 机器学习与数据科学 AI工具,涵盖 AI 应用, AI 模型, AI 移动应用, AI 框架AI 平台 等——每个条目上线前都经过人工审核,并以11种语言发布。

Visionati 提供统一的 API,可同时使用 OpenAI、Claude 和 Gemini 等多个 AI 模型来描述图像。比较来自不同模型的描述、标签和检测结果,以提取全面的视觉洞察。非常适合寻求高级图像分析功能的开发人员和企业。

计算机视觉工具

ChatPhoto 在几秒钟内将图像转换为文本和对话。上传照片,询问有关其内容的问题,并获得富有洞察力的回复。它支持文本和非文本图像,提供了一种提取信息和生成标题或描述的独特方式。ChatPhoto 通过多种语言响应来打破语言障碍。

计算机视觉工具

OpenALPR 提供先进的自动车牌识别 (LPR) 和车辆智能解决方案。它增强了安全摄像头,可实时识别车辆品牌、型号、颜色和行驶方向。非常适合执法、安全和业务自动化,可提供可操作的数据以提高安全性和效率。

计算机视觉工具

AI 应用

Flypix AI 提供人工智能驱动的地理空间解决方案,用于分析卫星、航空和无人机影像。它能自动化检测、监控和检查任务,为用户节省大量时间和精力。该平台专为各行业设计,支持为特定需求定制人工智能模型训练。

计算机视觉工具

AI 移动应用

这款 Chrome 扩展程序使用内部 OCR 引擎捕获和转换图像为文本。它支持 100 多种语言、自动方向和脚本检测。该工具离线处理 OCR,为各种文档类型和网页提供灵活性,并提供通过修改图像重试以提高准确性的选项。

计算机视觉工具

AI 应用

Snippai 是一款由 AI 驱动的截图工具,其功能远超基本的图像捕获。它能智能分析图像,将公式提取为 LaTeX,识别文本,将表格识别为 Markdown,描述图像内容,解释代码片段,并提取主色调。敬请期待更多高级 AI 功能。

计算机视觉工具

KBY-AI 提供本地部署的身份验证解决方案,并提供永久许可证。其人工智能驱动的 SDK 包括排名靠前的面部识别、活体检测、身份证件识别和掌纹识别,为寻求安全验证流程的企业提供强大而准确的身份验证。

计算机视觉工具

arivis Cloud 提供自动化的显微镜图像分析解决方案,利用深度学习和自定义工作流。它使生物技术研究人员能够自动化重复性任务,提高吞吐量并加速商业化。该平台提供经济高效的云基础设施,用于安全、灵活和移动的图像分析,无需编码。

计算机视觉工具医疗健康与生命科学

软银将通过简易合并吸收其全资子公司日本计算机视觉公司(JCV)。此举旨在通过整合JCV的图像识别和面部识别解决方案,统一管理、精简运营,并提升软银集团的整体企业价值。

计算机视觉工具

Candy 是一款由 AI 驱动的 Chrome 扩展程序,可根据下载图片的实际内容自动为其生成描述性文件名。这有助于更好地组织、简化分享,并通过提供新的视角来激发创意。它通过本地 AI 分析来优先保护用户隐私。

计算机视觉工具

ScentSnap 是一款由人工智能驱动的移动应用程序,旨在即时识别香水。用户可以扫描香水瓶以获取详细信息,包括香调、气味特征、可比香水和专家评论。它还可以作为香水收藏管理器,根据用户偏好和保存的香气提供个性化推荐。

计算机视觉工具

CarSnap 是一款由人工智能驱动的移动应用程序,它利用图像识别技术,能够即时识别照片中的汽车品牌、型号和年份。它提供包括速度、加速、价格和稀有度在内的详细信息,帮助汽车爱好者了解他们遇到的车辆。

计算机视觉工具

Logo Identifier 是一款免费的 AI 驱动的移动应用程序,可扫描徽标以提供品牌琐事和信息。用户可以通过拍照或从图库中选择来即时识别徽标,使其成为了解品牌和玩徽标测验的有趣工具。

计算机视觉工具

AI 移动应用

Scan2AI 是一款 Chrome 扩展程序,可捕获网页资源以供 AI 处理。它允许用户选择任何屏幕区域进行即时分析、翻译或数据提取。该工具提供用户友好的界面和高效率,以增强生产力,并确保安全和私密的数据处理。

计算机视觉工具

CrossPrism Nature Guide 是一款由 AI 驱动的移动应用,可离线识别植物、真菌和动物。它提供数千种物种的实时识别功能,让用户无需互联网连接即可探索和记录自然世界,是户外爱好者和自然爱好者的理想选择。

计算机视觉工具

AI 移动应用

Gtres AI 是一款由 AI 驱动的 Chrome 浏览器反向图片搜索引擎。它允许用户在 GTRES 图片库中查找相似的编辑类和创意类图片。该工具非常适合编辑人员,能够通过公众人物或上下文识别图片,缩短搜索时间并提供灵感。

计算机视觉工具媒体与娱乐

AI 移动应用

Whatshisface 是一款专为 Netflix 用户设计的 Chrome 扩展程序。它利用面部识别技术和 IMDb 数据库来识别屏幕上的演员。该扩展程序直接在 Netflix 界面内显示演员的图片、姓名和角色名称,从而提升了影迷的观看体验。

计算机视觉工具媒体与娱乐

AI 移动应用

Grab 'n Tag 是一款 Chrome 扩展程序,允许用户从网页中批量下载图片。它利用 AI 图像识别技术,根据图片内容智能命名下载的图片,避免了通用的文件名。该工具简化了从网站收集图片的过程,为需要整理图片素材的用户节省了时间和精力。

计算机视觉工具

api4ai的API可识别照片中的200多种家具和家居用品。它提供准确的检测、分类和计数,为室内设计、房地产、零售业简化库存管理,并提高搬家服务的效率。通过简化的照片物品识别来改进业务运营。

计算机视觉工具

Pipeless Agents 将任何视频流转换为可操作的数据流。这个无服务器的 Vision AI 平台可自动处理视觉输入任务,让您连接视频源并接收结构化数据。通过电子邮件或 Google 免费开始,无需信用卡。

计算机视觉工具

AI 应用

Epigos AI 提供了一个全面的计算机视觉平台,适用于企业。它使用户能够标注数据、训练强大的 AI 模型,并将它们无缝部署到生产环境中。通过先进的计算机视觉能力,转变运营、自动化流程并驱动智能决策。

计算机视觉工具

AI 移动应用

ABC Finder 是一款引人入胜的 iPhone 游戏,旨在帮助幼儿学习字母表。它包含两种互动模式:一种是利用 AI 图像识别来识别物体及其首字母的相机寻物游戏,另一种是经典的配对游戏。精美的 3D 表情符号、舒缓的音乐和俏皮的设计增强了学习体验。

计算机视觉工具

AI 移动应用

Smart Screen 是一款 Chrome 扩展程序,可自动识别 Netflix 上的演员。它使用 AI 分析屏幕上的面孔,提供有关他们其他作品的补充信息,并推荐类似内容。使用 Disruptel 的这款互动工具,提升您的观影体验。

计算机视觉工具媒体与娱乐

图片转文字:扫描转换使用 OCR 技术高精度提取图像中的文本。支持超过 100 种语言,包括手写体,并允许将提取的文本共享或导出为文本或 PDF 文件。可在应用内直接编辑和复制文本,实现高效文档处理。

计算机视觉工具

PreCheck 是一个人工智能驱动的平台,用于面部识别和人脸搜索。它帮助个人和企业监控在线图像、保护隐私、管理在线声誉并防止欺诈。凭借 99% 的准确率,它提供反向电话和电子邮件查找,并识别未经授权的图像在网络上的使用情况。

计算机视觉工具

VisionLabs 提供先进的人脸和物体识别技术。其解决方案被银行、政府机构和企业用于用户身份识别、车辆监控和增强安全等应用。VisionLabs 专注于准确性和可靠性,为多样化的行业需求提供强大的计算机视觉工具。

计算机视觉工具

AI 应用

Custom Vision 使您能够轻松创建最先进的计算机视觉模型,以满足特定用例的需求。通过提供已标记的图像,该平台会自动处理训练过程,并通过简单的 REST API 实现快速图像标记。它简化了各种应用的视觉智能。

计算机视觉工具

Lenso.ai 提供 AI 驱动的反向图片搜索,用于查找地点、人物和重复图片。利用面部识别技术追踪您的数字足迹或发现版权侵权。通过高级筛选器和开发者 API 探索数十亿张图片,无缝集成到您的应用程序中。

计算机视觉工具

AI 应用

GenXi 提供由 AI 驱动的工具,可将文本转化为逼真的图像和视频。创建艺术作品,通过 AI 聊天机器人生成即时答案,设计徽标,以及制作脚本动画。它易于使用,让任何人都能利用先进的 AI 技术将他们的想象力变为现实。免费试用。

计算机视觉工具

Liner.ai 是一个免费的无代码平台,用于构建和部署机器学习模型。它通过允许用户导入数据、一键训练模型并将它们导出以集成到应用程序中来简化机器学习。无需编码或机器学习专业知识,对初学者也很友好。

计算机视觉工具

AI 应用

Remyx AI 为 AI 团队提供决策智能,帮助他们确定下一步要交付什么。它分析评估、实验和生产结果,以推荐最具影响力的更改,并能发现那些不会提高性能的更改。该平台与现有堆栈集成,以简化 AI 开发生命周期。

MLOps 与模型部署

AI 应用

Xander 是一个开源的桌面平台,用于自动化 AI 模型训练。它允许用户通过自然语言描述需求来训练各种任务的模型,包括文本分类、LLM 微调和图像分析。该平台在本地处理数据管理、架构选择和超参数优化。

机器学习平台

AI 应用

Plexe AI 将您的数据转化为定制的机器学习模型,只需自然语言提示。它自动化了从数据连接和质量检查到模型构建和部署的整个过程,为寻求利用 AI 的企业提供完全的透明度和可操作的见解。

机器学习平台

Akkio 是一个专为媒体代理机构设计的 AI 工作流自动化平台。它集中管理数据和知识,使团队能够进行策略规划、受众细分、媒体规划、广告活动部署和效果衡量。通过特定应用的 AI 工具,加速客户交付并提升广告活动成效。

自然语言处理工具

AI 应用

Pixelcode 将代码截图转换为可编辑代码。通过 Chrome 扩展程序访问,支持 30 多种编程语言,并保留格式。通过即时将图像、视频和 PDF 中的代码提取到剪贴板来节省时间,显著提高开发人员的生产力。

计算机视觉工具

AI 应用

Eden AI 提供统一的 API,可访问 500 多个领先的 AI 模型,包括 LLM 以及用于语音、视觉和 OCR 的专业 AI。它支持基于成本、性能和区域的智能路由,并内置了故障转移机制以增强鲁棒性和控制力。

MLOps 与模型部署

ModelsLab 提供统一的 API,让开发者可以访问超过 1000 个生成式 AI 模型。生成图像、视频、音频,并利用 LLM 构建快速、可扩展且经济高效的 AI 驱动型应用。通过单一、简单的界面,使用多样化、前沿的 AI 工具进行构建。

MLOps 与模型部署

AI 应用

Raster 是一个面向现代团队的原生代理数字资产管理平台。它支持高效地存储、组织、搜索和分发视觉资产,并集成 AI 功能以增强工作流程。Raster 旨在加速高容量视觉制作和 API 连接团队的资产管理。

计算机视觉工具

AI 移动应用

BookmarkGPT 是一款 Chrome 扩展程序,旨在通过允许您轻松保存、组织和管理您喜欢的提示来增强您的 ChatGPT 体验。使用这款直观的 ChatGPT 用户工具,简化您的工作流程,再也不会丢失有价值的提示创意。

提示词工程工具

AI GitHub 仓库

Shumai 是一个为 JavaScript 和 TypeScript 构建的快速、可微分的张量库,基于 Bun 和 Flashlight。它使软件工程师和研究人员能够高效地在 JavaScript 生态系统中创建数据集、训练小型模型和实现高级训练逻辑。它利用原生类型数组和 JIT 编译器来提高性能。

机器学习平台

Datature 是一个用于构建和部署视觉 AI 模型的端到端平台。它提供数据标注、模型训练和集成工具,赋能企业和开发者加速创建针对不同行业的定制化计算机视觉解决方案。

计算机视觉工具

使用 Easy Folders 整理您的 ChatGPT 和 Claude 对话。创建用于聊天、图像和项目的文件夹和子文件夹。功能包括搜索、书签、提示管理和多账户支持。通过整理历史记录和提高可访问性来增强您的 AI 聊天体验。

提示词工程工具

Captum 是一个用于 PyTorch 的开源库,提供模型可解释性工具。它支持跨视觉和文本的多模态模型,使用户能够理解其神经网络如何做出预测。该库具有可扩展性,能够轻松实现和基准测试新的可解释性算法。

机器学习平台

Rerun 是物理 AI 的数据层,提供构建、理解和改进数据循环的原始数据类型。它处理从初始记录到大规模的多速率、多模态数据,支持可视化、查询、转换和训练,无需导出步骤。

机器学习平台

AI 应用

Promptly 是一款 Chrome 扩展程序,为 ChatGPT 和 Jasper 等 AI 写作工具提供预定义提示。它通过提供一系列即用型提示来简化内容创作,让用户只需点击几下即可更高效地生成引人入胜且有说服力的内容。

提示词工程工具

Algolia 是一个统一的 AI 搜索和检索平台,赋能超过 18,000 个组织。它通过理解意图、上下文和细微差别来增强用户体验,在智能体式、生成式和传统搜索应用中提供直观、自适应且高性能的搜索。

向量数据库与检索

AI 应用

Omnisearch 提供 AI 驱动的搜索功能,可搜索您的所有内容,包括音频、视频、文档和演示文稿。其索引速度比传统工具快 10 倍,无需任何设置,即可在各种格式和语言中即时访问和搜索信息,从而增强用户参与度和学习效果。

向量数据库与检索

Mixpeek 提供强大的视频搜索 API,可跨越数百万个视频场景进行语义搜索和聚类。用普通英语描述任何场景,即可即时检索精确时刻。它可与您现有的对象存储集成,并支持跨视频、图像、音频和文档的多模态搜索。

计算机视觉工具

FieldDay 是一款 iPhone 应用,赋能用户无需编码即可构建自定义的、由摄像头驱动的 AI 体验。在手机上几分钟内训练视觉 AI 模型,用自己的数据进行微调,并将其导出到其他平台或集成 HomeKit 控制等操作。

计算机视觉工具

AI 应用

Promptologer empowers prompt engineers to monetize their creations without coding. Transform your prompt collections into functional web applications, enabling you to share and…

提示词工程工具

AI 应用

Promptmatic 是一款免费的 Google Chrome 扩展程序,旨在增强您的 ChatGPT 体验。它允许您在一个中央位置收藏、保存和组织提示模板和 GPT,直接在您的 ChatGPT 仪表板中一键即时访问。

提示词工程工具

AI 移动应用

Prompti 是一款 Chrome 扩展程序,旨在通过帮助用户构建更优质的提示词来增强 ChatGPT 对话。它提供预构建的模板、定制化的输入建议以及后端提示词优化,使初学者和经验丰富的用户都能获得更富有成效和引人入胜的交互体验。

提示词工程工具

AI 移动应用

AIPRM for Claude 通过提供一个包含超过 4500 个专业一键式提示词的精选库,增强您与 Claude 的互动。它简化了从 SEO 文章到销售邮件等各种内容的生成,并提供高级提示词管理和自定义功能,帮助用户最大化 Claude 的潜力。

提示词工程工具

CharadesAI 提供一个API优先、超低延迟的计算机视觉平台,用于实时唇语识别和手势识别。它使开发人员能够构建具有企业级AI基础设施的可访问、智能应用程序,从而为跨不同行业的静默和免提通信重塑人机交互。

计算机视觉工具

AI 移动应用

PromptEasily ChatGPT 是一款 Chrome 扩展程序,通过提供精选的提示模板列表来增强您的 ChatGPT 体验。它旨在为从事 SEO、SaaS 和其他各种领域的用户简化交互,提供即用型提示以提高效率和输出质量。

提示词工程工具

AI 应用

PromptWise 是一个由 AI 驱动的平台,旨在帮助用户发现、管理和优化各种 AI 模型的提示。它提供了一个集中的提示工程存储库,支持高效协作和性能跟踪。通过结构化的提示管理和分析工具,增强您的 AI 交互。

提示词工程工具

AI 应用

Scanflow AI 提供一个 AI 视觉智能平台,用于自动化质量控制、资产识别和工业安全。它可提高效率,将错误率降低高达 80%,并增强可追溯性,以实现各行业的零缺陷运营。

计算机视觉工具制造与工业

Currux Vision 为智能基础设施提供自动人工智能系统,专注于城市、交通部门和政府机构。他们的解决方案利用现有的闭路电视、交通控制器和传感器来监控、优化和货币化复杂的基础设施项目,以提高安全性和效率。

计算机视觉工具政府与公共部门

Robovision 提供工业视觉智能基础设施,用于监控、控制和标准化视觉系统。通过减少浪费、限制质量漂移和降低运营开销,确保在业务扩展时实现结果保障。该基础设施贯穿视觉系统的整个生命周期进行管理,以适应制造环境的灵活性、可扩展性和可靠性。

计算机视觉工具制造与工业

clickworker 提供可扩展、精准且灵活的数据服务,由超过八百万经过验证的全球众包成员提供支持。他们通过其值得信赖的平台提供定制化的人工智能训练数据、调查、门店检查、标注、列表构建等服务,以实现快速可靠的数据收集和验证。

机器学习平台

GenImg AI 是一款由 FLUX.1 AI 模型驱动的先进免费在线图像生成器。它提供文本到图像和图像到图像功能,包括 Schnell、Dev、Pro 和 Pro Ultra 版本。生成具有卓越细节和提示遵循度的高质量 AI 艺术作品,并提供商业用途选项。

计算机视觉工具

Grably 提供高质量的多模态人类互动和对话数据集,用于人工智能研究。它们捕获并构建物理运动、生理信号、注视、语音和情境线索,以支持真正理解人类行为和决策过程的人工智能。

机器学习平台

AI 应用

FaceCheck.ID 是一个面部识别搜索引擎,可帮助您通过照片在线查找人员。它会扫描社交媒体、新闻、博客和通缉犯数据库,以验证身份并揭示潜在风险,从而提高个人安全性和在线验证。

计算机视觉工具

AI 平台

Wallaroo.ai 是一个 AI 平台,提供用于部署、管理和监控机器学习模型的工具。它旨在简化 MLOps 生命周期,使团队能够更快、更自信地将 AI 推向生产。该平台支持各种模型类型并与现有工作流集成。

MLOps 与模型部署

NVIDIA 提供了一个全面的 AI 平台,为人工智能、高性能计算、游戏和自动驾驶系统领域的进步提供动力。其解决方案使企业和研究人员能够大规模构建、训练和部署 AI 模型,通过尖端的硬件和软件推动各行各业的创新。

机器学习平台

Paperspace(现为 DigitalOcean 的一部分)提供了一个 MLOps 平台,用于构建和扩展 AI 应用。它提供了 Notebooks、Machines 和 Deployments 等集成工具,并由世界一流的 GPU 和 IPU 提供支持。该平台与主流框架兼容,可为开发人员简化从探索到部署的整个 ML 工作流程。

机器学习平台

AI 平台

Seldon Core 是一个 MLOps 和 LLMOps 框架,用于在 Kubernetes 上部署、管理和扩展 AI 系统。它支持跨云部署各种模型类型,并通过管道、自动伸缩和多模型服务等功能,促进模块化和以数据为中心的应用程序。

MLOps 与模型部署

Cortex 提供可扩展的云基础设施,用于在生产环境中部署、管理和扩展机器学习模型。它提供无服务器和批量处理、自动化集群管理以及 CI/CD 集成,基于 AWS EKS 构建,可实现可靠且经济高效的 ML 运营。

MLOps 与模型部署

AI 平台

KServe 是一个开源的、Kubernetes 原生的自托管 AI 推理平台。它为生成式 AI 和预测式 AI 提供统一的解决方案,通过 GPU 加速和自动伸缩等功能,简化了从快速部署到高要求的企业级工作负载的部署。

MLOps 与模型部署

SUPERWISE AMP 是一个面向受监管行业的 Agentic 管理平台,提供完整的可见性、实时护栏和策略执行。它使企业能够安全合规地构建、管理和治理 AI 代理,通过 PII 检测和审计日志等功能确保可信赖的 AI 结果。

MLOps 与模型部署

DKube 赋能企业部署安全、生产就绪的私有化 AI 系统。它支持在本地和混合环境中构建 AI 解决方案,确保完全的控制权、合规性和所有权。DKube 的综合平台可将 AI 部署速度从数周缩短至数月。

MLOps 与模型部署

NVIDIA NeMo 提供合成数据生成工具,以加速代理式 AI 的开发。它创建高质量、领域特定的数据集,用于训练和评估 AI 模型,克服数据稀缺、安全和成本方面的挑战。通过定制的合成数据增强对话式 AI、基准测试和自主系统。

机器学习平台

Imagimob 专注于边缘 AI 和 tinyML,提供将机器学习部署到边缘设备的解决方案。其 DEEPCRAFT™ Studio 加速 AI 模型开发,而 DEEPCRAFT™ Ready Models 提供预训练、可部署的 ML 模型,可快速集成到项目中。

机器学习平台

Neurala 为制造商提供由 AI 驱动的视觉检测自动化 (VIA) 软件。它增强视觉检测流程,减少产品缺陷,提高生产力。该解决方案旨在经济高效且易于集成到现有生产线,并能适应自然的产品变异。

计算机视觉工具制造与工业

AI 平台

DVC 是一个开源的数据科学和机器学习项目版本控制系统。它提供类似 Git 的体验来管理数据、模型和实验,将软件工程最佳实践引入 AI/ML 工作流和数据基础设施。

MLOps 与模型部署

AI 平台

DDN 是一个专注于高性能计算和人工智能工作负载的数据平台。他们提供数据管理、存储和分析解决方案,赋能组织加速其研发进程。其产品能够应对各种科学和工业领域中复杂的数据挑战。

机器学习平台

Claude Console 是一个用于与 Claude AI 模型交互的用户界面。它为开发人员和用户提供了一个平台,用于访问和利用 Anthropic 先进的 AI 功能。目前,该控制台正经历暂时的服务中断,后续将有更新。

AI 模型与大语言模型

DataRobot 产品文档为端到端的 AI 平台提供了全面的资源。访问代码优先和基于 UI 的 DataRobot 体验的详细指南、教程和 API 文档。这个中心枢纽支持用户有效地分析数据、创建模型和部署 AI 驱动的应用程序。

机器学习平台

Databricks Feature Store 是 Unity Catalog 中 AI/ML 特征的中央注册中心。它提供内置治理、数据沿袭、时间点连接和在线服务,可实现无缝的模型训练和推理,确保一致性并简化客户端代码。

机器学习平台

大语言模型

这是 Llama 2 13b 的一个微调版本,通过 Llama 33b 的额外注意力头进行了增强。它在约 1000 万个 RedPajama token 上进行了训练,以更好地集成这些新组件。该模型旨在作为进一步开发的基石,目标是提高学习能力,优于标准的 13b 模型。

AI 模型与大语言模型

大语言模型

Pure Sydney 是 LLaMA 2 的一个未经审查、不受约束的微调版本,专为友好聊天和陪伴而设计。它基于早期 Sydney 版本的 Reddit 帖子,提供一种天真纯粹的个性。这款 4 位 GPTQ 模型针对速度和互动性进行了优化,是对话式 AI 应用的理想选择。

AI 模型与大语言模型

大语言模型

Aiden T5 是一个具有互联网访问和 BDI 功能的 Transformer 模型,它将语言模型的能力与对世界的推理相结合。它在文本生成、翻译、摘要和问答方面取得了最先进的性能,拥有 1.5 万亿个参数,可实现复杂的学习和泛化。

AI 模型与大语言模型

大语言模型

FFMPerative-7B 是一个基于 Llama 2 7B 的 LLM,经过微调以适应视频制作工作流程。它允许用户通过自然语言命令控制视频编辑任务,并与 FFMPerative 工具进行交互。该模型简化了没有技术专长的用户的复杂视频编辑过程,使裁剪、调整大小和音频调整等任务变得易于操作。

AI 模型与大语言模型

AI 模型

OPT-175B 是 Meta AI 发布的一个拥有 1750 亿参数的语言模型,面向研究社区。它提供了对大规模语言模型的访问,从而能够更深入地理解和推进自然语言处理(NLP)研究,并专注于负责任的开发和减轻偏见。

AI 模型与大语言模型

Gato 是 Google DeepMind 开发的单一通用人工智能代理。它可以执行各种任务,包括玩 Atari 游戏、为图像添加字幕、聊天以及控制真实的机器人手臂。这种多模态代理使用 Transformer 神经网络来处理多样化的数据输入并生成适当的输出。

AI 模型与大语言模型

DETR 是一种端到端的对象检测和全景分割框架,将 Transformer 作为核心组件集成。它简化了架构,直接预测对象集,并在 COCO 等具有挑战性的数据集上达到了最先进的性能,为计算机视觉任务提供了更灵活、更精简的方法。

计算机视觉工具

Densenet是一种深度卷积神经网络架构,可通过PyTorch使用。它通过以前馈方式将每个层连接到所有其他层来增强特征传播和重用。该模型在ImageNet上进行了预训练,并提供densenet121、densenet169、densenet201和densenet161等变体,用于图像分类任务。

计算机视觉工具

MobileNets 是 TensorFlow 中面向移动设备优先的计算机视觉模型系列,专为高效的设备端或嵌入式应用而设计。它们在最大化精度的同时,最大限度地减少了计算量、功耗和存储空间,是无需互联网连接即可进行实时视觉识别的理想选择。

计算机视觉工具

SqueezeNet 是一个深度卷积神经网络模型,可通过 PyTorch 使用。它在实现 AlexNet 级别准确率的同时,参数量和模型尺寸显著减少,使其在各种计算机视觉任务中效率很高。该模型在 ImageNet 上进行了预训练,可以轻松集成到 PyTorch 项目中。

AI 模型与大语言模型

AI 模型

Xception 是一个深度学习模型,可通过 Keras 3 API 使用。它是 Keras Applications 的一部分,为各种计算机视觉任务提供预训练模型。Xception 专为图像分类及相关应用而设计,为构建先进的 AI 系统奠定了坚实的基础。

AI 模型与大语言模型

Transfo-XL-WT103 是一种具有相对位置嵌入的因果Transformer模型,可以重用隐藏状态以处理更长的上下文。该模型由Zihang Dai等人开发,并使用自适应Softmax处理输入和输出。该模型适用于文本生成任务,并在Wikitext-103数据集上进行了训练。

AI 模型与大语言模型

Google DeepMind 探索 Gopher 等大型语言模型,重点关注其能力、伦理考量和高效训练。研究包括一个拥有 2800 亿参数的模型、风险评估以及用于改进预测和可追溯性的检索增强架构。目标是安全且有益地推进人工智能。

AI 模型与大语言模型

本研究实证分析了在固定计算预算下,大型语言模型模型大小与训练数据之间的最优权衡。研究表明,当前的大型模型通常过大且训练不足,并提出了一种更高效的方法以获得更好的性能和降低推理成本。

AI 模型与大语言模型

AI 模型

LaMDA是谷歌突破性的对话式AI模型,旨在就广泛的主题进行自由流畅的对话。它基于Transformer架构,专门针对对话数据进行训练,以理解诸如合理性和特异性等细微差别,从而实现更自然的人机交互和新的应用类别。

AI 模型与大语言模型

AI 模型

InstructGPT 模型是经过训练的 AI 语言模型,比 GPT-3 更能遵循用户意图。它们通过人类反馈强化学习,更加真实、毒性更低,并与用户目标保持一致,现已为 OpenAI 的 API 提供支持。

AI 模型与大语言模型

AI 模型

FaceNet 是一个基于 FaceNet 论文的 TensorFlow 实现,用于人脸识别和聚类。它利用深度学习模型为面部生成统一的嵌入向量,从而实现准确的识别和分组。该项目提供了预训练模型和用于训练自定义分类器的代码。

计算机视觉工具

Longformer Base 4096 是一款为处理长文档而设计的 Transformer 模型。它基于 RoBERTa,并在最长 4096 个 token 的扩展序列上进行了预训练。该模型采用混合注意力机制,结合了滑动窗口和全局注意力,以实现高效的长文档理解和特定任务的表征学习。

AI 模型与大语言模型

BigBird基础模型是一个Transformer模型,它通过块稀疏注意力机制扩展了BERT,能够处理更长的序列。该模型已针对英文文本进行掩码语言模型任务的预训练,可以高效处理长达4096个token的序列,并在长文档任务上取得了最先进的成果。

AI 模型与大语言模型

RAG(检索增强生成)将预训练语言模型与外部数据源相结合。它会检索相关段落来指导生成,从而提高事实准确性,并允许在不完全重新训练模型的情况下更新知识。这种方法通过整合参数式和非参数式记忆来提高响应质量。

AI 模型与大语言模型

AI 模型

SimCLR 是一个用于视觉表示的自监督和半监督学习框架。它通过最大化同一图像不同变换视图之间的一致性来简化先前的方法,从而在标记数据有限的图像分类任务上取得了最先进的性能。

AI 模型与大语言模型

Phi-2 是来自微软研究院的一个拥有 27 亿参数的语言模型。它展现了出色的推理和语言理解能力,在 130 亿参数以下的模型中取得了最先进的性能。在复杂的基准测试中,Phi-2 的表现与模型大小高出 25 倍的模型相当或更优,是研究和实验的理想选择。

AI 模型与大语言模型

AI 模型

ControlNet 增强了扩散模型,增加了条件控制,允许用户通过特定输入来指导图像生成。它可以在不破坏预训练模型的情况下进行微调,适用于个人设备,并提供模型合并和替换的灵活性。

AI 模型与大语言模型

该AI模型详细介绍了一个大型深度卷积神经网络,该网络经过训练以进行ImageNet分类。它在测试数据上取得了最先进的成果,top-1和top-5错误率分别为39.7%和18.9%,使用了6000万个参数和50万个神经元,分布在五个卷积层和两个全连接层中。

AI 模型与大语言模型

此 GitHub 存储库提供了使用 PyTorch 的深度卷积生成对抗网络 (DCGAN) 的示例实现。它允许用户在 LSUN 等数据集上训练模型并生成逼真的图像,并提供自定义和 GPU 加速选项。代码包含数据集下载和模型训练的脚本。

机器学习平台

AI 模型

StyleGAN3 引入了无别名(alias-free)的生成对抗网络,通过彻底改革生成器内的信号处理来实现。这项创新消除了“纹理粘连”现象,能够更连贯地合成视频和动画。该模型在实现 StyleGAN2 的 FID 分数的同时,提供了对平移和旋转的完全等变性,即使在亚像素尺度上也是如此。

AI 模型与大语言模型

AI 模型

UL2 20B 是一个开源的统一语言学习模型,它统一了各种语言建模范式。通过将目标构建为具有混合去噪器的去噪任务,它在微调和少样本学习任务上提高了性能,为语言模型训练提供了一种平衡的方法。

AI 模型与大语言模型

AI 模型

FLAN-T5 是 T5 语言模型的增强版本,经过针对多样化任务混合的专门微调。它在无需进一步微调的情况下提供了改进的性能,使其可直接用于各种自然语言处理应用。提供多种尺寸,可满足不同的计算需求。

AI 模型与大语言模型

AI 模型

PaLM-E 是一个具身多模态语言模型,它将真实的连续传感器数据与文本相结合。通过将语言与感知相联系,使机器人能够执行复杂任务,并在不同的训练领域和具身环境中展现出积极的迁移能力,以实现高级推理和规划。

AI 模型与大语言模型

该框架引入了一种新颖的主动学习方法,用于丰富大型 3D 形状数据集的语义区域标注。它有效地结合了手动标注、自动传播和验证,以最大限度地减少用户工作量,同时最大限度地提高 3D 模型标注的准确性。

机器学习平台

AI 模型

DGCNN 是一款用于点云学习的 AI 模型,实现了动态图卷积神经网络。它在 3D 点云数据的分类和分割等任务中取得了最先进的性能。该模型有 PyTorch 实现版本,并已应用于实际场景。

AI 模型与大语言模型

MMAction2 是一个用于动作识别和视频理解任务的基础库。它提供了一个全面的工具包,用于开发和部署最先进的视频分析模型,该模型构建在 PyTorch 之上并与 OpenMMLab 生态系统集成。本档涵盖教程、API 参考和项目信息。

计算机视觉工具

AI 模型

Wav2vec 2.0 是一种用于自动语音识别的自监督学习算法。它从原始音频中学习,仅需极少量转录数据即可达到高精度。这使得更多语言、方言和领域能够实现语音识别,减少对海量标注数据集的依赖。

AI 模型与大语言模型

AI 模型

AudioLM 是一个能够生成高质量、具有长期一致性的音频的 AI 模型。它将音频生成视为一项语言建模任务,将音频映射到离散的 token。该框架在生成自然连贯的语音和音乐续写方面表现出色,即使是针对未曾见过的说话人或风格。

AI 模型与大语言模型

ALIGN 是一个 AI 模型,它利用来自超过十亿个图像-alt 文本对的嘈杂文本监督,扩展视觉和视觉-语言表示学习。它在跨模态检索和纯视觉任务中取得了最先进的成果,实现了零样本分类和多模态搜索。

AI 模型与大语言模型

Flamingo 是来自 Google DeepMind 的单一视觉语言模型 (VLM),在各种多模态任务的少样本学习方面表现出色。它处理交错的图像、视频和文本,以生成相关的语言输出,仅需极少的特定任务示例即可完成,无需额外训练。

AI 模型与大语言模型

BEiT 是一个自监督视觉表示模型,它使用掩码图像建模来预训练视觉 Transformer。它将图像分词为视觉标记,并恢复被掩码的图像块,在图像分类和语义分割等下游任务上取得了有竞争力的结果。

AI 模型与大语言模型

变分自编码器(VAE)提供了一种概率方法来表示潜在空间。与标准自编码器不同,VAE 将观测值编码为概率分布,从而实现更平滑的潜在空间和生成能力。这使得数据表示和重构更加细致。

AI 模型与大语言模型

Reformer 是一个 AI 模型,它增强了 Transformer 架构以处理海量顺序数据。它解决了注意力机制和内存分配的局限性,使得在具有 16GB 内存的单个加速器上能够处理高达 100 万字的上下文窗口。

AI 模型与大语言模型

ImageBind 是 Meta AI 开发的多模态 AI 模型,能够融合图像、视频、音频、文本、深度和热成像六种模态的数据。它在无需显式监督的情况下学习单一的嵌入空间,从而为 AI 系统实现先进的跨模态理解和生成。

AI 模型与大语言模型

AI 模型

Intern Large Models (InternLM),由上海人工智能实验室开发,提供开源的大语言模型(LLM)和多模态大语言模型(MLLM)。其套件包括 InternVL 和 InternLM-XComposer 等模型,以及用于开发和应用的工具链,其中包含用于微调的 XTuner 和用于部署的 LMDeploy。

AI 模型与大语言模型

通义实验室 (Meet Tongyi) 是阿里云通义千问大语言模型的官方网站。它展示了全系列模型、最新的行业新闻和前沿应用,全面概述了其在自然语言、文本生成和视觉理解方面的能力。

AI 模型与大语言模型

Zephyr-7B-β 是一个开源语言模型,通过直接偏好优化 (DPO) 从 Mistral-7B-v0.1 微调而来。它作为有用的助手表现出色,在 MT-Bench 和 AlpacaEval 基准测试中展现出强大的性能,非常适合聊天应用。

AI 模型与大语言模型

Fuyu-8B 是一款开源的多模态人工智能模型,专为数字代理设计。其简化的架构支持任意图像分辨率,能够以快速的响应时间回答关于图表、示意图和用户界面元素的问题。它在标准基准测试中表现良好,并可在 HuggingFace 上获取。

AI 模型与大语言模型

IDEFICS 是一个开放访问的视觉语言模型,能够复现最先进的性能。它接受交错的图像和文本输入,生成文本输出,其能力可与 Flamingo 等专有模型相媲美。提供 9B 和 80B 参数版本,支持多模态 AI 的研究和开发。

AI 模型与大语言模型

AI 模型

MiniGPT-4 是一个人工智能模型,通过将冻结的视觉编码器与大型语言模型对齐,增强了视觉-语言理解能力。它可以生成详细的图像描述、根据草稿创建网站、创作受图像启发的故事情节,并解决视觉问题,展现了先进的多模态能力。

AI 模型与大语言模型

AI 模型

LLaVA 是一个大型多模态模型,它将视觉编码器与语言模型相结合,用于通用的视觉和语言理解。它在多模态聊天能力方面表现出色,模仿 GPT-4,并通过视觉指令调优在 Science QA 等基准测试中取得了最先进的准确率。

AI 模型与大语言模型

Mamba 是一种新颖的状态空间模型架构,专为高效序列建模而设计,在语言等信息密集型数据上尤其有效。它提供了硬件感知的实现,旨在超越先前亚二次方模型并与 Transformer 竞争。

AI 模型与大语言模型

RWKV 是一个强大的语言模型,提供高效的推理和灵活的微调能力。它支持各种应用,包括桌面 GUI、基于 Web 的推理和移动应用,使先进的 AI 能够跨多个平台和设备用于各种任务。

AI 模型与大语言模型

OpenELM 是来自 Apple Machine Learning Research 的最先进的开放语言模型系列。它采用逐层缩放策略以提高准确性,并提供了一个完整的框架,用于在包括日志和检查点在内的公共数据集上进行训练和评估。该发布还包括在 Apple 设备上集成 MLX 的代码。

AI 模型与大语言模型

AI 模型

N-BEATS 是一个基于神经网络的单变量时间序列预测模型。由 ServiceNow Research 开发,它实现了 N-BEATS 算法以获得可复现的实验结果。该存储库提供了 PyTorch 实现、数据集加载器和用于高级时间序列分析的实验配置。

AI 模型与大语言模型

AI GitHub 仓库

Code Llama 提供 Meta 的 Code Llama 模型(一系列用于代码的大型语言模型)的推理代码。这些模型提供最先进的性能、代码补全能力,并支持大型输入上下文,非常适合各种编程任务和研究。

AI 模型与大语言模型

零一万物 (01.AI) 是一家全球性人工智能公司,专注于 AI 2.0,以基础模型突破为驱动。他们的目标是革新技术、平台和应用,创建一个人工智能增强人类生产力和社会价值的新生态系统。他们的愿景是让通用人工智能 (AGI) 惠及所有人。

AI 模型与大语言模型

AI 模型

DBRX 是 Databricks 推出的最先进的开源大型语言模型 (LLM),在语言、编程和数学基准测试中表现出色。它提供了更高的效率和质量,超越了 GPT-3.5,并与 Gemini 1.0 Pro 竞争,使企业和开源社区能够获得先进的 LLM 功能。

AI 模型与大语言模型

AI 模型

Fast R-CNN 是一个用于目标检测的深度学习框架。与 R-CNN 和 SPPnet 等先前方法相比,它显著加快了训练和测试速度,并在基准数据集上实现了更高的准确性。该框架使用 Python 和 C++/Caffe 编写,非常适合计算机视觉领域的研究人员和开发人员。

计算机视觉工具

py-faster-rcnn 是 Faster R-CNN 对象检测模型的 Python 实现。它提供了官方 MATLAB 版本的替代方案,在 CPU 上的 Python 层导致测试速度略有差异的情况下,实现了相似的准确度。该项目已弃用,推荐使用 Detectron。

计算机视觉工具

AI 模型

Caffe 框架集成 SSD 实现,用于目标检测。该存储库提供了一个快速、开放的深度学习框架,专门为单次多框检测器 (SSD) 定制。它能够使用单个模型训练和评估目标检测网络,提供高效的性能。

计算机视觉工具

特征金字塔网络 (FPN) 通过利用深度卷积网络的金字塔结构,以极低的计算开销生成多尺度特征图,从而增强目标检测能力。该架构提高了对各种尺寸目标的检测精度,为实时检测任务提供了实用且高效的解决方案。

计算机视觉工具

DeepLab 是最先进的深度学习模型,用于语义图像分割。此 TensorFlow 实现提供了在 PASCAL VOC 和 Cityscapes 等数据集上进行训练、评估和可视化分割结果的代码。它支持各种网络骨干和用于像素级标注的高级功能。

计算机视觉工具

AI 模型

ViT-Adapter 是一款人工智能模型,可提高 Vision Transformer (ViT) 在目标检测和分割等密集预测任务上的性能。它在无需预训练的情况下引入了特定于图像的归纳偏置,使普通 ViT 能够取得与专用 Transformer 相当的结果,从而适用于各种下游应用。

计算机视觉工具

TimeSformer 是一种新颖的 AI 架构,专门利用自注意力 Transformer 进行视频理解。它在动作识别基准测试中取得了最先进的成果,与传统的 3D CNN 相比,训练速度显著加快,推理计算成本更低。这使得更复杂的视频分析和实时应用成为可能。

计算机视觉工具

Imagen 是 Google Research 开发的一款文本到图像扩散模型,它能生成具有深刻语言理解能力的逼真图像。Imagen 在图像-文本对齐和样本保真度方面表现出色,在人类评估中优于其他模型,并在 COCO 等基准测试中取得了最先进的 FID 分数。

AI 模型与大语言模型

该AI模型引入了一种新颖的神经网络架构,即RNN Encoder-Decoder,用于统计机器翻译。它使用两个循环神经网络将源序列编码为向量,并将其解码为目标序列,从而提高翻译性能并学习有意义的短语表示。

AI 模型与大语言模型

ULMFiT 是一种强大的预训练语言模型微调技术。它能够高效地实现文本分类任务的迁移学习,以更少的数据和计算资源达到最先进的性能。该方法是 fast.ai 库的一部分,使得先进的 NLP 技术触手可及。

机器学习平台

AI 模型

Together AI 是一个AI模型平台。它提供对各种模型的访问,使开发人员能够将先进的AI功能集成到他们的应用程序中。该平台专注于提供一个强大的AI开发和部署环境,支持AI驱动项目的创新和效率。

MLOps 与模型部署

AI 模型

OpenLLaMA 是 Meta AI 的 LLaMA 7B 模型的一个允许自由许可的开源复现版本。它在 RedPajama 数据集上进行训练,提供 3B、7B 和 13B 参数版本,并提供 PyTorch 和 JAX 权重,可无缝集成到现有的 LLaMA 实现中。

AI 模型与大语言模型

GIT(生成式图像到文本转换器)是微软开发的一款用于视觉和语言任务的AI模型。它能从图像生成文本描述,并执行视觉问答。该模型提供多种预训练和微调版本,适用于不同应用。

计算机视觉工具

UNITER 是 ECCV 2020 论文“UNITER: UNiversal Image-TExt Representation Learning”的研究代码库。它提供了用于各种视觉-语言任务(包括 VQA、VCR 和图像-文本检索)的微调和推理代码。UNITER-base 和 UNITER-large 的预训练检查点均可用。

AI 模型与大语言模型

Oscar and VinVL are advanced AI models for vision-language tasks. Oscar uses object-semantics alignment for pre-training, achieving state-of-the-art results. VinVL enhances visual…

AI 模型与大语言模型

该存储库提供了图神经网络(GNN)的Principal Neighbourhood Aggregation (PNA) 的实现。它支持 PyTorch、DGL 和 PyTorch Geometric 框架,提供用于多任务和真实世界基准测试的脚本,以及灵活的 GNN 框架和比较模型。

机器学习平台

该 GitHub 仓库提供了 DeepGCNs、DeeperGCN 和 GNN1000 的 PyTorch 实现。它通过借鉴 CNN 的残差连接和空洞卷积等概念,实现了非常深层的图卷积网络训练,从而促进了图神经网络的研究。

机器学习平台

常见问题

知道一个在机器学习与数据科学中出类拔萃的工具吗?

ToolPotion是人们浏览以寻找最佳机器学习与数据科学的AI工具目录。免费列出,每个提交都经过编辑审核——将您的工具放在搜索的起点。

提交适用于机器学习与数据科学的AI工具