AI 模型
DistilGPT2 是一个经过蒸馏的、以英语为基础的文本生成模型,源自 GPT-2。它提供了比其前代产品更快、更轻量级的替代方案,适用于各种创意和辅助写作任务。该模型经过预训练,可通过 Hugging Face 进行集成。
探索最佳 AI 模型 — 从语言转换器如 DistilGPT2 和 Claude Opus 到先进系统如 GPT-5.6: Frontier intelligence 和 Google DeepMind 的 Gemini 3.1 Pro,这里是开发者和研究人员探索提升项目工具的地方:生成类人文本,构建对话代理,开发复杂算法,推动 AI 能力的边界。 浏览 324 个AI 模型,涵盖 机器学习平台, 科学发现与实验室工具, 计算机视觉工具, 3D 模型生成器 和 自然语言处理工具 等类别——每个条目上线前都经过人工审核,并以11种语言发布。
324 tools
AI 模型
DistilGPT2 是一个经过蒸馏的、以英语为基础的文本生成模型,源自 GPT-2。它提供了比其前代产品更快、更轻量级的替代方案,适用于各种创意和辅助写作任务。该模型经过预训练,可通过 Hugging Face 进行集成。
AI 模型
Claude Opus 是一个混合推理模型,专为严肃编码和 AI 代理设计,具有 1M 的上下文窗口。它在生产就绪代码、复杂的 AI 代理和复杂文档创建方面表现出色,非常适合高要求的用例。
GPT-5.6是OpenAI最新的AI模型,旨在提高各类任务的生产力和效率。它提供了每美元更高的性能,使用户能够以更少的投入实现更多,特别适合编码、知识工作和网络安全等高要求的工作流程。
Gemini 3.1 Pro 是一款先进的人工智能模型,旨在处理复杂任务和深度推理。它在多模态理解方面表现出色,提供智能且简洁的响应,非常适合学习、规划和构建创新应用。
AI 模型
Grok 4.6 增强了 Grok 4.5 的能力,专注于长时间运行的代理和雄心勃勃的交互式和视觉任务。它在复杂项目中表现出色,提供了编码和知识工作的性能提升。
AI 模型
Stability AI 提供一套开源的生成式 AI 模型,用于创建图像、视频、音频和 3D 内容。这些创新解决方案可满足寻求先进 AI 功能以实现各种应用的创作者和企业需求。立即探索其尖端技术。
AI 模型
Qwen Studio 提供了一种多功能的 AI 模型,擅长聊天机器人功能、图像和视频理解、图像生成、文档处理以及网络搜索集成,使其成为各种应用的宝贵工具。
GLM-5.3是一个先进的AI模型,旨在提供编码和网络能力。它在复杂编码任务和漏洞发现方面有显著改进,使其成为开发人员和安全专业人员的强大工具。
AI 模型
Cohere Command 是一系列可扩展的 AI 语言模型,专为企业级应用而设计。它为实际的代理式应用提供高性能和高准确性,能够实现业务工作流的自动化、内容创作以及安全部署。Command 模型能够将 AI 能力锚定在企业自身数据之上,赋能团队。
AI 模型
纳米香蕉专业版是一个AI模型,旨在以工作室级别的精确度和控制力创建和编辑图像。它利用先进的人工智能生成符合高标准细节和创意的视觉效果。
GPT 图像 2 是 OpenAI 开发的先进图像生成模型,旨在快速高质量地创建和编辑图像。它支持多种图像尺寸和高保真输入,适用于视觉内容创作的多种应用。
AI 模型
FLUX.2 是来自黑森林实验室的下一代图像生成技术,提供最先进的质量、速度和可控性,适用于各种创意应用。
AI 模型
Muse Glimmer是一个拥有300亿参数的因果语言模型,旨在在消费硬件上执行自主代理任务。它集成了多步骤推理、可靠的工具使用和多模态理解,使得在不依赖云的情况下实现高效的本地部署。
AI 模型
Midjourney V8.2 是一个 AI 模型,允许用户通过版本参数探索和切换不同版本。它专注于美学、图像质量和个性化,增强创意输出和用户体验。
Kling 3.0是一款先进的AI视频和图像生成器,可以将文本、图像和参考资料转化为高质量的多模态内容。它提供了用于电影叙事和增强音频输出的工具,非常适合创意专业人士。
Runway Gen-4.5是一个先进的AI视频生成模型,提升了运动质量、提示遵循性和时间一致性。它在所有付费计划中可用,是创作者和开发者的强大工具。
AI 模型
AI21 构建企业级基础模型和 AI 系统,专注于准确性、可靠性和可扩展性。其解决方案为关键业务工作流提供支持,提供智能模型路由和自动化集成优化等高级功能,以实现高效的 AI 代理开发和部署。
Gemma 是一系列轻量级的开放模型,基于驱动 Gemini 模型的相同技术构建。它使开发人员能够为各种平台创建 AI 应用程序,提高移动设备和物联网设备的效率和智能。
AI 模型
Wan是一个人工智能创意平台,旨在降低创意工作的门槛。它提供文本到图像、图像到图像、文本到视频、图像到视频和图像编辑等功能,使用户能够轻松实现他们的想法。
Mistral Large 3是一个先进的AI模型,专为企业设计,支持定制、微调和AI助手及代理的部署。它采用稀疏专家混合架构,具有410亿个活跃参数,在多模态和多语言应用中提供先进的能力。
Eleven v3是一个先进的AI语音模型,能够生成70多种语言的逼真语音。它提供情感深度、多说话者控制,并设计用于各种应用,包括客户体验和内容创作。
Suno v5.5 是一个 AI 音乐模型,通过 Voices、Custom models 和 My Taste 等功能增强创意,允许用户表达他们的音乐身份。它适合初学者和专业音乐人,使音乐创作更加个性化和引人入胜。
Genie 3 是一个开创性的 AI 模型,可以根据简单的文本描述生成逼真的环境。它允许用户实时探索这些互动世界,使其成为各种应用的强大工具,包括训练代理和教育模拟。
NVIDIA Nemotron 3 Ultra是一款强大的AI模型,旨在处理复杂推理和多语言任务。它拥有5500亿个参数,在长文本分析和工具使用方面表现出色,适用于各个行业的高风险应用。
AI 模型
gpt-oss 包含两个开放权重语言模型,gpt-oss-120b 和 gpt-oss-20b,旨在提供强大的性能和高效的部署。它们在 Apache 2.0 许可下提供,使其可用于各种应用,同时确保安全性和可定制性。
Muse Spark 1.2 是一个针对真实编码工作流程优化的 AI 模型,提供更高的首次尝试准确性和可靠的工具调用。它旨在通过 100 万个令牌的上下文增强编码能力,非常适合寻求高效集成的开发人员。
亚马逊Nova是一套为企业级应用设计的基础模型和服务,提供高性能和多模态能力。它使组织能够在确保安全和负责任的AI使用的同时进行创新。
AI 模型
MiniMax-M2.5是一个先进的AI模型,旨在用于编码、办公室工作和工具使用。它在效率和成本效益方面表现出色,使其能够在各个行业中实现创新应用。
Mistral Small 4是一个多功能的AI模型,将推理、编码和多模态能力统一到一个平台中。它允许用户高效地自定义、微调和部署AI助手和代理,非常适合各种企业应用。
Command A+ 是一个具有 25B 活跃参数和 218B 总参数的专家混合模型,旨在处理复杂推理、视觉和多语言任务,支持 48 种语言,为企业提供高效准确的解决方案。
AI 模型
ERNIE 5.1 是一款尖端的人工智能模型,性能卓越,同时将预训练成本降至最低。它在代理能力、推理和创造力方面有显著进展,使其成为人工智能领域的顶尖竞争者。
Gemini Omni 是 Google DeepMind 开发的 AI 模型,允许用户通过自然对话创建和编辑视频。它将推理与创造能力相结合,使用户能够将任何输入转化为连贯的视频输出。
Imagen 是由 Google DeepMind 开发的尖端文本到图像 AI 模型。它以卓越的清晰度和速度生成逼真的图像,使用户能够通过详细的提示将他们的想象愿景变为现实。
AI 模型
Qwen-Image 是一个先进的图像生成基础模型,擅长复杂文本渲染和精确图像编辑。它支持多种艺术风格,并提供高级编辑功能,使其成为艺术家和设计师的多功能工具。
AI 模型
Ideogram 4.0 是一个先进的 AI 模型,旨在用于各种应用。它为希望利用 AI 技术进行项目的用户提供强大的能力,提高各个领域的效率和生产力。
稳定扩散 3.5 是一个多模态扩散变换器模型,旨在进行文本到图像的生成。它提高了图像质量、排版和提示理解,同时资源效率高,适合各种创意应用。
AI 模型
Ray3.2是一个多功能的AI视频模型,将创意意图转化为可扩展的视频工作流程。它在多个工作流程中提供增强的控制、连续性和电影方向,包括修改视频、图像转视频、文本转视频和重新构图。
LTX-2 是一个基于 DiT 的音视频基础模型,旨在生成同步的视频和音频。它结合了现代视频生成技术和开放权重,使得在各种应用中能够进行实用的本地执行。
MiniMax Hailuo 2.3 是一款先进的 AI 模型,旨在处理复杂的视频性能和媒体任务。它通过多模态能力提升用户体验,适用于媒体和技术领域的广泛应用。
Cosmos 3 是 NVIDIA 开发的先进 AI 模型,旨在增强人工智能、高性能计算和机器人技术等各种应用。它利用 NVIDIA 在 GPU 技术方面的专业知识,提供强大的计算能力。
AI 模型
大理石是一个允许用户创建和分享沉浸式3D世界的平台。它提供了构建详细环境的工具,非常适合希望通过3D视觉增强项目的创作者和开发者。
AlphaFold 3 是由 Google DeepMind 开发的 AI 模型,能够预测蛋白质结构和相互作用,显著加速生物研究和分子相互作用的理解。
AI 模型
SAM 3 允许用户利用文本和视觉提示准确识别、分割和跟踪图像或视频中的对象。它将很快在 Meta AI 应用的 Instagram 编辑和 Vibes 中推出,增强用户的视频创作体验。
Lyria 3.5 是 Google DeepMind 开发的先进音乐生成模型,帮助用户轻松创作歌曲。它提供技术控制和在各种流派中创作曲目的能力,使音乐创作变得可及且富有创新性。
Sonic 是 Cartesia 的实时文本转语音 API,能够生成 44 种语言的富有表现力的声音,并带有笑声。专为 AI 代理和互动应用设计,提供低延迟和高质量的语音合成。
AI 模型
芝麻 CSM 是一个对话式语音模型,能够从文本和音频输入生成音频代码。它利用 Llama 主干,旨在用于研究和教育目的,促进 AI 技术的负责任使用。
AI 模型
IBM 花岗岩是一系列开放、可信赖的商业 AI 模型,提供高效的语言、视觉、语音和安全模型,可根据企业需求进行定制和部署。
Inkling 是一个拥有 9750 亿参数的多模态 AI 模型,专为开发者设计。它接受文本、图像和音频输入,生成文本输出,适用于各种应用,包括聊天机器人和编码助手。以开放权重发布,支持研究和集成到第三方产品中。
AI 模型
Vidu Q3是一个AI视频生成模型,能够创建带有原生音频的视频,实现无缝叙事。它提供更快的运动质量和更强的提示控制,非常适合各行业的创作者和团队。
HunyuanImage 3.0 是一个强大的本地多模态模型,专为图像生成而设计。它在文本到图像和图像到图像任务中表现出色,提供了先进的创意编辑和智能提示增强能力。
AI 模型
Olmo来自Ai2是一个完全开放的语言模型,旨在用于先进的人工智能研究和应用。它提供了多种针对编程、推理和对话优化的模型变体,确保开发者和研究人员的透明性和可访问性。
Phi-4-reasoning-vision-15B是微软开发的多模态AI模型,旨在处理需要视觉-语言理解和推理能力的任务。它在科学推理和计算机使用代理任务中表现出色,适用于各种应用。
AI 模型
ESMFold2 从氨基酸序列预测高分辨率、全原子 3D 蛋白质结构。它提供对单序列和 MSA 条件模型的开放访问,提高了对挑战性目标的准确性。
NVIDIA Isaac GR00T N1.7 是一个开放的基础模型,旨在用于类人机器人推理和技能。它处理多模态输入以执行操作任务,使开发人员能够针对不同环境中的特定应用进行后训练。
Falcon-H1R-7B 是一个专注于推理的 AI 模型,旨在提高数学、编程和逻辑任务的性能。由技术创新研究所开发,采用混合架构以实现高效推理和测试时扩展。
AI 模型
OpenAI是一家领先的人工智能研究和部署公司。它专注于开发先进的AI模型,并使其能够应用于各种场景。该公司的目标是确保通用人工智能能够造福全人类。
AI 模型
AudioGen 是一个自回归生成式 AI 模型,可根据描述性文本标题创建音频样本。它解决了音频生成中的挑战,例如分离声源、处理现实世界噪声以及文本标注稀缺的问题。该模型在学习到的离散音频表示上运行,以实现高保真输出。
AI 模型
OPT-175B 是 Meta AI 发布的一个拥有 1750 亿参数的语言模型,面向研究社区。它提供了对大规模语言模型的访问,从而能够更深入地理解和推进自然语言处理(NLP)研究,并专注于负责任的开发和减轻偏见。
Gato 是 Google DeepMind 开发的单一通用人工智能代理。它可以执行各种任务,包括玩 Atari 游戏、为图像添加字幕、聊天以及控制真实的机器人手臂。这种多模态代理使用 Transformer 神经网络来处理多样化的数据输入并生成适当的输出。
AI 模型
NeRF,即神经辐射场,通过优化连续的体积场景函数来合成复杂场景的新视角。它使用稀疏的输入视图集,通过深度网络表示场景,输出密度和视依赖辐射。该方法在神经渲染和视图合成方面取得了最先进的成果。
DETR 是一种端到端的对象检测和全景分割框架,将 Transformer 作为核心组件集成。它简化了架构,直接预测对象集,并在 COCO 等具有挑战性的数据集上达到了最先进的性能,为计算机视觉任务提供了更灵活、更精简的方法。
AI 模型
Meta 工程是 Meta 工程团队的官方博客,分享其工作见解。内容涵盖人工智能、数据基础设施、开发工具等。该网站还列出了各地的工程职位空缺,让人们得以一窥公司技术部门的职业机会。
AI 模型
Densenet是一种深度卷积神经网络架构,可通过PyTorch使用。它通过以前馈方式将每个层连接到所有其他层来增强特征传播和重用。该模型在ImageNet上进行了预训练,并提供densenet121、densenet169、densenet201和densenet161等变体,用于图像分类任务。
MobileNets 是 TensorFlow 中面向移动设备优先的计算机视觉模型系列,专为高效的设备端或嵌入式应用而设计。它们在最大化精度的同时,最大限度地减少了计算量、功耗和存储空间,是无需互联网连接即可进行实时视觉识别的理想选择。
AI 模型
SqueezeNet 是一个深度卷积神经网络模型,可通过 PyTorch 使用。它在实现 AlexNet 级别准确率的同时,参数量和模型尺寸显著减少,使其在各种计算机视觉任务中效率很高。该模型在 ImageNet 上进行了预训练,可以轻松集成到 PyTorch 项目中。
AI 模型
Xception 是一个深度学习模型,可通过 Keras 3 API 使用。它是 Keras Applications 的一部分,为各种计算机视觉任务提供预训练模型。Xception 专为图像分类及相关应用而设计,为构建先进的 AI 系统奠定了坚实的基础。
AI 模型
通过 Inceptionism 探索人工智能神经网络的内部工作原理。该技术通过增强输入图像来可视化网络层,以揭示学习到的特征,有助于理解和调试 AI 模型。它支持创意图像生成和对 AI 感知的更深入洞察。
AI 模型
英伟达在人工智能计算领域处于领先地位,推动着 GPU、AI 基础设施和智能体 AI 的进步。他们提供用于前沿模型训练、数据中心 AI 工厂和自主系统的解决方案,赋能各行业实现创新和加速开发。
AI 模型
Transfo-XL-WT103 是一种具有相对位置嵌入的因果Transformer模型,可以重用隐藏状态以处理更长的上下文。该模型由Zihang Dai等人开发,并使用自适应Softmax处理输入和输出。该模型适用于文本生成任务,并在Wikitext-103数据集上进行了训练。
AI 模型
MusicLM 是一个 AI 模型,可以根据文本描述生成高保真音乐。它可以生成长达 24 kHz 的音乐,并在数分钟内保持一致性,在音频质量和文本遵循度方面优于之前的系统。它还支持旋律条件生成。
AI 模型
Jukebox 是一个神经网络,可以生成包括初步人声在内的原始音频音乐。它可以创作各种流派和艺术家风格的音乐,为人工智能驱动的音乐创作提供了一种新颖的方法。模型权重和代码已发布,并附带一个用于探索生成样本的工具。
AI 模型
Google DeepMind 探索 Gopher 等大型语言模型,重点关注其能力、伦理考量和高效训练。研究包括一个拥有 2800 亿参数的模型、风险评估以及用于改进预测和可追溯性的检索增强架构。目标是安全且有益地推进人工智能。
AI 模型
本研究实证分析了在固定计算预算下,大型语言模型模型大小与训练数据之间的最优权衡。研究表明,当前的大型模型通常过大且训练不足,并提出了一种更高效的方法以获得更好的性能和降低推理成本。
AI 模型
OpenAI Codex 是一个将自然语言转换为代码的 AI 系统。它能解析简单指令并执行,从而为应用程序构建自然语言界面。它精通多种编程语言,擅长将问题映射到现有代码。
AI 模型
AlphaCode 是由 Google DeepMind 开发的一个人工智能系统,能够以竞技水平编写计算机程序。它在编程竞赛中的参与者中估计排名在前 54%,通过生成复杂编码挑战的新颖解决方案,展示了先进的问题解决能力。
Parti 是一个自回归文本到图像生成模型,可创建高保真度、照片级真实感的图像。它将图像生成视为一个序列到序列问题,利用大型语言模型的进步来实现复杂的构图和世界知识合成。Parti 支持内容丰富的合成,具有精细的细节和交互。
AI 模型
LaMDA是谷歌突破性的对话式AI模型,旨在就广泛的主题进行自由流畅的对话。它基于Transformer架构,专门针对对话数据进行训练,以理解诸如合理性和特异性等细微差别,从而实现更自然的人机交互和新的应用类别。
Google AI Blog Archive 是一个历史存档库,收录了来自 Google 的人工智能研究和开发相关的博文。它使用户能够浏览过去发布的公告、见解和 AI 技术更新,全面了解 Google 多年来在该领域的贡献。该存档按年份和月份进行组织,方便用户访问。
AI 模型
InstructGPT 模型是经过训练的 AI 语言模型,比 GPT-3 更能遵循用户意图。它们通过人类反馈强化学习,更加真实、毒性更低,并与用户目标保持一致,现已为 OpenAI 的 API 提供支持。
AI 模型
DreamFusion 是一个从文本描述生成 3D 物体的 AI 模型。它利用预训练的 2D 扩散模型来创建可重新照明的 3D 资产,如神经辐射场 (NeRF),而无需 3D 训练数据。这使得能够为各种文本提示生成高保真度的外观、深度和法线。
AI 模型
Point E 是 OpenAI 开发的一款 AI 模型,托管在 Hugging Face Spaces 上。它专注于从文本提示生成 3D 点云。该工具允许用户探索由 AI 驱动的 3D 内容创建,一窥生成式 AI 在空间数据方面的能力。
AI 模型
Diffuse The Rest 是一个 Hugging Face Space,它使用 Stable Diffusion 模型根据文本描述生成图像。只需输入您想看到的内容,AI 就会创建匹配的图片。然后您可以立即查看、下载或分享生成的图像。
AI 模型
图注意力网络(GATs)是为图结构数据设计的新型神经网络架构。它们利用掩码自注意力层来解决先前图卷积方法的局限性,从而能够对社交网络和分子数据等不规则空间结构进行原则性操作。
AI 模型
图卷积网络(GCN)是一种专门用于处理图结构数据的神经网络。它将卷积神经网络(CNN)的概念推广到图结构数据,从而在半监督学习和图嵌入等领域实现强大的应用。该模型为分析复杂网络数据提供了一种新颖的方法。
AI 模型
FaceNet 是一个基于 FaceNet 论文的 TensorFlow 实现,用于人脸识别和聚类。它利用深度学习模型为面部生成统一的嵌入向量,从而实现准确的识别和分组。该项目提供了预训练模型和用于训练自定义分类器的代码。
AI 模型
Longformer Base 4096 是一款为处理长文档而设计的 Transformer 模型。它基于 RoBERTa,并在最长 4096 个 token 的扩展序列上进行了预训练。该模型采用混合注意力机制,结合了滑动窗口和全局注意力,以实现高效的长文档理解和特定任务的表征学习。
BigBird基础模型是一个Transformer模型,它通过块稀疏注意力机制扩展了BERT,能够处理更长的序列。该模型已针对英文文本进行掩码语言模型任务的预训练,可以高效处理长达4096个token的序列,并在长文档任务上取得了最先进的成果。
AI 模型
NVIDIA 技术博客提供关于 AI、HPC 和加速计算的深度见解。它包含有关前沿研究、开发者工具和行业趋势的文章。该资源面向希望加深理解并利用 NVIDIA 技术进行创新的专业人士。
AI 模型
RAG(检索增强生成)将预训练语言模型与外部数据源相结合。它会检索相关段落来指导生成,从而提高事实准确性,并允许在不完全重新训练模型的情况下更新知识。这种方法通过整合参数式和非参数式记忆来提高响应质量。
AI 模型
SimCLR 是一个用于视觉表示的自监督和半监督学习框架。它通过最大化同一图像不同变换视图之间的一致性来简化先前的方法,从而在标记数据有限的图像分类任务上取得了最先进的性能。
AI 模型
DeepMind 是一个领先的人工智能研究实验室,专注于推动人工智能的最新进展。他们开发尖端的人工智能模型和系统,不断突破机器在各种科学和技术领域所能实现的界限。他们的工作旨在解决复杂问题并开启新的可能性。
AI 模型
Phi-2 是来自微软研究院的一个拥有 27 亿参数的语言模型。它展现了出色的推理和语言理解能力,在 130 亿参数以下的模型中取得了最先进的性能。在复杂的基准测试中,Phi-2 的表现与模型大小高出 25 倍的模型相当或更优,是研究和实验的理想选择。
AI 模型
ControlNet 增强了扩散模型,增加了条件控制,允许用户通过特定输入来指导图像生成。它可以在不破坏预训练模型的情况下进行微调,适用于个人设备,并提供模型合并和替换的灵活性。
AI 模型
该AI模型详细介绍了一个大型深度卷积神经网络,该网络经过训练以进行ImageNet分类。它在测试数据上取得了最先进的成果,top-1和top-5错误率分别为39.7%和18.9%,使用了6000万个参数和50万个神经元,分布在五个卷积层和两个全连接层中。
AI 模型
此 GitHub 存储库提供了使用 PyTorch 的深度卷积生成对抗网络 (DCGAN) 的示例实现。它允许用户在 LSUN 等数据集上训练模型并生成逼真的图像,并提供自定义和 GPU 加速选项。代码包含数据集下载和模型训练的脚本。
AI 模型
本文深入解析了 Wasserstein GAN (WGAN) 论文,使其复杂的理论更易于理解。文章详细阐述了该论文的重要性、理论基础和实证结果,为改进 GAN 训练和生成模型评估指标提供了见解。
AI 模型
本研究介绍了一种新颖的生成对抗网络(GAN)训练方法。它从低分辨率开始渐进式地增长生成器和判别器,并添加层以获得更精细的细节。这种方法显著加快了训练速度,增强了稳定性,并生成了具有更高质量和变异性的高分辨率图像。
AI 模型
StyleGAN3 引入了无别名(alias-free)的生成对抗网络,通过彻底改革生成器内的信号处理来实现。这项创新消除了“纹理粘连”现象,能够更连贯地合成视频和动画。该模型在实现 StyleGAN2 的 FID 分数的同时,提供了对平移和旋转的完全等变性,即使在亚像素尺度上也是如此。
Google DeepMind 的出版物档案展示了前沿的 AI 研究。探索从 AI 意识和安全到高级视觉和语言模型的复杂挑战的最新研究。发现强化学习、生成式 AI 和多智能体系统等领域的突破。
AI 模型
GitHub Pages 是 GitHub 提供的一项静态网站托管服务。它允许用户直接从 GitHub 仓库发布网站。非常适合项目文档、个人作品集和简单的 Web 应用程序,它提供了一种通过版本控制部署 Web 内容的直接方式。
AI 模型
这篇人工智能模型研究论文探讨了生成对抗网络(GANs)的逼近和收敛性质。它解决了关于判别器族限制如何影响逼近质量以及目标函数收敛何时导致分布收敛的基本问题。该工作引入了对抗散度以进行统一分析。
Graphormer 是一个用于分子建模任务的深度学习包,可加速材料和药物发现的研究。它支持分子动力学和性质预测,并计划未来增强反应预测和大规模分子建模功能。在图级别预测任务上,其性能优于传统的图神经网络。
AI 模型
reCAPTCHA 是一项安全措施,旨在保护网站免受自动化机器人和恶意流量的侵害。它在授予网页访问权限之前验证用户是否为真人,从而确保用户和网站管理员更安全的在线体验。该系统有助于维护网站的完整性并防止滥用。
AI 模型
UL2 20B 是一个开源的统一语言学习模型,它统一了各种语言建模范式。通过将目标构建为具有混合去噪器的去噪任务,它在微调和少样本学习任务上提高了性能,为语言模型训练提供了一种平衡的方法。
AI 模型
FLAN-T5 是 T5 语言模型的增强版本,经过针对多样化任务混合的专门微调。它在无需进一步微调的情况下提供了改进的性能,使其可直接用于各种自然语言处理应用。提供多种尺寸,可满足不同的计算需求。
AI 模型
PaLM-E 是一个具身多模态语言模型,它将真实的连续传感器数据与文本相结合。通过将语言与感知相联系,使机器人能够执行复杂任务,并在不同的训练领域和具身环境中展现出积极的迁移能力,以实现高级推理和规划。
AI 模型
该框架引入了一种新颖的主动学习方法,用于丰富大型 3D 形状数据集的语义区域标注。它有效地结合了手动标注、自动传播和验证,以最大限度地减少用户工作量,同时最大限度地提高 3D 模型标注的准确性。
AI 模型
DGCNN 是一款用于点云学习的 AI 模型,实现了动态图卷积神经网络。它在 3D 点云数据的分类和分割等任务中取得了最先进的性能。该模型有 PyTorch 实现版本,并已应用于实际场景。
AI 模型
MMAction2 是一个用于动作识别和视频理解任务的基础库。它提供了一个全面的工具包,用于开发和部署最先进的视频分析模型,该模型构建在 PyTorch 之上并与 OpenMMLab 生态系统集成。本档涵盖教程、API 参考和项目信息。
AI 模型
Wav2vec 2.0 是一种用于自动语音识别的自监督学习算法。它从原始音频中学习,仅需极少量转录数据即可达到高精度。这使得更多语言、方言和领域能够实现语音识别,减少对海量标注数据集的依赖。
AI 模型
AudioLM 是一个能够生成高质量、具有长期一致性的音频的 AI 模型。它将音频生成视为一项语言建模任务,将音频映射到离散的 token。该框架在生成自然连贯的语音和音乐续写方面表现出色,即使是针对未曾见过的说话人或风格。
AI 模型
Jiasen Lu 是艾伦人工智能研究所的一名研究科学家。他的工作专注于推进人工智能研究。此页面作为个人主页,提供其专业档案和研究活动的链接。它是了解他对人工智能领域贡献的中心枢纽。
AI 模型
此列表指向一个未找到的 GitHub Pages 站点。它表明在提供的域上没有活动的 GitHub Pages 站点。用户在尝试发布站点时,会被引导至 GitHub Pages 文档以获取设置说明。
ALIGN 是一个 AI 模型,它利用来自超过十亿个图像-alt 文本对的嘈杂文本监督,扩展视觉和视觉-语言表示学习。它在跨模态检索和纯视觉任务中取得了最先进的成果,实现了零样本分类和多模态搜索。
AI 模型
DALL·E 是一个 AI 模型,可以根据文本描述生成图像。它可以创建各种视觉概念,组合不相关的想法,渲染文本,并对现有图像进行转换,为可视化自然语言提示提供了一种新颖的方式。
AI 模型
Flamingo 是来自 Google DeepMind 的单一视觉语言模型 (VLM),在各种多模态任务的少样本学习方面表现出色。它处理交错的图像、视频和文本,以生成相关的语言输出,仅需极少的特定任务示例即可完成,无需额外训练。
AI 模型
Google AI Blog 是一个中心枢纽,用于发布公告、研究更新以及深入了解 Google 在人工智能领域的进展。它涵盖了广泛的 AI 主题,从机器学习的突破到实际应用,让人们得以一窥 AI 发展的未来及其对社会的影响。探索 AI 的最新动态。
AI 模型
BEiT 是一个自监督视觉表示模型,它使用掩码图像建模来预训练视觉 Transformer。它将图像分词为视觉标记,并恢复被掩码的图像块,在图像分类和语义分割等下游任务上取得了有竞争力的结果。
AI 模型
ACM 数字图书馆是一个全面的研究门户,提供对计算领域海量学术文章、会议论文集和期刊的访问。它是研究人员、学生和专业人士寻求深入知识以及计算机科学和工程领域最新进展的关键资源。该平台通过其广泛的档案促进发现和学习。
AI 模型
SchNetPack 是一个用于原子系统的深度学习 Python 库。它提供了一个灵活的框架,用于构建和训练神经网络势,使研究人员能够使用先进的 AI 模型进行模拟和分析分子性质。文档托管在 Read the Docs 上。
AI 模型
变分自编码器(VAE)提供了一种概率方法来表示潜在空间。与标准自编码器不同,VAE 将观测值编码为概率分布,从而实现更平滑的潜在空间和生成能力。这使得数据表示和重构更加细致。
AI 模型
Meta AI 是一项专注于通过开放研究和易于使用的工具来推进人工智能的研究计划。它旨在连接人们与其关心的事物,并赋能新的体验。当前页面显示错误,阻止访问其产品、研究和资源。
Reformer 是一个 AI 模型,它增强了 Transformer 架构以处理海量顺序数据。它解决了注意力机制和内存分配的局限性,使得在具有 16GB 内存的单个加速器上能够处理高达 100 万字的上下文窗口。
AI 模型
AlphaDev 是一个使用强化学习来发现增强型计算机科学算法的 AI 系统。它已成功识别出比人类开发的方法更快的排序和哈希算法,从而实现了更高效和可持续的计算。这些算法现已开源。
AI 模型
ImageBind 是 Meta AI 开发的多模态 AI 模型,能够融合图像、视频、音频、文本、深度和热成像六种模态的数据。它在无需显式监督的情况下学习单一的嵌入空间,从而为 AI 系统实现先进的跨模态理解和生成。
AI 模型
Intern Large Models (InternLM),由上海人工智能实验室开发,提供开源的大语言模型(LLM)和多模态大语言模型(MLLM)。其套件包括 InternVL 和 InternLM-XComposer 等模型,以及用于开发和应用的工具链,其中包含用于微调的 XTuner 和用于部署的 LMDeploy。
AI 模型
通义实验室 (Meet Tongyi) 是阿里云通义千问大语言模型的官方网站。它展示了全系列模型、最新的行业新闻和前沿应用,全面概述了其在自然语言、文本生成和视觉理解方面的能力。
Zephyr-7B-β 是一个开源语言模型,通过直接偏好优化 (DPO) 从 Mistral-7B-v0.1 微调而来。它作为有用的助手表现出色,在 MT-Bench 和 AlpacaEval 基准测试中展现出强大的性能,非常适合聊天应用。
AI 模型
VideoPoet 是 Google Research 开发的一款大型语言模型,能够进行零样本视频生成。它将自回归语言模型转化为高质量的视频生成器,支持文本到视频、视频到音频以及各种编辑任务,并具有出色的时间一致性和运动保真度。
AI 模型
Lumiere 是 Google Research 开发的时空扩散模型,用于生成逼真、多样且连贯的视频。它能在单次运行中合成整个视频时长,从而实现高级的文本到视频、图像到视频、视频修复以及风格化生成任务,并具有出色的时间一致性。
AI 模型
Fuyu-8B 是一款开源的多模态人工智能模型,专为数字代理设计。其简化的架构支持任意图像分辨率,能够以快速的响应时间回答关于图表、示意图和用户界面元素的问题。它在标准基准测试中表现良好,并可在 HuggingFace 上获取。
IDEFICS 是一个开放访问的视觉语言模型,能够复现最先进的性能。它接受交错的图像和文本输入,生成文本输出,其能力可与 Flamingo 等专有模型相媲美。提供 9B 和 80B 参数版本,支持多模态 AI 的研究和开发。
AI 模型
MiniGPT-4 是一个人工智能模型,通过将冻结的视觉编码器与大型语言模型对齐,增强了视觉-语言理解能力。它可以生成详细的图像描述、根据草稿创建网站、创作受图像启发的故事情节,并解决视觉问题,展现了先进的多模态能力。
AI 模型
LLaVA 是一个大型多模态模型,它将视觉编码器与语言模型相结合,用于通用的视觉和语言理解。它在多模态聊天能力方面表现出色,模仿 GPT-4,并通过视觉指令调优在 Science QA 等基准测试中取得了最先进的准确率。
AI 模型
Mamba 是一种新颖的状态空间模型架构,专为高效序列建模而设计,在语言等信息密集型数据上尤其有效。它提供了硬件感知的实现,旨在超越先前亚二次方模型并与 Transformer 竞争。
AI 模型
RWKV 是一个强大的语言模型,提供高效的推理和灵活的微调能力。它支持各种应用,包括桌面 GUI、基于 Web 的推理和移动应用,使先进的 AI 能够跨多个平台和设备用于各种任务。
AI 模型
OpenELM 是来自 Apple Machine Learning Research 的最先进的开放语言模型系列。它采用逐层缩放策略以提高准确性,并提供了一个完整的框架,用于在包括日志和检查点在内的公共数据集上进行训练和评估。该发布还包括在 Apple 设备上集成 MLX 的代码。
AI 模型
约翰内斯·开普勒大学林茨分校的机器学习研究所(IML)在机器学习领域进行享有盛誉的研究并提供相关教育。该研究所专注于机器学习和统计方法的开发与应用,并提供生物信息学领域的学士和硕士课程。
AI 模型
Medium 是一个庞大的在线出版平台,个人和组织在此分享各种文章、故事和见解。它涵盖技术、文化、个人发展和时事等广泛主题的内容,培养了读者和作者社群。
AI 模型
N-BEATS 是一个基于神经网络的单变量时间序列预测模型。由 ServiceNow Research 开发,它实现了 N-BEATS 算法以获得可复现的实验结果。该存储库提供了 PyTorch 实现、数据集加载器和用于高级时间序列分析的实验配置。
AI 模型
零一万物 (01.AI) 是一家全球性人工智能公司,专注于 AI 2.0,以基础模型突破为驱动。他们的目标是革新技术、平台和应用,创建一个人工智能增强人类生产力和社会价值的新生态系统。他们的愿景是让通用人工智能 (AGI) 惠及所有人。
AI 模型
物理信息神经网络 (PINNs) 通过遵循非线性偏微分方程描述的物理定律来解决监督学习任务。它们能够实现数据驱动的解决方案和偏微分方程的发现,提供一种自然编码物理约束的新型函数逼近方法。
AI 模型
Ansuman Bora 的个人作品集网站展示了他作为 Corteva Agriscience 软件工程师的专业背景。它突出了他的学术成就,包括亚利桑那州立大学的计算机科学硕士学位和 Nirma 大学计算机工程的 B.Tech 学位。该网站还涉及他的兴趣和项目。
AI 模型
Octo 是一款开源的通用机器人策略,专为机器人操作的广泛应用而设计。这款基于 Transformer 的扩散策略在大型数据集上进行了预训练,支持灵活的任务定义和高效的微调以适应新的观察和动作空间,使其能够适应各种机器人应用。
AI 模型
APS 期刊是一个数字平台,提供对美国物理学会出版的大量同行评审科学研究文章的访问。它为物理学家、研究人员和学生提供了一个至关重要的资源,以获取物理学各个领域的最新发现和基础知识。该平台确保可靠地访问高质量的科学文献。
AI 模型
DBRX 是 Databricks 推出的最先进的开源大型语言模型 (LLM),在语言、编程和数学基准测试中表现出色。它提供了更高的效率和质量,超越了 GPT-3.5,并与 Gemini 1.0 Pro 竞争,使企业和开源社区能够获得先进的 LLM 功能。
AI 模型
Fast R-CNN 是一个用于目标检测的深度学习框架。与 R-CNN 和 SPPnet 等先前方法相比,它显著加快了训练和测试速度,并在基准数据集上实现了更高的准确性。该框架使用 Python 和 C++/Caffe 编写,非常适合计算机视觉领域的研究人员和开发人员。
AI 模型
py-faster-rcnn 是 Faster R-CNN 对象检测模型的 Python 实现。它提供了官方 MATLAB 版本的替代方案,在 CPU 上的 Python 层导致测试速度略有差异的情况下,实现了相似的准确度。该项目已弃用,推荐使用 Detectron。
AI 模型
Caffe 框架集成 SSD 实现,用于目标检测。该存储库提供了一个快速、开放的深度学习框架,专门为单次多框检测器 (SSD) 定制。它能够使用单个模型训练和评估目标检测网络,提供高效的性能。
AI 模型
特征金字塔网络 (FPN) 通过利用深度卷积网络的金字塔结构,以极低的计算开销生成多尺度特征图,从而增强目标检测能力。该架构提高了对各种尺寸目标的检测精度,为实时检测任务提供了实用且高效的解决方案。
ToolPotion是人们浏览以寻找最佳AI 模型的AI工具目录。免费列出,每个提交都经过编辑审核——将您的工具放在搜索的起点。