描述
Nomic-embed-text-v1.5 是一个先进的嵌入模型,托管在 Hugging Face 上,旨在促进文本在各种人工智能应用中的嵌入。该模型是一个更广泛的倡议的一部分,旨在通过开源和开放科学推动和普及人工智能。多模态能力的引入意味着它可以与其他模型(如 nomic-embed-vision-v1.5)对齐,从而实现对文本和视觉数据的更集成的嵌入方法。
该模型采用 Matryoshka 表示学习,为开发者提供了调整嵌入大小的灵活性,几乎不影响性能。这对于需要不同维度的应用特别有用,因为该模型支持多种大小的嵌入,包括 512、256、128 和 64 维。这种适应性使其适用于广泛的任务,从文档嵌入到问答和聚类。
为了有效利用 nomic-embed-text-v1.5,用户必须在文本提示中包含任务指令前缀。该前缀指示正在执行的特定任务,例如为检索增强生成(RAG)应用或分类目的嵌入文本。该模型设计用于处理长序列,支持超过 2048 个标记的长度,这对于处理大量数据集至关重要。
Nomic-embed-text-v1.5 基于一个强大的训练管道,包含多阶段的训练过程。初始阶段涉及对多样化数据集进行无监督对比训练,随后是利用高质量标记数据集的微调阶段。这种严格的训练方法确保模型能够处理各种任务,并在不同基准测试中提供可靠的性能指标。
对于希望将此模型集成到其应用中的开发者,Nomic 嵌入 API 提供了一种便捷的方式,通过 nomic Python 客户端生成嵌入。可以使用各种指标评估模型的性能,并且对于那些希望进一步了解其开发的人,详细的训练数据也可用。总体而言,nomic-embed-text-v1.5 是一个多功能的工具,适合希望通过先进的文本嵌入能力增强其应用的人工智能从业者。
nomic-embed-text-v1.5亮点
多模态支持
Matryoshka 表示学习
支持嵌入大小:64、128、256、512
长序列支持:>2048 个标记
需要任务指令前缀
提供 API
开源
发布高质量训练数据
nomic-embed-text-v1.5入门
访问页面:访问 Hugging Face 的 nomic-embed-text-v1.5 页面。
加载模型:使用 Nomic 嵌入 API 加载模型。
配置环境:设置开发环境以支持模型的要求。
集成:使用提供的 API 将模型集成到您的应用中。
微调:根据您的特定用例调整模型参数。
nomic-embed-text-v1.5的使用案例
- 文档嵌入
- 问答
- 聚类
- 分类
- 长上下文处理









