描述
nomic-embed-text-v2-moe 是一款尖端的多语言专家混合(MoE)文本嵌入模型,旨在在多语言检索任务中表现出色。它支持大约 100 种语言,并在超过 16 亿对数据上进行训练,使其在多样的语言应用中非常有效。该模型提供灵活的嵌入维度,利用 Matryoshka 嵌入实现高达三倍的存储成本降低,同时性能损失最小。
nomic-embed-text-v2-moe 的架构包括 4.75 亿个总参数,在推理过程中有 3.05 亿个处于激活状态。它具有八个专家和 top-2 路由的 MoE 配置,允许高效处理和高性能。该模型的最大序列长度为 512 个标记,支持从 768 到 256 的嵌入维度。
nomic-embed-text-v2-moe 完全开源,模型权重、代码和训练数据可供公众使用。这种透明性确保了可重复性,并促进了进一步的研究和开发。该模型在 BEIR 和 MIRACL 等基准测试中表现优异,超越了同类参数模型,并与更大模型保持竞争力。
尽管具有这些优势,用户仍需注意某些限制。不同语言的性能可能有所不同,由于 MoE 架构,资源需求可能高于传统的稠密模型。此外,用户在加载模型时必须启用 trust_remote_code=True,以利用自定义架构实现。
总体而言,nomic-embed-text-v2-moe 是一款强大的多语言文本嵌入任务工具,为广泛的应用提供灵活性、高效性和高性能。
nomic-embed-text-v2-moe亮点
最先进的多语言性能
支持大约 100 种语言
在超过 16 亿对数据上进行训练
灵活的嵌入维度
开源模型权重和代码
专家混合架构
使用 Matryoshka 嵌入实现高效存储
在 BEIR 和 MIRACL 基准测试中表现优异
nomic-embed-text-v2-moe入门
访问页面:访问 Hugging Face 模型页面
加载模型:使用 SentenceTransformers 或 Transformers
配置环境:设置 GPU 以获得最佳性能
集成:使用任务指令前缀进行查询和文档处理
微调:根据特定需求调整嵌入维度
nomic-embed-text-v2-moe的使用案例
- 多语言检索
- 文本嵌入
- 数据分析
- 语言处理
- 研究与开发







