跳转到主要内容
ToolPotion

Jina Embeddings v3

Jina Embeddings v3 是一个多语言、多任务的文本嵌入模型,旨在支持各种自然语言处理应用。它支持长输入序列和特定任务的嵌入,使其在不同用例中具有多功能性。

查看模型
分享

描述

Jina Embeddings v3 是由 Jina AI 开发的复杂多语言文本嵌入模型。它旨在满足广泛的自然语言处理 (NLP) 应用需求。该模型基于 Jina-XLM-RoBERTa 架构,并结合了旋转位置嵌入 (RoPE),使其能够处理长达 8192 个标记的输入序列。这一能力对于需要大量文本处理的应用特别有利。

该模型具有五个 LoRA 适配器,能够高效生成特定任务的嵌入。用户可以为各种任务自定义嵌入,包括检索查询、段落嵌入、聚类、分类和文本匹配。这种灵活性使 Jina Embeddings v3 适用于不对称检索任务、聚类和重新排序应用、分类任务以及量化文本相似性的任务。

Jina Embeddings v3 支持 Matryoshka 嵌入,提供从 32 到 1024 的灵活嵌入大小。此功能允许用户截断嵌入以适应特定应用需求。该模型针对 30 种语言进行了调优,包括阿拉伯语、中文、英语、法语、德语、印地语、日语、韩语和西班牙语等。

该模型的一个显著更新是修复了编码函数中的一个错误,确保截断嵌入的一致归一化。建议用户在集成模型时应用均值池化,因为这种方法可以产生高质量的句子嵌入。该模型可以通过 Jina 嵌入 API 或直接通过 Transformers 包使用。

Jina Embeddings v3 兼容支持 FlashAttention-2 的 GPU,例如 Ampere、Ada 或 Hopper GPU。它在 CC BY-NC 4.0 许可下发布,商业使用咨询请联系 Jina AI。该模型的使用量显著,上个月下载量超过 200 万次,并在 AWS 和 Azure 平台上列出。

Jina Embeddings v3亮点

  • 支持 30 种语言的多语言功能

  • 扩展序列长度可达 8192 个标记

  • 具有 LoRA 适配器的特定任务嵌入

  • Matryoshka 嵌入以实现灵活大小

  • 均值池化以获得高质量句子嵌入

  • 与 FlashAttention-2 GPU 兼容

  • 支持使用 SentenceTransformerTrainer 进行微调

  • ONNX 推理以实现高效处理

  • 修复编码函数归一化的错误

  • CC BY-NC 4.0 许可

Jina Embeddings v3入门

  1. 访问页面:访问 huggingface.co/jinaai/jina-embeddings-v3

  2. 加载模型:使用 AutoModel.from_pretrained

  3. 配置环境:确保 GPU 兼容性

  4. 集成:应用均值池化以获得嵌入

  5. 微调:使用 SentenceTransformerTrainer 进行任务

Jina Embeddings v3的使用案例

  • 文本检索
  • 文本分类
  • 聚类
  • 文本匹配
  • 多语言处理

Jina Embeddings v3的常见问题

From Jina AI

Jina Embeddings v3 评价

加载中...

与 Jina Embeddings v3 类似的热门AI工具

nomic-embed-text-v2-moe 是一款最先进的多语言专家混合文本嵌入模型。它支持大约 100 种语言,并在多语言检索任务中表现出色,提供灵活的嵌入维度和降低的存储成本。

AI 模型与大语言模型

BAAI/bge-large-en-v1.5 是一个最先进的嵌入模型,旨在增强检索增强语言模型的能力。它提升了检索能力并支持多种任务,适用于自然语言处理和人工智能研究的应用。

精选AI 模型与大语言模型

BAAI/bge-small-en-v1.5 是一个小规模的嵌入模型,旨在用于检索增强语言模型任务。它在各种自然语言处理应用中表现出色,适合 AI 领域的开发者和研究人员。

精选AI 模型与大语言模型

intfloat multilingual-e5-large模型是一款强大的AI工具,旨在提供多语言文本嵌入。它支持100种语言,并针对文本检索和语义相似性等任务进行了优化,在各种数据集上表现出色。

AI 模型与大语言模型

Longformer Base 4096 是一款为处理长文档而设计的 Transformer 模型。它基于 RoBERTa,并在最长 4096 个 token 的扩展序列上进行了预训练。该模型采用混合注意力机制,结合了滑动窗口和全局注意力,以实现高效的长文档理解和特定任务的表征学习。

AI 模型与大语言模型

MUSE 是一个用于创建多语言词嵌入的 Python 库,支持无监督和有监督方法。它将 fastText 嵌入对齐到公共空间,并提供大规模双语词典用于训练和评估,从而实现跨语言 NLP 任务。

AI 模型与大语言模型

Qwen1.5-110B 是一种基于变换器的语言模型,提供显著的性能提升、多语言支持和稳定的 32K 上下文长度。非常适合高级 AI 应用。

AI 模型与大语言模型

BAAI/bge-reranker-v2-m3 是一个轻量级的多语言重排序模型,旨在快速推理和便捷部署。它为查询和文档输出相似度评分,支持中文和英文。

AI 模型与大语言模型