描述
Jina Embeddings v3 是由 Jina AI 开发的复杂多语言文本嵌入模型。它旨在满足广泛的自然语言处理 (NLP) 应用需求。该模型基于 Jina-XLM-RoBERTa 架构,并结合了旋转位置嵌入 (RoPE),使其能够处理长达 8192 个标记的输入序列。这一能力对于需要大量文本处理的应用特别有利。
该模型具有五个 LoRA 适配器,能够高效生成特定任务的嵌入。用户可以为各种任务自定义嵌入,包括检索查询、段落嵌入、聚类、分类和文本匹配。这种灵活性使 Jina Embeddings v3 适用于不对称检索任务、聚类和重新排序应用、分类任务以及量化文本相似性的任务。
Jina Embeddings v3 支持 Matryoshka 嵌入,提供从 32 到 1024 的灵活嵌入大小。此功能允许用户截断嵌入以适应特定应用需求。该模型针对 30 种语言进行了调优,包括阿拉伯语、中文、英语、法语、德语、印地语、日语、韩语和西班牙语等。
该模型的一个显著更新是修复了编码函数中的一个错误,确保截断嵌入的一致归一化。建议用户在集成模型时应用均值池化,因为这种方法可以产生高质量的句子嵌入。该模型可以通过 Jina 嵌入 API 或直接通过 Transformers 包使用。
Jina Embeddings v3 兼容支持 FlashAttention-2 的 GPU,例如 Ampere、Ada 或 Hopper GPU。它在 CC BY-NC 4.0 许可下发布,商业使用咨询请联系 Jina AI。该模型的使用量显著,上个月下载量超过 200 万次,并在 AWS 和 Azure 平台上列出。
Jina Embeddings v3亮点
支持 30 种语言的多语言功能
扩展序列长度可达 8192 个标记
具有 LoRA 适配器的特定任务嵌入
Matryoshka 嵌入以实现灵活大小
均值池化以获得高质量句子嵌入
与 FlashAttention-2 GPU 兼容
支持使用 SentenceTransformerTrainer 进行微调
ONNX 推理以实现高效处理
修复编码函数归一化的错误
CC BY-NC 4.0 许可
Jina Embeddings v3入门
访问页面:访问 huggingface.co/jinaai/jina-embeddings-v3
加载模型:使用 AutoModel.from_pretrained
配置环境:确保 GPU 兼容性
集成:应用均值池化以获得嵌入
微调:使用 SentenceTransformerTrainer 进行任务
Jina Embeddings v3的使用案例
- 文本检索
- 文本分类
- 聚类
- 文本匹配
- 多语言处理









