Descripción
Jina Embeddings v3 es un sofisticado modelo de incrustación de texto multilingüe desarrollado por Jina AI. Está diseñado para atender una amplia gama de aplicaciones de procesamiento de lenguaje natural (NLP). El modelo se basa en la arquitectura Jina-XLM-RoBERTa e incorpora Rotary Position Embeddings (RoPE), lo que le permite manejar secuencias de entrada largas de hasta 8192 tokens. Esta capacidad es particularmente beneficiosa para aplicaciones que requieren un procesamiento extenso de texto.
El modelo cuenta con cinco adaptadores LoRA, que permiten la generación eficiente de incrustaciones específicas de tareas. Los usuarios pueden personalizar las incrustaciones para diversas tareas, incluyendo consultas de recuperación, incrustaciones de pasajes, agrupamiento, clasificación y coincidencia de texto. Esta flexibilidad hace que Jina Embeddings v3 sea adecuado para tareas de recuperación asimétrica, aplicaciones de agrupamiento y reordenamiento, tareas de clasificación y tareas que cuantifican la similitud del texto.
Jina Embeddings v3 soporta Matryoshka Embeddings, ofreciendo tamaños de incrustación flexibles que van desde 32 hasta 1024. Esta característica permite a los usuarios truncar las incrustaciones para ajustarse a las necesidades específicas de la aplicación. El modelo está ajustado para 30 idiomas, incluyendo árabe, chino, inglés, francés, alemán, hindi, japonés, coreano y español, entre otros.
Una actualización notable en el modelo es la resolución de un error en la función de codificación, asegurando una normalización consistente de las incrustaciones truncadas. Se aconseja a los usuarios aplicar agrupamiento medio al integrar el modelo, ya que este enfoque produce incrustaciones de oraciones de alta calidad. El modelo se puede utilizar a través de la API de Jina Embedding o directamente a través del paquete Transformers.
Jina Embeddings v3 es compatible con GPUs que soportan FlashAttention-2, como las GPUs Ampere, Ada o Hopper. Está licenciado bajo CC BY-NC 4.0, con consultas de uso comercial dirigidas a Jina AI. El modelo ha tenido un uso significativo, con más de 2 millones de descargas el mes pasado, y está listado en las plataformas AWS y Azure.
Aspectos destacados de Jina Embeddings v3
Soporte multilingüe para 30 idiomas
Longitud de secuencia extendida de hasta 8192 tokens
Incrustaciones específicas de tareas con adaptadores LoRA
Matryoshka Embeddings para tamaños flexibles
Agrupamiento medio para incrustaciones de oraciones de alta calidad
Compatibilidad con GPUs FlashAttention-2
Soporte para ajuste fino con SentenceTransformerTrainer
Inferencia ONNX para procesamiento eficiente
Corrección de errores para la normalización de la función de codificación
Licencia CC BY-NC 4.0
Primeros pasos con Jina Embeddings v3
Acceder a la página: Visita huggingface.co/jinaai/jina-embeddings-v3
Cargar modelo: Usa AutoModel.from_pretrained
Configurar entorno: Asegúrate de la compatibilidad con GPU
Integrar: Aplica agrupamiento medio para las incrustaciones
Ajustar: Usa SentenceTransformerTrainer para tareas
Casos de uso de Jina Embeddings v3
- Recuperación de Texto
- Clasificación de Texto
- Agrupamiento
- Coincidencia de Texto
- Procesamiento Multilingüe









