Descrição
Jina Embeddings v3 é um sofisticado modelo de incorporação de texto multilíngue desenvolvido pela Jina AI. Ele foi projetado para atender a uma ampla gama de aplicações de processamento de linguagem natural (PNL). O modelo é baseado na arquitetura Jina-XLM-RoBERTa e incorpora Rotary Position Embeddings (RoPE), permitindo que ele lide com sequências de entrada longas de até 8192 tokens. Essa capacidade é particularmente benéfica para aplicações que exigem processamento extenso de texto.
O modelo apresenta cinco adaptadores LoRA, permitindo a geração eficiente de incorporações específicas de tarefas. Os usuários podem personalizar incorporações para várias tarefas, incluindo consultas de recuperação, incorporações de passagens, agrupamento, classificação e correspondência de texto. Essa flexibilidade torna o Jina Embeddings v3 adequado para tarefas de recuperação assimétrica, aplicações de agrupamento e reclassificação, tarefas de classificação e tarefas que quantificam a similaridade de texto.
Jina Embeddings v3 suporta Matryoshka Embeddings, oferecendo tamanhos de incorporação flexíveis que variam de 32 a 1024. Esse recurso permite que os usuários truncem incorporações para atender às necessidades específicas da aplicação. O modelo é ajustado para 30 idiomas, incluindo árabe, chinês, inglês, francês, alemão, hindi, japonês, coreano e espanhol, entre outros.
Uma atualização notável no modelo é a resolução de um bug na função de codificação, garantindo a normalização consistente das incorporações truncadas. Os usuários são aconselhados a aplicar mean pooling ao integrar o modelo, pois essa abordagem resulta em incorporações de sentença de alta qualidade. O modelo pode ser utilizado através da API de Incorporação Jina ou diretamente pelo pacote Transformers.
Jina Embeddings v3 é compatível com GPUs que suportam FlashAttention-2, como GPUs Ampere, Ada ou Hopper. Ele é licenciado sob CC BY-NC 4.0, com consultas sobre uso comercial direcionadas à Jina AI. O modelo teve um uso significativo, com mais de 2 milhões de downloads no mês passado, e está listado nas plataformas AWS e Azure.
Destaques de Jina Embeddings v3
Suporte multilíngue para 30 idiomas
Comprimento de sequência estendido de até 8192 tokens
Incorporações específicas de tarefas com adaptadores LoRA
Matryoshka Embeddings para tamanhos flexíveis
Mean pooling para incorporações de sentença de alta qualidade
Compatibilidade com GPUs FlashAttention-2
Suporte a fine-tuning com SentenceTransformerTrainer
Inferência ONNX para processamento eficiente
Correção de bug na normalização da função de codificação
Licença CC BY-NC 4.0
Primeiros passos com Jina Embeddings v3
Acesse a página: Visite huggingface.co/jinaai/jina-embeddings-v3
Carregue o modelo: Use AutoModel.from_pretrained
Configure o ambiente: Garanta a compatibilidade com GPU
Integre: Aplique mean pooling para incorporações
Ajuste fino: Use SentenceTransformerTrainer para tarefas
Casos de uso de Jina Embeddings v3
- Recuperação de Texto
- Classificação de Texto
- Agrupamento
- Correspondência de Texto
- Processamento Multilíngue









