Pular para o conteúdo principal
ToolPotion

Jina Embeddings v3

Jina Embeddings v3 é um modelo de incorporação de texto multilíngue e multitarefa projetado para várias aplicações de PNL. Ele suporta sequências de entrada longas e incorporações específicas de tarefas, tornando-o versátil para diferentes casos de uso.

Ver modelo
Compartilhar

Descrição

Jina Embeddings v3 é um sofisticado modelo de incorporação de texto multilíngue desenvolvido pela Jina AI. Ele foi projetado para atender a uma ampla gama de aplicações de processamento de linguagem natural (PNL). O modelo é baseado na arquitetura Jina-XLM-RoBERTa e incorpora Rotary Position Embeddings (RoPE), permitindo que ele lide com sequências de entrada longas de até 8192 tokens. Essa capacidade é particularmente benéfica para aplicações que exigem processamento extenso de texto.

O modelo apresenta cinco adaptadores LoRA, permitindo a geração eficiente de incorporações específicas de tarefas. Os usuários podem personalizar incorporações para várias tarefas, incluindo consultas de recuperação, incorporações de passagens, agrupamento, classificação e correspondência de texto. Essa flexibilidade torna o Jina Embeddings v3 adequado para tarefas de recuperação assimétrica, aplicações de agrupamento e reclassificação, tarefas de classificação e tarefas que quantificam a similaridade de texto.

Jina Embeddings v3 suporta Matryoshka Embeddings, oferecendo tamanhos de incorporação flexíveis que variam de 32 a 1024. Esse recurso permite que os usuários truncem incorporações para atender às necessidades específicas da aplicação. O modelo é ajustado para 30 idiomas, incluindo árabe, chinês, inglês, francês, alemão, hindi, japonês, coreano e espanhol, entre outros.

Uma atualização notável no modelo é a resolução de um bug na função de codificação, garantindo a normalização consistente das incorporações truncadas. Os usuários são aconselhados a aplicar mean pooling ao integrar o modelo, pois essa abordagem resulta em incorporações de sentença de alta qualidade. O modelo pode ser utilizado através da API de Incorporação Jina ou diretamente pelo pacote Transformers.

Jina Embeddings v3 é compatível com GPUs que suportam FlashAttention-2, como GPUs Ampere, Ada ou Hopper. Ele é licenciado sob CC BY-NC 4.0, com consultas sobre uso comercial direcionadas à Jina AI. O modelo teve um uso significativo, com mais de 2 milhões de downloads no mês passado, e está listado nas plataformas AWS e Azure.

Destaques de Jina Embeddings v3

  • Suporte multilíngue para 30 idiomas

  • Comprimento de sequência estendido de até 8192 tokens

  • Incorporações específicas de tarefas com adaptadores LoRA

  • Matryoshka Embeddings para tamanhos flexíveis

  • Mean pooling para incorporações de sentença de alta qualidade

  • Compatibilidade com GPUs FlashAttention-2

  • Suporte a fine-tuning com SentenceTransformerTrainer

  • Inferência ONNX para processamento eficiente

  • Correção de bug na normalização da função de codificação

  • Licença CC BY-NC 4.0

Primeiros passos com Jina Embeddings v3

  1. Acesse a página: Visite huggingface.co/jinaai/jina-embeddings-v3

  2. Carregue o modelo: Use AutoModel.from_pretrained

  3. Configure o ambiente: Garanta a compatibilidade com GPU

  4. Integre: Aplique mean pooling para incorporações

  5. Ajuste fino: Use SentenceTransformerTrainer para tarefas

Casos de uso de Jina Embeddings v3

  • Recuperação de Texto
  • Classificação de Texto
  • Agrupamento
  • Correspondência de Texto
  • Processamento Multilíngue

Perguntas frequentes de Jina Embeddings v3

From Jina AI

Avaliações de Jina Embeddings v3

Carregando...

Ferramentas de IA populares como Jina Embeddings v3

nomic-embed-text-v2-moe é um modelo de incorporação de texto Mixture of Experts multilíngue de última geração. Suporta aproximadamente 100 idiomas e se destaca em tarefas de…

Modelos de IA e LLMs

BAAI/bge-large-en-v1.5 é um modelo de incorporação de última geração projetado para modelos de linguagem aumentados por recuperação. Ele melhora as capacidades de recuperação e…

DestaqueModelos de IA e LLMs

BAAI/bge-small-en-v1.5 é um modelo de incorporação em pequena escala projetado para tarefas de modelos de linguagem aumentados por recuperação. Ele oferece desempenho competitivo…

DestaqueModelos de IA e LLMs

O modelo intfloat multilingual-e5-large é uma ferramenta robusta de IA projetada para embeddings de texto multilíngues. Ele suporta 100 idiomas e é otimizado para tarefas como…

Modelos de IA e LLMs

Longformer Base 4096 é um modelo transformer projetado para processar documentos longos. Ele se baseia no RoBERTa, pré-treinado em sequências estendidas de até 4.096 tokens. Este…

Modelos de IA e LLMs

MUSE é uma biblioteca Python para criar embeddings de palavras multilíngues, suportando métodos não supervisionados e supervisionados. Ela alinha embeddings fastText em um espaço…

Modelos de IA e LLMs

Modelos de IA

Qwen1.5-110B é um modelo de linguagem baseado em transformador que oferece melhorias significativas de desempenho, suporte multilíngue e um comprimento de contexto estável de 32K.…

Modelos de IA e LLMs

BAAI/bge-reranker-v2-m3 é um modelo de reranking leve e multilíngue projetado para inferência rápida e fácil implantação. Ele gera pontuações de similaridade para consultas e…

Modelos de IA e LLMs