Перейти к основному содержимому
ToolPotion

Jina Embeddings v3

Jina Embeddings v3 — это многоязычная, многозадачная модель встраивания текста, предназначенная для различных приложений обработки естественного языка (NLP). Она поддерживает длинные входные последовательности и встраивания, специфичные для задач, что делает её универсальной для различных случаев использования.

Открыть модель
Поделиться

Описание

Jina Embeddings v3 — это сложная многоязычная модель встраивания текста, разработанная компанией Jina AI. Она предназначена для удовлетворения широкого спектра приложений обработки естественного языка (NLP). Модель основана на архитектуре Jina-XLM-RoBERTa и включает в себя вращательные позиционные встраивания (RoPE), что позволяет ей обрабатывать длинные входные последовательности до 8192 токенов. Эта возможность особенно полезна для приложений, требующих обширной обработки текста.

Модель имеет пять адаптеров LoRA, что позволяет эффективно генерировать встраивания, специфичные для задач. Пользователи могут настраивать встраивания для различных задач, включая запросы на извлечение, встраивания отрывков, кластеризацию, классификацию и сопоставление текста. Эта гибкость делает Jina Embeddings v3 подходящей для асимметричных задач извлечения, приложений кластеризации и повторной сортировки, задач классификации и задач, которые количественно оценивают сходство текста.

Jina Embeddings v3 поддерживает встраивания матрешки, предлагая гибкие размеры встраиваний от 32 до 1024. Эта функция позволяет пользователям обрезать встраивания, чтобы соответствовать конкретным потребностям приложения. Модель настроена для 30 языков, включая арабский, китайский, английский, французский, немецкий, хинди, японский, корейский и испанский, среди прочих.

Значительное обновление в модели — это исправление ошибки в функции кодирования, что обеспечивает последовательную нормализацию обрезанных встраиваний. Пользователям рекомендуется применять среднее объединение при интеграции модели, так как этот подход дает высококачественные встраивания предложений. Модель можно использовать через API Jina Embedding или напрямую через пакет Transformers.

Jina Embeddings v3 совместима с графическими процессорами, поддерживающими FlashAttention-2, такими как графические процессоры Ampere, Ada или Hopper. Она лицензирована по лицензии CC BY-NC 4.0, запросы на коммерческое использование направляются в Jina AI. Модель была значительно использована, с более чем 2 миллионами загрузок в прошлом месяце, и она представлена на платформах AWS и Azure.

Главное о Jina Embeddings v3

  • Многоязычная поддержка для 30 языков

  • Увеличенная длина последовательности до 8192 токенов

  • Специфичные для задач встраивания с адаптерами LoRA

  • Встраивания матрешки для гибких размеров

  • Среднее объединение для высококачественных встраиваний предложений

  • Совместимость с графическими процессорами FlashAttention-2

  • Поддержка тонкой настройки с помощью SentenceTransformerTrainer

  • Вывод ONNX для эффективной обработки

  • Исправление ошибки нормализации функции кодирования

  • Лицензия CC BY-NC 4.0

Начало работы с Jina Embeddings v3

  1. Страница доступа: Посетите huggingface.co/jinaai/jina-embeddings-v3

  2. Загрузите модель: Используйте AutoModel.from_pretrained

  3. Настройте окружение: Убедитесь в совместимости с GPU

  4. Интеграция: Примените среднее объединение для встраиваний

  5. Тонкая настройка: Используйте SentenceTransformerTrainer для задач

Варианты использования Jina Embeddings v3

  • Извлечение текста
  • Классификация текста
  • Кластеризация
  • Сопоставление текста
  • Многоязычная обработка

Часто задаваемые вопросы Jina Embeddings v3

From Jina AI

Отзывы о Jina Embeddings v3

Загрузка...

Популярные ИИ-инструменты, похожие на Jina Embeddings v3

nomic-embed-text-v2-moe — это современная многоязычная модель встраивания текста Mixture of Experts. Она поддерживает около 100 языков и превосходит в задачах многоязычного…

ИИ-модели и LLM

BAAI/bge-large-en-v1.5 — это современная модель встраивания, разработанная для языковых моделей с поддержкой извлечения. Она улучшает возможности извлечения и поддерживает…

РекомендованоИИ-модели и LLM

BAAI/bge-small-en-v1.5 — это маломасштабная модель встраивания, предназначенная для задач языковых моделей с поддержкой поиска. Она демонстрирует конкурентоспособные результаты в…

РекомендованоИИ-модели и LLM

Модель intfloat multilingual-e5-large — это мощный инструмент ИИ, предназначенный для многоязычных текстовых эмбеддингов. Она поддерживает 100 языков и оптимизирована для задач,…

ИИ-модели и LLM

AI-модели

Longformer Base 4096 — это трансформерная модель, разработанная для обработки длинных документов. Она основана на RoBERTa, предварительно обучена на расширенных…

ИИ-модели и LLM

MUSE — это библиотека Python для создания многоязычных векторных представлений слов, поддерживающая как неконтролируемые, так и контролируемые методы. Она выравнивает вложения…

ИИ-модели и LLM

Qwen1.5-110B — это языковая модель на основе трансформеров, предлагающая значительные улучшения производительности, поддержку нескольких языков и стабильную длину контекста 32K.…

ИИ-модели и LLM

BAAI/bge-reranker-v2-m3 — это легковесная многоязычная модель ранжирования, разработанная для быстрого вывода и простоты развертывания. Она выдает оценки схожести для запросов и…

ИИ-модели и LLM