メインコンテンツへスキップ
ToolPotion

Jina Embeddings v3

Jina Embeddings v3は、さまざまなNLPアプリケーション向けに設計された多言語・多タスクのテキスト埋め込みモデルです。長い入力シーケンスとタスク特有の埋め込みをサポートし、さまざまなユースケースに対応します。

モデルを見る
共有

説明

Jina Embeddings v3は、Jina AIによって開発された高度な多言語テキスト埋め込みモデルです。自然言語処理(NLP)アプリケーションの幅広いニーズに応えるように設計されています。このモデルは、Jina-XLM-RoBERTaアーキテクチャに基づいており、Rotary Position Embeddings(RoPE)を組み込むことで、最大8192トークンの長い入力シーケンスを処理できます。この機能は、広範なテキスト処理を必要とするアプリケーションに特に有益です。

このモデルは、5つのLoRAアダプターを備えており、タスク特有の埋め込みを効率的に生成できます。ユーザーは、検索クエリ、パッセージ埋め込み、クラスタリング、分類、テキストマッチングなど、さまざまなタスクに対して埋め込みをカスタマイズできます。この柔軟性により、Jina Embeddings v3は非対称検索タスク、クラスタリングおよび再ランキングアプリケーション、分類タスク、テキストの類似性を定量化するタスクに適しています。

Jina Embeddings v3は、32から1024までの柔軟な埋め込みサイズを提供するMatryoshka Embeddingsをサポートしています。この機能により、ユーザーは特定のアプリケーションのニーズに合わせて埋め込みを切り詰めることができます。このモデルは、アラビア語、中国語、英語、フランス語、ドイツ語、ヒンディー語、日本語、韓国語、スペイン語など、30の言語に調整されています。

モデルの注目すべき更新点は、encode関数のバグが修正され、切り詰められた埋め込みの正規化が一貫して行われるようになったことです。ユーザーは、モデルを統合する際に平均プーリングを適用することを推奨されており、このアプローチにより高品質な文埋め込みが得られます。モデルは、Jina Embedding APIを介して、またはTransformersパッケージを通じて直接使用できます。

Jina Embeddings v3は、Ampere、Ada、またはHopper GPUなど、FlashAttention-2をサポートするGPUと互換性があります。ライセンスはCC BY-NC 4.0で、商業利用に関する問い合わせはJina AIに向けられます。このモデルは、先月だけで200万回以上のダウンロードがあり、AWSおよびAzureプラットフォームにリストされています。

Jina Embeddings v3のハイライト

  • 30言語の多言語サポート

  • 最大8192トークンの拡張シーケンス長

  • LoRAアダプターによるタスク特有の埋め込み

  • 柔軟なサイズのMatryoshka Embeddings

  • 高品質な文埋め込みのための平均プーリング

  • FlashAttention-2 GPUとの互換性

  • SentenceTransformerTrainerによるファインチューニングサポート

  • 効率的な処理のためのONNX推論

  • encode関数の正規化に関するバグ修正

  • CC BY-NC 4.0ライセンス

Jina Embeddings v3をはじめる

  1. ページにアクセス: huggingface.co/jinaai/jina-embeddings-v3を訪問

  2. モデルをロード: AutoModel.from_pretrainedを使用

  3. 環境を設定: GPUの互換性を確認

  4. 統合: 埋め込みのために平均プーリングを適用

  5. ファインチューニング: タスクのためにSentenceTransformerTrainerを使用

Jina Embeddings v3の使用例

  • テキスト検索
  • テキスト分類
  • クラスタリング
  • テキストマッチング
  • 多言語処理

Jina Embeddings v3のFAQ

From Jina AI

Jina Embeddings v3 のレビュー

読み込み中...

Jina Embeddings v3 に似た人気のAIツール

nomic-embed-text-v2-moeは、最先端の多言語Mixture of Expertsテキスト埋め込みモデルです。約100の言語をサポートし、多言語検索タスクに優れ、柔軟な埋め込み次元とストレージコストの削減を提供します。

AIモデルとLLM

BAAI/bge-large-en-v1.5は、検索強化型言語モデルのために設計された最先端の埋め込みモデルです。検索機能を向上させ、さまざまなタスクをサポートし、自然言語処理やAI研究のアプリケーションに適しています。

注目AIモデルとLLM

BAAI/bge-small-en-v1.5は、検索強化型言語モデルタスクのために設計された小規模な埋め込みモデルです。さまざまな自然言語処理アプリケーションで競争力のあるパフォーマンスを提供し、AIの開発者や研究者に適しています。

注目AIモデルとLLM

intfloat multilingual-e5-largeモデルは、多言語テキスト埋め込みのために設計された堅牢なAIツールです。100の言語をサポートし、テキスト検索や意味的類似性などのタスクに最適化されており、多様なデータセットで高いパフォーマンスを提供します。

AIモデルとLLM

Longformer Base 4096 は、長文ドキュメントの処理に特化したTransformerモデルです。RoBERTaをベースとし、最大4,096トークンの拡張シーケンスで事前学習されています。このモデルは、スライディングウィンドウとグローバルアテンションを組み合わせたハイブリッドアテンションメカニズムを採用し、効率的な長文理解とタスク固有の表現学習…

AIモデルとLLM

MUSEは、教師なしおよび教師ありの手法をサポートする、多言語単語埋め込みを作成するためのPythonライブラリです。fastText埋め込みを共通空間に整列させ、トレーニングと評価のための大規模なバイリンガル辞書を提供し、クロスリンガルNLPタスクを可能にします。

AIモデルとLLM

Qwen1.5-110Bは、重要な性能向上、マルチリンガルサポート、安定した32Kコンテキスト長を提供するトランスフォーマーベースの言語モデルです。高度なAIアプリケーションに最適です。

AIモデルとLLM

BAAI/bge-reranker-v2-m3は、高速推論と簡単なデプロイメントのために設計された軽量の多言語リランカーモデルです。クエリとドキュメントの類似スコアを出力し、中国語と英語の両方をサポートしています。

AIモデルとLLM