説明
nomic-embed-text-v2-moeは、多言語検索タスクにおいて優れた性能を発揮するために設計された最先端の多言語Mixture of Experts(MoE)テキスト埋め込みモデルです。約100の言語をサポートし、16億以上のペアでトレーニングされているため、多様な言語アプリケーションに非常に効果的です。このモデルは、柔軟な埋め込み次元を提供し、Matryoshka Embeddingsを利用してストレージコストを最大3倍削減し、パフォーマンスの劣化を最小限に抑えています。
nomic-embed-text-v2-moeのアーキテクチャは、合計475百万のパラメータを含み、推論中に305百万がアクティブになります。8つのエキスパートとトップ2ルーティングを備えたMoE構成を特徴としており、効率的な処理と高いパフォーマンスを実現しています。モデルの最大シーケンス長は512トークンで、768から256の範囲の埋め込み次元をサポートしています。
nomic-embed-text-v2-moeは完全にオープンソースであり、モデルの重み、コード、トレーニングデータが公開されているため、再現性が確保され、さらなる研究開発が促進されます。このモデルは、BEIRやMIRACLなどのベンチマークで優れたパフォーマンスを示し、同じパラメータクラスのモデルを上回り、より大きなモデルと競争力を維持しています。
その強みにもかかわらず、ユーザーは特定の制限に注意する必要があります。パフォーマンスは異なる言語で異なる場合があり、MoEアーキテクチャのためにリソース要件が従来の密なモデルよりも高くなる可能性があります。さらに、ユーザーはカスタムアーキテクチャの実装を利用するために、モデルをロードする際にtrust_remote_code=Trueを有効にする必要があります。
全体として、nomic-embed-text-v2-moeは、多言語テキスト埋め込みタスクにおいて強力なツールであり、柔軟性、効率性、高いパフォーマンスを提供し、幅広いアプリケーションに対応しています。
nomic-embed-text-v2-moeのハイライト
最先端の多言語パフォーマンス
約100の言語をサポート
16億以上のペアでトレーニング
柔軟な埋め込み次元
オープンソースのモデル重みとコード
Mixture of Expertsアーキテクチャ
Matryoshka Embeddingsによる効率的なストレージ
BEIRおよびMIRACLベンチマークでの高パフォーマンス
nomic-embed-text-v2-moeをはじめる
ページにアクセス: Hugging Faceモデルページを訪問
モデルをロード: SentenceTransformersまたはTransformersを使用
環境を設定: 最適なパフォーマンスのためにGPUを設定
統合: クエリとドキュメントのためにタスク指示プレフィックスを使用
ファインチューニング: 特定のニーズに合わせて埋め込み次元を調整
nomic-embed-text-v2-moeの使用例
- 多言語検索
- テキスト埋め込み
- データ分析
- 言語処理
- 研究開発







