説明
Falcon3-10B-Instructは、テクノロジーイノベーション研究所によって開発されたOpen Foundation ModelsのFalcon3ファミリーの一部です。これは、40のデコーダーブロックと、より高速な推論のためのGrouped Query Attentionを特徴とするトランスフォーマーベースの因果デコーダー専用アーキテクチャです。このモデルは、推論、言語理解、指示に従う、コード、および数学のタスクにおいて最先端の結果を達成するように設計されています。英語、フランス語、スペイン語、ポルトガル語の4つの言語をサポートし、最大32Kのコンテキスト長を提供します。
このモデルは、STEM、会話、コード、安全性、関数呼び出しデータの120万サンプルでポストトレーニングされ、1024のH100 GPUチップを利用しています。Falcon3-10B-Instructは、TII Falcon-LLM License 2.0の下でライセンスされており、2024年12月にリリースされる予定です。IFEval、BBH、MATH Lvl-5、GPQA、MUSRなどのさまざまなベンチマークで高いパフォーマンスを示しています。
Falcon3-10B-Instructは、複数の言語で複雑なタスクを処理できる堅牢な言語モデルを求める開発者や研究者に適しています。速度と精度の面で大きな利点を提供し、AI駆動のプロジェクトにとって貴重なツールとなります。このモデルのアーキテクチャとトレーニングデータは、包括的な言語理解と指示に従う能力を保証します。
Falcon3-10B-Instructモデルのハイライト
トランスフォーマーベースの因果デコーダー専用アーキテクチャ
40のデコーダーブロック
より高速な推論のためのGrouped Query Attention
英語、フランス語、スペイン語、ポルトガル語をサポート
32Kのコンテキスト長
120万サンプルでポストトレーニング
長いコンテキスト理解のための高いRoPE値
SwiGLuとRMSNormを使用
131Kの語彙サイズ
テクノロジーイノベーション研究所によって開発
ライセンス: TII Falcon-LLM License 2.0
モデルリリース日: 2024年12月
ベンチマークパフォーマンス: IFEval、BBH、MATH Lvl-5
1024のH100 GPUチップを利用
Falcon3-7B-Baseからの深さのアップスケーリング
Falcon3-10B-Instructモデルをはじめる
ページにアクセス: Hugging Faceモデルリポジトリを訪問
モデルをロード: 環境でFalcon3-10B-Instructを初期化
環境を設定: 必要な依存関係と設定を整える
統合: モデルをアプリケーションに接続
ファインチューニング: 特定のタスクに合わせてモデルパラメータを調整
Falcon3-10B-Instructモデルの使用例
- 言語理解
- 指示に従う
- 推論タスク
- コード分析
- 数学タスク








