説明
NVIDIA NeMoは、エージェント型AIワークフローの開発を加速するために特別に設計された、強力な合成データ生成(SDG)ソリューションを提供します。推論を行う大規模言語モデル(LLM)、マルチエージェントシステム、マルチモーダルAIアシスタントなどの専門的なエージェント型システムをトレーニングするには、広範で高品質なデータセットが必要です。しかし、これらのデータセットはしばしば不足していたり、サイロ化されていたり、機密情報を含んでいたりするため、大きなボトルネックとなっています。NVIDIA NeMoの合成データツールは、多様でドメイン固有のデータセットを大規模に作成できるようにすることで、これらの課題を解消します。
NVIDIA NeMoを通じて生成される合成データは、ドメイン固有の実際のデータが限られているか利用できない場合のデータ不足といった、重要な問題に対処します。また、機密性の高い内部データに代わるプライバシー保護された代替手段を提供することで、セキュリティ上の懸念を解決し、医療データに関するHIPAAおよびGDPRへの準拠を例とするNeMo Safe Synthesizerのように、規制やプライバシーの制約なしにシームレスな共有を可能にします。さらに、手動でのデータ収集とラベリングに伴う高コストと時間を軽減し、これらはバイアスも生じやすいです。
このプラットフォームは、生成AI/LLMや会話型AI/NLPを含むさまざまなAIワークロードをサポートしています。特に、高品質な会話のためのデータ作成に役立ち、ドメイン固有の言語、意図のバリエーション、まれなエッジケースを捉えることで、会話型AIの精度と適応性を向上させます。評価とベンチマークについては、ドメイン固有の質問と回答のペアのようなターゲットデータセットを作成し、検索拡張生成(RAG)システムのパフォーマンスを測定および向上させることができます。リソースの少ないドメインも、現実的で複雑な合成テキストデータから恩恵を受け、AIモデルの推論と精度を向上させます。
技術的な実装には、NeMo Data Designerを使用してSDGのモデルを構成し、それらを接続およびカスタマイズし、望ましい出力品質のために推論パラメータをファインチューニングすることが含まれます。ユーザーは、合成データが特定のパターンと分布を維持するように、既存の実際のデータセットで生成プロセスにシードを提供できます。ユーザー定義スキーマを持つ列を定義することで、構造化された現実的なデータセットの設計が可能になります。LLM生成列は、プロンプトと構造化された出力で構成できます。このプロセスには、検証のためのデータセットのプレビュー、構成の反復、大規模なデータ生成、および自動化されたメトリックとLLMベースのジャッジを使用したデータ品質の評価が含まれます。
NVIDIA NeMoの合成データ生成機能は、推論、計画、目標駆動型のアクションを実行できる自律システムの構築に不可欠です。税務フォームの検証、法的文書、住宅ローンの承認などのアプリケーションのために、高忠実度の合成ドキュメントデータセットを提供することで、大規模なAIモデルのトレーニングをサポートします。このプラットフォームは、金融サービスや小売業を含むさまざまな業界の企業が、高度なAIアプリケーションを通じて投資収益率やイノベーションといった目標を達成できるようにします。
NVIDIA Synthetic Data Generationの主要機能
エージェント型AIのための合成データ生成
高品質でドメイン固有のデータセット
AIエージェント開発の加速
データ不足とセキュリティの懸念に対処
データ収集のコストと時間の削減
生成AI/LLMをサポート
会話型AI/NLPを強化
ターゲットを絞った評価とベンチマークを可能にする
リソースの少ないドメインへの適応を促進
プライバシー保護された合成データを作成(HIPAA、GDPR準拠)
高忠実度の合成ドキュメントデータセットを設計
構成のためにNeMo Data Designerを利用
既存の実際のデータセットでのシードを許可
構造化データのためのユーザー定義スキーマをサポート
データプレビューと品質評価ツールを含む
NVIDIA Synthetic Data Generationの使い方は?
モデルの構成:NeMo Data Designerで合成データ生成用のモデルを選択し、カスタマイズします。
データセットのシード:既存の実際のデータを提供して、生成プロセスをガイドします。
列の設計:ユーザー定義スキーマを使用して、合成データセットの構造とコンテンツを定義します。
LLM列の構成:プロンプトと構造化された出力を使用して、LLM生成データを構成します。
プレビューと反復:小規模なサンプルを生成して、構成を検証および調整します。
大規模生成:要件が満たされたら、完全なデータセットを生成します。
品質評価:検証ツールを使用して、高品質な合成データを保証します。
NVIDIA Synthetic Data Generationの使用例
- エージェント型AIワークフロー
- 会話型AI
- 評価とベンチマーク
- リソースの少ないドメイン
- プライバシー保護されたデータ
- 合成ドキュメント
- LLMトレーニング
- マルチエージェントシステム



