説明
CassetteAIは、クラウドサーバーを必要とせず、エッジハードウェア上で直接リアルタイムな生成オーディオを提供します。高度な3億パラメータモデルが、印象的な速度と品質で音楽、効果音(SFX)、テキスト読み上げ(TTS)を生成します。このシステムは、SFXで50ミリ秒未満のFirst Audioまでの時間(TTFA)を達成し、30秒の音楽サンプルを2秒未満でレンダリングし、フル3分間のトラックは10秒未満で完了します。すべて44.1 kHzステレオで行われます。
開発者は、単一のSDKを通じてCassetteAIの機能を利用できます。このSDKは、ムード、ジャンル、または参照プロンプトに基づいた適応型音楽生成、テキストで説明されるオンデマンド効果音、フレームごとの再ロール機能、そして近日公開予定の短いオーディオサンプルからのゼロショットクローニングによる自然で表現力豊かなTTSをサポートします。この統一されたアプローチにより、ゲーム、クリエイターアプリ、リアルタイムパイプラインへの統合が簡素化されます。
このプラットフォームは、サインアップなしで即座にテストできるライブプレイグラウンドを提供し、使いやすさを重視しています。APIはJavaScript、Python、cURLからアクセス可能で、開発者は同じAPI呼び出し構造内で音楽、SFX、またはTTSのモデルIDを切り替えることができます。出力品質はプロフェッショナル基準に匹敵し、44.1 kHzステレオ、16ビットの忠実度を持つ.wavファイルで提供されます。
CassetteAIは、従量課金制の価格モデルで運用されており、音楽は出力分あたり0.02ドル、SFXは生成あたり0.01ドルで課金されます。ティア、シート、月額契約はありません。このモデルにより、ユーザーは消費したオーディオに対してのみ支払いを行うため、さまざまなアプリケーションでコスト効率が高くなります。同社はまた、ストリーミング出力とサブ秒の最初の音素レイテンシを備えたTTSジェネレーターを開発しており、リアルタイムオーディオ生成機能をさらに拡張しています。
CassetteAIの主要機能
オンデバイスでのリアルタイム生成オーディオ
音楽、SFX、TTS向けの3億パラメータモデル
50ミリ秒未満のFirst Audioまでの時間(TTFA)
44.1 kHzステレオオーディオ出力
複数のオーディオモダリティに対応する単一SDK
オンデマンド効果音生成
適応型音楽生成
ゼロショットTTSクローニング(近日公開)
JavaScript、Python、cURLで利用可能なAPI
従量課金制モデル
テスト用のライブプレイグラウンド
再現可能な結果のための決定論的シード
ループセーフなSFX出力
CassetteAIの使い方は?
APIへのアクセス: APIキーを取得して、CassetteAIをアプリケーションに統合します。
モデルの設定: APIを通じて、希望するオーディオモダリティ(音楽、SFX、またはTTS)を選択します。
オーディオ生成: プロンプトまたは説明をAPIに送信して、オーディオコンテンツを作成します。
出力の統合: 生成されたオーディオファイルをプロジェクトに直接ストリーミングまたはダウンロードします。
パフォーマンスの最適化: 低レイテンシおよびリアルタイムアプリケーションのために、オンデバイス処理を活用します。
CassetteAIの使用例
- ゲームオーディオ
- クリエイターツール
- リアルタイムパイプライン
- アプリサウンドトラック
- プロトタイピング
- AR/VR体験







