説明
Vidu S1 APIは、リアルタイムのインタラクティブなデジタルヒューマンのために設計された商業用ストリーミングビデオ生成モデルです。この革新的なAPIにより、開発者はAIキャラクターがユーザーと視覚的に、聴覚的に、会話できるライブセッションを作成できます。このプラットフォームは、無制限の生成をサポートし、28の言語で50以上の音声を提供し、さまざまなアプリケーションに対応します。
Vidu S1 APIの請求は、デジタルキャラクターが準備完了となり、セッションが「on_live」状態に入るとすぐに始まります。使用量は2秒ごとに3クレジットのレートで計測され、6秒ごとに差し引かれ、ユーザーはサービスを積極的に使用している時間のみ支払うことになります。各セッションは最大600秒まで持続可能で、長時間のインタラクションの場合、ユーザーは品質を損なうことなく新しいセッションを作成できます。
Vidu S1はHTTPインタラクションに限定されず、セッション管理にはHTTPを、リアルタイムの音声とビデオの伝送にはAliRTCを、制御信号にはWebSocketを使用します。この統合により、デジタルキャラクターがユーザーの入力に対して表情や個性を持って応答する、シームレスなユーザー体験が実現します。
このAPIは、AIコンパニオン、バーチャルアイドル、トレーニングと教育、カスタマーサービス、ライブストリームコマース、インタラクティブエンターテインメントなど、さまざまな業界向けに設計されています。チームは、プラットフォーム全体でユーザーエンゲージメントを変革し、商業用デジタルヒューマンを迅速に展開できます。ペルソナメモリやマルチモーダル知覚などの機能により、Vidu S1はパーソナライズされた一貫したインタラクションを生み出し、ユーザーの満足度を向上させます。
その強力な機能に加えて、Vidu S1 APIは新しいユーザーに1,000クレジットの無料トライアルを提供し、初期投資なしでプラットフォームの機能を探索できるようにしています。これにより、高度なAIインタラクションを迅速に製品に統合しようとする開発者にとって魅力的な選択肢となります。
Vidu S1 APIの主要機能
無制限のインタラクティブな期間
50以上の音声
28の言語サポート
リアルタイムインタラクション
HTTPによるセッション管理
AliRTCによる音声/ビデオ伝送
WebSocketによる制御信号
カスタム音声クローン
ペルソナのための短期記憶
高解像度出力
Vidu S1 APIの使い方は?
セッションを作成: キャラクターのペルソナ、アバター画像、音声を含むPOSTコールを行い、セッションIDを受け取ります。
RTCチャンネルに参加: 返されたトークンを使用してAliRTCチャンネルに参加し、ユーザーのマイクとカメラを公開します。
WebSocketを開く: 認証トークンをクエリ文字列に渡して制御チャンネルに接続します。
準備が整うまで待つ: キャラクターがライブであることを示す成功確認を監視します。
セッションを維持: サーバーのピングに応答し、切断メッセージを適切に処理します。
ハングアップと請求の確認: ハングアップメッセージを送信し、WebSocketを閉じて最終セッションステータスを確認します。
Vidu S1 APIの使用例
- AIコンパニオン
- バーチャルアイドル
- トレーニングと教育
- AIカスタマーサービス
- ライブストリームコマース
- インタラクティブエンターテインメント






