説明
一般計算は、速度に焦点を当てた推論プロバイダーです。AIモデルをGPUではなく特別に設計されたASICインフラストラクチャ上に展開し、OpenAI互換のAPIを通じて公開することで、チームはコードを書き換えることなくベースURLとAPIキーを変更するだけで切り替えが可能です。サブミリ秒のファーストトークン時間、高いスループット、最大1秒あたり1,000トークンを提供し、一般計算で実行された同じモデルをGPUベースラインと比較したベンチマークを宣伝しています。
このプラットフォームは、自己サービスAPIによる使用量ベースの推論、保証されたキャパシティと生産サポートが必要なチーム向けの専用キャパシティ、一般計算のインフラストラクチャ上でプライベートウェイトを実行する持ち込みモデル提供の3つの方法を提供します。すべては、ツール呼び出し、JSONモード、推論モデル、ストリーミングセマンティクスを含む同じOpenAI互換のインターフェースを共有しているため、既存のオーケストレーターはそのまま機能します。生産トラフィックは現在、米国地域で実行されており、企業向けの展開には専用地域が利用可能です。
一般計算は、需要駆動型で資産重視のプロバイダーとして位置付けられており、顧客が自らラックに設置しないチップで実行できるように、専門のシリコン(SambaNovaやEtched Sohuなど)を購入、展開、運用し、その結果を推論として販売します。新しいアカウントは無料クレジットから始まり、従量課金プランは最善の努力による信頼性を引き継ぎ、企業向けプランには契約SLAs、エスカレーションパス、専用キャパシティが追加されます。
一般計算の主要機能
OpenAI互換の推論APIとベースURLの移行
高速推論のための特別に設計されたASICインフラストラクチャ
低いファーストトークン時間と高いスループット
ツール呼び出し、JSONモード、推論モデル、ストリーミング
自己サービスAPI、専用デプロイメント、持ち込みモデル提供
新しいアカウント向けの無料クレジット
契約SLAsと専用キャパシティを持つ企業向けプラン
一般計算の使い方は?
キーを取得する: サインアップして無料クレジット付きのAPIキーを受け取ります。
ベースURLを変更する: 既存のOpenAI互換SDKを一般計算に向けます。
推論を実行する: リクエストを送信し、通常通りツール呼び出し、JSONモード、ストリーミングを使用します。
スケールアップする: 保証されたキャパシティが必要な場合は、専用キャパシティに移行するか、持ち込みモデルを使用します。
一般計算の使用例
- コーディングエージェント
- リアルタイム音声とインタラクティブAI
- 高スループット推論
- プライベートモデル提供







