説明
Z-Imageは、Fooocus.oneを通じて提供されるAI画像生成および編集モデルで、フォトリアルな出力、正確なバイリンガルテキストレンダリング、ネイティブ編集のために構築されています。わずか8ステップで、業界の競合他社と同等またはそれ以上のパフォーマンスを達成し、消費者向けGPUで約2〜5秒で画像を生成できます。
この60億パラメータのモデルは、テキスト、視覚的セマンティックトークン、画像ラテントを単一の入力シーケンスに統合するスケーラブルなシングルストリームDiT(S3-DiT)アーキテクチャを使用しており、デュアルストリームアプローチと比較してパラメータ効率を最大化しています。消費者デバイスの16GBのVRAM内に収まり、エンタープライズH800 GPUでサブ秒のレイテンシを提供します。
Z-Imageは、詳細、照明、テクスチャに対する細かな制御を持つ写真レベルのリアリズムに優れ、中国語と英語のテキストを正確にレンダリングし、小さなフォントサイズでも強力な構成力とタイポグラフィスキルを持ってポスターデザインを行います。内蔵のプロンプトエンハンサーは、構造化された推論チェーンを使用して論理と常識を注入し、モデルが複雑なタスクを処理し、あいまいな指示から意図を推測できるようにします。Z-Image-Editは、外部ツールなしで柔軟な変換を理解するバイリンガル指示に基づくクリエイティブな編集を追加します。
Alibaba AI ArenaでのEloベースの人間の好み評価によると、Z-Imageは業界の主要モデルに対して非常に競争力があり、オープンソースオプションの中で最先端の結果を達成しています。アクセスは、月額および年額オプションを含むFooocus.oneの階層プランを通じて行われ、ツールクレジットが含まれています。
Z-Imageの主要機能
詳細と照明制御を備えたフォトリアルな画像生成
正確な中国語と英語のバイリンガルテキストレンダリング
消費者向けGPUでわずか8ステップ、数秒での高速生成
効率的なS3-DiTシングルストリームアーキテクチャ
構造化された推論を持つ内蔵プロンプトエンハンサー
Z-Image-Editによるネイティブなクリエイティブ画像編集
消費者デバイスの16GB VRAM内で動作
オープンソースモデルの中で最先端の結果
Z-Imageの使い方は?
プロンプトを書く: 画像の詳細を説明し、バイリンガルテキストの要件を含めます。
プロンプトエンハンスメントを活用する: 複雑なタスクやあいまいな指示から意図を推測するためにプロンプトエンハンサーを使用します。
生成と編集: 約2〜5秒で画像を生成し、Z-Image-Editでそれを洗練させます。
結果をダウンロード: プロフェッショナル品質の画像を保存します。
Z-Imageの使用例
- フォトリアルな画像
- バイリンガルポスターデザイン
- 製品写真
- クリエイティブ画像編集
- 迅速な反復





