モデル・画像
LLaDA-Imageの生成・編集モデルと学習レシピを公開
原題: LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
Baseと4ステップのTurboをApache 2.0で配布
inclusionAIは9月4日、LLaDA-ImageのBase版とTurbo版を公開しました。
約6B規模の統合画像生成・編集モデル群です。
一つのチェックポイントでテキストからの画像生成と参照画像を保った指示編集を行えます。
英語と中国語の文字描画にも対応します。
Base版は高品質生成と編集向けに50ステップを使います。
蒸留されたTurbo版は2〜4ステップで生成・編集できます。
BaseとTurboのそれぞれについてBF16版とFP8版を提供しています。
チェックポイント、Diffusersベースの推論コード、学習手順を公開しました。
モデルはApache 2.0ライセンスで取得できます。
テキスト生成、VQ条件付き生成、参照画像編集の3モードを利用できます。
Hugging Face上の推論プロバイダーには現時点で配備されておらず、公開ファイルを取得して実行します。
ベンチマーク結果はinclusionAI自身の評価であり、独立評価ではありません。