重要ニュース / モデル・基盤

DiffusionGemmaはテキスト生成の「一語ずつ」を崩し、ローカル推論を再設計する

Googleの実験モデルDiffusionGemmaは、複数トークンを並列に更新する拡散方式を採用します。最大4倍という速度だけでなく、生成途中で前の箇所を修正できる点が従来モデルとの大きな違いです。

重要度★★★研究・モデル読了6分比較表あり

生成順序そのものを変える

一般的な自己回帰モデルは、確定したトークンを左から右へ一つずつ積み上げます。DiffusionGemmaは256トークンの「キャンバス」を用意し、曖昧な状態から全体を反復更新します。GPUに大きな並列処理を渡せるため、メモリ帯域待ちを減らし、計算器を使い切る狙いです。

自己回帰テキスト拡散
生成左から一語ずつ確定ブロック全体を反復更新
修正確定済み箇所は戻りにくい信頼度が下がれば再生成可能
GPU負荷メモリ帯域が律速になりやすい並列計算へ寄せる
成熟度運用知見が豊富実験段階、品質検証が必要

「最大4倍」は用途別に検証する

公表値ではRTX 5090で毎秒700超、H100単体で毎秒1000超のトークン生成が示されています。ただし速度はキャンバス長、反復回数、バッチ、早期停止、出力品質の条件で変わります。通常のtokens/secだけを横並びにせず、同等品質に達するまでの時間と費用で測る必要があります。

26B MoEのうち推論時に有効化するのは3.8B相当で、量子化時は18GB VRAM内を想定します。vLLMのOpenAI互換サーバーから配信できるため、実験を既存アプリへつなぎやすい点は実務的です。

向く仕事、慎重に見る仕事

まとめ

DiffusionGemmaの重要性は、新しいモデルが一つ増えたことより、テキスト生成の実装前提に別ルートが現れたことです。現時点では置き換えではなく、短い高スループット処理から比較評価するのが現実的です。

参考情報

← AIニュースのトップへ戻る