モデル・開発
Qwen3.8-Flash-Next:新しいアーキテクチャ、究極のコスト効率に向けて
原題: Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency
Qwen4向けの新設計を先行公開
AlibabaのQwenチームは8月26日、マルチモーダルMoEモデル「Qwen3.8-Flash-Next」を公開しました。
Qwenは、このモデルを将来のQwen4で使うアーキテクチャの早期プレビューと位置づけています。
モデルは本体1250億パラメータと追加のN-gram埋め込み510億パラメータで構成され、1トークンあたり60億パラメータを活性化します。
テキストに加えて画像を扱うマルチモーダルモデルです。
新しいQwen Sparse Attentionは、長い入力から重要な部分をマイクロブロック単位で選び、長文処理の計算量を抑える設計です。
Gated Residualは残差ストリームを4分岐に広げ、動的なゲートで層をまたぐ情報の読み書きを制御します。
N-gram Embeddingは局所的な文脈を使う参照表でモデル容量を増やし、ホストメモリへ退避できると説明されています。
学習にはMuonオプティマイザーを使い、学習安定性と計算効率を改善したとしています。
ネイティブのコンテキスト長は262,144トークンで、YaRNにより100万トークンへ拡張できます。
モデルウェイトはHugging FaceとModelScopeで公開済みで、Transformers、vLLM、SGLangなどから利用できます。
一方、100万トークン文脈と公式組み込みツールを備える管理版「Qwen3.8-Flash」はQwenCloudで案内されていますが、発表時点でAPIは近日提供です。
QwenはQwen3.7-Plusより学習コストを約9分の1へ減らし、コーディングと業務タスクで上回ると主張しています。
性能値とコスト比較はQwen自身の評価であり、独立評価ではありません。
公開ウェイトはQwen Community License 1.0で提供されるため、利用前にライセンス条件の確認が必要です。