開発

vLLM 0.29.0を公開

原題: v0.29.0

重要正式版推論基盤

Model Runner V2を全モデルの既定に

vLLMプロジェクトは9月9日、vLLM 0.29.0を正式公開しました。

Model Runner V2を、未対応の一部ROCmモデルと機能を除く全モデルで既定にしました。

KVキャッシュの自動サイズ調整、バッチ分割サンプリング、prompt embedsなどをModel Runner V2へ追加しています。

Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA、NemotronH Omni Reasoning V3、Kimi K3 NVFP4へ対応しました。

Kimi K3とDeepSeek V4には複数のカーネル統合と推論高速化を追加しています。

投機的デコードの受理統計をOpenAI互換API応答へ含めるオプションを追加しました。

Mambaのプレフィックスキャッシュでは、公式測定で初回トークンまでの時間を9〜25%改善しています。

FlashInfer all-reduceと分散KVキャッシュ向けの決定論的ハッシュを既定化しました。

10種類の非推奨モデル構成や旧PyAV動画デコーダーなどを削除する破壊的変更があります。

PyPI、CUDA、ROCm、CPU、XPU向けwheelとDockerイメージを配布しています。

原文

← 日次まとめへ戻る