開発
vLLM 0.29.0を公開
原題: v0.29.0
Model Runner V2を全モデルの既定に
vLLMプロジェクトは9月9日、vLLM 0.29.0を正式公開しました。
Model Runner V2を、未対応の一部ROCmモデルと機能を除く全モデルで既定にしました。
KVキャッシュの自動サイズ調整、バッチ分割サンプリング、prompt embedsなどをModel Runner V2へ追加しています。
Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA、NemotronH Omni Reasoning V3、Kimi K3 NVFP4へ対応しました。
Kimi K3とDeepSeek V4には複数のカーネル統合と推論高速化を追加しています。
投機的デコードの受理統計をOpenAI互換API応答へ含めるオプションを追加しました。
Mambaのプレフィックスキャッシュでは、公式測定で初回トークンまでの時間を9〜25%改善しています。
FlashInfer all-reduceと分散KVキャッシュ向けの決定論的ハッシュを既定化しました。
10種類の非推奨モデル構成や旧PyAV動画デコーダーなどを削除する破壊的変更があります。
PyPI、CUDA、ROCm、CPU、XPU向けwheelとDockerイメージを配布しています。