#vLLM
「vLLM」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から vLLM に関連するノウハウを 3 件発信しています。
Prefill/Decode分離で推論基盤を設計する
自社ホスティングLLM推論のPrefill/Decode分離アーキテクチャを解説。vLLM・SGLang・NVIDIA DynamoのKVキャッシュ転送方式とTTFT/ITL最適化のトレードオフを整理します。
投機的デコーディングで推論を高速化する設計
自社ホスティングLLM推論に投機的デコーディングを導入する設計を解説。vLLMのEAGLE・ドラフトモデル・N-gram方式の使い分けと、QPS帯域別のトレードオフを整理します。
セルフホストLLM推論スタック——vLLM/SGLang選定
自社ホスティングのLLM推論エンジンはvLLMとSGLangが2026年の標準選択肢。RadixAttentionはプレフィックス再利用でキャッシュヒット率50〜99%を達成する。テンソル並列とKVキャッシュ設計の判断基準を解説する。
