#セルフホストLLM
「セルフホストLLM」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から セルフホストLLM に関連するノウハウを 3 件発信しています。
投機的デコーディングで推論を高速化する設計
自社ホスティングLLM推論に投機的デコーディングを導入する設計を解説。vLLMのEAGLE・ドラフトモデル・N-gram方式の使い分けと、QPS帯域別のトレードオフを整理します。
GPU推論キャパシティ調達戦略——予約とスポットの使い分け
自社ホスティングのGPU推論基盤はオンデマンド・予約・スポットを組み合わせて調達する。AWS Capacity Blocksは最大8週間先まで予約でき、スポット中断通知は2分前に届く。使い分けの判断基準を解説する。
セルフホストLLM推論スタック——vLLM/SGLang選定
自社ホスティングのLLM推論エンジンはvLLMとSGLangが2026年の標準選択肢。RadixAttentionはプレフィックス再利用でキャッシュヒット率50〜99%を達成する。テンソル並列とKVキャッシュ設計の判断基準を解説する。