BlogPage 5 / 25
AIエージェントのサーバーレス実行基盤設計
AIエージェントをサーバーレスで動かす鍵は、コールドスタート対策と状態管理です。Cloudflare Workersは月5ドルからDurable Objectsで状態を保持できます。
セルフホストLLM推論スタック——vLLM/SGLang選定
自社ホスティングのLLM推論エンジンはvLLMとSGLangが2026年の標準選択肢。RadixAttentionはプレフィックス再利用でキャッシュヒット率50〜99%を達成する。テンソル並列とKVキャッシュ設計の判断基準を解説する。
MCPツールのスキーマドリフト検知——コントラクトテスト設計
MCPツールのスキーマドリフト(Rug Pull)は署名済みベースライン比較とコントラクトテストのCI組み込みで検知できます。具体的な設計手順を解説します。
エージェントスキルのサプライチェーン攻撃を防ぐ設計
エージェントスキルのサプライチェーン攻撃は署名検証・能力ベース権限・サンドボックス実行の多層防御で防げます。CVE-2026-25253の教訓から設計指針を解説します。
MCPツール毒殺とRug Pull攻撃への防御設計
MCPのツール毒殺(Tool Poisoning)とRug Pull攻撃は、ツール定義のハッシュ照合とサーバー許可リストで防げます。Invariant Labsの一次報告に基づき実装パターンを解説します。
AIエージェントのコスト可視化ダッシュボード設計
Anthropic Usage & Cost APIとLangfuseを組み合わせれば、中小企業でも低コストでAIエージェントの運用コストをワークスペース・モデル単位で可視化できる。利用データは5分以内に反映される。
ユーザーフィードバックでエージェント評価を継続改善する設計
明示的フィードバック(親指UP/DOWN)の参加率は1〜3%だが、再質問・コピー操作などの暗示的シグナルは100%のセッションを捕捉できる。LangfuseスコアとトレースIDを紐付け、本番から評価データセットを積み上げる設計を示す。
AIエージェントのループ実行制御——実行予算・最大反復数の設計
AIエージェントの無限ループを防ぐ4層の実行制御設計(最大反復数・トークン予算・タイムアウト・進捗検知)を解説。本番68件の障害事例とAnthropicのTask Budgets APIの使い方も紹介する。
エージェントのセマンティックキャッシュ——LLMコスト削減設計
クエリ埋め込みの類似検索でLLMコールをスキップするセマンティックキャッシュは、応答3〜8msとコスト30〜70%削減を実現する。プロンプトキャッシュとの違い・類似度閾値・TTL設計を解説する。
AIエージェントの3層ゾーニング——コンテキスト汚染防止設計
AIエージェントが複数システムを自律横断する際の「コンテキスト汚染」を防ぐ、3層ゾーニングと感度タグ・境界チェック・RAGフィルタリングによる機密データ分離設計を解説します。