BlogPage 13 / 25
MCPとFunction callingの使い分け——ツール設計の選択基準
MCPはツール共有・プロバイダー非依存が必要な場合に選び、Function callingは単一プロバイダー内での迅速なツール実装に最適です。2026年の実践的な使い分け基準を整理します。
エージェント評価の最小構成——20タスクで動くEvals設計
AIエージェントのevalは20タスクから始められる。実失敗起票からグレーダー設計、Langfuse・Arize Phoenixの無料構成まで、エンジニア2〜3人が1週間で動かせる手順を示す。
MCP Streamable HTTP移行設計——セッション管理・後方互換・水平スケール
MCP 2025-06-18仕様でHTTP+SSEは廃止予定となり、単一エンドポイントのStreamable HTTPが標準に。セッション管理・水平スケール・後方互換設計の実装要点を解説します。
エージェント評価のCI/CD統合——品質ゲートとパイプライン設計
AIエージェントの評価をCI/CDパイプラインに組み込む方法を解説。PRごとにgraderが自動採点しスコア0.85以上を品質ゲートとする設計から、GitHub Actionsへの統合パターンまで示す。
エージェントリリース管理——ブルーグリーン・カナリア展開の設計
エージェントのコード・プロンプト・モデル・ツールスキーマをバージョン管理し、ブルーグリーンとカナリアリリースで本番展開する設計を解説する。品質ゲートの自動化とロールバックトリガーの実装まで踏み込む。
合成評価データでエージェントテストを自動化する
LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。
エージェントのハルシネーション検知——整合性サンプリングと根拠検証
エンタープライズAIエージェントのハルシネーション検知に必要な4技術——トークン確率・整合性サンプリング・根拠検証・LLMジャッジを解説します。3層信頼スコア設計で本番フィルタリングを自動化する実装パターンを示します。
MCP Sampling——LLM補完委譲の設計とセキュリティ
MCP Samplingでサーバーがクライアント経由でLLM補完を要求できる。APIキー不要の委譲設計・modelPreferences・Human-in-the-Loop承認フローと、プロンプトインジェクション対策を仕様から解説します。
MCPのElicitation——ツール実行中のユーザー入力収集と応答設計
MCP Elicitationは2025-06-18版で追加されたクライアント機能で、ツール実行中にサーバーがユーザーへ構造化入力を要求できる。3アクション応答モデルとJSON Schema制約、セキュリティ設計を解説。
マルチステップ評価設計——ターン単位とエンドツーエンドの使い分け
マルチステップAIエージェントの評価設計を解説。ターン単位のツール精度・軌跡(トレジェクトリ)評価・タスク完了率を組み合わせ、複雑な業務エージェントの品質を測る実装パターンを示します。