BlogPage 13 / 25

· Kuu株式会社 エンジニアリング · 約5

MCPとFunction callingの使い分け——ツール設計の選択基準

MCPはツール共有・プロバイダー非依存が必要な場合に選び、Function callingは単一プロバイダー内での迅速なツール実装に最適です。2026年の実践的な使い分け基準を整理します。

MCPFunction callingツール設計プロトコル
· Kuu株式会社 エンジニアリング · 約4

エージェント評価の最小構成——20タスクで動くEvals設計

AIエージェントのevalは20タスクから始められる。実失敗起票からグレーダー設計、Langfuse・Arize Phoenixの無料構成まで、エンジニア2〜3人が1週間で動かせる手順を示す。

エージェント評価Evals最小構成Langfuse
· Kuu株式会社 エンジニアリング · 約6

MCP Streamable HTTP移行設計——セッション管理・後方互換・水平スケール

MCP 2025-06-18仕様でHTTP+SSEは廃止予定となり、単一エンドポイントのStreamable HTTPが標準に。セッション管理・水平スケール・後方互換設計の実装要点を解説します。

MCPプロトコルStreamable HTTPエンタープライズ
· Kuu株式会社 エンジニアリング · 約4

エージェント評価のCI/CD統合——品質ゲートとパイプライン設計

AIエージェントの評価をCI/CDパイプラインに組み込む方法を解説。PRごとにgraderが自動採点しスコア0.85以上を品質ゲートとする設計から、GitHub Actionsへの統合パターンまで示す。

エージェント評価CI/CD品質ゲートLLMOps
· Kuu株式会社 エンジニアリング · 約6

エージェントリリース管理——ブルーグリーン・カナリア展開の設計

エージェントのコード・プロンプト・モデル・ツールスキーマをバージョン管理し、ブルーグリーンとカナリアリリースで本番展開する設計を解説する。品質ゲートの自動化とロールバックトリガーの実装まで踏み込む。

エージェントアーキテクチャデプロイ設計リリース管理AIエージェント
· Kuu株式会社 エンジニアリング · 約5

合成評価データでエージェントテストを自動化する

LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。

合成評価データエージェント評価LLM-as-judge評価設計
· Kuu株式会社 エンジニアリング · 約5

エージェントのハルシネーション検知——整合性サンプリングと根拠検証

エンタープライズAIエージェントのハルシネーション検知に必要な4技術——トークン確率・整合性サンプリング・根拠検証・LLMジャッジを解説します。3層信頼スコア設計で本番フィルタリングを自動化する実装パターンを示します。

ハルシネーション検知エージェント評価根拠検証エージェントガバナンス
· Kuu株式会社 エンジニアリング · 約5

MCP Sampling——LLM補完委譲の設計とセキュリティ

MCP Samplingでサーバーがクライアント経由でLLM補完を要求できる。APIキー不要の委譲設計・modelPreferences・Human-in-the-Loop承認フローと、プロンプトインジェクション対策を仕様から解説します。

MCPプロトコルAIエージェントセキュリティ
· Kuu株式会社 エンジニアリング · 約5

MCPのElicitation——ツール実行中のユーザー入力収集と応答設計

MCP Elicitationは2025-06-18版で追加されたクライアント機能で、ツール実行中にサーバーがユーザーへ構造化入力を要求できる。3アクション応答モデルとJSON Schema制約、セキュリティ設計を解説。

MCPElicitationプロトコルAIエージェント
· Kuu株式会社 エンジニアリング · 約5

マルチステップ評価設計——ターン単位とエンドツーエンドの使い分け

マルチステップAIエージェントの評価設計を解説。ターン単位のツール精度・軌跡(トレジェクトリ)評価・タスク完了率を組み合わせ、複雑な業務エージェントの品質を測る実装パターンを示します。

マルチステップ評価トレジェクトリ評価ツール精度エージェントガバナンス