#エージェント評価

「エージェント評価」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から エージェント評価 に関連するノウハウを 21 件発信しています。

Inspect AIでエージェント評価基盤を設計する

Inspect AIはUK AISI製のOSS評価フレームワークで、Task・Solver・Scorerの3層構成とサンドボックス実行でエージェント評価を再現可能にします。MITライセンスで200超の公開評価を利用できます。

エージェント評価のラベリング体制設計とIAA指標選定

AIエージェント評価のラベリング体制は、2〜3名の重複アノテーションとタスク特性に応じたIAA指標選定でルーブリックの曖昧さを検出して設計します。Anthropicのevalガイドと指標選定研究に基づき解説します。

エージェント評価のフレーキーテスト対策——非決定性と再現性設計

AIエージェント評価の非決定性はpass@kとpass^kの使い分けと複数トライアル設計で吸収できます。ツール列一貫性87%・引数一貫性69%という実測差を基に再現性設計の要点を解説します。

MCPツールのスキーマドリフト検知——コントラクトテスト設計

MCPツールのスキーマドリフト(Rug Pull)は署名済みベースライン比較とコントラクトテストのCI組み込みで検知できます。具体的な設計手順を解説します。

ユーザーフィードバックでエージェント評価を継続改善する設計

明示的フィードバック(親指UP/DOWN)の参加率は1〜3%だが、再質問・コピー操作などの暗示的シグナルは100%のセッションを捕捉できる。LangfuseスコアとトレースIDを紐付け、本番から評価データセットを積み上げる設計を示す。

Agent-as-a-Judge——軌跡評価設計と実装

Agent-as-a-JudgeはLLM単一呼び出しではなくツール使用・記憶・多段推論を持つ評価エージェントで軌跡全体を採点します。4段階の依存グラフ型評価パイプラインとエンタープライズでの権限分離設計を解説します。

エージェント評価コストを抑える——judge 選択とサンプリング設計

AIエージェントのevalコストはjudgeモデルとサンプリング率で大半が決まります。Claude Haiku 4.5を採用し本番10%・CI全件の設計で、月数千円以下で継続評価を回す実装手順を解説します。

Managed Agents Outcomes——ルーブリック駆動の評価・改訂ループ

Managed Agents OutcomesでルーブリックとAI採点エージェントを組み合わせて品質ゲートを実装する設計パターン。引用検証・DCFモデル・コンプライアンス審査など複数基準タスクで有効。

AIエージェントSLO設計——品質ダッシュボードの実装

AIエージェントにSLO/SLIを設定し、Langfuse・Heliconeで品質ダッシュボードを構築する具体手順。タスク完了率・ハルシネーション率・レイテンシを中小企業が低コストで計測・改善する方法を解説します。

AIエージェントのA/Bテスト統計設計——評価実験の信頼性確保

エージェントの非決定性はソフトウェアA/Bテストの統計設計を覆します。マッチドペア設計・ブートストラップCIでサンプルサイズを決定し、ピーキング問題を回避する逐次テスト統合まで解説します。

人間評価とLLMジャッジの使い分け——3層評価パイプライン設計

AIエージェントの評価で人間評価・LLMジャッジ・自動チェックをいつ使い分けるかを解説。本番への適用比率、コスト設計、SMB・エンタープライズ別の実装指針を示します。

モデル更新時のエージェント評価——アップグレード前後を安全に比較する

モデルアップグレード時にAIエージェントの品質が維持されているかをシャドーモードで検証する評価設計を解説する。10〜25%のトラフィック並列採点でタスク完了率・根拠整合性・エラー率を比較し、安全に本番移行を判断する手順を示す。

LLMジャッジのキャリブレーション——バイアス除去と信頼性設計の実践

LLMジャッジには長さ・位置・ファミリーの3バイアスが混入します。月次ゴールドセット照合でCohen's κを0.6以上に保つキャリブレーション設計と、自己一貫性チェックの実装を解説します。

AIエージェントのオンライン評価——本番サンプリング設計の実践

本番AIエージェントのトラフィックをサンプリングしてオンライン評価する設計パターン。ヒューリスティック全量・LLM-as-judge 10〜20%・人手2〜5%の三層構造で分布ドリフトを継続検知する。

LLMエージェント評価フレームワーク選定——RAGAS・DeepEval・Braintrust比較

RAG評価に強いRAGAS、CI/CD統合のDeepEval、本番監視まで含むBraintrustの設計思想を比較し、エージェント種別・チーム規模ごとの選定基準と2ツール構成パターンを解説します。

エージェント評価の最小構成——20タスクで動くEvals設計

AIエージェントのevalは20タスクから始められる。実失敗起票からグレーダー設計、Langfuse・Arize Phoenixの無料構成まで、エンジニア2〜3人が1週間で動かせる手順を示す。

エージェント評価のCI/CD統合——品質ゲートとパイプライン設計

AIエージェントの評価をCI/CDパイプラインに組み込む方法を解説。PRごとにgraderが自動採点しスコア0.85以上を品質ゲートとする設計から、GitHub Actionsへの統合パターンまで示す。

合成評価データでエージェントテストを自動化する

LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。

エージェントのハルシネーション検知——整合性サンプリングと根拠検証

エンタープライズAIエージェントのハルシネーション検知に必要な4技術——トークン確率・整合性サンプリング・根拠検証・LLMジャッジを解説します。3層信頼スコア設計で本番フィルタリングを自動化する実装パターンを示します。

ゴールデンデータセットで始めるエージェント回帰テスト設計

AIエージェントの回帰テストをゴールデンデータセットで自動化する手法を解説。Anthropicが推奨する50〜200件のテストセット構築、pass@k指標、CIパイプライン統合まで解説します。

LLM-as-a-judgeでエージェント品質を自動採点する評価基盤設計

LLM-as-a-judgeを用いてAIエージェントの品質を自動採点する方法を解説。採点ルーブリック・ゴールデンデータセット・回帰テストパイプラインの設計まで、大規模運用を前提としたエンタープライズ向け評価基盤の実装パターンを示します。