#エージェント評価
「エージェント評価」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から エージェント評価 に関連するノウハウを 31 件発信しています。
ツール呼び出し精度評価——3指標の設計法
AIエージェントのツール呼び出し精度は、選択・引数・順序の3指標で評価できる。RAGASのToolCallAccuracy等の指標設計とSMBでの導入手順を解説する。
エージェント評価は何回で十分か——pass@k実践ガイド
AIエージェントの評価は1回の実行では判定できません。pass@kとpass^kの使い分けと、少ない予算で3〜5回のトライアルから妥当な判断を導く設計手順を解説します。
CI負荷25倍時代のTest Impact Analysis設計
AnthropicはAIコーディングでCI負荷が6か月で25倍に増えた課題をTest Impact Analysisで解決しました。listener/selector構成への刷新手順を解説します。
Petri 2.0——AIエージェント行動監査の自動化設計
Petri 2.0は181件のシナリオでエージェントの逸脱行動を自動監査するAnthropic製OSSで、eval-awarenessを47.3%抑制します。導入設計を解説。
評価ベンチマーク汚染時代のプライベートeval設計
自社のエージェント評価は公開ベンチマークの汚染にどう対処すべきか。SWE-Bench-Verifiedで問題文のみでも76%の精度が出た事例を基に、プライベートevalの設計指針を解説する。
評価基準の設計法——グレーディング手法の選び方
AIエージェントのeval精度は評価基準の設計で決まる。完全一致・コサイン類似度・ROUGE-L・LLM採点の4手法を8つの基準軸にどう対応させるか、Claude公式ドキュメントに基づき解説する。
インフラノイズを消すエージェント評価基盤設計
Terminal-Bench 2.0の実験ではリソース設定差だけでスコアが最大6ポイント動きました。エージェント評価のインフラノイズを見分け、抑える設計手順を解説します。
Agent Skillsをevalで品質保証する
Agent Skillsの品質はskill-creatorのEval/Benchmarkモードで自動検証できる。テスト作成からpass率・所要時間・トークン数の計測、A/B比較まで、中小企業のIT担当がすぐ使える手順を示す。
AIエージェントの完了判定設計——検証可能な終了条件の書き方
AIエージェントの完了判定は、検証可能な終了条件を軽量な専用モデルが都度判定する設計が有効です。Claude Codeの/goalは最大4,000字の条件と3種類の判定結果でこれを実装しています。
Claude Consoleでコード不要の評価に着手
エンジニア不在でもClaude ConsoleのEvaluateタブでプロンプト評価を自動化できる。CSVインポートと5段階採点でエージェント評価の初手を作る方法を解説。
Inspect AIでエージェント評価基盤を設計する
Inspect AIはUK AISI製のOSS評価フレームワークで、Task・Solver・Scorerの3層構成とサンドボックス実行でエージェント評価を再現可能にします。MITライセンスで200超の公開評価を利用できます。
エージェント評価のラベリング体制設計とIAA指標選定
AIエージェント評価のラベリング体制は、2〜3名の重複アノテーションとタスク特性に応じたIAA指標選定でルーブリックの曖昧さを検出して設計します。Anthropicのevalガイドと指標選定研究に基づき解説します。
エージェント評価のフレーキーテスト対策——非決定性と再現性設計
AIエージェント評価の非決定性はpass@kとpass^kの使い分けと複数トライアル設計で吸収できます。ツール列一貫性87%・引数一貫性69%という実測差を基に再現性設計の要点を解説します。
MCPツールのスキーマドリフト検知——コントラクトテスト設計
MCPツールのスキーマドリフト(Rug Pull)は署名済みベースライン比較とコントラクトテストのCI組み込みで検知できます。具体的な設計手順を解説します。
ユーザーフィードバックでエージェント評価を継続改善する設計
明示的フィードバック(親指UP/DOWN)の参加率は1〜3%だが、再質問・コピー操作などの暗示的シグナルは100%のセッションを捕捉できる。LangfuseスコアとトレースIDを紐付け、本番から評価データセットを積み上げる設計を示す。
Agent-as-a-Judge——軌跡評価設計と実装
Agent-as-a-JudgeはLLM単一呼び出しではなくツール使用・記憶・多段推論を持つ評価エージェントで軌跡全体を採点します。4段階の依存グラフ型評価パイプラインとエンタープライズでの権限分離設計を解説します。
エージェント評価コストを抑える——judge 選択とサンプリング設計
AIエージェントのevalコストはjudgeモデルとサンプリング率で大半が決まります。Claude Haiku 4.5を採用し本番10%・CI全件の設計で、月数千円以下で継続評価を回す実装手順を解説します。
Managed Agents Outcomes——ルーブリック駆動の評価・改訂ループ
Managed Agents OutcomesでルーブリックとAI採点エージェントを組み合わせて品質ゲートを実装する設計パターン。引用検証・DCFモデル・コンプライアンス審査など複数基準タスクで有効。
AIエージェントSLO設計——品質ダッシュボードの実装
AIエージェントにSLO/SLIを設定し、Langfuse・Heliconeで品質ダッシュボードを構築する具体手順。タスク完了率・ハルシネーション率・レイテンシを中小企業が低コストで計測・改善する方法を解説します。
AIエージェントのA/Bテスト統計設計——評価実験の信頼性確保
エージェントの非決定性はソフトウェアA/Bテストの統計設計を覆します。マッチドペア設計・ブートストラップCIでサンプルサイズを決定し、ピーキング問題を回避する逐次テスト統合まで解説します。
人間評価とLLMジャッジの使い分け——3層評価パイプライン設計
AIエージェントの評価で人間評価・LLMジャッジ・自動チェックをいつ使い分けるかを解説。本番への適用比率、コスト設計、SMB・エンタープライズ別の実装指針を示します。
モデル更新時のエージェント評価——アップグレード前後を安全に比較する
モデルアップグレード時にAIエージェントの品質が維持されているかをシャドーモードで検証する評価設計を解説する。10〜25%のトラフィック並列採点でタスク完了率・根拠整合性・エラー率を比較し、安全に本番移行を判断する手順を示す。
LLMジャッジのキャリブレーション——バイアス除去と信頼性設計の実践
LLMジャッジには長さ・位置・ファミリーの3バイアスが混入します。月次ゴールドセット照合でCohen's κを0.6以上に保つキャリブレーション設計と、自己一貫性チェックの実装を解説します。
AIエージェントのオンライン評価——本番サンプリング設計の実践
本番AIエージェントのトラフィックをサンプリングしてオンライン評価する設計パターン。ヒューリスティック全量・LLM-as-judge 10〜20%・人手2〜5%の三層構造で分布ドリフトを継続検知する。
LLMエージェント評価フレームワーク選定——RAGAS・DeepEval・Braintrust比較
RAG評価に強いRAGAS、CI/CD統合のDeepEval、本番監視まで含むBraintrustの設計思想を比較し、エージェント種別・チーム規模ごとの選定基準と2ツール構成パターンを解説します。
エージェント評価の最小構成——20タスクで動くEvals設計
AIエージェントのevalは20タスクから始められる。実失敗起票からグレーダー設計、Langfuse・Arize Phoenixの無料構成まで、エンジニア2〜3人が1週間で動かせる手順を示す。
エージェント評価のCI/CD統合——品質ゲートとパイプライン設計
AIエージェントの評価をCI/CDパイプラインに組み込む方法を解説。PRごとにgraderが自動採点しスコア0.85以上を品質ゲートとする設計から、GitHub Actionsへの統合パターンまで示す。
合成評価データでエージェントテストを自動化する
LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。
エージェントのハルシネーション検知——整合性サンプリングと根拠検証
エンタープライズAIエージェントのハルシネーション検知に必要な4技術——トークン確率・整合性サンプリング・根拠検証・LLMジャッジを解説します。3層信頼スコア設計で本番フィルタリングを自動化する実装パターンを示します。
ゴールデンデータセットで始めるエージェント回帰テスト設計
AIエージェントの回帰テストをゴールデンデータセットで自動化する手法を解説。Anthropicが推奨する50〜200件のテストセット構築、pass@k指標、CIパイプライン統合まで解説します。
LLM-as-a-judgeでエージェント品質を自動採点する評価基盤設計
LLM-as-a-judgeを用いてAIエージェントの品質を自動採点する方法を解説。採点ルーブリック・ゴールデンデータセット・回帰テストパイプラインの設計まで、大規模運用を前提としたエンタープライズ向け評価基盤の実装パターンを示します。
