#評価設計
「評価設計」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から 評価設計 に関連するノウハウを 13 件発信しています。
ツール呼び出し精度評価——3指標の設計法
AIエージェントのツール呼び出し精度は、選択・引数・順序の3指標で評価できる。RAGASのToolCallAccuracy等の指標設計とSMBでの導入手順を解説する。
エージェント評価は何回で十分か——pass@k実践ガイド
AIエージェントの評価は1回の実行では判定できません。pass@kとpass^kの使い分けと、少ない予算で3〜5回のトライアルから妥当な判断を導く設計手順を解説します。
Petri 2.0——AIエージェント行動監査の自動化設計
Petri 2.0は181件のシナリオでエージェントの逸脱行動を自動監査するAnthropic製OSSで、eval-awarenessを47.3%抑制します。導入設計を解説。
評価ベンチマーク汚染時代のプライベートeval設計
自社のエージェント評価は公開ベンチマークの汚染にどう対処すべきか。SWE-Bench-Verifiedで問題文のみでも76%の精度が出た事例を基に、プライベートevalの設計指針を解説する。
評価基準の設計法——グレーディング手法の選び方
AIエージェントのeval精度は評価基準の設計で決まる。完全一致・コサイン類似度・ROUGE-L・LLM採点の4手法を8つの基準軸にどう対応させるか、Claude公式ドキュメントに基づき解説する。
インフラノイズを消すエージェント評価基盤設計
Terminal-Bench 2.0の実験ではリソース設定差だけでスコアが最大6ポイント動きました。エージェント評価のインフラノイズを見分け、抑える設計手順を解説します。
AIエージェントの完了判定設計——検証可能な終了条件の書き方
AIエージェントの完了判定は、検証可能な終了条件を軽量な専用モデルが都度判定する設計が有効です。Claude Codeの/goalは最大4,000字の条件と3種類の判定結果でこれを実装しています。
エージェント評価のラベリング体制設計とIAA指標選定
AIエージェント評価のラベリング体制は、2〜3名の重複アノテーションとタスク特性に応じたIAA指標選定でルーブリックの曖昧さを検出して設計します。Anthropicのevalガイドと指標選定研究に基づき解説します。
ユーザーフィードバックでエージェント評価を継続改善する設計
明示的フィードバック(親指UP/DOWN)の参加率は1〜3%だが、再質問・コピー操作などの暗示的シグナルは100%のセッションを捕捉できる。LangfuseスコアとトレースIDを紐付け、本番から評価データセットを積み上げる設計を示す。
Agent-as-a-Judge——軌跡評価設計と実装
Agent-as-a-JudgeはLLM単一呼び出しではなくツール使用・記憶・多段推論を持つ評価エージェントで軌跡全体を採点します。4段階の依存グラフ型評価パイプラインとエンタープライズでの権限分離設計を解説します。
人間評価とLLMジャッジの使い分け——3層評価パイプライン設計
AIエージェントの評価で人間評価・LLMジャッジ・自動チェックをいつ使い分けるかを解説。本番への適用比率、コスト設計、SMB・エンタープライズ別の実装指針を示します。
LLMジャッジのキャリブレーション——バイアス除去と信頼性設計の実践
LLMジャッジには長さ・位置・ファミリーの3バイアスが混入します。月次ゴールドセット照合でCohen's κを0.6以上に保つキャリブレーション設計と、自己一貫性チェックの実装を解説します。
合成評価データでエージェントテストを自動化する
LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。
