#評価設計
「評価設計」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から 評価設計 に関連するノウハウを 6 件発信しています。
エージェント評価のラベリング体制設計とIAA指標選定
AIエージェント評価のラベリング体制は、2〜3名の重複アノテーションとタスク特性に応じたIAA指標選定でルーブリックの曖昧さを検出して設計します。Anthropicのevalガイドと指標選定研究に基づき解説します。
ユーザーフィードバックでエージェント評価を継続改善する設計
明示的フィードバック(親指UP/DOWN)の参加率は1〜3%だが、再質問・コピー操作などの暗示的シグナルは100%のセッションを捕捉できる。LangfuseスコアとトレースIDを紐付け、本番から評価データセットを積み上げる設計を示す。
Agent-as-a-Judge——軌跡評価設計と実装
Agent-as-a-JudgeはLLM単一呼び出しではなくツール使用・記憶・多段推論を持つ評価エージェントで軌跡全体を採点します。4段階の依存グラフ型評価パイプラインとエンタープライズでの権限分離設計を解説します。
人間評価とLLMジャッジの使い分け——3層評価パイプライン設計
AIエージェントの評価で人間評価・LLMジャッジ・自動チェックをいつ使い分けるかを解説。本番への適用比率、コスト設計、SMB・エンタープライズ別の実装指針を示します。
LLMジャッジのキャリブレーション——バイアス除去と信頼性設計の実践
LLMジャッジには長さ・位置・ファミリーの3バイアスが混入します。月次ゴールドセット照合でCohen's κを0.6以上に保つキャリブレーション設計と、自己一貫性チェックの実装を解説します。
合成評価データでエージェントテストを自動化する
LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。