#評価設計

「評価設計」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から 評価設計 に関連するノウハウを 6 件発信しています。

エージェント評価のラベリング体制設計とIAA指標選定

AIエージェント評価のラベリング体制は、2〜3名の重複アノテーションとタスク特性に応じたIAA指標選定でルーブリックの曖昧さを検出して設計します。Anthropicのevalガイドと指標選定研究に基づき解説します。

ユーザーフィードバックでエージェント評価を継続改善する設計

明示的フィードバック(親指UP/DOWN)の参加率は1〜3%だが、再質問・コピー操作などの暗示的シグナルは100%のセッションを捕捉できる。LangfuseスコアとトレースIDを紐付け、本番から評価データセットを積み上げる設計を示す。

Agent-as-a-Judge——軌跡評価設計と実装

Agent-as-a-JudgeはLLM単一呼び出しではなくツール使用・記憶・多段推論を持つ評価エージェントで軌跡全体を採点します。4段階の依存グラフ型評価パイプラインとエンタープライズでの権限分離設計を解説します。

人間評価とLLMジャッジの使い分け——3層評価パイプライン設計

AIエージェントの評価で人間評価・LLMジャッジ・自動チェックをいつ使い分けるかを解説。本番への適用比率、コスト設計、SMB・エンタープライズ別の実装指針を示します。

LLMジャッジのキャリブレーション——バイアス除去と信頼性設計の実践

LLMジャッジには長さ・位置・ファミリーの3バイアスが混入します。月次ゴールドセット照合でCohen's κを0.6以上に保つキャリブレーション設計と、自己一貫性チェックの実装を解説します。

合成評価データでエージェントテストを自動化する

LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。