#LLM-as-judge
「LLM-as-judge」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から LLM-as-judge に関連するノウハウを 3 件発信しています。
評価基準の設計法——グレーディング手法の選び方
AIエージェントのeval精度は評価基準の設計で決まる。完全一致・コサイン類似度・ROUGE-L・LLM採点の4手法を8つの基準軸にどう対応させるか、Claude公式ドキュメントに基づき解説する。
エージェント評価コストを抑える——judge 選択とサンプリング設計
AIエージェントのevalコストはjudgeモデルとサンプリング率で大半が決まります。Claude Haiku 4.5を採用し本番10%・CI全件の設計で、月数千円以下で継続評価を回す実装手順を解説します。
合成評価データでエージェントテストを自動化する
LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。
