「LLM-as-judge」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から LLM-as-judge に関連するノウハウを 2 件発信しています。
AIエージェントのevalコストはjudgeモデルとサンプリング率で大半が決まります。Claude Haiku 4.5を採用し本番10%・CI全件の設計で、月数千円以下で継続評価を回す実装手順を解説します。
LLMを使った合成評価データセット生成でAIエージェントのテストを自動化する。ペルソナシミュレーター・ツール呼び出し・マルチターン会話・敵対的ケースの4パターンとAnthropicが推奨する品質設計を解説します。