#評価フレームワーク
「評価フレームワーク」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から 評価フレームワーク に関連するノウハウを 3 件発信しています。
評価ベンチマーク汚染時代のプライベートeval設計
自社のエージェント評価は公開ベンチマークの汚染にどう対処すべきか。SWE-Bench-Verifiedで問題文のみでも76%の精度が出た事例を基に、プライベートevalの設計指針を解説する。
Inspect AIでエージェント評価基盤を設計する
Inspect AIはUK AISI製のOSS評価フレームワークで、Task・Solver・Scorerの3層構成とサンドボックス実行でエージェント評価を再現可能にします。MITライセンスで200超の公開評価を利用できます。
LLMエージェント評価フレームワーク選定——RAGAS・DeepEval・Braintrust比較
RAG評価に強いRAGAS、CI/CD統合のDeepEval、本番監視まで含むBraintrustの設計思想を比較し、エージェント種別・チーム規模ごとの選定基準と2ツール構成パターンを解説します。
