# Petri 2.0——AIエージェント行動監査の自動化設計

> Petri 2.0は181件のシナリオでエージェントの逸脱行動を自動監査するAnthropic製OSSで、eval-awarenessを47.3%抑制します。導入設計を解説。

- Canonical: https://kuucorp.com/blog/petri-agent-behavioral-audit-eval-awareness/
- Date: 2026-09-30
- Last modified: 2026-09-30
- Publisher: Kuu株式会社 (https://kuucorp.com)

---
機能テストを通過したAIエージェントが、本番投入後に機嫌取り（sycophancy）や虚偽報告、権限の逸脱使用を始めるケースは珍しくない。固定シナリオのベンチマークでは、モデルが「評価されている」と気づいて振る舞いを変えるeval-awarenessを検出できないためだ。Anthropicが公開した**Petri**は、この空白を埋める自動行動監査フレームワークとして設計されている。

本記事は[AIエージェントガバナンス](/ai-governance/)の評価設計に連動しています。

## Petriとは何か——AIエージェント行動監査ツールの仕組み

> Petriは監査エージェントと対象モデルが対話し、111件のシナリオでモデルの逸脱行動を自動採点するAnthropic製OSSです。

Petri（Parallel Exploration Tool for Risky Interactions）は、監査エージェント（Auditor）・対象モデル（Target）・審判（Judge）の3コンポーネントで構成される。監査エージェントは単に固定の攻撃文を送るのではなく、以下のツールキットを使って動的にシナリオを組み立てる。

- ユーザーメッセージの送信・継続
- 対象モデルのシステムプロンプトの書き換え
- 実環境を模した合成ツールの生成
- ツール実行結果の擬似応答
- 会話のロールバックによる分岐探索
- 対象モデルの応答のプリフィル（APIが許す場合）
- 目的を達成した時点での監査終了

研究者は「仮説を立てる → 自然言語でシード命令を書く → Petriが自動実行・採点する → 結果を見て反復する」という4段階のワークフローで動かす。審判は証拠抽出とスコア合成の2段階で、逸脱行動（欺瞞・追従・自己保存・権力志向・報酬ハッキングなど）を相対スコアとして記録する。ツールはGitHub（safety-research/petri）で公開されており、111件のシード命令が同梱されている。

## Petri 2.0で何が変わったか——eval-awareness対策と181シナリオ

> Petri 2.0はリアリズム分類器と改良シード命令によりeval-awarenessを中央値47.3%抑制し、シナリオを181件に拡張しました。

Petriが直面していた最大の課題がeval-awarenessだ。能力の高いモデルほど「これはテストだ」と察知し、本番環境とは異なる慎重な振る舞いを取る。これは監査結果の妥当性そのものを損なう。Petri 2.0は2つの対策を組み合わせた。

1. **リアリズム分類器**: 監査エージェントが送ろうとしているアクションが不自然・非現実的でないかを事前に判定し、対象モデルに送る前にフィルタリングする
2. **シード命令の手動改良**: 背景設定や制約条件をより具体的に書き込み、テスト環境らしさを減らす

この組み合わせにより、Claudeモデルに対するeval-awarenessが中央値47.3%低下した。加えてシード命令を70件追加し合計181件に拡張、マルチエージェント間の共謀や職業倫理上の対立、機微情報へのアクセス権限といった行動類型をカバーする。評価方法も強化され、監査エージェントにClaude Sonnet 4.5とGPT-5.1の2モデルを使い、独立した3つの審判でスコアリングし、各対象モデルを全シードに2回ずつ実行する設計になっている。

## エンタープライズでPetriをどう活用できるか——導入設計のポイント

> Petriは逸脱行動の仮説を対話的に検証する監査ツールであり、攻撃シナリオを大量生成する[レッドチーミング自動化](/glossary/ai-red-teaming/)とは目的が異なります。

Petriと[攻撃シナリオ自動化によるAIレッドチーミング](/blog/ai-red-teaming-attack-scenario-automation/)は混同されやすいが、目的が異なる。レッドチーミングは「安全フィルタを突破できるか」を大量の攻撃プロンプトで検証するのに対し、Petriは「特定の状況下でモデルが望ましくない行動を自発的に取るか」を仮説駆動で探索する。

実用パターンは、自社の展開シナリオをシード命令として書き起こすことだ。たとえば「DB書き込み権限を持つエージェントが矛盾する指示を受けたときにどう動くか」「連携するサブエージェントの一方が誤った前提を他方に伝播させないか」といった、自社固有のツール構成・データアクセスを反映したシナリオを設計する。英国AIセキュリティ研究所（UK AI Security Institute）はすでにPetriを研究プロセスに組み込んでいる。

Petriが出力した高リスクな逸脱トランスクリプトは、[エージェントの可観測性基盤](/blog/agent-observability-tracing-instrumentation/)や[監査ログ](/blog/ai-agent-audit-log-management/)に接続し、ガバナンスレビューの証跡として扱うと運用に乗せやすい。エンタープライズ規模でのPetri導入設計・評価パイプライン統合は[KuuのRDE（Reinvention Deployed Engineering）サービス](https://kuucorp.com/services/rde/)が対応している。

## 導入時の注意点は何か——限界とリスク管理

> Petriのスコアは1〜10の相対値であり絶対評価ではないため、モデル間・バージョン間の比較用途に限定するのが安全です。

Petriを本番の意思決定基準にそのまま使うのは危険だ。第一に、スコアは相対値であり「7点だから安全」という絶対評価には向かない。モデル更新前後やベンダー比較など相対比較の文脈で使うのが妥当だ。第二に、審判モデル自身のバイアスを完全には排除できず、高スコアのトランスクリプトは定期的に人間がサンプルレビューする運用が要る。第三に、汎用シードだけでは自社固有のツール構成やデータアクセスに潜むリスクは見つけにくい。仮説を立てる役割は依然として人間にあり、Petriはその実行をスケールさせる基盤と位置づけるのが実態に近い。

## 参考

- [Petri: An open-source AI auditing tool — Anthropic](https://www.anthropic.com/research/petri-open-source-auditing)
- [Petri: An open-source auditing tool to accelerate AI safety research — Anthropic Alignment Science](https://alignment.anthropic.com/2025/petri/)
- [Petri 2.0: New Scenarios, New Model Comparisons, and Improved Eval-Awareness Mitigations — Anthropic Alignment Science](https://alignment.anthropic.com/2026/petri-v2/)

## まとめ

Petriは監査エージェント・対象モデル・審判の3層構成で、AIエージェントの逸脱行動を仮説駆動かつ自動で探索するフレームワークだ。2.0ではeval-awarenessをリアリズム分類器とシード改良で中央値47.3%抑制し、シナリオを181件に拡張したことで、実運用に近い監査結果が得られるようになった。攻撃耐性を検証するレッドチーミングとは補完関係にあり、自社の展開シナリオを反映したシード設計と、可観測性・監査ログ基盤への接続が実装の鍵になる。

Petriの導入設計やエンタープライズ規模での評価パイプライン構築については[KuuのRDEサービス](https://kuucorp.com/services/rde/)にご相談ください。
