6観点を fan-out し、finding ごとに敵対検証を経て、run ごとにライブ自己校正を実施。リリース判定・高リスク変更・最終ゲートのための徹底ティアです。
日常の「done と言う前」のチェックには、軽量の companion review-audit を。
計測: benchmark/ に同梱した 90 欠陥のコーパス(Python + JS/TS、6カテゴリ)上で、現行の Claude モデル(2026-06)で計測。スクリプトを実行して自分で確かめられます。
バグ・配線・セキュリティ・テスト・spec・回帰
fresh な反証者が各 finding を DISPROVE しようとする。反証成立なら除外(ログに残す・黙過しない)。確認/未解決なら統合 + severity 順に整列
確認済 high が1件以上: FAIL — must-fix / 全観点が監査済かつ実証済: PASS / 未監査・未実証の観点あり: INCOMPLETE
多くの監査は「ちゃんと見た」ことを信じてくれと言います。これは あなたのコード上で、この実行で、自分の検出力を測ります。使い捨てコピーに既知の欠陥を植え、捕まえられるか確かめます。調査した範囲では、努力を報告するだけでなく per-run で能力を実証する同種ツールを他に確認できませんでした。
| 観点 | 植えた | 捕捉 | 検出力 | 判定 |
|---|---|---|---|---|
| バグ | 1 | 1 | 100% | OK |
| 配線 | 1 | 1 | 100% | OK |
| セキュリティ | 1 | 0 | 0% | DEGRADED → 観点 INCOMPLETE |
ロジックの誤り・境界条件・不正な前提(correctness / bugs)
作ったが呼ばれない・dead code・完成品として出された stub(wiring — built-but-never-called, dead code)
入力検証・認証・秘密の扱い(security)
テストが本当に効いているか。走るだけでは足りない(test efficacy)
実装が仕様どおりか(spec compliance)
テスト・ビルドを実際に走らせる。証拠は exit code だけ(regression — actually run tests/build)
各観点は「監査済 / 部分 / 未監査 / 対象外」を報告します。調べていない観点が PASS に混ざることはありません。すべての finding は fresh な反証エージェントによる確認を経てから届きます。
「調べなかった」は黙った隙間ではなく、一級の出力です。調べていない観点は PASS に貢献できません。
すべての finding は、それを DISPROVE しようとする fresh-context の反証エージェントに渡されます。CONFIRMED または UNRESOLVED だけが返ってきます。偽陽性は、あなたが見る前に除外されます。
修正案は出しますが、適用はしません。前後の checksum で本物のソースが無傷だと証明します。自己校正の使い捨てコピーは実行後に破棄されます。
「監査済」と名乗るには、コマンド・grep・file:line の具体的な根拠が必要です。「大丈夫そう」は監査済ではありません。
| 項目 | review-audit(companion) | review-audit-pro(本ページ) |
|---|---|---|
| いつ | 日常の「done と言う前」 | リリース / 高リスク / 最終ゲート |
| コスト | 低トークン・1パス | 重い・多エージェント fan-out |
| 方法 | 自分で6観点を当てる・1パス | 観点ごとに fresh エージェント + finding ごとに敵対検証 |
| 検出力の実証 | — | ライブ自己校正(per-run) |
| ベンチ数値 | 継承しない | recall 95.6% · hallucination 2.5%・再現可能 |
軽量の review-audit は、深さや per-run の検出力実証が要るとき pro にエスカレーションします。任意の連携(すべて無くても穏やかに縮退・必須ではない): wiring-auditor subagent は配線観点を深め、semgrep(MCP または CLI)はセキュリティ観点を強め、codex(openai-codex プラグイン)は明示的に頼んだときだけ外部レビュアーとして使えます。無断起動はしません。
「Claude」「Claude Code」は Anthropic, PBC の商標です。review-audit-pro は独立したコミュニティのプロジェクトであり、Anthropic とは関連・提携・推奨・スポンサーのいずれの関係もありません。Claude Code への言及は、相互運用性を説明する目的に限られます。