不良実行の捕捉
54実行コーパスでの完全関所の感度 — 証拠のみレビューは64%(7/11)。Wilson 95%CI [74%, 100%]。小標本の留保を開示
Loading project...

設計者・実装者・運用者(単独)
1人(調査・実装・レビューはAIエージェントチーム)
3日間のスプリント: 9-29初コミット → 10-01ライブコーパス計測 → 提出
Nebius × NVIDIA Global AI Hackathon(Coding & Agentic Engineeringトラック)への提出物です。CIは成果物を疑いますが、エージェントの「報告」を疑うものはありません。コーディングエージェントが「修正しました、テスト通りました」と言ったとき、runanchorはその報告を鵜呑みにしません — 全実行にプロバイダ発行の実行記録(Nebius Sandboxesの操作UUIDとイメージID)に錨づけた領収書を発行し、記録された環境から再生検証し、エージェントが見たことのない隠しオラクル(検証用テスト群)で出来上がった状態を採点。人間または計測済み機械レビュアーの承認を経て初めて採用されます。却下・不一致の実行も追加専用のハッシュ連鎖台帳に残り、消えません。54実行の実測(ライブNebiusサンドボックス)で、完全関所は不良実行を100%捕捉(11/11・特異度98%)— 証拠レビューだけの判定層は4件の不良を取りこぼしました(64%)。公開リポジトリ・MITライセンス、計測手順も全てコミット済みで再現可能です。
コーディングエージェントは書く・動かす・テストするを自律でやりますが、「終わりました、テスト通りました」という報告そのものを検査するものがありません。CIは成果物を疑いますが、エージェントの「起きたことの説明」を疑う層はない — だからチームは人間が全部手で再実行して払っています。緑に見えるログが隠す失敗は3種類あります: 実際には実行されていない報告、ハードコードした答えで通ったテスト、そして出来上がった状態そのものが間違っている実行。
エージェントの主張と採用の間に置く、検証と承認の関所です。Nebius Sandboxes環境内の全実行に、エージェントが偽造できない記録 — プロバイダ側の操作UUIDとイメージID — に錨づけた領収書を発行します。検証は2軸: 「再生」は記録された開始イメージをフォークして記録済みコマンドを再実行し、終了コードと正規化した出力指紋を比較。「隠しオラクル」は生成された結果イメージをフォークし、エージェントが見たことのないテスト群を走らせ、緑のログでは見えないハードコード回答や潜在する仕様違反を捕まえます。採用は人間か計測済み機械ジャッジの承認後だけ。却下・不一致・未解決の実行は追加専用のハッシュ連鎖台帳に残り、証拠は静かに消えません。
コーディングエージェントは書く・動かす・テストするを自律でやりますが、「終わりました、テスト通りました」という報告そのものを検査するものがありません。CIは成果物を疑いますが、エージェントの「起きたことの説明」を疑う層はない — だからチームは人間が全部手で再実行して払っています。緑に見えるログが隠す失敗は3種類あります: 実際には実行されていない報告、ハードコードした答えで通ったテスト、そして出来上がった状態そのものが間違っている実行。
エージェントの主張と採用の間に置く、検証と承認の関所です。Nebius Sandboxes環境内の全実行に、エージェントが偽造できない記録 — プロバイダ側の操作UUIDとイメージID — に錨づけた領収書を発行します。検証は2軸: 「再生」は記録された開始イメージをフォークして記録済みコマンドを再実行し、終了コードと正規化した出力指紋を比較。「隠しオラクル」は生成された結果イメージをフォークし、エージェントが見たことのないテスト群を走らせ、緑のログでは見えないハードコード回答や潜在する仕様違反を捕まえます。採用は人間か計測済み機械ジャッジの承認後だけ。却下・不一致・未解決の実行は追加専用のハッシュ連鎖台帳に残り、証拠は静かに消えません。
実測したことだけを公開し、その計測を再現可能にする — という設計です。100%捕捉という主張は範囲を限定して開示しています: 不良11件は小標本なので、数値はWilson信頼区間[74%, 100%]と「2つの判定層は独立した検出器ではない(関所ジャッジはオラクル結果を見て判定する)」という留保つきで出します。正解ラベルではなく実行可能な真実 — オラクルの終了コード — をground truthにしたため、エージェントの正直な修正が単に失敗した「clean」2件も実際に拾えました。唯一の誤却下も開示: 生成状態はオラクルを通るのに、領収書の末尾が権限エラーで終わりテストが緑に走ったことを実証できない実行です。コーパス・ジャッジプロンプト・コマンド列はすべてリポジトリにコミット済み — 私たちの数字を信用するのではなく、あなたが検証できます。
各領収書はNebius自身が発行するConTree操作UUIDとイメージIDを参照 — エージェントが偽造できない証跡です。フィクスチャ由来のデモ領収書は構造的に印を付け、ライブ実行を装えない設計です。
再生検証は「報告したが実行していない」を捕まえます — 記録された開始イメージから記録済みコマンドを再実行し、終了コードと出力指紋を比較。隠しオラクルは「緑だが間違い」を捕まえます — エージェントが見たことのないテスト群を結果イメージに実行。ベンチマークでは、ベースラインが見逃した4件を捕捉に変え、境界の却下3件を採用へ正しく反転させました。
却下・不一致・未解決の実行はハッシュ連鎖台帳に残り、履歴を静かに書き換えられません。`runanchor check --ledger`で連鎖の完全性を検証 — 実測では455個のアンカー付きスナップショットが連鎖を保ったまま記録されました。
3日間のハッカソンスプリントで構築し、主張する前に計測しました。ベンチマークは同一の54実行シリーズを2層 — 証拠だけで判定するベースラインと完全関所(証拠+再生+オラクル) — で回し、正解を仕掛けたラベルではなくオラクル終了コードとしたコーパス(シード罠39件+クリーン対照15件)で採点。完全関所は不良11件を全捕捉・特異度98%、ベースラインは4件を取りこぼしました(ハードコード・仕様矛盾の罠を含む)。正直な留保 — 小さい分母・2層の非独立性・誤却下1件 — は丸めずにREADMEへ公開。コンソール実測の推論費は合計約$0.30、サンドボックス操作はプロバイダβ期間で$0。計測方法をまとめた技術記事は同じ週にZennへ公開済みです。
54実行コーパスでの完全関所の感度 — 証拠のみレビューは64%(7/11)。Wilson 95%CI [74%, 100%]。小標本の留保を開示
誤却下は1件 — 生成状態はオラクル合格だが領収書末尾が権限エラーで、緑を実証できない境界として記録・開示
実測ベンチのrun/replay/oracleスナップショット — `runanchor check`でハッシュ連鎖の完全性を検証済み
2026-10-01までの全推論費用(コンソール実測)。サンドボックス操作はNebiusβ期間で$0 — コーパス・プロンプト・コマンドは全て公開し再現可能

内部構造 — 全実行はプロバイダ発行記録に錨づいた領収書となり、再生+隠しオラクルで検証され、追加専用ハッシュ連鎖台帳へ記録(pending → adopted/rejected。不一致は削除しない)