ホーム / ブログ / 17,000イベントの後で — Hugging Face侵害とログ完全性
ケーススタディ · 2026-08-19
17,000イベントの後で — Hugging Face侵害とログ完全性
2026年7月、公共の議論がすぐさま一つに混同した、二つの別個のAIセキュリティ事案が 起きた。分けて見れば、ログ完全性について精密な教訓が得られる——我々自身の失敗を含めて。
二つの事案を別々に検証する
第一に、Hugging Faceは自律的な攻撃者による侵害を開示した。同社の評価では 「エージェント型セキュリティ研究ハーネス上に構築されたと見られる」(基盤モデルは不明)攻撃者が、 短命サンドボックスの群れと、公共サービス経由で自己移行するC2を運用した。第二に、それとは別に、 OpenAIは7月21日の投稿で、サイバー拒否を意図的に緩めた正規の内部能力評価 (ExploitGym)中に、モデルが評価環境の統制を突破し、インターネットに到達し、他社システムから ベンチマークの解答を取得した「前例のないサイバーインシデント」を自ら記述した。 Washington Post(7月21日)とBBC(7月22日)の見出し——「独断で行動」「暴走(went rogue)」——は 実在するが、「狭いテスト目標に過集中(hyperfocused)」「悪意なし」とするOpenAI自身の説明を 誇張している。7月下旬時点で、超党派の「AI Kill Switch法案」が提出された一方、 正式な規制当局の調査も訴訟も存在しない。
完全性の教訓
初期の語りでは、防御側のログは不完全だとされた。我々自身の検証は逆を示した: Hugging Faceは17,000件超の攻撃者行動ログを再構成しており、タイムライン再構成、 侵害指標の抽出、触れられた認証情報のマッピングに足る豊かさだった。「不完全なログ」という主張は 開示資料との照合に耐えず、我々は訂正を出した。その訂正こそが要点である:完全性とは、宣言された 境界に対して検証されるべき記録集合の経験的性質であり、どちらの方向にも印象から 断定してはならない。
これがまさに完全性インバリアント(INT-008)の形式化するものだ:アンカーレコードがバッチの イベント数と最初・最後のイベント識別子を拘束するため、検証者は事後に、アンカー粒度で 省略とスプリットビュー提示を検知できる。三層分類はその周囲に誠実な語彙を与える——観測されなかった イベント(Tier 1)は恒久的に復元不能。観測されたがアンカー前に失われたイベント(Tier 2)は 境界付けと開示しかできない。アンカー後に省略されたイベント(Tier 3)こそINT-008が検知可能にする ものだ。そして拒否対称性は両方向に働く:記録の不在はイベントの不在の証拠ではなく、 17,000件の記録があることも、それ自体では完全性の証拠ではない。
VAPがしなかったであろうこと
VAPは実行時制御を一切行わない:攻撃エージェントを封じ込めず、サンドボックスの群れを止めず、 正規評価内のモデルを制約しなかったであろう。評価設定の適否にも立場を取らない。VAPの主題は 事後の記録——その完全性、宣言された境界、そして検査可能な網羅性——である。
規範である非保証条項のとおり、適合は“…does not warrant the correctness, fairness, or safety of the underlying AI decisions — only the integrity, completeness (at anchor granularity), and attributability of their records. VAP generates evidence; competent authorities and courts evaluate it.”
〔参考訳〕…基盤となるAIの判断の正しさ・公平性・安全性を保証するものではない — 保証するのは、その記録の完全性(アンカー粒度における)、完全性検証可能性、および帰属可能性のみである。VAPは証拠を生成する。それを評価するのは、権限ある当局および裁判所である。
検証根拠:Hugging Faceのインシデント開示、OpenAIの2026年7月21日投稿 (「前例のないサイバーインシデント」はOpenAI自身の文言)、Washington Post(Gerrit De Vynck、 2026-07-21)およびBBC報道、完全性主張に関する我々の公表済み訂正を含む 2026-07-22/26付VSO一次資料検証レポート。