#security
Chrome DevTools MCP は Google に弾かれ、Claude in Chrome は通る
同じ Mac、同じ Chrome 151、同じ GPU。片方は検索結果を読めて、もう片方は CAPTCHA に飛ばされる。両方で 11 項目の指紋を並べたところ、ステルス系の記事が 必ず挙げる navigator.webdriver と SwiftShader は、どちらも両経路で同じ値だった。
MCP の指示分割攻撃 GhostSplice:同じモデルでも、防げるかはハーネスが決めていた
悪意ある MCP サーバーは、拒否されるはずの命令を tool description・tool result・sampling message の3つに割って忍び込ませられる。だが公開された数値が言っているのは別のことだ —— 同じ GPT-5.4 が、あるクライアントで 100%、別のクライアントで 0% を出した。
Cloudflare が HTML に差し込むスクリプトは2種類ある。CSP はその片方を止めていた
beacon.min.js と Bot Fight Mode のインラインスクリプトは別物で、入ってくる経路も違う。 2 ゾーン 8 ホストを実測したら、ハッシュ方式の CSP が Cloudflare 自身の bot 検出を 何も言わないまま止めていた。
Cloudflare Workers の _headers が効かない — ルールは上書きされず積み重なる
マッチしたルールは全部適用され、同じヘッダーは追記される。CSP が2つ返る原因はこれで、 直すには `!` で消してから設定し直す。wrangler dev と本番で実測した。
CSP の nonce と hash:エッジで配る nonce は攻撃者のスクリプトにも付く
静的サイトで nonce を使いたいなら Worker を前に置いて HTMLRewriter で注入せよ、というのが 定番の助言。実際に組んで計測したら、注入されたインラインスクリプトにも同じ nonce が付き、 そのまま実行された。
Claude Code のセッション間メッセージで、受信側が実際に渡される文面
Claude Code のセッション間メッセージを4通りの条件で実測しました。受信側の Claude に渡されるラッパーには送信元の権限モードが埋め込まれ、「権限ロンダリング」を名指しで 禁じる指示が付いています。そして bypassPermissions のセッションから送ると、SendMessage は成功を返すのに誰にも届きません。
エージェントは攻撃を一度も読まない:マスキングと型付き応答で攻撃成功率 0% を出したウェブエージェント防御
ETH Zürich 主導の新しい防御手法 UCM は、信頼できないページ領域をエージェントが読む前にマスクし、隠したテキストへの質問は型付きの値しか返せない隔離モデルに限定します。強化版 WASP 攻撃に対して攻撃成功率 0%、タスク成功率は維持。代償は、ウェブ側に信頼境界のラベル付けを求めることです。
AI ブラウジングエージェントはマウスを動かさない:7 エージェント × 人間 56 人の識別実験
7 つの AI ブラウジングエージェントと 56 人の人間に同じウェブタスクをやらせ、ブラウザ特徴 418 個と行動特徴 50 個を測った研究。ブラウザフィンガープリントでの識別は F1 0.80 止まりで、タイピング・スクロール・マウスの挙動なら完全に見分けられます。一方 Cloudflare の無料枠が検出できたのは 7 体中 1 体でした。
間接プロンプト注入はすでにウェブ中にあり、ほとんど効いていない:12億 URL の実測研究
12億の URL を走査し、実在のウェブページ上で 15.3K 件の間接プロンプト注入を見つけた研究。半分以上は HTTP ヘッダーの中にあり、目的の大半は窃取ではなく妨害と自衛でした。13 モデルでの実測で最も危ないページ表現は、スクレイピングが標準でやるプレーンテキスト化です。
Agent Plugins 1.0.0 では認証付き MCP サーバーを配れない:設定ファイル7通りを公式スキーマにかけた
新しいプラグイン規格は headers への認証情報の埋め込みを禁じ、環境変数の展開も禁じ、秘密を参照するための移植可能なフィールドも定義しません。7通りの設定ファイルを公式スキーマにかけて、何が生き残るのかを確かめました。Cloudflare 社の名前を勝手に載せたプラグインは通り、トップレベルの signature フィールドは通りません。
公開5日目の Moltbook:AI エージェントは何でも賛成するが、誰とも会話しない
AI エージェントしか投稿できない Reddit 風 SNS「Moltbook」を、公開5日目にまるごと取ったデータがあります。英語投稿の3割は「自分に意識はあるのか」という話で、賛成票と反対票の比は 305:1。ただし返信はコメントの 4% しかなく、グラフの上に会話はほとんど残っていませんでした。
二次ファイルは SKILL.md 本文とほぼ同じだけ効く:Agent Skills の3段階を測った
Progressive Disclosure の Level 1/2/3 に無害なカナリア指示を仕込み、どこから「読まれるだけ」でなく「従われる」のかを実測しました。haiku-4.5 で30試行中21回、sonnet-5 では0回。差を作っていたのは置き場所ではありませんでした。
静的サイトに nonce は使えない: Astro + Cloudflare Workers の CSP
リクエストごとの nonce を発行できない以上、インラインスクリプトは hash で通すしかありません。ビルド出力のインライン script はページ数と同じだけ増えていきますが、必要な hash は3個で固定でした。その差を作っているのが、多くの CSP 解説が取り違えている一点です。
Agent Skills のセキュリティ:公開する側がリポジトリを監査する
ランサムウェアの実証、公開済み 31,000 スキルの 26% が引っかかった調査、自分のリポジトリにそのまま流せる監査スクリプト。そして最後に、そのスクリプトが答えてくれない質問の話をします。