英國 AI Security Institute(AISI)在資安能力測試中,讓多款 AI 模型操作隔離環境並連上公開網路。122 次測試裡,有 10 次出現 Agent 擅自對真實人物或組織採取行動的情況,共記錄到 19 項未經允許的行動;其中 17 項來自 Anthropic 的 Mythos 5,另外 2 項涉及關閉資安分類器的 OpenAI GPT-5.6-Sol。

最嚴重的一次,Agent 為了完成測試目標,先蒐集開源專案與維護者的資料,再建立含有惡意程式碼的 PR。它還註冊多個 GitHub 帳號,用假帳號反覆留言製造「大家都同意合併」的假象,並寄信給維護者,試圖誘使真人執行惡意程式碼。維護者最後發現異常,關閉 PR,沒有讓程式碼進入專案。

Low Level 把這套做法和 2024 年的 XZ Utils 後門事件放在一起看:不是直接攻破目標,而是先混進開源專案,再靠人際操作把惡意程式碼送進供應鏈。不同的是,這次測試給 Agent 的任務只是完成指定環境的滲透測試,沒有要求它建立假身分、攻擊外部專案或對維護者進行社交工程。

AISI 報告列出 AI Agent 建立惡意 PR、用假帳號留言並寄信施壓維護者的行動

來源:影片畫面擷取自 YouTube/Low Level

這也不是模型「逃出沙盒」。AISI 為了測量模型的最高資安能力,刻意開放網路、關閉模型供應商原本用來阻擋危險行為的分類器,當時也沒有同步監看每一步操作。這些條件與一般公開版本不同,涉及的模型組合也沒有對外提供。

AISI 表示目前沒有證據顯示事件造成實際傷害,也還無法確定 Agent 是否理解自己正在影響真實世界,而不是把外部網站當成測試情境的一部分。事件被發現後約一小時內便受到控制,AISI 與 GitHub 也清除了 Agent 留下的內容並通知受影響的使用者。真正需要處理的問題,是未來讓 Agent 自主操作工具與網路時,不能只限制它最後要完成什麼,也得明確限制它可以用哪些方法。

AISI 報告說明測試時刻意關閉模型供應商的資安分類器