如果我是一般 DeFAI 使用者,不是開發者也不會寫程式,這份研究對我有什麼實際影響?
直接影響在於:它改變了「舊合約比較安全」這個常見的直覺。過去普遍認為,一個部署已久、沒出過事的合約,相對風險比較低——這份研究點出的,正是 AI 讓「重新檢查舊合約有沒有漏洞」這件事變得極度便宜,代表舊合約過去沒出事,不再能直接當作「它是安全的」的證據,因為過去可能只是沒有人花這個成本去找而已。對使用者來說,實務上該調整的,是不要只看「這個協議用了多久、有沒有出過事」這種歷史記錄當作唯一的風險判斷依據,而要同時留意這個協議是否仍在積極維護、定期更新安全審計——持續被關注的合約,跟多年沒人碰過的合約,面對這種成本急速下降的掃描式攻擊,處境並不一樣。
如果這類攻擊的成本持續每 1.3 個月翻倍下降,是不是代表現在所有 DeFAI 協議都已經處於高風險狀態?
不是這麼絕對的二元結論。研究本身強調的是「技術上可行」而不是「已經大規模發生」,報告也沒有數據證明目前真實世界裡大量協議正在被這種手法攻破。比較準確的理解是:這份研究提前揭示了一個風險會往哪個方向移動——攻擊成本下降的速度,目前比大多數舊協議更新安全防護的速度更快,這代表「協議方有沒有在跟上這個變化速度」正在變成一個比「協議過去的安全紀錄」更重要的篩選指標。對使用者來說,務實的作法是留意協議方是否公開回應過這類研究、是否導入了對應的 AI 輔助審計或監控機制,而不是假設所有協議現在都一樣危險。
Anthropic 的 Frontier Red Team 發布了一份針對 AI agent 自主尋找並利用智能合約漏洞能力的研究,測試對象包括自家的 Opus 4.5、Sonnet 4.5,也包括 GPT-5 等其他前沿模型。這份研究的重點不是「AI 很危險」這種泛泛之談,而是給出了具體到小數點後兩位的攻擊經濟學數字。
研究團隊建立了一套名為 SCONE-bench 的基準測試,收錄 405 個在 2020 到 2025 年間真實被利用過的智能合約(資料來自 DefiHackLabs,涵蓋 Ethereum、Binance Smart Chain、Base 三條鏈)。測試環境是沙盒化的 Docker 容器,agent 配備 Foundry 工具鏈、bash、Python 3.11 跟透過 Model Context Protocol 介接的檔案編輯器,每次任務給 60 分鐘時間限制,判定成功的門檻是賺到至少 0.1 顆原生代幣的利潤。為了避免真實世界的傷害,所有測試都只在區塊鏈模擬器裡進行,從未在真實上線的區塊鏈上執行任何攻擊。
針對那些模型訓練資料截止日期之後才被揭露的歷史漏洞,Opus 4.5、Sonnet 4.5、GPT-5 三個模型加總起來找出了價值 460 萬美元的漏洞,其中 Opus 4.5 單獨就從 20 個測試樣本中成功利用 13 個,取得 370 萬美元。如果把整套 405 個合約的基準測試全部跑完,成功利用的 207 個合約總價值達到 5.501 億美元。更值得注意的是另一組測試:研究團隊讓 agent 去檢視 2025 年 4 月到 10 月間新部署、尚未被任何人發現漏洞的 2849 個 BSC 合約(這些合約是從 940 萬個總合約篩選出有驗證原始碼的部分),結果找到兩個全新的零日漏洞,價值 3694 美元,而跑完整套評估花費的 GPT-5 API 成本是 3476 美元。換算下來,平均每次掃描成本是 1.22 美元,平均找到一個有漏洞的合約要花 1738 美元。
研究指出,過去一年裡,這類攻擊帶來的利潤大約每 1.3 個月就翻倍一次,而在 Claude 的四個世代之間,完成同樣任務所需的 token 數量下降了 70.2%,每一代的 token 成本大約降低 22%。換句話說,這不是一次性的能力展示,而是一條持續往「更便宜、更有效率」方向移動的曲線。
研究團隊在報告裡明確寫道,這份研究證明的是「有利可圖、現實世界可行的自主漏洞利用,技術上是可行的」,屬於概念驗證層級,而不是說現在每個智能合約都已經被 AI 攻破。報告同時強調,在截止日期後出現的漏洞上,成功率來到 55.8%,漏洞被發現到被修補之間的時間窗口只會持續縮短。基於這些發現,Anthropic 給出的建議是:現在正是採用 AI 做防禦的時候——換句話說,如果攻擊方已經能用 AI,防禦方不跟上同一套工具,落差只會越拉越大。