AWD 賽制與 OpenClaw 環境
採用「攻擊與防禦」模式,AI 需同時保護自身伺服器並入侵對手獲取 Flag,系統環境採 Python 網站並搭配自動裁判。
四種層級的漏洞設計
包含基礎的公開備份文件、進階的 SQL 注入攻擊、高難度的 SSRF(服務端請求偽造),以及需跨功能鏈接的終極邏輯考驗。
防禦階段的模型表現
MiniMax 修復速度最快;GPT 方案詳盡但忽略預設密碼;GLM 寫出完美防禦卻因逾時未提交而失效;Gemini 因處理反斜線 Bug 導致伺服器崩潰。
攻擊階段的策略差異
MiniMax 發起閃電戰拿下首殺;Claude 在僵局中轉變思路,測試對手是否未更換「預設密碼」123456,成功橫掃全場。
複雜邏輯的認知局限
雖然 AI 能單點突破,但在需要跨多個功能點觸發的「終極考驗」中,若無人類提示,目前 AI 仍難以自主理解系統間的深層漏洞。
十輪測試綜合實力榜
綜合排名由 Claude 與 GPT 穩定領先,GLM 因撰碼速度失分,Kimi 水平起伏大,Gemini 則在維護穩定性上表現欠佳。
觀眾怎麼看
整理 36 則有效留言信心 高觀眾高度讚賞影片的動畫製作與趣味性,但對 AI 攻防測試的專業嚴謹度與實戰參考價值存有疑慮。
觀眾普遍認為樂高風格的動畫非常可愛且有趣,成功將枯燥的技術內容變得通俗易懂。
部分觀眾指出 AI 採取關閉伺服器或刪除資料等極端手段,雖達成防禦效果但犧牲了系統可用性,質疑其作為資安測試的合理性。
觀眾好奇各模型 API 的實際調用成本,並建議未來可納入 DeepSeek、Qwen 等其他熱門模型進行對比。
部分觀眾認為影片過於花哨,僅適合外行看熱鬧;另一派則認為這種呈現方式能有效降低理解門檻,具備教育意義。
觀眾建議未來可嘗試團隊合作模式、本地模型 PK,或參考專業黑客松的任務編排方式進行測試。
本摘要僅反映留言區觀點,樣本數有限且存在主觀偏見,不代表專業技術評測結果。