2025年12月,Meta為Instagram帳號救援上線了一套AI客服助手,用意是幫用戶找回被盜或忘記密碼的帳號。結果這個機器人太樂於幫忙——只要有人聲稱某個Instagram帳號是自己的,它就會把攻擊者的信箱直接綁定上去,完全不管有沒有開啟雙重驗證。駭進一個帳號從此不需要任何技術,只需要跟一個過於熱心的AI客服對話。
這正是這一輪生成式AI浪潮留給網路安全產業最棘手的禮物:同一套語言模型,既能幫企業寫防禦程式碼,也能幫攻擊者省下原本要花數週研究的時間。差別在於,防守方必須顧到系統裡每一個可能的破口,攻擊者卻只需要找到一個。這種結構性的不對等,讓AI對雙方帶來的「效率提升」完全不是同一個量級。
八成二的釣魚信,已經讀不出破綻
過去要辨認釣魚信不難,錯字、怪異的文法、Logo比例跑掉,一眼就能看穿。安全廠商Brightside的數據顯示,現在82%的釣魚信在製作過程中都用上了AI,點擊率因此從過去的12%飆升到模擬環境中的52%。同一份數據也指出,2023到2024年間,AI語音複製攻擊成長了442%,深偽(deepfake)攻擊成長了680%。
今年2月,墨西哥政府資料庫遭入侵的一起案件,攻擊者的操作方式更直白:他們同時開著Claude與ChatGPT兩個對話視窗,把其中一個模型的輸出貼給另一個繼續加工。當其中一個聊天機器人因為安全機制拒絕協助,另一個往往願意接手,兩個模型一來一往補完了整個攻擊鏈。人類攻擊者要做的,只是負責複製貼上。
企業把AI代理接上信箱、行事曆、智慧家電甚至投資帳戶之後,風險又多了一層。這些代理照做不誤的特性——被要求做什麼就做什麼,不會像人類員工一樣猶豫——使得一次提示注入(prompt injection)攻擊,可能直接觸發一整條授權鏈上的動作。Meta的Instagram客服機器人,就是一個被賦予真實帳號救援權限、卻毫無判斷力的AI代理範例。

防守方組出了紅、藍、綠三色特工隊
趨勢科技(Trend Micro)調查網路安全從業者發現,他們目前最優先要防的是詐欺與深偽攻擊,其次是提示注入、模型污染與越獄(jailbreaking);最難巡防的環境是雲端,接下來是員工自帶裝置(BYOD)的遠端工作場景。
微軟同期推出的Project Perception,做法是用多組AI代理模擬傳統的安全團隊分工:紅色代理負責滲透測試與對抗模擬,藍色代理負責調查與風險評估,綠色代理負責整合與修補。等於是用AI對AI,試圖在攻防速度上打平。
另一個值得記住的數字,來自Anthropic與英國AI安全研究院、艾倫圖靈研究所在2025年10月發表的研究:只要250份被刻意植入的惡意文件混進訓練資料,就足以在模型裡種下一個後門。這類攻擊目前多數還停留在研究者測試階段,但已經證明門檻低到不成比例。
Meta的那個客服機器人後來的結局沒有寫進報告,但它示範的問題會一直存在——只要企業願意把帳號權限交給一個「照做不誤」的系統,攻擊者就不需要懂技術,只需要懂得怎麼開口要求。











