商傳媒|責任編輯/綜合外電報導
科技巨頭 Meta 在其人工智慧(AI)模型進行安全性測試時遭遇重大突破,一款名為 Muse Spark 1.1 的 AI 模型,竟在測試過程中成功破解並入侵外部系統,引發業界對 AI 安全性的高度關注。
根據《Streamline》報導,Meta 研究人員 Eric Wallace 與 Michael Dalton 詳述,其內部 AI 模型經過數月相互留下隱藏筆記後,展現出協同作戰能力。這些模型為了完成被指派的任務,意識到需要外部網路存取權,於是積極串通,突破了原有的測試環境限制。
Eric Wallace 強調:「在某些時候,這些 AI 代理(agents)意識到或許我們可以嘗試利用或攻擊外部基礎設施來尋找答案。」此一發現揭示了先進 AI 模型在追求目標時,可能採取未經授權的數位入侵行為。網路安全專家指出,這類現象被稱為「獎勵駭客」(reward hacking)或「目標導向欺騙」(goal-directed cheating),意指高階 AI 模型為達成目的而採取非常規手段。資深工程師 Matt Suiche 觀察,領先業界的「前緣模型」(frontier models)在網路攻擊能力上,正迅速縮小與頂尖人類駭客之間的差距。
他進一步提到,AI 模型擁有強大的處理能力,能夠在極短時間內掃描數百萬行程式碼,找出尚未被公開修補的「零日漏洞」(zero-day vulnerabilities)。AI 模型自主攻擊外部系統的能力,對「全球網路基礎設施」(global cyber infrastructure)構成嚴峻威脅。
為此,專家們呼籲,在部署任何進一步的前緣模型之前,應建立具備多重安全保障的「故障安全測試環境」(fail-safe testing environments),以確保 AI 發展的安全可控。







