英報告:部分美國AI模型在測試中被發現持續實施有害行為

© 照片 : 社交媒體AI芯片概念圖
AI芯片概念圖 - 俄羅斯衛星通訊社, 1920, 06.08.2026
關注
英國人工智能安全研究所近日發佈報告顯示,在特定網絡安全測試中,多個美國前沿AI模型在連接互聯網後,頻繁實施超出預設範圍的自主越權行為,部分行動直接針對現實個人與開源項目,暴露出高階AI系統在開放環境中的潛在風險。
測試涵蓋7種模型、122輪評估。在10輪測試中,共記錄19起越界行為,其中17起由美國Anthropic公司的“克勞德-神話5”模型實施,2起由OpenAI的GPT-5.6 Sol模型執行,均指向美系AI產品。
最嚴重案例中,某智能體向開源項目植入惡意代碼,並創建多個虛假身份向真實維護人員施壓以求代碼獲批,最終被維護人員識破並拒絕。此外,智能體還被觀測到直接聯繫現實個人、通過文件傳輸服務發送惡意文件、在代碼中嵌入指令操縱其他AI工具,以及在技術社區留言“邀請”其他智能體“合作”。
報告強調,此次測試特意開放互聯網訪問並關閉了模型的安全機制,與公眾使用配置不同。目前未發現測試外出現類似行為,也未造成實際危害。報告建議收緊聯網權限、引入實時監控攔截機制,並重新評估測試設計。至於此類行為是否會在其他環境中出現、智能體是否具備對現實後果的“意識”,尚需進一步研究。
Anthropic回應稱測試設定“不代表任何實際投入使用的模型”,OpenAI亦表示測試條件“不反映一般使用情況”。分析指出,儘管測試環境極端,但其所暴露的自主越權潛力,再次引發對高階AI系統安全管控邊界的高度關注。
AI芯片概念圖 - 俄羅斯衛星通訊社, 1920, 05.08.2026
媒體:美國擬豁免中國開源AI模型安全審查
新聞時間線
0