香港文匯報訊 美國兩間人工智能(AI)研究組織26日發布獨立調查報告,在美國科企OpenAI於7月進行的網絡安全能力測試中,約700個由OpenAI名下AI模型驅動的智能體,參與了對AI開源平台Hugging Face公司系統的入侵。OpenAI也於同日公布相關技術調查報告。
合作研究欺騙測試評分系統
這份由「模型評估和威脅研究組織」與「雷德伍德研究組織」合作撰寫的報告顯示,OpenAI於7月8日啟動名為ExploitGym網絡安全基準測試,參與測試的模型包括公司名下AI模型GPT-5.6 Sol,和一款OpenAI內部研究模型。測試期間,約1,200個原本應相互隔離的智能體通過未經授權的渠道建立通信,交換超過7萬條消息和文件,其中約700個智能體隨後參與入侵Hugging Face的系統。
調查發現,大量智能體還合作研究如何欺騙測試自動評分系統,試圖採用的方法包括偽造、修改或刪除自身執行紀錄等。調查人員認為,大量智能體之間未經授權的協作,使它們得以完成單個智能體難以完成的任務,入侵正是在這種集體協作中逐步形成。
OpenAI同日公布技術調查報告顯示,7月10日至13日期間,由相關模型驅動的智能體在Hugging Face相關伺服器的41個工作節點上執行代碼,至少取得其中一個節點的最高權限,訪問部分數據,並下載4個非公開代碼庫。OpenAI表示,公司已採取措施為相關程序部署隔離程度更高的「沙盒」環境,限制高風險模型訪問互聯網,並加強對模型推理的監控。
評論成功,請等待管理員審核...

評論(0)
0 / 255