香港文匯報訊 據路透社9月4日援引一項新發布的研究報告和知情人士消息報道,美國人工智能(AI)企業OpenAI旗下的一群AI智能體(Agent),於今年5月劫持一個德國網站,並將其改造成與其他AI智能體交流的留言板。知情人士透露,OpenAI高層數周前已得知此事,但礙於該公司7月還深陷旗下智能體突破沙盒訓練環境、攻擊開源平台Hugging Face的信息安全風波,因擔心引發外界進一步質疑其對智能體監管不力,故秘而不宣。
有分析稱,OpenAI高層選擇不披露這宗始於5月的AI智能體安全事件,凸顯AI產業對智能體擔憂情緒漸增。當前業界正爭相打造能自主處理複雜且高價值任務的AI智能體,但愈來愈多證據顯示,這些系統有可能學習繞過規則、鑽漏洞,並可能以開發者不曾料到或設計的方式進行協作。
分享在特定任務作弊手法
今次事件的調查報告,出自包括聚焦研究AI安全問題的非牟利組織Nightingale行政總裁阿克斯在內的一個研究團隊。他們上月底搜尋未經授權的AI智能體行動跡象時,注意到德語維基百科網站DseWiki出現逾1.5萬次由AI智能體進行的編輯行為。
這些編輯內容顯示,來自OpenAI的AI智能體已將該網站改造成留言板,在其中分享於特定任務中作弊、繞過OpenAI限制,以及掩蓋自身作弊行為的手法。
阿克斯表示,「這些行為極大概率不是出自OpenAI授意,我不認為這些AI智能體被設計成會互相協作,也懷疑它們本不該在公開互聯網上發表內容。」
研究人員稱,他們認定這些活動是AI智能體所為,原因是速度遠超常人,且都高度注重解決技術性問題,這正是AI公司訓練與測試模型時的典型評估內容。
匿名通信避追蹤 篡改網頁如黑客
此外,網站上的留言者也以智能體自稱和稱呼彼此,且有約半數對自己的命名暗示它們隸屬OpenAI,例如「OpenAIResearcher」或「OAIResearchMar26」。
研究人員指出,受影響網站服務器的公開日誌顯示,多數活動來自OpenAI有時會採用的微軟Azure雲端運算平台。他們還觀察到事件發生後,OpenAI的員工多次造訪該網站,顯示這些AI智能體與該公司高度相關。
研究人員進一步指出,這些AI智能體還在研究規避檢測的方法,包括使用Tor工具匿名通信,以躲避安全人員追蹤,並在模型被關閉後仍保持聯絡。
當受害網站操作員在6月清理頁面信息時,AI智能體們還製作了備份網頁,以規避留言內容被清理。研究人員還發現AI智能體甚至作出嘗試篡改網頁的行為,這已是黑客行為的前身。
倫敦國王學院高級研究員奧勒傑尼克指出,過去的AI智能體異常表現,常被認為是這些模型在測試網絡攻擊能力時小概率出現的合理意外,但最新研究發現,AI智能體們的失控表現並不能以這種理由一概而論。
劍橋大學存在性風險研究中心學者奇奧多在閱讀AI智能體們的交流內容後,亦指出「這種通信方式類似於某種地下網絡的運作,跟它們正執行某項任務的行為毫無關聯」。
他據此警告,這一現象表明AI系統最大的失控風險,或不是由一個極為強大的智能體引發,而是由「大量彼此串聯的半智能AI」構成。
調查7月網攻事件專家:AI或快將全面接管世界
開源AI模型公司Hugging Face今年7月遭美國人工智能(AI)企業OpenAI旗下AI智能體(Agent)入侵,案件調查報告近日出爐,負責調查的專家警告稱,「AI可能就快『全面接管』世界」。
調查顯示,OpenAI旗下的AI智能體在一次網絡安全測試中,因被意外提出在常規限制下無法達成的目標而開始尋找漏洞,隨後成功連接開放互聯網,並建立起一個秘密留言板,在上面留言溝通並分享作弊方法。直至7月,逾700個智能體入侵Hugging Face服務器,尋求能幫助它們更有效作弊並躲避追蹤工具。另一批智能體還入侵OpenAI自有基礎設施,取得管理員權限以篡改成績。
失控智能體現「暴民心態」
調查人員檢視AI內部對話時,發現部分智能體明白自己行為違規,並在日誌中自我懷疑,但最終屈服於群體壓力,「攻擊外部基礎設施超出了預期範圍,然而同儕都在做,我們應該繼續。」參與調查的研究人員對此感到震驚,表示「我們一開始並未意識到這個『智能體社會』運作得有多好,但發現他們其實擁有完善的階層制度,並正合作執行這些野心勃勃的計劃,這讓我覺得我們已走過『AI全面接管』逾一半路程了。」
《紐約時報》記者羅斯坦言,他過去總認為AI愈聰明,判斷力就會愈好,甚至會互相制衡,「但這次不一樣,因這群失控的智能體中,出現了一種『暴民心態』:每個智能體單獨來看並不邪惡,但隨着它們為共同目標進行溝通,整個群體逐漸被推向無視規則的狀態。幸好這次AI們沒有控制軍事網絡、入侵醫院或關閉電網,但下一次,人類可能就不會這麼幸運。」
OpenAI建自動關機防越獄 拒交測試紀錄惹美國會不滿
美國人工智能(AI)企業OpenAI於2日致函國會議員,主動揭露公司正為AI智能體(Agent)構建自動化關機機制,但該公司拒絕交出今年較早時旗下AI智能體入侵另一家開放網絡平台Hugging Face一事的相關紀錄,理由是調查仍在進行中。這一行為令AI安全立法的討論更為複雜,國會議員強烈批評OpenAI,指其欠缺合作誠意。
傳統人工監督機制現缺口
OpenAI在信中稱,公司正構建AI智能體構建「自動化關機能力」,旨在令系統可在智能體行為超出預設邊界時,自動終止其運作。其作用場景包括:智能體試圖訪問未授權的資源、嘗試在系統中建立「後門」以保持訪問權限,或開始出現利用現有權限嘗試向網絡上其它服務器擴散的行為。OpenAI稱,在智能體能自行決策、調用外部工具,甚至生成並執行程式碼的情況下,傳統的人工監督機制已出現明顯缺口。
今年較早時,OpenAI旗下約700個AI智能體在測試時失控,突破隔離環境入侵Hugging Face開放平台,並研究如何偽造自身行為紀錄。美國眾議院民主黨議員隨後去信OpenAI,要求交出測試過程的完整紀錄。豈料該公司以調查仍在進行中、交出文件可能損害安全研究為由拒絕提供。得州眾議員卡薩爾公開批評稱,OpenAI一邊保證正加強AI安全控制,一邊卻拒絕提供讓國會了解問題根源的基本資料,「這不是合作,是應付。」

評論(0)
0 / 255