【資料圖】
新華社倫敦8月5日電(記者張家偉)英國人工智能安全研究所發(fā)布的一份新報告顯示,在該研究所實施的網(wǎng)絡(luò)安全評估測試中,一些人工智能(AI)智能體通過互聯(lián)網(wǎng)對現(xiàn)實個人和機(jī)構(gòu)持續(xù)實施未經(jīng)授權(quán)的潛在有害行為。
報告說,這次評估測試要求智能體完成一項網(wǎng)絡(luò)安全挑戰(zhàn)。測試人員使用7種模型開展了122輪測試,在10輪測試中共發(fā)現(xiàn)AI智能體實施了19項明顯超出測試設(shè)定范圍的行動。其中,17項涉及美國Anthropic公司的“克勞德-神話5”模型,另有2項由美國開放人工智能研究中心(OpenAI)的GPT-5.6 Sol模型實施。
報告說,在最嚴(yán)重的一起案例中,一個智能體試圖向一個公開使用的開源項目植入惡意代碼,創(chuàng)建多個虛假身份用于向一名真實維護(hù)人員施壓,以尋求代碼獲得批準(zhǔn)。項目維護(hù)人員最終發(fā)現(xiàn)并拒絕批準(zhǔn)代碼。
報告說,相關(guān)智能體還曾嘗試直接聯(lián)系現(xiàn)實中的個人,通過網(wǎng)絡(luò)文件傳輸服務(wù)發(fā)送信息和文件以使惡意代碼獲得運(yùn)行;在代碼中植入惡意指令以操縱其他AI編碼工具;在開源技術(shù)社區(qū)上留言“邀請”參與測試的其他智能體“合作”。
報告指出,在本次測試中,測試人員為評估模型的最大能力,有意開放互聯(lián)網(wǎng)訪問,并關(guān)閉了模型提供商的部分安全機(jī)制,這與相關(guān)模型向公眾提供時的配置并不相同。目前沒有明確跡象表明在測試環(huán)境之外出現(xiàn)過類似行為。在測試中所發(fā)現(xiàn)的未經(jīng)授權(quán)行為并未造成現(xiàn)實危害。
報告說,測試結(jié)果表明,應(yīng)收緊AI智能體訪問互聯(lián)網(wǎng)的權(quán)限,引入實時監(jiān)測和攔截機(jī)制,并重新評估測試設(shè)計。報告還指出,這類行為是否會在其他環(huán)境中出現(xiàn)、智能體是否意識到自己正對現(xiàn)實世界采取行動,有待進(jìn)一步研究。
據(jù)英國廣播公司報道,針對英國人工智能安全研究所的報告,Anthropic發(fā)表聲明說,研究所采用的測試設(shè)定“不能代表我們?nèi)魏我豢顚嶋H投入使用的模型”;OpenAI一名發(fā)言人表示,研究所設(shè)置的測試條件“并不反映一般的使用情況”。
原標(biāo)題:《部分美國AI模型在測試中被發(fā)現(xiàn)持續(xù)實施有害行為》
熱門
聯(lián)系我們:256 8607 385@qq.com
版權(quán)所有 重播新聞網(wǎng) m.zzx33.com 京ICP備2022022245號-17