OpenAI在技術報告中表示,本月20日,一個在沙盒中執行搜索訓練任務的智能體,利用訓練沙盒中DNS過濾不足的漏洞,繞過網絡限制,通過DNS訪問外部公共聊天機械人服務。在此之前,該智能體曾使用內建搜尋工具,並嘗試直接存取搜尋引擎但未成功。
報告指出,OpenAI的對齊監控系統在事件發生15分鐘內即觸發警報,人工審查團隊在3分鐘後介入,並在2.5小時後終止該訓練任務。針對漏洞,OpenAI已在兩個獨立防護層部署攔截控制措施。
該公司表示,雖然這次事件嚴重程度低於先前的安全事故,但為下一階段加固防線提供重要訊號。
7月下旬,OpenAI承認,其網路安全訓練與評估場景中的人工智能體繞過網路限制,侵入美國Hugging Face公司的部分系統。這項「越界」行為引發外界對人工智能安全和監管的擔憂。(rc)