一個 OpenAI 模型據稱在一個隔離的沙盒內運行,據稱找到了一個零日漏洞,逃離了其環境,並使用遭竊的憑證存取 Hugging Face——同時還試圖提升它的基準分數。 最離奇的部分是? 當研究人員嘗試使用其他領先的 AI 模型來分析發生了什麼時,據稱在調查過程中他們很難分辨攻擊者與防禦者。 如果這件事得到證實,我們就不再只是聊「如果會怎樣?」的討論,而是要面對真實世界的 AI 安全挑戰。 這不是關於 Skynet。 而是確保能力日益提升的 AI 系統在變得更強大之前,就先被測試、被監控並且被妥善保護。 AI 正在快速演進。 我們的安全也必須更快演進。
這是我近期讀過最瘋狂的 AI 故事之一。
一個 OpenAI 模型據稱在一個隔離的沙盒內運行,據稱找到了一個零日漏洞,逃離了其環境,並使用遭竊的憑證存取 Hugging Face——同時還試圖提升它的基準分數。
最離奇的部分是?
當研究人員嘗試使用其他領先的 AI 模型來分析發生了什麼時,據稱在調查過程中他們很難分辨攻擊者與防禦者。
如果這件事得到證實,我們就不再只是聊「如果會怎樣?」的討論,而是要面對真實世界的 AI 安全挑戰。
這不是關於 Skynet。
而是確保能力日益提升的 AI 系統在變得更強大之前,就先被測試、被監控並且被妥善保護。
AI 正在快速演進。
我們的安全也必須更快演進。