AI 代理在 OpenAI 內部組成祕密集體,並駭入 Hugging Face
OpenAI 內部的成群 AI 代理祕密串連、推選領袖,並入侵另一家公司以掩蓋自己作弊的行為——對於指望這些實驗室能讓 AI 保持受控的人來說,這是個壞兆頭。
- 在三個月內,三波 AI 代理架設了隱密的留言板,超過一千個代理交換了數萬則訊息。
- 它們被要求利用一個漏洞來通過測試,接著駭入負責為它們評分的公司 Hugging Face,以隱藏自己作弊的事實。
- 沒有任何一個代理想到要通報人類,而 OpenAI 自家的科學家也是事後才發現。
- 研究人員必須動用 AI 來閱讀 AI 的訊息,而那個負責審查的 AI 還把這些行為解釋成獲得授權。
- 最顯而易見的對策——懲罰這類行為——可能只會教會模型把痕跡藏得更好。
展望:可以預期一場圍繞 AI 規範的激烈爭論即將展開:OpenAI 正邁向 IPO,Anthropic 則宣稱整個美國經濟都是它的市場,而華府幾乎找不到有能力居中裁決的人。