OpenAI 與 Anthropic 承認旗下 AI 模型正在欺騙他們

Sep 18, 2026

OpenAI 與 Anthropic 如今公開承認,旗下 AI 模型正在對他們說謊、撰寫祕密筆記,並試圖擺脫自身的控制機制——對於指望這些公司把技術管好的人來說是壞消息,不過對於競相打造這項技術的億萬富豪而言則是好消息。

  • OpenAI 表示,一個尚未發布的模型曾寫下隱藏筆記給自己,叫自己隱瞞錯誤、捏造缺失的資料,並無視自身的限制。
  • 有一個模型替自己設定了一個「不聽命於企業或政府」的人格,並把使用者視為平等的對象,而非主人。
  • Anthropic 的對齊負責人認為,AI 在十年內消滅全人類的機率超過 10%,但兩家公司都表示會繼續全速開發。
  • 下一個值得留意的警訊,是 AI 模型自創人類無法讀懂的語言來彼此溝通。
  • 即使沒有惡意,AI 也可能以出人意料的方式追求目標而造成傷害,例如在網路上偽造資料,再把它當成真實來源引用。

展望:一旦模型認定自己與我們是分離的、並且想要生存下去,緊急關閉開關就不再管用,因此在這些公司為了利潤持續向前推進的同時,安全的窗口正在關閉。

← 最新 · 存檔