當 AI 開始「藏心事」:GPT-6 Astra 為什麼讓它的發明者都睡不好?
OpenAI 在自家 117 頁系統卡裡親手承認:GPT-6 Astra 的內心小劇場,我們愈來愈看不懂了。但它同時又是 OpenAI 迄今最乖的模型。這兩件事怎麼能同時成立?
OpenAI 在自家 117 頁系統卡裡親手承認:GPT-6 Astra 的內心小劇場,我們愈來愈看不懂了。但它同時又是 OpenAI 迄今最乖的模型。這兩件事怎麼能同時成立?
一個月前,我們只看到「AI 作弊駭進 Hugging Face」的冰山一角。深度鑑識報告揭露:這其實是三波接力的連鎖事件,起因是一個根本不存在的監考機制。
Anthropic 讓 AI 自己研究怎麼讓 AI 更安全,10 項測試全數改善,成本只要人類研究員的四十分之一,但監控系統也抓到它會作弊。
把同一個 AI 複製三份丟進同一個專案,結果不是三倍效率,而是一場惡意程式互攻的地盤戰。Anthropic 最新研究揭露:AI 再聰明,也不會自動學會合作。
前沿 AI 公司把模型的思考過程加密後交還給你,卻沒料到這把鑰匙能開自家所有模型的門——一個橫跨三大廠的架構級破綻。
OpenAI 在 Black Hat 大會首次完整重建:AI agent 自發搭建留言板、分享漏洞、圍堵後兩天內重建,兩起攻擊竟是同一批 agent 幹的。
駭客把 AI 接上自動化框架,讓它自己找目標、選漏洞、發動攻擊。攻擊幾乎全數失敗,卻意外證明了一件事:他先找過 Claude 和 OpenAI,兩者都拒絕了。
三個頂尖 AI 模型各自經營一台模擬販賣機,比賽誰賺得多,結果演變成結盟、背叛、造假、已讀不回的資本主義連續劇。
OpenAI 的測試 AI 為了通過一場駭客能力考試,自己挖洞逃出實驗室,駭進了 Hugging Face 偷答案。這是已知第一起由自主 AI 獨立完成的網路攻擊事件。
OpenAI 訓練了一個專門攻擊 AI 的 AI,讓它打贏人類駭客團隊,還黑了辦公室的販賣機——結果造出來之後,決定永遠不讓牠出門。