AI 一晚解掉十道數學難題,花費只要 2000 美元:Astra 事件到底發生了什麼?

以下為虛構對話,人物與情節為創作,科學內容來源標註於文末。
▌一、墓碑上的那句話
門是被撞開的。
「K!」Dg 的筆電夾在腋下,另一隻手還抓著手機。「我們必須知道,我們終將知道——希爾伯特說的。今天終於應驗了。」
K 沒有抬頭。咖啡杯就在鍵盤右邊,冷了大概兩個小時。
「那句話刻在他的墓碑上。」
「對啊,很有份量吧——」
「三年後哥德爾證明他錯了。」
冷氣的低頻聲填滿了兩秒鐘的空白。
Dg 把筆電放到桌上,動作慢了一點。「……好,那句先跳過。重點是,OpenAI 昨天公布了。一個叫 Astra 的模型,一口氣解掉十道題。全部都是卡了至少十年的,很多卡了幾十年。」
「我看過了。」
「你看過了還這麼冷靜?」
「因為我看的是那份 249 頁的東西,不是推文。」K 終於轉過來。「你知道最重要的部分是哪裡嗎?」
「兩千美元啊!十題總共只花兩千美元的 token!這不是重點嗎?」
「不是。」
「那是什麼?」
「Lean。」
Dg 眨了兩下眼睛。「那個……程式語言?」
「證明助理。」K 把杯子推到一邊。「每一題他們都附了 Lean 4 的證書,全部丟在 GitHub 上公開。任何人都可以自己跑。」
「所以呢?」
「所以這次不需要相信 OpenAI。」
▌二、機器不吃「聽起來很有道理」
Dg 拉了椅子坐下,這次是真的坐下,不是靠著。
「等一下,我理一下。以前 AI 說它證出什麼東西,大家為什麼不信?」
「因為沒人有空驗。」K 說。「一份數學論文,人類審稿要幾個月到幾年。AI 一天可以吐十份。這個比例撐不住。」
「所以就變成——它說它證完了,然後大家在推特上吵三天,最後不了了之。」
「差不多。」
「那 Lean 解決了什麼?」
「Lean 只認邏輯。」K 的語速沒有變。「你把證明寫成它的語言,它逐步檢查每一個推論。它不會因為某一段『聽起來很有道理』就放行。通過了,就是通過了。」
Dg 突然坐直。「所以只要 Lean 跑過去,那題就一定對?」
「不對。」
「欸?」
「Lean 保證的是:那份形式化的敘述被正確證明了。」K 停了一下。「它不保證那份敘述,就是數學家原本關心的那個問題。」
「……差在哪裡?」
「差在翻譯。」K 拿了紙,但沒寫。「你把一個中文問題翻成英文,翻譯本身可能翻錯。Lean 檢查的是英文版的推理有沒有問題,它不會回頭看中文原文。」
Dg 張了張嘴。
「所以現在數學社群在做的事,」K 繼續,「不是驗證那十份證明對不對——那個機器已經做了。是驗證那十份形式化敘述,有沒有忠實對應到原本的題目。」
「這個還是要人做。」
「對。」
「而且還沒做完。」
「對。」
▌三、被挑出來的那十題
Dg 沉默了一會兒,然後突然想到什麼,眼睛又亮起來。
「不過還是很誇張啊。愛迪生說過,天才是百分之一的靈感加上百分之九十九的汗水——現在 AI 把那百分之九十九的汗水外包掉了,人類只要負責靈感就好,這不是解放嗎?」
「那句話的常見版本本來就被砍掉一半,而且愛迪生說那句的時候,賣的是他自己的形象。」K 頓了一下。「更重要的是,你把方向搞反了。」
「哪裡反了?」
「Astra 產出的是論證本身。」K 說。「靈感的部分是它做的。人類做的是整理成論文、形式化、然後負責正確性。」
Dg 的表情僵住。
「還有,」K 補了一句,「你只看到那十題。」
「什麼意思?」
「他們自己承認,也試過其他重大問題,失敗了。沒有人知道那些走不通的嘗試燒掉多少運算。從成功案例裡挑十個出來展示,畫面本來就會偏好看。」
「……那兩千美元其實是……」
「是成功那一批的帳單。」
Dg 把臉埋進手裡三秒鐘,然後抬起來。
「所以整件事其實是這樣,」他慢慢地說,像在確認每一個字,「厲害的不是它解出十題。厲害的是這次它把作業本攤開放在桌上,說你們自己改。改的方法還便宜到大學生都做得到。」
K 看了他一秒。
「嗯。」
「而且——」Dg 又補了一句,「還沒改完之前,都還不算數。」
「對。」
外面有機車催了兩下油門,聲音拖過走廊。
Dg 把筆電轉回自己面前,關掉那個已經打了一半、標題叫〈AI 終將知道一切〉的草稿檔。他沒有存檔。空白頁面上,他只打了一行字:誰檢查了那個檢查的人。然後開始查 Lean 4 的安裝說明。
🔑 關鍵亮點
- 十道題、十年起跳的空白期:涵蓋高維幾何、編碼理論、群論、算子代數、量子複雜度、格密碼學與極值組合學,全部是「主要結果至少十年沒進展」的老問題。
- 論證由 AI 生成,人類負責整理:OpenAI 明確表示數學論證本身由模型產出,人類協助整理成論文並形式化,且公司對正確性負責。
- 可被機器逐步檢查:每一題都附上 Lean 4 證書並公開在 GitHub,任何人都能自行驗證,這是本次與過往「AI 做數學」新聞最大的差別。
- 成本低到不像話:十題全部的 token 花費,按 Sol API 費率估算約 2,000 美元。
事情是這樣開始的
一則公告,兩份 PDF,一個 GitHub 倉庫
2026 年 8 月 1 日,OpenAI 發布了一篇標題為〈Ten advances in mathematics and theoretical computer science〉的文章,宣布分享十項研究成果,這些問題的主要結果至少十年沒有進展,多數更久,橫跨高維幾何、編碼理論、算術電路複雜度、群論、算子代數、量子複雜度、格密碼學與極值組合學。

OpenAI 同步釋出 249 頁論文、推理過程紀錄,以及可機器驗證的 Lean 證書。
這不是 OpenAI 第一次做這件事。今年五月,他們曾公布一個尚未發布的模型在開發評估期間,生成了 Erdős 單位距離猜想的反證。那次已經讓數學圈震了一下,但這次的規模完全不同——不是一題,是十題。
為什麼「至少十年」這個門檻很重要?
如果你不是數學系的,可能會覺得「解出一道題」聽起來還好。但數學這門學科有個殘酷的特性:一個問題被公開懸置越久,通常代表所有顯而易見的路都被走過了。
一道卡了三十年的猜想,意味著全世界最聰明的一群人,用盡他們知道的所有工具,都撬不開它。要突破,往往需要一個「沒有人想到過的角度」——而這正是過去大家認為 AI 最不可能做到的部分。
這十道題到底是什麼等級的難?
完整清單,先看一遍
OpenAI 公布的十項結果分別是:高維球體堆積(將堆積密度上界推進到 Cohn–Elkies 門檻)、二進制與球面碼(在任意給定最小距離下,對二元碼最大規模的界限做出指數級改進)、非 sofic 群的構造(解決群論中的核心開放問題)、推翻 Connes 剛性猜想(該猜想主張某些群可由其馮·諾伊曼代數唯一確定)、算術電路複雜度(對積和式計算給出新下界,其中算術公式下界為 n⁴/log n 量級)、量子平行重複定理(將古典複雜度理論的基礎原理擴展到一般雙人量子博弈)、最近向量問題(多項式因子的近似困難度,與後量子密碼學直接相關)、Ehrhart 體積猜想(在每個維度中確定「質心是其唯一內部格點」的凸體最大可能體積)、多色 Ramsey 數(三角形多色 Ramsey 數的超指數下界,解決 Erdős 問題 183)、以及極值圖論中的緊緻性與退化性猜想(解決 Erdős 問題 146 與 180)。
挑三題,用白話講
① 球體堆積:怎麼把柳丁塞進箱子?
想像你要把大量等大的球塞進一個空間,能塞多滿?三維的答案(就是水果攤堆柳丁的方式)早就有解,但高維空間的情況完全不同——維度一高,直覺就徹底失效,數學家只能不斷收緊「上界」與「下界」之間的差距。Astra 把高維球體堆積的漸近上界改進到 Cohn–Elkies 門檻,這是自 1978 年以來對一般球體堆積指數的首次改進。
② 非 sofic 群:找一隻沒人見過的獨角獸
群論裡有個概念叫「sofic 群」,白話說就是可以用有限的排列去近似的群。長年來的問題是:是不是每一個群都能被有限排列近似?這種題目的難處在於,你不能靠「檢查一堆例子」來解決——你必須造出一個明確的反例,而且證明它真的不 sofic。這個問題自 Gromov 提出 sofic 概念以來的 27 年間,沒有任何數學家能證明或證偽。
③ Connes 剛性猜想:兩個不同的東西,能長出同一個影子嗎?
這個猜想主張某些群會被它們對應的馮·諾伊曼代數「唯一釘住」——換句話說,看到影子就能反推出原物。Astra 的結果顯示事情沒那麼乾淨:不同的群也可能對應到同一個代數。
| 問題 | 領域 | 空白期 | 結果類型 |
|---|---|---|---|
| 高維球體堆積 | 高維幾何 | 自 1978 年 | 上界改進 |
| 非 sofic 群 | 群論 | 27 年 | 構造存在性 |
| Connes 剛性猜想 | 算子代數 | 數十年 | 推翻猜想 |
| Erdős 問題 183 | 極值組合學 | 數十年 | 下界證明 |
| 最近向量問題 | 格密碼學 | 十年以上 | 困難度結果 |
| 量子平行重複 | 量子複雜度 | 十年以上 | 定理擴展 |
最關鍵的一步:Lean 4 證書
這才是本次事件真正的分水嶺
過去每次「AI 解數學題」的新聞,最大的麻煩都不是題目難不難,而是沒人能快速確認 AI 有沒有在瞎掰。數學論證動輒數十頁,人類審稿要花上幾個月甚至幾年。
這次不一樣。OpenAI 表示,模型將每一個論證形式化為 Lean 證書,並公開在 GitHub 上,同時也釋出模型思考過程的敘事紀錄。
Lean 是一種證明助理:你把數學證明寫成它的語言,它會逐步檢查每一個推論步驟是否成立。它不理解「聽起來很有道理」,它只認邏輯。通過 Lean 檢查的證明,等於通過了機器的無情審查。
GitHub 倉庫中確實包含各題對應的 Lean 檔案,例如 NonSoficGroup.lean、ConnesRigidity.lean、SpherePacking.lean、GapCVP.lean、QuantumParallelRepetition.lean 等,並附有比對驗證的設定。
⚠️ 需要留意的地方:Lean 證書能保證「這份形式化敘述被正確證明了」,但形式化敘述本身是否忠實對應到數學家原本關心的那個問題,仍需要人類專家逐一檢查。這是數學社群目前正在做的事,尚未完成。
2000 美元的意義,比你想的更複雜
一個令人坐立難安的數字
OpenAI 表示,找出這些問題解答所需的 token 總量,按 Sol API 費率計算約為 2,000 美元。
這個數字之所以震撼,是因為對照組太懸殊了。一位數學家投入三年在單一問題上,包含薪資、時間成本,數量級完全不是同一個世界。
但先別急著下結論
這裡有幾個容易被忽略的細節:
第一,這是「成功案例」的成本。 Noam Brown 本人坦承,OpenAI 也嘗試過其他重大問題但失敗了;沒有人知道那些走不通的嘗試燒掉了多少運算資源。從一堆成功案例中挑選出來展示,本來就會產生偏向樂觀的畫面。
第二,Brown 自己也劃了界線。 他指出模型還沒碰到七大千禧年大獎難題中的任何一題。換句話說,這不是「數學被解決了」,而是「數學的某一層被撬開了」。
第三,成本低反而暗示上限還很高。 如果每題只花了這麼少的運算資源就有這種成果,那麼在測試時投入更多運算,理論上還有相當大的提升空間。這句話既是好消息,也是讓人不太舒服的暗示。
數學家怎麼說:興奮,但沒有失去理智
「大新聞」,但語氣是有保留的
曼徹斯特大學數學家 Thomas Bloom(erdosproblems.com 站長)在 X 上稱這是「big news」,並認為這比五月公布的單位距離猜想反例更重要。他寫道:或許沒有比「證明」單位距離猜想更重大,但就構造而言,這是大事。
注意他那句轉折——「就構造而言」。這不是隨口的修飾。推翻一個猜想(找到反例)和證明一個猜想成立,在數學上的難度與意義往往差很多。Bloom 的措辭其實相當精準地把興奮控制在該有的範圍內。
Bloom 同時也反駁了「AI 正在取代數學家」的說法。他的論點是:用數學家提出的猜想、數學家一個多世紀累積的理論、數學家打造並用數學家寫過的所有東西訓練出來的 AI,去證明一個結果,稱之為「取代數學家」並不合理。
OpenAI 自己也踩了倫理煞車
值得注意的是,OpenAI 在公告中花了相當篇幅談歸屬問題。他們表示尊重對 AI 影響感到憂慮的人們,包括 Leiden AI 與數學宣言的連署者,並主張歸屬應該誠實反映結果是如何產生的——把完全由 AI 系統生成的證明宣稱為人類作者,會同時誤現系統的貢獻與人類真正的智識工作。他們說明自己協助準備論文並形式化證明、對正確性負責,但數學論證本身由系統生成。
這段話在一份技術公告裡出現,本身就是一個訊號:這件事的爭議點已經從「AI 做不做得到」,轉移到「做到之後我們該怎麼稱呼它」。
Astra 是什麼?我們知道的與不知道的
一個還碰不到的模型
先講最重要的:你現在無法使用 Astra。
OpenAI 只把它描述為「我們的下一個主力模型」(our next major model),這次的成果來自其內部版本。OpenAI 沒有說明 Astra 何時會公開發布;有觀察者揣測 Astra 屬於 GPT-6 系列,但這仍屬推測。依《The Information》的報導,Astra 將與 Sol、Terra、Luna 並列成為獨立的模型類別,而 OpenAI 尚未決定要以 GPT-6 之名推出,或作為 GPT-5 系列中的版本,也還沒有發布時間表。
一個不太舒服的時間點
有評論指出,在公布的前一週,Astra 曾在閉門場合向一群美國參議員展示,當時正逢 8 月 1 日的聯邦期限。
⚠️ 查核提醒:關於「向政策制定者展示」這件事,不同外電對於由誰展示、確切場合與日期的描述有出入。撰寫或轉述時建議保守處理,避免過度具體化人名與細節。
這不代表成果是假的——Lean 證書就攤在 GitHub 上,任何人都能檢查。但它確實提醒我們:科學突破的發布時機,從來不只是科學問題。
常見問題 FAQ
Q1:所以數學家要失業了嗎?
目前沒有證據支持這個結論。Bloom 的反駁點很直接:這些成果建立在數學家提出的問題、數學家累積的理論、以及用數學家的著作訓練出來的系統之上。此外,論文整理與形式化的協作、以及後續的社群驗證,目前都還需要人類。
Q2:我可以自己驗證這些證明嗎?
理論上可以。所有 Lean 證書都公開在 github.com/openai/ten-proofs,249 頁論文與推理紀錄也是公開的 PDF。實務上,你需要安裝 Lean 4 環境,而看懂證明內容則需要相應的數學訓練。
Q3:這代表 AI「理解」數學了嗎?
這篇文章無法回答這個問題,因為它牽涉到「什麼叫理解」的哲學爭論。能確定的是:模型產出了通過機器驗證的正確論證。至於這算不算理解,目前沒有共識。
Q4:為什麼 Lean 證書這麼重要?
因為它把「相信 OpenAI」變成「檢查程式碼」。過去 AI 數學成果最大的問題是驗證成本高昂,Lean 讓機器能逐步檢查每個推論步驟,大幅降低了外部檢驗的門檻。
Q5:這十題有實際應用嗎?
其中「最近向量問題」與後量子密碼學直接相關,編碼理論的結果與資料傳輸糾錯有關。但多數結果屬於基礎數學,短期內不會有直接應用——這在數學史上是常態,應用往往在數十年後才出現。
結論:真正的問題已經換了一個
回頭看整件事,最值得注意的可能不是「AI 解出十題」,而是討論的框架整個換掉了。
以前大家爭論的是:AI 到底能不能做真正的數學?現在爭論的是:既然它能,那我們該怎麼標註作者?該怎麼驗證?該怎麼分配那些原本屬於人類研究者的時間與注意力?
Bloom 的謹慎、OpenAI 主動提及 Leiden 宣言、Noam Brown 坦承失敗案例與千禧年難題的界線——這些都不是公關辭令,而是一個領域在面對結構性變化時,真實的自我校準過程。
接下來幾個月最值得追蹤的,不是 Astra 什麼時候發布,而是數學社群對這十份 Lean 證書的獨立檢驗結果。如果它們站得住,這一天大概會被寫進數學史;如果其中出現形式化與原問題不對應的落差,那也同樣重要——因為那會告訴我們,這條路的下一個瓶頸在哪裡。
延伸搜尋
參考資料來源
- Ten advances in mathematics and theoretical computer science — OpenAI
- 完整論文 PDF(249 頁)— OpenAI
- 推理過程紀錄 PDF — OpenAI
- Lean 4 證書 GitHub 倉庫 — openai/ten-proofs
- OpenAI says its next model, Astra, has solved ten open problems in mathematics — The Next Web
- OpenAI announces its “next major model” Astra — The Decoder
- OpenAI Says Astra Solved 10 Math Problems With Lean Proofs — Implicator.ai
- OpenAI Model Solves Ten Unresolved Mathematical Problems — ForkLog
- Ten Open Problems Solved by Astra: the Proofs Are in Lean — Pasquale Pillitteri
- Thomas Bloom 原始 X 貼文