OpenAI 說,10,000 個 AI agent 解出一道 $1,000,000 等級的數學難題,而且是用比 GPT-6 Astra 更強的內部模型。我的第一反應不是「AI 好強」,而是:證明到底誰驗?數學圈現在打起來,重點不是模型會不會算,而是人類怎麼承認一個機器導出的答案。與其說這是模型能力的展示,不如說是一場關於「誰有資格說證明完成」的權力測試。
這段新聞最刺眼的地方,不是 OpenAI 又拿出了一個大數字,而是它把「解題」和「證明」混在一起。Millennium Prize Problems 不是程式碼競賽,也不是 benchmark 上跑分。數學界要的是可檢查、可反駁、可同行審查的推導。如果 AI agent 只是把大量猜測、搜尋與重組結果打包成「proposed solution」,那它離真正解掉難題還差很遠。
| 角色 | 可能吃到什麼 | 真正風險 |
|---|---|---|
OpenAI 與大型 AI 實驗室 |
用千禧難題建立研究權威,強化「模型能發現新知識」的敘事 | 若驗證不足,會被視為刷榜,研究信譽受損 |
| 數學界與審查機構 | 被迫建立更嚴的 AI 證明審查流程,掌握標準制定權 | 短期被動,長期要處理海量機器產出的審查成本 |
DeFi 與 Web3 開發者 |
可借鏡形式化驗證、可驗證計算與稽核機制 | 若只追熱點,會忽略驗證基礎設施的真實成本 |
| 投資者與讀者 | 更容易被「AI 解難題」的敘事吸引 | 把研究突破誤當成可交易事件,低估技術成熟度 |
我比較在意的是「獨立性」這個詞。新聞說問題在於它如何獨立得到答案,這句話其實很要命。一個模型如果靠人類知識庫、提示工程、多 agent 互相檢查,甚至靠大量 trial and error 跑出結果,那它到底是發現者,還是高級搜尋引擎?這跟 DeFi 裡講 smart contract 稽核很像:你看到一個 audit report 說「無高風險漏洞」,不代表程式就安全,因為要看稽核工具能不能覆蓋所有路徑、測試是否夠完整、假設是否站得住。
真正吵翻的不是「AI 解出答案」,而是「AI 解出的答案,能不能被當成證明」。
對加密市場來說,這類新聞最大的誘惑在於:它很容易被包裝成「AI 要取代研究、數學、甚至金融建模」的敘事。但真正有價值的部分反而比較無聊:驗證鏈、可重複執行、形式化證明、稽核流程。Layer 2 或 zero-knowledge 這類技術之所以重要,就是因為它們不只看「結果對不對」,還看「能不能證明結果對」。如果 AI agent 未來真的能大量產出數學或程式證明,第一個受益的未必是炒 AI 的標的,而是能把驗證做成基礎設施的團隊。
反過來,輸家也很明顯。第一類是只懂講故事的项目,第二類是沒有審查能力的機構。數學界現在吵,吵的是標準。若所有 AI 產出的「解」都要走同一套人類審查流程,研究速度會被拖慢;若太快放寬標準,又可能把未驗證結果當成真,污染後續研究。對 Web3 來說,這也是一面鏡子:DeFi 從高收益敘事走到今天,最後拼的不是誰的口徑最大,而是誰的稽核、驗證與風險披露最紮實。
我的結論很簡單:AI 可以提出證明,但數學界不該急著接過獎盃。先把驗證流程跑通,再談誰贏。
延伸思考與常見問題
Q1:什麼是 Millennium Prize Problems?
它是美國克雷數學研究院指定的七個極難數學問題,每個問題解出並經審查可獲得一百萬美元獎金。
Q2:AI agent 是什麼?
AI agent 是能自主執行多步驟任務的 AI 程式,可搜尋、推理、呼叫工具並與其它 agent 協作完成目標。
Q3:為什麼驗證比解題更重要?
數學證明必須能被同行審查與重複驗證,若只靠模型輸出而缺少完整推導,就無法確認是否真正解決問題。