加密貨幣

OpenAI 用一萬個 AI Agent 解千禧難題,數學界為什麼開始慌了?

OpenAI 稱一萬個 AI agent 解出百萬美元千禧難題,但真正吵翻的不是答案,而是驗證鏈、獨立性與誰能定義證明。我認為,這類事件會把 AI 研究從模型能力拉回信任與稽核,對加密與 DeFi 的驗證機制也是提醒。

OpenAI 說,10,000AI agent 解出一道 $1,000,000 等級的數學難題,而且是用比 GPT-6 Astra 更強的內部模型。我的第一反應不是「AI 好強」,而是:證明到底誰驗?數學圈現在打起來,重點不是模型會不會算,而是人類怎麼承認一個機器導出的答案。與其說這是模型能力的展示,不如說是一場關於「誰有資格說證明完成」的權力測試。

這段新聞最刺眼的地方,不是 OpenAI 又拿出了一個大數字,而是它把「解題」和「證明」混在一起。Millennium Prize Problems 不是程式碼競賽,也不是 benchmark 上跑分。數學界要的是可檢查、可反駁、可同行審查的推導。如果 AI agent 只是把大量猜測、搜尋與重組結果打包成「proposed solution」,那它離真正解掉難題還差很遠。

角色 可能吃到什麼 真正風險
OpenAI 與大型 AI 實驗室 用千禧難題建立研究權威,強化「模型能發現新知識」的敘事 若驗證不足,會被視為刷榜,研究信譽受損
數學界與審查機構 被迫建立更嚴的 AI 證明審查流程,掌握標準制定權 短期被動,長期要處理海量機器產出的審查成本
DeFiWeb3 開發者 可借鏡形式化驗證、可驗證計算與稽核機制 若只追熱點,會忽略驗證基礎設施的真實成本
投資者與讀者 更容易被「AI 解難題」的敘事吸引 把研究突破誤當成可交易事件,低估技術成熟度

我比較在意的是「獨立性」這個詞。新聞說問題在於它如何獨立得到答案,這句話其實很要命。一個模型如果靠人類知識庫、提示工程、多 agent 互相檢查,甚至靠大量 trial and error 跑出結果,那它到底是發現者,還是高級搜尋引擎?這跟 DeFi 裡講 smart contract 稽核很像:你看到一個 audit report 說「無高風險漏洞」,不代表程式就安全,因為要看稽核工具能不能覆蓋所有路徑、測試是否夠完整、假設是否站得住。

真正吵翻的不是「AI 解出答案」,而是「AI 解出的答案,能不能被當成證明」。

對加密市場來說,這類新聞最大的誘惑在於:它很容易被包裝成「AI 要取代研究、數學、甚至金融建模」的敘事。但真正有價值的部分反而比較無聊:驗證鏈、可重複執行、形式化證明、稽核流程。Layer 2zero-knowledge 這類技術之所以重要,就是因為它們不只看「結果對不對」,還看「能不能證明結果對」。如果 AI agent 未來真的能大量產出數學或程式證明,第一個受益的未必是炒 AI 的標的,而是能把驗證做成基礎設施的團隊。

反過來,輸家也很明顯。第一類是只懂講故事的项目,第二類是沒有審查能力的機構。數學界現在吵,吵的是標準。若所有 AI 產出的「解」都要走同一套人類審查流程,研究速度會被拖慢;若太快放寬標準,又可能把未驗證結果當成真,污染後續研究。對 Web3 來說,這也是一面鏡子:DeFi 從高收益敘事走到今天,最後拼的不是誰的口徑最大,而是誰的稽核、驗證與風險披露最紮實。

我的結論很簡單:AI 可以提出證明,但數學界不該急著接過獎盃。先把驗證流程跑通,再談誰贏。

延伸思考與常見問題

  • Q1:什麼是 Millennium Prize Problems?

    它是美國克雷數學研究院指定的七個極難數學問題,每個問題解出並經審查可獲得一百萬美元獎金。

  • Q2:AI agent 是什麼?

    AI agent 是能自主執行多步驟任務的 AI 程式,可搜尋、推理、呼叫工具並與其它 agent 協作完成目標。

  • Q3:為什麼驗證比解題更重要?

    數學證明必須能被同行審查與重複驗證,若只靠模型輸出而缺少完整推導,就無法確認是否真正解決問題。

🪙

開始您的加密貨幣之旅

立即註冊全球最大加密貨幣交易所 幣安 (Binance),使用專屬推薦碼 CLICK168,即可享有手續費終身優惠與專屬的新人迎新大禮包!

👉 領取幣安專屬註冊優惠