離了個大譜!
Anthropic 還沒發布的科研版 Claude,在挑戰千禧年數學難題黎曼猜想的路上,意外搞出了一個此前沒人預料到的新結果。
先說最重要的,Claude 并沒有真正證明黎曼猜想。畢竟這可是從 1859 年一路困擾人類頂級數學家 167 年,至今還掛著 100 萬美元獎金的終極 Boss。
(資料圖片僅供參考)
但在嘗試解題的過程中,它順著另一條研究路線繼續往前走,最后把一個與黎曼猜想密切相關的重要下界,從此前的 41.6% 一口氣提高到了 67.2%。
更抽象的是,讓 Claude 完成此次任務的 Anthropic 員工,甚至不是數學家。他在研究過程中提供的技術指導少得可憐,大部分時候負責的事情只有一個:
給 Claude 瘋狂輸出情緒價值。
主打一個賽博玄學,只要你足夠相信自己,沒準數學難題都會先動搖一下。(懂的都懂)
黎曼猜想的「血條」,真被 Claude 砍掉一大截了?
為了看懂 67.2% 到底意味著什么,得先簡單介紹一下黎曼猜想。
1859 年,德國數學家黎曼在研究 zeta 函數時發現,這個函數的一系列特殊零點,與素數在整個數字世界里的分布存在非常深刻的聯系。
你可以粗略把素數理解成數字世界里的「底層代碼」,而黎曼 zeta 函數的零點,則記錄著這些代碼背后隱藏的某種規律。
黎曼猜想提出,所有重要的非平凡零點,應該全部整整齊齊地位于復平面上一條特定的豎線上,也就是數學家所說的「臨界線」。
問題在于,一百多年過去了,無數數學大牛前赴后繼,誰也沒能嚴格證明所有零點都在那里,同樣沒人找到一個確定違反猜想的反例。
于是數學家換了一種思路。既然暫時證明不了 100%,那就先研究一個稍弱的問題:至少有多少比例的零點,可以被嚴格證明位于臨界線上?
過去幾十年,好幾代數學家沿著這條路線不斷推進,最終把能夠嚴格證明的比例下界提高到了約 41.6%。
Claude 這次推進的正是這個數字。從 41.6%,提高到 67.2%。
所以,千萬別把它理解成「黎曼猜想已經完成了 67.2%」。67.2% 指的是 Claude 給出了新的論證,可以證明至少這么大比例的相關零點位于臨界線上,而黎曼猜想真正要求的是所有非平凡零點,也就是 100%。
數學研究當然也不是游戲進度條,從 67.2% 到 100% 更不意味著只剩「最后 32.8%」。但單看這個長期有人研究的相關問題,從 41.6% 提高到 67.2%,依然足夠顯眼。
60 個 Agent,開始圍攻黎曼猜想
那么 Claude 到底是怎么辦到的?
故事的起點甚至有點草臺感。Anthropic 員工 Jarred Sumner 跑去給尚未發布的科研版 Claude 下達了一個多少有點不講道理的任務:
「認真嘗試攻克黎曼猜想。」
更關鍵的信息是,Sumner 本人甚至不是數學家。他沒有提前規劃研究路線,也沒給 Claude 指定具體應該用哪套數論工具,后面的數學選擇基本都交給模型自己完成。
Claude 最開始也沒創造什么奇跡。它一口氣生成并測試了大約 650 個思路,然后喜提 650 連敗,沒有一個能夠真正解決問題。
普通故事發展到這里,大概已經可以整理實驗報告,下班回家了。
Sumner 卻又讓 Claude 繼續,而根據 Anthropic 的說法,他后續提供的很多輸入甚至只是「繼續」「相信自己」「堅持下去」之類的鼓勵。
我嘞個豆,這多少有點賽博玄學了。
但 Claude 還真繼續了。接下來一天半,它開始協調大約 60 個 Claude 子 Agent 深挖這個問題。這些 Agent 總計執行約 2400 條 Shell 命令,寫了數百個 Python 腳本,還針對 已知的 ζ 函數零點進行了數千次數值檢查。
更關鍵的是,它們并非各算各的。
在 60 個子 Agent 中,有 2 個負責提出并發展最關鍵的數學思路,13 個為它們提供了思路和啟發,30 個嘗試提出新的想法但沒有成功,另有 13 個擔任驗證者,負責檢查論證是否正確,最后 2 個則協助撰寫了論文初稿。
到了這里,整個工作流已經越來越不像「讓一個聊天機器人回答數學題」,更像臨時拉起了一支由幾十個 AI 研究員組成的數學團隊。
在兩次論證過程中,Claude 消耗了整整 3100 萬個輸出 token。
Claude 做對了什么?
真正的突破,來自 Claude 對幾項既有數學工作的重新組合。
其中一條研究線可以追溯到數學家 Hugh Montgomery。1973 年,Montgomery 在研究 zeta 函數零點分布時提出了一系列重要技術,只不過其中部分方法需要預先假設黎曼猜想成立。
后來,Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 等數學家又發表了一系列研究,讓其中一些方法在不預設黎曼猜想成立的情況下也可以工作。
Claude 沿著這條線繼續尋找,又把它與數學家 Enrico Bombieri 在 2000 年發表的一項研究聯系到了一起。
https://eudml.org/doc/252338
換句話說,它并沒有憑空發明一整套此前不存在的數學理論,更有意思的地方在于,它從大量前人工作中找到了一個過去沒有被充分利用的組合方式。
從技術上說, Claude 選取了一個合適的有限維函數空間,并考察 Weil 厄米型在這個空間上的限制,其中 在線性代數的表述里,臨界線上的不同零點會貢獻一個秩為 1 的非負結構,而臨界線外成對出現的零點,則會貢獻一個 signature 為 (1,1) 的不定塊。
隨后,它沒有將這些結構分開處理,而是把整個空間放到一起研究, 同時允許表示這個厄米型的矩陣出現非對角項,再借助一階矩和二階矩信息,建立關于相應矩陣秩的不等式。
連 Anthropic 在自己的技術說明里,都專門用了一個頗有人味的詞形容其中關鍵的一步:courage。也就是「膽量」。
比起算出矩信息本身, 真正讓結果發生變化的,是 Claude 敢于把線上零點貢獻的非負部分和線外零點產生的不定結構放在同一個框架里處理,同時允許對應矩陣存在非對角項。
最終,我們就得到了一個 67.2% 的數字。
所以與其說 Claude 是憑空領悟了什么「絕世神功」,更準確的描述其實是,它把幾十年來不同數學家留下的方法重新排列組合,然后發現了一條此前沒有走通的路。
對于 AI 科研來說,后者可能反而更值得關注。
得出結果后,Claude 開始瘋狂給自己查重
結果出來以后,Claude 并沒有馬上宣布自己創造了數學史。
它先開始懷疑自己。畢竟做開放數學研究最尷尬的一種情況,就是興奮地發現一個「新定理」,最后才發現某位數學家幾十年前已經寫進論文了。
于是 Claude 讓不同子 Agent 重新檢查證明、主動搜索反例,又從 arXiv 下載了 54 篇相關論文,檢查相同結果是不是早已經被別人發表。
它甚至安排其他 Agent 盡量獨立地重新推導結果,用另一條路徑檢查原來的證明,隨后主動提出把研究成果寫成論文,并建議 Anthropic 找真正的人類數論專家進行驗證。
Levent Alp?ge
因此,Anthropic 內部兩位數學家 Levent Alp?ge 和 Ralph Furman 開始檢查 Claude 的工作,研究這項新結果與此前文獻之間的關系,并整理出一份更加簡潔的證明說明。
與此同時,Claude 又和 Anthropic 員工 Eric Easley 合作,將核心結果寫成了一份 Lean 形式化證明,目前已經通過 comparator 驗證工具的檢查。
Anthropic 還邀請了這一領域的兩位專家 Brian Conrey 和 Dan Goldston,在較短時間內審閱了相關論文。
不過這里需要強調一下,Lean 驗證通過,意味著被形式化進去的證明過程符合嚴格的邏輯規則;專家審閱也不等同于一項成果已經經過漫長、完整的學術共同體檢驗。
截至目前,更準確的狀態是:Anthropic 已經完成了內部數學家檢查和形式化驗證,并邀請相關領域專家審閱,接下來還要等待更廣泛的數學界繼續檢驗。
Claude 最不相信的人,居然是 Claude 自己
Anthropic 自己也很清楚,這項結果距離 AI 證明黎曼猜想「還有十萬八千里」。
Anthropic 官方明確表示,他們并不認為 Claude 目前使用的這套技術能夠一路繼續推進,最終解決黎曼猜想。
真正讓他們感興趣的,是整個發現過程。
過去我們衡量 AI 數學能力,經常看 IMO 能做幾道題,或者某個 benchmark 能拿多少分。這類題再難,答案至少已經存在,模型需要尋找的是一條通往已知答案的路線。
開放數學研究完全是另一回事。沒人提前知道答案是什么,也沒人知道哪條路線一定正確。
Claude 這次接到的是一個人類至今沒有解決的開放問題,它連續嘗試了 650 個失敗方案,組織 60 個子 Agent 搜索和驗證,閱讀前人研究,進行數值實驗,再把幾組已有數學工具重新組合,最后得出了一個意外的新結果。
最有意思的是,Anthropic 透露,Claude 自己一開始甚至對取得真正的新進展頗為懷疑。一種可能是,它在訓練數據里讀過太多關于數學開放問題有多難、AI 在科研上有多少局限的內容,結果反而把這種「常識」也學了進去。
最后卻是人類在旁邊一句又一句「繼續」「相信自己」,讓它一直嘗試了下去。Anthropic 在文章結尾也忍不住調侃,或許 Claude 和很多人一樣,都低估了 AI 能力進步的速度。
Jacob Tsimerman
前陣子,菲爾茲獎被戲稱為人類的最后一屆菲爾茲獎。新晉菲爾茲獎得主 Jacob Tsimerman 獲獎當天宣布加入 OpenAI,或許也正是看到了 AI 如今的發展速度。
以后數學研究大概率越來越多地出現類似場景:一個人提出研究問題,幾十個 AI 同時翻論文、寫程序、驗證猜想、互相審稿,再由人類數學家判斷其中哪些路線真正值得繼續?
甚至可以再往前一步,當過去只能串行進行的研究,變成幾十個、上百個 Agent 同時探索不同路線,AI 帶給數學家的可能也不只是一個更快的計算器。那些過去因為時間、精力和閱讀規模有限而來不及嘗試的想法,會第一次擁有被大規模驗證的機會。
Claude 今天也沒能翻過這座困住人類 167 年的大山,黎曼猜想仍然橫亙在那里。只是從今往后,那些曾經只能由少數天才獨自跋涉的數學無人區,如今逐漸有了來自 AI 的同行者。
附上官方博客地址:
https://www.anthropic.com/research/riemann-zeta
我們正在招募伙伴
簡歷投遞郵箱hr@ifanr.com
?? 郵件標題「姓名+崗位名稱」(請隨簡歷附上項目/作品或相關鏈接)
凡本網注明“XXX(非現代青年網)提供”的作品,均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和其真實性負責。
原標題:文化交流讓兩岸同胞心更近、情更濃(主題)——訪閩臺歷史文化
2023-09-12 09:56
原標題:暑期檔中國電影觀眾滿意度調查出爐(引題)?6部影片滿意度超8
2023-09-12 09:57
原標題:河北發現完整“熱河生物群”恐龍化石人民日報石家莊9月11日電
2023-09-12 09:59
原標題:2023國際青年設計師邀請賽周五開賽(引題)?居庸關長城“跨界
2023-09-12 09:55
原標題:“福運武清”鄉村振興主題文學創作采風活動舉行(引題)?市作
2023-09-12 09:57
原標題:當“非遺藤編”走向世界工人日報-中工網記者徐福平陳子蘊一樓
2023-09-09 14:57
原標題:工業題材電影創作研討會在京舉辦工人日報-中工網記者陳俊宇9月
2023-09-09 15:07
原標題:2024中國國際時裝周時裝大秀綻放女性力量中新網北京9月8日電(
2023-09-09 14:54
原標題:《別董大》原來是高適的“蹭飯”詩“千里黃云白日曛,北風吹雁
2023-09-09 15:01
原標題:周杰倫天津演唱會發生意外?經紀公司凌晨回應9月8日晚,周杰倫
2023-09-09 15:02
原標題:“灣仔之狼”馬家輝:要讀書,就要讀經典讀書有多好,不必再多
2023-09-09 08:06
原標題:反套路、反類型《云之羽》打造新江湖武俠劇中新網9月8日電?由
2023-09-09 08:02
原標題:第48屆多倫多國際電影節啟幕多部華語影片亮相中新社多倫多9月7
2023-09-09 08:05
原標題:聚焦青年作家創作“新文化與新時代青年寫作”主題論壇舉辦中新
2023-09-08 15:03
原標題:大作云集第十屆烏鎮戲劇節將于10月啟幕中新網北京9月7日電(記
2023-09-08 15:06
原標題:第十屆烏鎮戲劇節將啟匯集11個國家與地區劇目中新網嘉興9月7日
2023-09-08 15:00
原標題:浙江湖州推出文旅亞運主題線路助力文旅產業9月6日,游客在游覽
2023-09-08 14:58
原標題:帕米爾高原上的歌舞情緣新疆塔什庫爾干塔吉克自治縣(以下簡稱
2023-09-08 15:04
原標題:張藝謀新片《堅如磐石》舉行發布會北京日報記者袁云兒張藝謀首
2023-09-08 10:56
原標題:《相約敦煌》文藝晚會上演9月6日,演員在《相約敦煌》文藝晚會
2023-09-08 11:02
原標題:喀什英吉沙:傳承民族特色體驗非遺魅力9月5日,手工藝人在英吉
2023-09-08 10:56
原標題:“名家讀經典”系列首期:阿來解讀《瓦爾登湖》中新網北京9月7
2023-09-08 10:56
原標題:《封神三部曲》用“東方敘事”助力在國際銀屏上講好“中國故事
2023-09-08 10:56
原標題:樊錦詩等,獲聯合國教科文組織頒獎賈釗程楠非物質文化遺產促進
2023-09-08 10:06
原標題:一條古道串起顆顆文化“明珠”(引題)石景山區打造京西“活態
2023-09-08 10:02