0

作者丨高允毅
編輯丨馬曉寧
級別的純數學硬成果,已經直接落地到大模型訓練一線了。
一位小紅書作者Z9在翻論文時發現,剛剛刷屏全網的三維掛谷猜想,現在被佛羅里達大學團隊搬進了神經網絡訓練流程,跨界解決大模型的 “黑盒問題”了。
他們的論文叫《GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models》,其核心是利用掛谷猜想證明中,誕生的核心概念"粘性掛谷集",給大模型的內部語義空間立了套 “擺放規矩”,從訓練階段就把纏成一團的概念捋順,讓 AI 的思考路徑真正變得可追溯。

真可謂,前有數學大佬開荒,后有AI研究員撿寶。

01
先從大家都有體感的 “黑盒問題” 說起。
現在的大模型,做題、寫代碼、做分析正確率都很高,但你問它 “這一步是怎么想出來的”,它要么說不清楚,要么直接編個假理由糊弄你。
這個問題的根源,藏在一個叫表征坍塌的底層特性里。
你可以把大模型的語義空間想象成一個幾千層的超大智能倉庫,理論上能分門別類放下無數概念:邏輯、情感、事實、推理等,各自占位。
但 Transformer 訓練的時候特別 “會偷懶”,它總愛把所有語義信息都一股腦堆在倉庫門口的一小塊區域,剩下 90% 的空間全空著不用。
結果就是,所有概念都擠在一個狹窄的高維錐形區域里,這就是學界說的“各向異性”。
而擠成一團的后果會帶來很多問題。
比如,概念糾纏會把八竿子打不著的內容硬塞在同一個方向,讓一個神經元既要響應 “貓”,又要激活 “圣經經文”
而且你根本拆不清哪部分表征對應哪條邏輯,連模型自己都沒法還原真實思考路徑。
當把相近但不同的概念擠在一處,還容易混淆,稍微換個問法,AI就容易胡說。
對此,論文里有個很精準的總結,少數幾個 “流氓維度” 霸占了大部分信息方差,把模型的有效容量全浪費了。
這個問題幾乎是所有主流 Transformer 架構的弊病,從 GPT、Llama 到 Gemma無一幸免。
面對這種局面,之前行業的解法基本都是 “事后補救”,等模型訓練完,用稀疏自編碼器之類的工具,把纏在一起的概念強行拆開。
但這種方法拆出來的結果只是 “看起來合理”,不一定對應模型內部的真實邏輯,保真度始終打折扣。
現在,GeoLAN的思路直接換了個方向:別等亂了再整理,剛開始就按規矩擺好。在訓練全程給表征空間加幾何約束,讓每個概念各就各位。

02
要理解GeoLAN的思路,得先知道掛谷猜想在講什么。
1917年,數學家掛谷宗一問了一個看似簡單,卻折磨數學界半個世紀的難題:拿一根1厘米長的針,在桌面上轉一圈,它掃過的面積最小能有多小?
你可能會想,轉一圈嘛,肯定得畫個圈,面積小不了。但數學家發現,可以接近于0。
怎么做到的呢?
如果你讓針一邊旋轉一邊滑動,它居然能掃出一個面積幾乎為零的奇葩圖形。也就是說在二維世界里,你可以把全方位的幾何軌跡塞進一個極小的角落里。
挑戰進一步升級,如果在三維空間呢?當這根針可以在上下左右、無數個立體方向上旋轉,要想把這些全方向的針全部裝進一個空間里,這個空間最少需要多大?
按照二維的經驗,在三維空間里,這個圖形的絕對體積依然可以被壓縮到接近于零。
但這里產生了一個新謎題:這個圖形雖然空洞得沒有體積,但它在微觀上是不是也縮水、退化了?數學家引入了“分形維數”來衡量它的骨架密實度。
最后王虹等人發現,即便你把圖形的體積壓榨得再空洞,為了照顧到每一個方向的針,它內部交織的骨架依然保持著結結實實的“三維飽滿度”,在微觀維度上一點都沒有退化。這正是王虹終結世紀難題的偉大之處。
正是在這個硬核的證明過程中,誕生了一個極其關鍵的概念叫“粘性掛谷集”。
“粘性”說白了就是一套防擠規則。它專門用來管住那些線段和管子,不讓它們往一塊兒湊。
如果一組管子遵守了這套規則,它們就會老老實實鋪開,空間該是多大還是多大;但如果它們不守規矩,全擠在一個小角落里,空間的“大小”就會縮水,看著像被壓扁了一樣。
看到這兒你應該能對上號了:大模型的表征坍塌,不就是 “語義管子不滿足粘性條件、全擠一塊了嗎”?
GeoLAN 做的事,是直接把掛谷猜想的數學結論拿來當工程標準:既然數學上已經嚴格證明 “滿足粘性,空間不坍縮”,那我們就給大模型的語義空間也加上同款粘性約束,讓它的表征天然就不會擠成一團。
要把這個規則塞進訓練過程,核心是造出一個能量化的懲罰函數,也就是能讓模型算得出來、知道怎么改的懲罰規則。
然后,GeoLAN設計了兩套能算賬的懲罰規則,把掛谷猜想里的幾何規矩變成了訓練目標。一個叫KT-CW ,專治 “語義扎堆”;另一個叫KT-Attn ,專治 “注意力偷懶”。
KT-CW簡單說,就是訓練的時候隨機抽查語義空間的各個方向。如果發現某個方向擠了太多語義信息,就給模型扣分。逼著模型把知識均勻鋪滿整個高維空間的每個角落,把之前浪費的維度全用上,從根上解決“擠成一團”的問題。
另一套KT-Attn則專治注意力機制的摸魚行為。大模型的注意力頭到了訓練后期往往會陷入嚴重的同質化,很多頭終日只盯著同一個詞同一個位置打轉,有效干活的勞動力極少。這條規則強行規定每個注意力頭必須關注截然不同的語義區域,確保注意力能夠全方向覆蓋,徹底根治了注意力頭的秩坍縮現象。
這套組合拳打下來,效果可以說是立竿見影。
在Llama-3-8B上,GeoLAN硬生生把原本被擠扁的錐形表征空間揉捏成了圓潤的球形,擠在一起的程度顯著降低,各方向均勻性大幅提升,同時保持了任務準確率。
在 Gemma-3-4B 上,MMLU 準確率從 0.59 提升到 0.60,約提升 0.75 個百分點。TruthfulQA 語義穩定性顯著改善。
在更大體量的Gemma-3-12B上,偏見率指標也迎來了統計學層面的明顯下降。
更有意思的是,論文還發現了一個叫"金鳳花區"的有趣的現象。
即均勻分布這套嚴苛的幾何約束對于參數量太小的模型反而是一種災難,小模型天生需要靠概念糾纏來進行極致的語義壓縮,強行打散只會讓內部幾何結構徹底惡化。
而對于體量過大的巨無霸模型,龐大的預訓練過程已經自發建立起了極其復雜的流形結構,再加這套規則,不僅水土不服,還會拖累整體性能。
只有像四到八十億參數這樣的中等體量模型,剛好擁有足夠的空間來消化均勻分布帶來的紅利,反而效果最好。
不僅如此,論文還推導出一個精妙的定理"語義粘性定理":當表征滿足“防擠規則”時,不同的語義概念會自動分解為近似互相垂直的子空間,論文將其形象地稱為顆粒。每個子空間可以獨立解釋、獨立調整,這意味著困擾了業界多年的黑盒問題就此變得透明。
一篇ACL論文,一把將掛谷猜想從純數學殿堂拽進了AI工程。

03
另一個值得注意的是,本次菲爾茲獎得主中,有一個數學大佬Jacob Tsimerman,在獲獎當天直接宣布,未來會很快入職OpenAI,做AI安全方向。

這讓人不得不注意前沿數學與AI的緊密聯系。
就在一年前,他與伯克利AI安全研究者Andrew Critch合著了論文《A Taxonomy of Omnicidal Futures Involving Artificial Intelligence》,用數學家的極致嚴謹,為 AI 風險路徑搭建起嚴密的分類體系。
他本人更是 AI 的重度受益者,在2025 年他有 5 篇數學論文上線 arXiv,直言 AI 讓自己的科研產出效率直接翻了一番。
更戲劇的是,在頒獎前三天,有人借助 Anthropic 最新的 Claude Fable 5,一夜推翻了懸置 87 年的雅可比猜想,震動全球數學界。那個人正是他的學生 Levent Alp?ge 。
面對AI不斷逼近甚至超越頂級數學家的“智商”,連數學泰斗蒂莫西公開感嘆:這是他生平第一次見到大語言模型在自己完全陌生的領域,輕松攻克家喻戶曉的世紀難題。
數學與AI的關系,早已經過了密不可分這個詞所能描述的范疇,它們正在以驚人的速度融為一體。
回顧過去一年AI在數學競技場上的成績單,從DeepMind的AlphaProof在國際奧數賽場斬獲銀牌,到OpenAI的推理模型一舉推翻埃爾德什單位距離猜想這樁八十年懸案,再到GPT-5.6僅用一小時就搞定循環雙覆蓋猜想,以及Claude Fable 5一夜蕩平雅可比猜想,AI在短短兩個月內連續創下多項世紀紀錄,而且攻堅的速度正在呈指數級加快。
在AMS訪談里,Jacob直言,"數學界存在大量'自我安慰,大家盯著AI現在不如數學家,就推斷它永遠不如數學家。"他用自己的實踐證明,雖然模型的證明"不完整、不嚴謹",但"通常能拉出大致正確的方法,幫你走完八成的路"。
他甚至認為,兩年內,AI 在數學證明這件事上,將全面超過人類。
那么問題來了:四年后的2030年菲爾茲獎,還會有人類得主嗎?
菲爾茲獎有硬性的年齡限制,獲獎者必須未滿40歲。這意味著,如果AI在未來四年內系統性超越了人類數學家的原創發現能力,那么評審委員會將面臨一個前所未有的困境:你是在把獎頒給做出最好數學工作的人,還是頒給"人類中做出最好數學工作"的人?
更耐人尋味的,是數學與 AI 的雙向加速。 三維掛谷猜想剛被證明,三個月后就誕生了 GeoLAN,純數學成果直接落地成大模型訓練工具。今天菲爾茲獎上表彰的 André-Oort 猜想、希爾伯特第六問題突破,明天又會演化出什么樣的 AI 能力?
過去總說,數學家在前頭拓荒,AI 在后面撿寶。 但現在,撿寶的那個,已經開始自己開路了。
參考鏈接:https://arxiv.org/html/2603.19460v1


上車,雷峰網(公眾號:雷峰網)帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。