0
| 本文作者: 陳淑瑜 | 2026-06-26 11:12 | 專題:ICML:國際機器學習會議 |
來源:公眾號“CycleUser“
原文鏈接:https://mp.weixin.qq.com/s/v5KU6jnXAUOzwbHPR_F05w
今天24級帶佬崔總推薦了一篇 arXiv 編號2504.09762,投給ICML 2026 的這篇論文,粗略一看我以為又一篇很常見的那種「我反對一下」的文章。
細讀之后才發(fā)覺并非如此——作者團隊用一系列實驗數(shù)據(jù),對當前「推理模型思維鏈就是思考的過程」這一主流敘事提出了相當有力的挑戰(zhàn)。
論文的核心觀點可以概括:大模型在回答問題之前所生成的那一長串中間Token,不應被解讀為模型在「思考」,更不應被視為推理過程的可解釋窗口。
這個論斷看似簡單,牽涉的范圍卻很廣。
目前有多少研究圍繞「思維鏈」展開,有多少評測將中間Token的長度作為推理能力的指標,又有多少產(chǎn)品把「思維痕跡」展示給用戶當作賣點。
如果中間Token的語義內(nèi)容與最終答案之間不存在穩(wěn)定、確定的因果關(guān)系,那么上述努力的方向都需要重新審視。
下面把論文中幾個關(guān)鍵實驗和論證梳理一遍,跟大家分享。

論文將當前「推理模型」的構(gòu)建思路歸結(jié)為兩大類技術(shù):
一是測試時擴展,即在推理階段讓模型多做工作而非直接猜測答案,如圖1所示,包括自一致性選擇、樹搜索、LLM-Modulo驗證等方式;
二是后訓練方法,即將測試時驗證的信號編譯進模型參數(shù),如圖2所示。

迷宮實驗是整篇論文中最有說服力的工作之一。作者用A搜索算法——圖搜索中可證明最優(yōu)的算法——生成迷宮路徑尋找的解答痕跡,包括從開列表取節(jié)點、加入閉列表等每一步操作。然后用這些痕跡訓練Transformer。由于痕跡由A生成,模型在推理時輸出的痕跡是否有效,用A*驗證器一跑便知分曉。
結(jié)果,痕跡的有效性與答案的正確性之間僅存在松散的相關(guān)性,一旦測試問題超出訓練分布,這點相關(guān)性也隨之消散。隨后他們做了一個因果干預實驗——將不同迷宮實例的痕跡「交換」(迷宮A的A*痕跡配到迷宮B上)來訓練模型。按常理,痕跡與問題完全不相干,模型應當學不好。然而事實是:完全正確和完全交換的痕跡訓練出的模型,表現(xiàn)都很高;只有當正確痕跡與錯誤痕跡混合時,表現(xiàn)才下降。將其畫成圖表,呈現(xiàn)出一個U型曲線。

圖3是這個實驗的核心結(jié)果,也是整篇論文最有沖擊力的一張圖。橫軸代表訓練數(shù)據(jù)中被「交換」痕跡的比例——0%表示全部用正確痕跡,100%表示全部用錯配痕跡。縱軸是模型在測試集上的解答準確率。
曲線呈U型:兩端高、中間低。這意味著,無論痕跡在語義上是否正確,只要訓練數(shù)據(jù)內(nèi)部保持一致性,模型就能學得不錯;一旦正確與錯誤痕跡混雜,模型反而無所適從。
這說明,模型靠中間Token提升準確率,依靠的不是Token的語義內(nèi)容,而是訓練數(shù)據(jù)中存在的某種「一致性模式」供模型擬合。換句話說,看起來像是在推理,實際上是在做模式匹配,看像不像。
RL后訓練那部分的論證更為銳利。
如果用明確正確的痕跡訓練出的模型,其生成的痕跡都不能保證有效,那么用只關(guān)注答案正確與否的RL繼續(xù)訓練,痕跡的質(zhì)量更無從提高。
因為RL(如GRPO)根本不審查中間Token的內(nèi)容,只看最終答案。實驗發(fā)現(xiàn),RL后訓練確實提高了答案準確率,但痕跡的語義有效性并未隨之提升。
即使用完全無關(guān)的「交換」痕跡訓練的模型,RL照樣能把答案準確率拉上去,痕跡有效性依然極低。
QA任務的干預實驗進一步印證了這一點。作者用主流開源預訓練模型,在問答任務上做了兩組對比:一組用正確的中間痕跡配正確答案訓練,另一組用錯誤的中間痕跡配正確答案訓練。
出人意料的是,錯誤痕跡那組的表現(xiàn)反而更好。同時,大量正確答案前面跟著的是錯誤的痕跡——痕跡正確不保證答案正確,答案正確也不保證痕跡正確,兩頭徹底脫節(jié)。
論文中關(guān)于痕跡長度的討論,讀來格外扎實。業(yè)界有一種流行說法:RL訓練輪次增加導致中間Token變長,說明模型「學會了更深入的思考」。
有的供應商按中間Token數(shù)量向用戶收費,卻并不一定把這些Token展示出來。
作者用「無迷宮」實例做了一個測試。所謂無迷宮,是指起點和終點都在完全空曠的空間中,A*搜索幾乎不需要計算即可解決。然而被復雜迷宮訓練出的模型,面對這種簡單到不能再簡單的輸入,反而生成了極長的中間Token序列,有時連上下文窗口都被撐滿。痕跡長度與問題實際難度之間,根本沒有可靠關(guān)聯(lián)。
也就是說,模型只是在模仿「復雜問題對應長痕跡」這個模式,一旦換了分布就失去控制。

圖4直觀展示了兩者的反差。左側(cè)是訓練時使用的復雜迷宮,路徑尋找需要A搜索進行大量節(jié)點擴展。右側(cè)是「無迷宮」實例,起點和終點之間沒有任何障礙,A幾乎一步到位。但模型對這種簡單實例的反應不是簡短輸出,而是漫無邊際的長篇大論,恰好印證了痕跡長度與問題實際計算復雜度之間并無可靠關(guān)聯(lián)這一判斷。
痕跡為什么會變長?論文引用了作者團隊之前的工作RLiNO,分析了業(yè)界廣泛采用的MDP公式。在把狀態(tài)表示為Token序列、終端獎勵均勻分配到每個中間Token的結(jié)構(gòu)假設下,RL天然就有生成更長序列的傾向。將最終獎勵均攤到每個Token,等于把RL的信用分配機制短路了,整個RL退化為「帶過濾的在線策略有監(jiān)督微調(diào)」。痕跡變長并非模型思考更深入,而是訓練機制的結(jié)構(gòu)性副作用。那些號稱靠縮減痕跡實現(xiàn)「高效推理」的工作,更準確地說,是對基礎(chǔ)模型針對特定分布做了過度訓練。
關(guān)于「啊哈時刻」那段,論文寫得相當直白。模型在推理過程中輸出「aha」這個Token,被解讀為突然的頓悟。但從技術(shù)層面看,模型輸出「啊哈」之后的下一次前向傳播,與「啊哈」之前唯一的區(qū)別,就是上下文中多了這一個Token。模型沒有任何內(nèi)部狀態(tài)被改變。稱其「頓悟」,是將人類經(jīng)驗投射到一個沒有內(nèi)部狀態(tài)的Token生成器上。模型輸出「嗯...」「等一下」「我重新考慮」這些短語,很可能只是模仿了訓練數(shù)據(jù)中人類「自言自語」的文體——人確實在思考時會嘟囔這些詞,但模仿文體與實際進行同樣的認知過程,是兩碼事。

圖5展示了推理模型面對一個并不復雜的規(guī)劃問題時所吐出的中間Token片段。可以看到,其中充斥著「嗯」「等等」「讓我重新想想」之類的短語,文體上確實很像人類在思考時的自言自語。但論文指出,這種文體上的相似并不能證明模型在進行同樣的認知過程——它可能只是在復現(xiàn)訓練數(shù)據(jù)中常見的「思考獨白」風格,而非真正經(jīng)歷了內(nèi)部的推理狀態(tài)變化。
論文中社會意義最大的部分,當屬關(guān)于「虛假信任」的討論。作者設計了一項人類被試實驗,在用戶無法獨立驗證答案對錯的真實場景中,測試展示中間Token對用戶信任的影響。結(jié)果是這樣的:只要將推理痕跡(或其摘要)與最終答案一同展示,用戶對模型預測的信任就顯著增加——這與答案實際正確與否無關(guān),用戶對錯誤答案的接受度也隨之大幅攀升。
論文中有一個思想實驗,用來解釋這種現(xiàn)象。假設你有一個不知道答案的問題,交給兩位朋友各一張紙請他們回答。一位朋友直接寫下答案,另一位除了寫答案還在旁邊寫滿「看起來很合理的推理過程」。雖然你不知道誰對,你很可能會更相信寫了推理過程的那位——哪怕他的答案其實是錯的。這不是用戶的問題,而是人類認知的固有傾向:我們天生更信任「看起來有推理過程」的結(jié)論。如果一個AI系統(tǒng)生成看似推理實則不可靠的文本,借此誘導用戶接受錯誤答案,這就構(gòu)成了對人類認知缺陷的系統(tǒng)性利用。
論文并非只破不立。作者提出了一個替代理論框架——「提示增強」。核心想法是:中間Token本質(zhì)上是一種「學習到的提示增強」。對于給定任務T,可能存在一個增強PA,使得模型在T+PA上的表現(xiàn)超過在T上的表現(xiàn)。挑戰(zhàn)在于學習一個函數(shù),將每個任務映射到有效的增強。當前推理模型生成中間Token所做的正是這件事。但關(guān)鍵洞察在于:提示增強不需要對人類可解釋。對抗性提示的研究已有證據(jù)——有效的越獄攻擊用人類看不懂的字符串增強提示即可成功。用這個框架來看,U型曲線也講得通:完全正確和完全交換的痕跡都提供了「一致性模式」,模型將其作為支架來使用。
一旦承認中間Token只服務于模型自身而非最終用戶,研究方向便豁然開朗——可以用非語言Token、用連續(xù)潛在空間的向量,僅為了答案準確率做優(yōu)化,無需為了「讓用戶看懂」而限制格式。

論文中有一個頗具諷刺意味的細節(jié)。部分所謂的前沿模型制造商以專利為由不向用戶展示實際的中間Token,卻照常按中間Token數(shù)量收費。論文暗示這些公司或許比學界更清楚這東西不可靠。反倒是研究社區(qū)仍在抱有「中間Token能為用戶提供可解釋說明」的期待。有學者撰文呼吁「保護」中間Token與答案之間那條「脆弱的」聯(lián)系,以便模型能被「監(jiān)控」——哪怕這種監(jiān)控可能只是幻象。
論文最后給出了幾條建議。不應將中間Token作為安全監(jiān)控的依據(jù),安全關(guān)鍵場景應采用第三方驗證。不應將中間Token的可解釋性當作信任來源,信任應來自對答案本身的獨立驗證。不應為了「讓用戶看懂」而限制中間Token的格式——作者提到,將原始那個中英混合的版本改為純英語后,性能不升反降。一旦承認中間Token只幫助模型自身,便可以放手探索非語言Token和連續(xù)潛在空間思考的路徑。
這篇論文并不否認推理基準上的性能提升,它質(zhì)疑的是對提升的「解釋」。模型生成看起來合理的中間Token,可能只是在模仿訓練數(shù)據(jù)中人類自言自語的文化慣例。將這東西稱為「思維」,如同因為一本書印滿了字便說這本書在思考一樣——屬于范疇錯誤。在出現(xiàn)比間接證據(jù)更強的證據(jù)之前,對解答和決策的第三方驗證才是更穩(wěn)妥的路徑。
這篇論文最大的價值,或許不在于給出定論,而在于提醒人類社會:對AI能力的解讀需要誠實,不能被表面類似人類行為的模式所誤導。性能提升或許是真實的,但「為什么提升」這個問題,仍值得持續(xù)追問。
論文原文地址見下方,課題組還公開了相關(guān)實驗的代碼和數(shù)據(jù),感興趣的讀者可自行復現(xiàn)。
參考:arXiv:2504.09762v4 https://arxiv.org/html/2504.09762v4
本專題其他文章