0
| 本文作者: 吳思夢 | 2026-06-16 13:47 | 專題:ICML:國際機(jī)器學(xué)習(xí)會議 |
ICML 2026

PRM-PBE方法示意圖
盡管大語言模型在代碼生成和程序推理任務(wù)中取得了顯著進(jìn)展,但其在Programming-by-Example(PBE)任務(wù)中的表現(xiàn)仍受到明顯限制。PBE要求模型僅根據(jù)輸入輸出樣例推斷潛在程序邏輯,并合成能夠滿足所有樣例的程序。現(xiàn)有LLM方法通常依賴輸入到輸出的直接映射,或借助Chain-of-Thought、執(zhí)行反饋、監(jiān)督微調(diào)等方式增強(qiáng)推理能力。然而,這類方法缺乏對中間推理過程的細(xì)粒度監(jiān)督,容易生成只滿足部分樣例的shortcut程序,或在復(fù)雜邏輯歸納場景下偏離真實(shí)意圖。
近日,北京大學(xué)、京東、華東師范大學(xué)、實(shí)驗室聯(lián)合研究團(tuán)隊圍繞 LLM在PBE場景中缺乏過程監(jiān)督的問題,提出一種面向程序樣例歸納的過程獎勵強(qiáng)化學(xué)習(xí)框架PRM-PBE。該方法通過反饋引導(dǎo)的推理樹構(gòu)建過程監(jiān)督數(shù)據(jù),并訓(xùn)練Process Reward Model(PRM)評估中間推理步驟的可靠性,再結(jié)合按失敗模式組織的三階段課程學(xué)習(xí)與PPO優(yōu)化程序合成模型,從而提升模型從輸入輸出樣例中捕捉隱含程序邏輯的能力。相關(guān)論文題為PRM-PBE : Process Reward Model for Reinforcement Learning in Programming-by-Example。
論文作者:房越、金芝、安杰、陳宏申、李江夢、陳小紅、詹乃軍
通訊作者:金芝、安杰
現(xiàn)有 PBE 方法缺乏對推理過程的細(xì)粒度監(jiān)督
Programming-by-Example的核心目標(biāo),是從少量輸入輸出樣例中推斷用戶真正想要的程序邏輯。傳統(tǒng)PBE系統(tǒng)通常依賴預(yù)定義DSL,通過符號搜索、遞歸分解或神經(jīng)網(wǎng)絡(luò)引導(dǎo)搜索完成程序合成。隨著大語言模型的發(fā)展,PBE不再必須受限于特定DSL,模型可以直接基于自然語言提示、輸入輸出樣例和推理鏈生成通用語言程序。
然而,論文指出,當(dāng)前LLM-based PBE方法仍存在一個關(guān)鍵缺陷:模型主要學(xué)習(xí)輸入與輸出之間的表層映射,而缺少對中間歸納過程的監(jiān)督。對于復(fù)雜PBE任務(wù),僅憑樣例進(jìn)行端到端生成容易產(chǎn)生兩類錯誤。一類是模型推斷出完全錯誤的邏輯,例如把“多個列表相同位置元素相等的索引”錯誤理解為簡單集合交集。另一類是模型生成只覆蓋部分樣例的程序,例如任務(wù)要求降序排序,模型卻只執(zhí)行反轉(zhuǎn)操作,從而在部分樣例上看似正確,但無法表達(dá)真實(shí)規(guī)則。
這些失敗說明,PBE的難點(diǎn)并不只是最終代碼是否通過測試,而在于模型是否能夠在推理過程中逐步接近樣例背后的潛在意圖。若缺少對推理步驟的顯式監(jiān)督,模型很容易沿著錯誤歸納方向繼續(xù)生成,并最終得到看似合理但邏輯不完整的程序。
用反饋引導(dǎo)的推理樹構(gòu)建過程監(jiān)督數(shù)據(jù)
針對PBE中間推理過程難以監(jiān)督的問題,論文提出反饋引導(dǎo)的推理樹構(gòu)建方法。推理樹中的每個節(jié)點(diǎn)表示一個自然語言形式的中間推理步驟,模型從輸入輸出樣例出發(fā),逐步采樣后繼推理節(jié)點(diǎn),直到形成完整推理路徑。由于這些中間節(jié)點(diǎn)本身不能直接執(zhí)行,系統(tǒng)會在路徑終止后將其轉(zhuǎn)化為完整程序,并通過執(zhí)行測試判斷其是否滿足所有樣例。
在此基礎(chǔ)上,論文用后續(xù)路徑的成功比例衡量節(jié)點(diǎn)質(zhì)量。若某個節(jié)點(diǎn)的大部分后續(xù)路徑都能導(dǎo)向正確程序,說明該推理狀態(tài)較為可靠。若某個推理前綴的所有后繼路徑都失敗,系統(tǒng)則將其視為潛在邏輯偏離點(diǎn),并引入外部自然語言指令進(jìn)行定向修復(fù),從而生成更多高質(zhì)量正樣本,緩解PBE過程監(jiān)督數(shù)據(jù)中正樣本稀疏的問題。
用后繼成功率訓(xùn)練過程獎勵模型
在完成推理樹構(gòu)建后,論文進(jìn)一步訓(xùn)練Process Reward Model來評估中間推理步驟的質(zhì)量。PRM并不直接判斷最終程序是否正確,而是為每個推理狀態(tài)分配獎勵分?jǐn)?shù),用來估計該狀態(tài)繼續(xù)生成正確程序的可能性。
具體而言,論文將節(jié)點(diǎn)的后繼成功率作為偏好信號。如果節(jié)點(diǎn)A的后續(xù)采樣路徑更容易生成正確程序,而節(jié)點(diǎn)B的后續(xù)路徑更容易失敗,訓(xùn)練目標(biāo)就要求PRM給節(jié)點(diǎn)A更高分?jǐn)?shù)。相比簡單的正負(fù)樣本分類,這種偏好學(xué)習(xí)能夠更細(xì)致地區(qū)分不同推理狀態(tài)的可靠程度,使模型學(xué)會識別更可能通向正確程序的歸納方向。
獲得PRM后,論文將其接入強(qiáng)化學(xué)習(xí)框架,用過程級獎勵優(yōu)化程序合成模型。為提升訓(xùn)練穩(wěn)定性,研究團(tuán)隊設(shè)計了按失敗模式組織的三階段課程學(xué)習(xí)策略,使模型從基礎(chǔ)可執(zhí)行性逐步過渡到復(fù)雜邏輯正確性。
第一階段關(guān)注語法錯誤和運(yùn)行時錯誤,訓(xùn)練模型生成能夠正常執(zhí)行的程序。第二階段關(guān)注可執(zhí)行但與目標(biāo)行為完全不一致的程序,引導(dǎo)模型學(xué)習(xí)輸入輸出樣例中的核心約束。第三階段處理只能通過部分樣例的程序,幫助模型減少對有限樣例的過擬合。在每個階段中,PRM對中間推理狀態(tài)提供獎勵,并通過PPO更新策略模型,從而讓模型逐步學(xué)習(xí)更可靠的程序歸納路徑。
多基準(zhǔn)實(shí)驗驗證PRM-PBE的有效性
論文在PROSE、SyGuS、Playgol、Lists和MBPP五個代表性PBE基準(zhǔn)上進(jìn)行實(shí)驗,覆蓋字符串處理、列表操作、歸納邏輯程序設(shè)計以及由 MBPP改造而來的輸入輸出樣例合成任務(wù)。實(shí)驗同時比較了多種閉源與開源大語言模型,包括GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Flash、Qwen2.5-Coder、DeepSeek-Coder-V2、Llama-3和Qwen3。
主實(shí)驗結(jié)果顯示,PRM-PBE在所有基準(zhǔn)上均顯著優(yōu)于現(xiàn)有基線。以 DeepSeek-Coder-V2為基礎(chǔ)模型時,SFT的平均Pass@1為42.76%,而PRM-PBE提升至56.61%,帶來13.85個百分點(diǎn)的增益。與最強(qiáng)非PRM基線Claude-3.5-Sonnet的WPS方法相比,PRM-PBE仍高出8.73個百分點(diǎn)。這說明,對于復(fù)雜PBE任務(wù),僅依賴提示工程、搜索反饋或監(jiān)督微調(diào)仍然不足,顯式過程獎勵能夠更有效地提升程序合成準(zhǔn)確率。

這項工作的影響在于,它把PBE中最難監(jiān)督的“從樣例歸納程序意圖”這一過程顯式建模出來,并用過程獎勵為強(qiáng)化學(xué)習(xí)提供了比最終執(zhí)行結(jié)果更細(xì)粒度的訓(xùn)練信號。相比只判斷程序是否通過測試,PRM-PBE 能夠進(jìn)一步識別推理路徑中的偏離點(diǎn),減少只滿足部分樣例的shortcut 程序,使模型更可靠地學(xué)習(xí)輸入輸出樣例背后的全局邏輯。
更進(jìn)一步,這一框架也為后續(xù)LLM程序合成研究提供了可擴(kuò)展思路:對于許多難以直接標(biāo)注中間過程的任務(wù),可以通過“采樣后續(xù)路徑、驗證最終結(jié)果、反推中間狀態(tài)價值”的方式構(gòu)建過程監(jiān)督信號。隨著更強(qiáng)的代碼模型和自動驗證工具發(fā)展,類似的過程獎勵機(jī)制有望擴(kuò)展到更復(fù)雜的程序歸納、算法生成和真實(shí)軟件工程任務(wù)中。
原文作者:公眾號“天基綜合信息系統(tǒng)全國重點(diǎn)實(shí)驗室”
原文鏈接:https://mp.weixin.qq.com/s/AQxUnKKX4qqRgi3KpRgSpw
雷峰網(wǎng)(公眾號:雷峰網(wǎng))
本專題其他文章