0
| 本文作者: 陳淑瑜 | 2026-06-02 18:04 |
來源:公眾號“智能CV”
原文鏈接:https://mp.weixin.qq.com/s/3Ffpo_6rwTspweLdk5RiWw?scene=1&click_id=37

這篇論文聚焦于多標注者醫學圖像分割。在醫學影像中,不同醫生對同一病灶邊界的判斷常常并不完全一致,例如肺結節、鼻咽癌腫瘤區域等任務中,病灶邊界模糊、影像質量差異、醫生經驗不同,都會導致標注結果存在明顯差異。
傳統方法通常會把多個醫生的標注通過多數投票、平均融合或 STAPLE 等方式合成為一個“共識標簽”。但這類做法會壓縮掉專家之間真實存在的差異,使模型過度自信,無法表達臨床不確定性。近年來的概率分割方法,如 Probabilistic U-Net、D-Persona 等,開始嘗試建模多種可能的分割結果,但仍存在兩個問題:
掃描儀噪聲、成像偽影與真實標注差異容易混在一起
個體醫生的標注風格建模不充分
因此,本文提出一個新的框架:Harmonizer Network,目標是在多標注者醫學分割中同時解決“設備/噪聲差異”和“醫生標注風格差異”。

本文的整體框架如圖1所示。模型以 Probabilistic U-Net 為基礎,加入兩個關鍵模塊:Noise Harmonizer 和 Frequency-Prompt Personalization Module,并使用 GED 損失約束預測分布與真實多醫生標注分布的一致性。
圖1展示了 Harmonizer Network 的主干結構。輸入醫學圖像經過編碼器、潛變量空間和解碼器生成分割結果。在解碼器不同層中,作者插入了 Harmonizer 模塊,對特征進行動態調制。
其核心思想是:
模型不應把掃描儀差異、運動偽影、強度漂移等成像問題誤認為醫生之間的診斷差異。因此,作者設計了一個輕量級的 Noise Harmonizer,通過學習一組“偽影 token”,對不同層的特征生成調制參數:

其中,
這一模塊的作用可以概括為:
先把設備和采集噪聲壓下去,再讓模型去學習真正有臨床意義的標注不確定性。
本文第二個重要創新是 High-Frequency Prompt / Frequency-Prompt Personalization Module,結構見圖2。

作者認為,不同醫生的分割風格往往體現在高頻細節上,例如:
因此,作者沒有只在普通空間特征上做個性化,而是使用 離散小波變換 DWT 將特征分解為低頻和高頻子帶:
隨后模型通過 Rater-Aware Prompt Projection,RAPP 生成與具體標注者相關的頻率提示,再通過注意力機制調制高頻特征。最后利用 IDWT 還原為完整特征,并生成醫生個性化的潛變量
簡單說,圖2說明了本文如何把“醫生風格”轉化為頻率域提示,使模型能夠生成不同醫生風格下的個性化分割結果。
本文還使用 Generalized Energy Distance,GED 作為分布對齊損失。它衡量模型生成的多個預測分割與真實多個醫生標注之間的分布距離。
GED 損失由兩部分組成:
因此,GED 的作用是讓模型做到:
本文采用兩階段訓練:
第一階段訓練 Probabilistic U-Net 主干和 Noise Harmonizer,目標是學習穩定、去噪、跨設備一致的潛空間表示。
第二階段凍結主干和 Harmonizer,只訓練頻率個性化模塊,使其學習不同醫生的標注風格。
這種設計避免了個性化模塊直接學習到設備噪聲,從而更好地區分“成像噪聲”和“醫生差異”。

本文主要在兩個多標注者醫學圖像分割數據集上驗證方法:
LIDC-IDRI
NPC-170
表1比較了 Probabilistic U-Net、D-Persona 和本文方法在 LIDC-IDRI 與 NPC-170 上的 GED、Soft Dice、Dice max、Dice match 等指標。
在 LIDC-IDRI 上,當采樣數為 50 時:
| 0.1048 | 91.81 | 92.28 | 91.94 |
在 NPC-170 上,本文方法同樣取得最低 GED:
| 0.1758 | 84.83 | 82.65 |
這說明本文方法能夠更好地擬合真實多醫生標注分布,生成的分割結果既有多樣性,又不會偏離合理解剖結構。

表2展示了 LIDC-IDRI 上的個性化分割結果。本文方法在平均個性化 Dice 上達到 90.78%,高于 D-Persona 的 89.17%。
| 0.1419 | 91.35 | 92.65 | 90.00 | 90.78 |
表3展示了 NPC-170 上的結果。本文方法的平均個性化 Dice 為 81.63%,優于 D-Persona 的 80.40%。
| 0.2685 | 83.10 | 84.46 | 81.63 | 81.63 |
這些結果表明,頻率域提示確實能更好捕捉不同醫生的邊界風格,而不是簡單生成隨機多樣化結果。
圖3展示了 LIDC-IDRI 和 NPC-170 上的多醫生標注、模型預測和誤差圖。紅色邊界表示真實標注,藍色邊界表示模型預測。
從圖3可以看出,本文方法在邊界模糊、醫生意見不一致的區域,能夠生成較合理的個性化輪廓;在醫生一致性較高的區域,預測邊界也更加穩定。這說明模型的不確定性主要集中在真實存在爭議的區域,而不是隨機噪聲區域。
補充材料中還驗證了方法在不同擾動下的魯棒性,包括高斯噪聲、模糊、亮度/對比度擾動等。表5顯示,在強高斯噪聲
| 84.27 | 6.53 |
這說明 Noise Harmonizer 對成像噪聲確實有抑制作用。
此外,圖10展示了頻率模塊前后的頻譜響應。加入頻率適配器后,高頻響應明顯增強,說明該模塊確實強化了邊界和紋理細節,有助于個性化分割。
這篇論文提出的 Harmonizer Network 解決了多標注者醫學圖像分割中的兩個關鍵問題:一是成像設備和噪聲導致的偽不確定性,二是醫生個體標注風格帶來的真實不確定性。
其核心貢獻可以概括為三點:
第一,提出 Noise Harmonizer,通過動態特征調制抑制掃描儀和采集噪聲,使潛空間更加穩定,避免模型把噪聲誤認為臨床差異。
第二,提出 頻率域個性化提示模塊,利用小波變換提取高頻邊界與紋理信息,從而更細致地建模不同醫生的標注習慣。
第三,引入 GED 分布約束,讓模型預測分布與真實多醫生標注分布對齊,在專家一致區域保持確定性,在專家分歧區域保留多樣性。
整體來看,本文方法不僅提升了分割精度,也增強了醫學分割模型的可解釋性和臨床可信度。它的意義不只是“分得更準”,而是讓模型能夠回答一個更臨床化的問題:不同醫生為什么會分得不一樣,模型又該如何合理表達這種不確定性。