0
| 本文作者: 徐咪 | 2026-07-31 14:48 |
7月31日,阿里巴巴發(fā)布語(yǔ)音識(shí)別大模型Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行業(yè)詞識(shí)別和熱詞定制化三個(gè)維度系統(tǒng)性升級(jí),同時(shí)具備語(yǔ)音潤(rùn)色能力,可直接輸出結(jié)構(gòu)化文本。
目前,Qwen-Audio-ASR系列已在會(huì)議紀(jì)要整理、實(shí)時(shí)字幕、教育錄播、智能客服等場(chǎng)景中獲得廣泛驗(yàn)證,離線版本曾在全球權(quán)威AI評(píng)測(cè)平臺(tái)Artificial Analysis以1.7%的錯(cuò)字率位列全球第一。識(shí)準(zhǔn)專業(yè)詞匯,是ASR模型走向行業(yè)落地的最后一公里,也是本次升級(jí)的核心。全新升級(jí)的3.0版本,聚焦通用的語(yǔ)音識(shí)別能力,不止于把每個(gè)字聽(tīng)對(duì),更要在復(fù)雜語(yǔ)境中持續(xù)聽(tīng)對(duì)、在專業(yè)領(lǐng)域中精準(zhǔn)聽(tīng)對(duì)。
在會(huì)議、訪談、課程、直播等長(zhǎng)音頻場(chǎng)景中,很多專業(yè)術(shù)語(yǔ)、英文詞匯等并不能只靠當(dāng)前幾秒的語(yǔ)音準(zhǔn)確判斷。同一個(gè)發(fā)音可能對(duì)應(yīng)十幾個(gè)同音詞,模型必須記住前面說(shuō)過(guò)什么,才能輸出正確的那一個(gè)。Qwen-Audio-3.0-ASR-Flash新增長(zhǎng)音頻Context能力:模型在轉(zhuǎn)寫(xiě)當(dāng)前語(yǔ)音片段時(shí),可參考近期已識(shí)別的上下文,延續(xù)同一話題中的關(guān)鍵詞與語(yǔ)義線索,從而減少同音詞誤判,提升術(shù)語(yǔ)和中英文混合表達(dá)的識(shí)別準(zhǔn)確率。在一場(chǎng)長(zhǎng)達(dá)數(shù)小時(shí)的會(huì)議錄音中,同一位發(fā)言人的名字、同一個(gè)技術(shù)概念,不會(huì)因?yàn)榭缌硕鄠€(gè)語(yǔ)音片段就被忘記或認(rèn)錯(cuò)。
上下文記憶解決了“說(shuō)過(guò)的詞不再認(rèn)錯(cuò)”,而很多專業(yè)詞匯在整場(chǎng)對(duì)話中可能只出現(xiàn)一次,模型需要在從未見(jiàn)過(guò)的情況下也能一次聽(tīng)對(duì)。傳統(tǒng)方案中,行業(yè)詞識(shí)別往往依賴人工維護(hù)詞表,Qwen-Audio-3.0-ASR-Flash將這一過(guò)程內(nèi)化為模型自身能力,無(wú)需人工逐一設(shè)置,即可在真實(shí)業(yè)務(wù)場(chǎng)景中持續(xù)進(jìn)化。通過(guò)持續(xù)挖掘醫(yī)療、IT編程、股票、社會(huì)名人等領(lǐng)域的實(shí)體詞,研究團(tuán)隊(duì)構(gòu)建了覆蓋多行業(yè)的高質(zhì)量詞庫(kù),并基于這些實(shí)體詞合成相關(guān)訓(xùn)練數(shù)據(jù),增強(qiáng)模型對(duì)專業(yè)術(shù)語(yǔ)和低頻詞的識(shí)別能力。在最新的行業(yè)詞匯內(nèi)部評(píng)測(cè)中,新模型的行業(yè)詞召回率均有顯著提升,其中醫(yī)療場(chǎng)景突破95.36%。
行業(yè)詞庫(kù)覆蓋了通用場(chǎng)景,但各行各業(yè)還有自己的長(zhǎng)尾詞,比如人名、品牌名、產(chǎn)品名和各類行業(yè)黑話。這些詞頻率低、更新快,不可能全部預(yù)裝進(jìn)模型,熱詞定制正是為了讓它們也能被精準(zhǔn)識(shí)別。傳統(tǒng)方案長(zhǎng)期面臨一個(gè)矛盾:熱詞加得越多,誤觸發(fā)越多,識(shí)別結(jié)果反而被帶偏。Qwen-Audio-3.0-ASR-Flash對(duì)熱詞定制能力進(jìn)行了全面升級(jí),采用模型結(jié)合聲學(xué)證據(jù)與上下文進(jìn)行智能判斷的方式,而非簡(jiǎn)單替換。在傳入熱詞的條件下,熱詞定制化準(zhǔn)確率在所有測(cè)試集均達(dá)到90%以上,多數(shù)場(chǎng)景更是突破99%。
此外,Qwen-Audio-3.0-ASR-Flash還具備語(yǔ)音潤(rùn)色能力:口語(yǔ)中的“那個(gè)”“嗯”等填充詞被直接去除;說(shuō)話時(shí)的自我修正,如“我們下周三評(píng)審,不對(duì),是周四”只保留最終意圖;散亂的口述可自動(dòng)整理為結(jié)構(gòu)化表達(dá)。更重要的是,這些潤(rùn)色由ASR模型在識(shí)別環(huán)節(jié)一步完成,無(wú)需再調(diào)用下游文本大模型,鏈路更短、延遲更低、使用成本也更低。
即日起,Qwen-Audio-3.0-ASR-Flash已在阿里云百煉平臺(tái)開(kāi)放調(diào)用,用戶可前往體驗(yàn)。