0
| 本文作者: Nemo | 2026-07-09 18:40 |
人與 AI 的溝通正在變得越來越像人與人之間的溝通。
一位店員用 AI 制作門店宣傳視頻時(shí),不再把需求列成一段非常細(xì)致的 Prompt 發(fā)給 AI,然后等待它返回結(jié)果;而是直接開啟一個(gè)與 AI 的對(duì)話,告訴它“幫我剪一條今天新品上架的視頻”,然后通過連續(xù)對(duì)話敲定任務(wù)的具體細(xì)節(jié),就像與人類剪輯師一樣。
同樣的情況已經(jīng)發(fā)生在很多具體場(chǎng)景中。一些程序員在通勤或散步時(shí)會(huì)用語音和 Agent 討論一個(gè)功能該怎么設(shè)計(jì),如何實(shí)現(xiàn);有用戶在玩游戲時(shí),會(huì)不斷與 AI 游戲助手溝通現(xiàn)在應(yīng)該做哪些任務(wù),當(dāng)前的關(guān)卡還有哪些道具沒有收集……
進(jìn)入 Agent 時(shí)代,AI 不再只是輸入框另一端的響應(yīng)系統(tǒng),而是開始進(jìn)入需求討論、方案判斷和任務(wù)執(zhí)行的全過程。這種角色變化,也讓音視頻對(duì)話成為越來越多人與 Agent 交互的主要方式。
數(shù)據(jù)顯示,豆包 App 在今年一季度的音頻用量環(huán)比增長(zhǎng)約200%,視頻用量增長(zhǎng)約350%;近一年來的音視頻模型日均 Token 消耗已經(jīng)達(dá)到千億級(jí)別。聯(lián)想天禧 AI 看世界功能從2025年8月上線到2026年5月,人均對(duì)話輪次提升至剛上線時(shí)的1.65倍,是傳統(tǒng)一問一答主對(duì)話的3倍。

當(dāng)越來越多的人把與 Agent 的主要溝通方式從打字切換到視頻或語音,多模態(tài)對(duì)話就很可能會(huì)成為人與 Agent 協(xié)作的主要交互界面。語音、視頻、屏幕共享和環(huán)境信息都會(huì)成為這個(gè)界面的一部分。用戶不再只是“輸入問題”,而是在一個(gè)持續(xù)的上下文中,讓 Agent 理解任務(wù)、補(bǔ)充信息、調(diào)用工具并參與執(zhí)行。
但要真正實(shí)現(xiàn)這一點(diǎn),對(duì)多模態(tài)交互能力的要求就不能只是“能聽見聲音”或“能看見畫面”,而是要具備接近人的溝通能力,同時(shí)做好聽覺、視覺、記憶和意圖四項(xiàng)能力。只有當(dāng)這些能力同時(shí)成立,多模態(tài)對(duì)話才會(huì)從一種輸入方式,升級(jí)為支撐任務(wù)判斷、方案形成和執(zhí)行推進(jìn)的協(xié)作機(jī)制,支持 Agent 完成從工具到伙伴的進(jìn)化。
一、從等待指令到參與討論
多模態(tài)交互真正改變的,不只是用戶向 Agent 發(fā)出指令的方式,而是 Agent 進(jìn)入任務(wù)的時(shí)間點(diǎn)。
在人與人的協(xié)作中,很多需求和答案并不是一開始就完整存在。往往先是有一個(gè)模糊的想法,然后在大家討論中不斷被追問細(xì)節(jié),結(jié)合場(chǎng)景、資源和目標(biāo)不斷補(bǔ)充信息,最終才被沉淀成一個(gè)清晰的執(zhí)行方案。
現(xiàn)在,人與 Agent 的溝通也開始從一次性發(fā)出指令,轉(zhuǎn)向在多輪交流中澄清需求、形成方案。這是多模態(tài)交互改變協(xié)作方式的關(guān)鍵。
首先,它降低了人與 Agent 溝通的門檻。
對(duì)很多人來說,用一段文字向 AI 提需求是一個(gè)看似簡(jiǎn)單、實(shí)際上很難的問題。用戶需要知道如何描述背景、目標(biāo)、限制條件和期望結(jié)果,也需要提前預(yù)判模型可能會(huì)誤解的地方。Prompt 寫得不完整,結(jié)果就會(huì)偏差;想把 Prompt 寫清晰,又需要付出一定的時(shí)間和精力進(jìn)行思考、學(xué)習(xí)。
多模態(tài)交互讓用戶可以用自己最習(xí)慣的方式表達(dá)需求,不需要學(xué)習(xí)如何寫好 Prompt,甚至也不需要掌握專業(yè)工具和術(shù)語。在開頭提到的用 AI 制作門店宣傳視頻的場(chǎng)景中,店員與 Agent 協(xié)作時(shí),就只需要想明白自己要什么樣的成果,不必再變成一個(gè)既懂技術(shù)又懂業(yè)務(wù)的多面手。
其次,在人與 Agent 的充分討論中,問題的上下文能被更完整地還原。
當(dāng)前很多任務(wù)的挑戰(zhàn)不在執(zhí)行,而在沒有充分向 Agent 澄清需求。尤其是編程、設(shè)計(jì)、辦公、內(nèi)容生產(chǎn)等場(chǎng)景,用戶一開始往往只有一個(gè)方向,而不是一份完整需求文檔。
如果 Agent 只接收一個(gè)靜態(tài) Prompt,它只能基于有限信息直接執(zhí)行;如果能通過多模態(tài)交互和用戶反復(fù)討論,它就可以追問關(guān)鍵條件、澄清模糊表達(dá)、補(bǔ)全上下文,在理解目標(biāo)、約束和實(shí)現(xiàn)路徑的基礎(chǔ)上,進(jìn)入執(zhí)行環(huán)節(jié)。
例如,在 Vibe Coding 場(chǎng)景中,Agent 的價(jià)值不只發(fā)生在寫代碼這一刻,而是更多體現(xiàn)在需求討論和方案澄清階段。TRAE Work “語音討論”功能的數(shù)據(jù)顯示,用戶平均每通對(duì)話與 Agent 交互17輪;60%的對(duì)話屬于探索發(fā)散型;70%的對(duì)話用于方案討論,只有30%用于代碼生成。
最后,多模態(tài)交互也符合人類工作重心從執(zhí)行到監(jiān)督的轉(zhuǎn)移趨勢(shì)。
隨著 Agent 能力繼續(xù)增強(qiáng),用戶會(huì)越來越少地親自執(zhí)行具體步驟,而是轉(zhuǎn)向監(jiān)督和保障 Agent 執(zhí)行任務(wù)的效果。未來很多工作甚至不再需要人一直守在屏幕前,而是由 Agent 持續(xù)推進(jìn),在遇到不確定、需要判斷或需要授權(quán)的環(huán)節(jié)時(shí),再提醒人介入。
這樣的工作狀態(tài)下,語音和視頻會(huì)成為更自然的監(jiān)督和介入方式。人在通勤路上,可以用語音和 Agent 討論方案;可以通過屏幕隨時(shí)觀察 Agent 的執(zhí)行狀態(tài)和結(jié)果;也可以打開攝像頭,讓 Agent 結(jié)合現(xiàn)場(chǎng)畫面給出新的判斷。
因此,多模態(tài)對(duì)話的價(jià)值不只是讓用戶少打字,而是改變了 Agent 進(jìn)入任務(wù)的階段:它從結(jié)果生成環(huán)節(jié)前移到需求形成、方案討論和執(zhí)行監(jiān)督環(huán)節(jié)。
二、類人溝通,邁向人與 Agent 協(xié)作的關(guān)鍵進(jìn)化
Agent 的多模態(tài)交互能力讓人不必始終待在傳統(tǒng)操作界面里,也能配合其完成工作。這需要在四個(gè)方面進(jìn)行增強(qiáng):
第一是聽覺,目標(biāo)是在真實(shí)環(huán)境中保證 Agent 能與人進(jìn)行順暢、高效的溝通。
真實(shí)世界的聲音環(huán)境遠(yuǎn)比實(shí)驗(yàn)室復(fù)雜。用戶可能在地鐵、咖啡廳、辦公室、戶外環(huán)境中和 Agent 對(duì)話,環(huán)境里往往有回聲、噪音;還可能面對(duì)多人溝通場(chǎng)景。對(duì)人來說,我們可以自然區(qū)分“誰在跟我說話”“哪句話與我有關(guān)”;但對(duì) Agent 來說,這需要依賴聲學(xué)和語義系統(tǒng)實(shí)現(xiàn)。
火山引擎為提升 Agent 的多模態(tài)交互能力,會(huì)面向 Agent 優(yōu)化回聲消除、基于聲紋識(shí)別的降噪,以及聲學(xué)和語義的聯(lián)合理解。
傳統(tǒng)回聲消除會(huì)更關(guān)注人耳的聽感,但 Agent 更在意語音識(shí)別的完整性,因此需要在壓制回聲的同時(shí),保護(hù)主講人的聲音頻譜。聲紋識(shí)別則可以幫助 Agent 鎖定主講人,減少旁人說話帶來的干擾。聲學(xué)和語義的聯(lián)合理解,可以讓 Agent 知道這句話是不是對(duì)它說的。
只有 Agent 能穩(wěn)定聽清用戶、理解用戶,用戶才會(huì)愿意用自然語言持續(xù)和它交流。這對(duì)終端場(chǎng)景尤其重要。聯(lián)想天禧 AI 看世界的使用場(chǎng)景包括了辦公、戶外、看球、健身、通勤等真實(shí)環(huán)境。借助火山引擎的聽覺能力,聯(lián)想將自由打斷、低延遲響應(yīng)和高擬真音色打造成了 AI 看世界的體驗(yàn)亮點(diǎn)。
第二是視覺,可以讓 Agent 和用戶共享同一個(gè)問題現(xiàn)場(chǎng)。
聯(lián)想天禧 AI 看世界打通了實(shí)時(shí)對(duì)話、屏幕共享和攝像頭共享三種模式。用戶可以在 Excel 里問“這幾個(gè)單元格怎么合并”,也可以讓 AI 評(píng)價(jià)自己今天的穿搭,讓 AI 陪自己看劇、估算食物熱量。
實(shí)現(xiàn)這種視頻理解體驗(yàn)的難點(diǎn)不是讓 Agent 看到更多畫面,而是讓它看到更有效的畫面。連續(xù)視頻里有大量重復(fù)幀、模糊幀和低價(jià)值信息,如果全部送入模型,會(huì)帶來成本和延遲壓力,也會(huì)影響理解效率。
因此,服務(wù) Agent 的多模態(tài)交互需要在端側(cè)提升采集質(zhì)量,在云端具備關(guān)鍵幀優(yōu)選、智能抽幀能力,并能具備選擇性注意力。
其中,選擇性注意力是火山引擎推出的讓 Agent 能進(jìn)行類人溝通的關(guān)鍵能力之一。它能讓 Agent 在處理連續(xù)畫面前,先根據(jù)用戶的意圖去創(chuàng)建一個(gè)實(shí)時(shí)視覺理解任務(wù),帶著目標(biāo)去看視頻。比如,在服務(wù)球賽場(chǎng)景時(shí),Agent 應(yīng)該能通過球衣號(hào)碼辨別出對(duì)應(yīng)的球員,進(jìn)而確認(rèn)需要追蹤哪位球員的場(chǎng)上動(dòng)作。
第三是記憶,決定了 Agent 與人能否跨越單次會(huì)話,實(shí)現(xiàn)真正的合作。
真正的類人溝通不是只理解當(dāng)前一句話,而是能記住過去發(fā)生了什么,和用戶之間發(fā)生過什么。比如用戶問“剛才午飯熱量高嗎”,Agent 需要回憶起此前看到的食物畫面。這樣的交流才會(huì)更接近人與人之間的相處狀態(tài)。
火山引擎為多模態(tài)交互構(gòu)建了三層記憶體系:第一層是增強(qiáng)上下文,負(fù)責(zé)將多模態(tài)解析出來的畫面核心主體類型、時(shí)空位置、行為動(dòng)作等信息結(jié)構(gòu)化,作為上下文提供給 Agent;第二層是短期記憶,記錄幾分鐘前看到的畫面或聽到的聲音;第三層是長(zhǎng)期記憶,抽象和記錄用戶長(zhǎng)期交互中的關(guān)鍵行為、習(xí)慣特征和重要事件。
具體實(shí)踐中,聯(lián)想天禧 AI 會(huì)據(jù)此搭建跨端、跨會(huì)話、跨場(chǎng)景的記憶體系。這套記憶系統(tǒng)不只服務(wù)于主對(duì)話,也會(huì)接入 AI 看世界,并覆蓋 PC、Phone、Pad 多端。用戶無論通過文字、語音還是視頻交互,記憶都可以被沉淀下來,并在下一次會(huì)話中被調(diào)用。
這會(huì)讓 Agent 不再只處理單次請(qǐng)求,而是開始沿著用戶的生活和任務(wù)脈絡(luò)持續(xù)積累上下文。

第四是意圖,解決 Agent 能否參與任務(wù)定義的問題。
人類溝通中,大量信息并不會(huì)被明確說出。用戶說“幫我做一個(gè)權(quán)限管理系統(tǒng)”,真正重要的問題可能是:權(quán)限按角色分配還是按部門分配?是否需要審批?是否有管理員層級(jí)?是否要和現(xiàn)有系統(tǒng)打通?一個(gè)只會(huì)執(zhí)行的 Agent 會(huì)立刻開始生成結(jié)果;而一個(gè)更接近協(xié)作者的 Agent,則會(huì)主動(dòng)追問關(guān)鍵約束,把模糊需求變成可執(zhí)行方案。
聽覺解決“聽見誰”,視覺解決“看見什么”,記憶解決“記得哪些上下文”,意圖解決“到底要完成什么任務(wù)”。四項(xiàng)能力共同構(gòu)成了 Agent 從對(duì)話走向協(xié)作的基礎(chǔ)。這也是火山引擎的多模態(tài)交互能力區(qū)別于傳統(tǒng)問答的地方。它能在連續(xù)溝通中理解用戶真正想完成什么,并達(dá)成協(xié)作共識(shí)。
三、當(dāng)多模態(tài)對(duì)話成為通用協(xié)作界面
多模態(tài)交互最終不會(huì)只是某個(gè) App 里的一個(gè)功能模塊,而會(huì)變成通用的 Agent 任務(wù)界面。
過去,語音、視頻、拍照識(shí)別、屏幕共享往往是分散功能。用戶需要在不同入口之間切換:想語音就打開語音模式,想識(shí)別圖片就上傳圖片,想讓 AI 理解屏幕就截圖。未來,這些能力會(huì)融合成一個(gè)持續(xù)感知、持續(xù)協(xié)作的 Agent 入口,用戶可以隨時(shí)切換模態(tài)與 Agent 溝通,依靠 Agent 調(diào)用工具完成協(xié)作任務(wù)。
聯(lián)想天禧 AI 看世界已經(jīng)在終端側(cè)展示了這種趨勢(shì)。它不是單獨(dú)增加了一個(gè)視頻通話功能,而是把火山引擎提供的 RTC/AgentRTC、端到端語音、TTS、ASR、Seed 大模型、視覺理解、多模態(tài)傳輸?shù)饶芰Γc聯(lián)想天禧 AI 自身的會(huì)話管理、記憶管理、跨端同步、人設(shè)管理、場(chǎng)景編排、上下文路由結(jié)合起來,再呈現(xiàn)在 PC、Phone、Pad 等設(shè)備上。
這意味著,實(shí)時(shí)對(duì)話正在從“打電話模式”變得更加通用,逐漸嵌入到工具、內(nèi)容和現(xiàn)實(shí)場(chǎng)景中。
AI 眼鏡之所以被認(rèn)為是未來的關(guān)鍵硬件產(chǎn)品之一,就是因?yàn)樗烊唤咏说囊暯牵梢猿掷m(xù)接收聲音、畫面和環(huán)境信息,是為“隨時(shí)可見、隨時(shí)可說、隨時(shí)可協(xié)作”的 Agent 準(zhǔn)備的理想載體。
當(dāng) Agent 能聽、能看、能記住、能理解意圖,用戶就可以通過 AI 眼鏡這樣的伴身硬件與其建立更自然的聯(lián)系,利用自然語言和視覺信息操控其完成現(xiàn)實(shí)中的任務(wù)。比如看到一臺(tái)設(shè)備,可以直接詢問異常原因;在陌生環(huán)境中,也可以讓 Agent 結(jié)合眼前畫面進(jìn)行解釋,提供行動(dòng)建議。
這種交互閉環(huán)本身就是一個(gè)適配 Agent 的通用操作界面,承載著未來人與物理世界的互動(dòng)。
它會(huì)非常接近人們?cè)谟耙曌髌分锌吹降匿撹F俠的賈維斯,或者高智能方程式賽車?yán)锏能囕d電腦。它們并不是被動(dòng)等待指令的工具,而是持續(xù)理解環(huán)境、記住用戶、適時(shí)介入、協(xié)助執(zhí)行任務(wù)的伙伴。
這種協(xié)作方式也會(huì)進(jìn)一步抬高多模態(tài)交互技術(shù)的天花板。過去 AI 產(chǎn)品比的是模型能力和任務(wù)效率,未來還會(huì)比誰更接近用戶的真實(shí)使用現(xiàn)場(chǎng),誰能讓用戶更自然地持續(xù)交流、持續(xù)信任、持續(xù)協(xié)作。對(duì) Agent 來說,下一代入口可能不只是一個(gè)應(yīng)用,也不只是一個(gè)硬件,而是一套圍繞多模態(tài)對(duì)話建立起來的協(xié)作系統(tǒng)。