0
| 本文作者: 李娜 | 2026-08-03 10:30 |

作者丨rhea
編輯丨馬曉寧 李娜
6 月 30 日,Google 發布了兩款面向開發者的新模型,這也促使我們對圖像模型產生了更多的思考。
Nano Banana 2 Lite 的定位,是 Nano Banana 圖像家族中速度最快、成本最低的一款,4 秒生成一張 1K (1024×1024) 分辨率的圖像,一張0.034 美元,折合約人民幣 0.25 元。
各家圖像模型的產品線幾乎都排在同一根軸上:頂層定位專業終稿,追求極致質量;中間層覆蓋日常需求,平衡成本與效果;底層主打廉價快速,以量取勝。海外的 Flux、Grok Imagine,國內字節的 Seedream,都有自己的廉價檔圖像模型,價格普遍在 1.5 到 3.5 美分(約 0.1 到 0.25 元人民幣) 一張的量級。
Lite 特殊的地方,在于它把調用一次的門檻壓到了幾乎可以忽略。一張圖只要四秒、三分錢,做圖這件事就從生成一張變成了可以批量生成、隨時重來、快速試錯。
可以說,這款便宜的模型改變了整個圖像生成的場景,以前是人偶爾點一下,現在是機器可以不停地調。反正生成圖片這么便宜,為什么不讓機器人多試幾次呢?
這就帶出一個問題:真正需要 4 秒出圖的,到底是誰?
大概率不是坐在屏幕前等精品圖的人,這群對質量高度敏感的用戶,多等十幾秒也無所謂。真正在乎這四秒的,是后臺自動跑的系統。廣告平臺要給一條投放生成幾十版素材做 A/B 測試,電商要給成千上萬的 SKU(Stock Keeping Unit,庫存單位) 批量出變體圖,內容平臺要給不同用戶生成不同封面,一個 Agent 在拼網頁、做 PPT、寫短視頻腳本的時候要順手補一張配圖。這些場景的共同點是,圖不是給人細看的作品,是流水線里的一個零件。
順著這條線看,Google 此次的目標,就不是一個更優秀的圖像生成工具。它想把生成一張視覺素材這件事,做成一個像調用函數一樣便宜、能塞進任何自動化流程的環節。Nano Banana 2 Lite 加 Omni Flash,是它把視覺生產接進工作流的第一套零件。

01
Lite負責低成本出圖,Omni Flash負責把圖變成視頻,二者串聯成了一套視覺生成流水線。
在此之前,谷歌的圖像生成和視頻生成是兩個獨立的產品線,中間沒有官方推薦的銜接方式。開發者想從圖片推進到視頻,需要自己寫膠水代碼、做格式轉換、處理接口不一致等問題。Lite 和 Omni Flash 的串聯是谷歌第一次在架構層面把圖生視頻的標準鏈路做通,本質上是在補中間那截缺失的管道。
先看 Lite 所在的 Nano Banana 家族。它現在不是一個模型,是谷歌 Gemini 圖像模型的一整個家族外號,按速度和成本這根軸分了幾檔:

Lite 的補充讓整個 NB(Nano Banana)家族幾乎完整覆蓋了從專業到平民,從重度生產力到量大管飽的四象限:

表格:Nano Banana 家族產品矩陣
三檔各管一段:PRO(Nano Banana PRO 簡稱,后文同) 管終稿和專業活,能出到 4K、能做復雜推理;NB2(Nano Banana 2簡稱,后文同) 是通用主力,質量和成本最平衡;Lite 只出 1K(1024×1024),把算力全壓在快和便宜上。Lite 在家族里的位置很明確,它不是給人做一張要細看的圖,是給系統做那種“要得多、要得快、單張不值錢”的圖。谷歌自己也把它定位成初代 Nano Banana 的替代款,等于把最低那一檔整個換新。
Omni Flash 補的是鏈路的下一環。Omni Flash 在 5 月 19 日的 I/O 大會上首次亮相,并在當天上線了消費端產品,而 6 月 30 日 是它首次通過 API 向開發者開放的日子。Omni Flash 能把一張圖或一段文字變成十秒視頻,還能靠 Interactions API 維持會話狀態,讓人用自然語言在同一段視頻上連續疊加編輯(官方說的上限是三次)。

圖:Gemini Omni 從展示頁走向產品入口

圖:Google 宣布 Nano Banana 2 Lite 與 Gemini Omni Flash 面向開發者開放
這條鏈路對應的定價也說明了它是給誰用的,Omni Flash 每秒 的收費標準是 0.10 美元,和 Veo 3.1 Fast(Google 推出的快速版生成模型) 持平;Lite 生成一張 1K 分辨率圖像的標準價是 0.034 美元,約合人民幣 0.25 元;100 張約 3.4 美元,折合人民幣二十多元,批量檔(指單次調用量達到閾值后觸發的自動折扣)還能再砍一半到 0.0168 美元。
區分給人用還是給系統用不只是看單價高低,而是價格結構。消費級產品按次付費、按張計費,貴但靈活;流水線定價的特征是:單價壓到足夠低,同時提供批量折扣(批量檔再砍一半),暗示調用方是按千次、萬次為單位消耗的。一個人一個月做不了1000張圖,但一個廣告系統一小時就能跑掉一萬張。這套定價不是讓用戶買得起,是讓系統虧得起。

圖:Nano Banana 2 Lite 與 Gemini Omni Flash 的組合工作流
這個價格標出來,幾乎是明牌告訴你,它是給流水線批量調用定的,不是給一個人偶爾作圖定的。

02
新一代的 Nano Banana 出圖方式已經變了。
出圖之前和過程中,模型會先花一部分算力去想構圖、檢查空間關系和物理是否合理、斟酌圖里的文字,然后才落筆,這跟老式擴散模型直接硬畫不一樣。這個想的過程要花時間。
Lite 的核心取舍,就是把大部分斟酌的步驟省掉,但也并不是完全放棄思考,官方依然顯示有 Thinking On。Thinking On 是谷歌官方生成截圖里標注的一個狀態字段,表示模型在輸出前啟動了內部推演機制,換句話說,就是前面說的“先在腦子里擺盤”的那個過程。憑訓練出來的直覺一步到位,省掉斟酌,就換來了 4 秒時間和和三分錢的價格。

圖:Google 對 Nano Banana 推理能力的官方表述
PRO 像一個接單的大廚,拿到一個新需求會先在腦子里擺盤、分析客戶的定制要求,再動手,慢,但講究。Lite 像大排檔炒飯的師傅,同一道菜炒過一萬遍,憑肌肉記憶直接出鍋,4秒上桌,圖個七十分管飽,客戶對它也本來就沒那么多定制訴求。這兩種做法沒有高下,區別只在于來吃飯的人要的是什么,是單純的填飽肚子,還是需要享受一頓美餐。
從這個角度看我們可以把傳統的用圖場景分為兩類:
一類是圖作為資產的場景。品牌主視覺、地鐵站和高端商場的大幅海報、電商詳情頁的首圖、影視海報、要印刷或者要放大長期使用的東西。這類圖會被反復細看、會被放大、承載品牌形象和商業風險,一個錯字或者一處崩壞放大之后就是事故。這類場景對質量有要求,得用 NB2 或者 PRO。
另一類是圖作為耗材的場景。比如教育里給學生看個大概的示意圖,信息流廣告里大批量做 A/B 測試、電商海量 SU 的占位圖,縮略圖草稿,表情包,個性化推薦里千人千面、用完即棄的圖。這類圖即用即棄、量大、看個大概就行,并且對成本非常敏感,質量超過一定閾值之后的收益很低,這應該就是 Lite 的主場。所以區分不在模型強弱,在用圖的人是誰。
這個判斷是不是站得住腳,不能靠猜。所以我們分了三個維度、六個場景,把 Nano Banana 家族的 Lite、NB2、PRO 和字節的 Seedream 4.5 放在同一套提示詞下并排跑了實測。

03
判斷標準很簡單:每個場景的圖最終要能用。不管它是給廣告投放、教學示意圖還是公眾號封面,能用就是及格線。在此之上再談好不好看。
我們實測分三組維度、每組兩個場景,一共六個場景。每個場景寫一份內容一致的提示詞,英文版喂 Nano Banana 家族(Lite、NB2、PRO),中文版喂字節的 Seedream 4.5。同一場景下四個模型并排出圖,Lite 是主要的測試對象,圖片滿意的那組再用 Omni Flash 把 Lite 出的圖做成視頻。所有調用走 API。只選Lite的圖做視頻,是因為這一輪測試的核心問題是'Lite+Omni Flash這條鏈路能不能跑通',NB2 和 PRO 的出圖質量已經足夠好,用它們做視頻反倒掩蓋了Lite在鏈路中的表現。
測試之前先看看官方披露的 Benchmark。

官方Benchmark數據展示
Lite 在質量上緊貼第一梯隊,價格和速度依然非常有優勢。
生成質量:Lite 雖然便宜,但從零畫圖的質量并不比貴幾倍的對手差。Lite 在從零生圖這項能力上得分 1251,只比自家高端版 NB2(1270)低了 19 分,但碾壓了它自己的初代產品(1151)、Flux 的低配版(1069)、馬斯克家的 Grok Imagine(1174)和字節的 SeedreamLite(1132)。
編輯質量:改圖這項能力,并不是 Lite 的強項。Lite 得分 1308,輸給了自家 NB2(1387),也被 Grok Imagine(1329)超過了。
延遲: Lite 的速度是碾壓級的,Lite 4 秒出圖,和 Flux 并列最快,NB2 要 20 秒,SeedreamLite 慢到 45 秒。
價格: Lite 單張 0.034 美元,比自家 NB2 的 0.067 便宜一半,但它并不是圖里最便宜的,Flux 2 Klein 9B 起價僅為 0.016 美元,只是質量上并不如 Lite。
從這幾個維度的 Benchmark 數據也可以看出,Lite不是最便宜的,但它在速度、質量、價格三者平衡上卻是最優的。這幾張官方圖里還有兩個彩蛋:
▎彩蛋1:Thinking On
Lite 有“Thinking On”,說明它不是完全放棄思考的傻瓜式生成,依然有內部推理過程,只是比 PRO 少了很多斟酌。
▎彩蛋2:從頭到尾沒有Nano Banana PRO
官方 Benchmark 里只對比了Lite、NB2、初代和競品,但 PRO 缺席了。潛臺詞可能是:PRO 定位的是專業級終稿,它的評分體系和這幾款不在一條賽道上,PRO 的得分放進來可能會讓對比失去意義。

04
▎場景一:高端快消品橫版大海報
這個場景的任務是給地鐵站或高端商場燈箱這種場景設計海報。提示詞故意設計了幾個難點:半空凝固的液體飛濺、凝露反光、電影級輪廓光、大量留白的編輯排版,以及三級中文文字,包括主標題、副標題、底角品牌細則小字。

從出圖的文字上來看,四家表現都沒出問題,這反而證明 NB2 Lite 的出圖質量還不錯。NB 2 和 NB PRO 有光影的應用細節,證實了在重度生產力端這兩個模型依舊有獨特的優勢。
從 Flash 生成的視頻上來看,瓶身細節表現還不錯,但主體之外的冰塊、檸檬就有些粗糙了,并且配樂和運鏡以及畫面切換節奏比較生硬。
▎場景二:無線耳機電商詳情首圖
我們在提示詞中要求生成正方形,白底的圖片,考驗產品保真度和小字標簽是否符合要求,在內容上也要能吸引用戶產生購買欲、表達產品核心賣點,本身對質量要求較高。

這一組四個模型輸出幾乎沒差別,如果盲測的話可能都難以分辨。文字清晰沒犯錯,產品細節和棚拍的效果都不錯。
視頻表現同樣中規中矩,畫面邏輯合理,運鏡絲滑。也許是棚拍產品概念圖本身不需要過多細節,反而落到了Omni Flash 的舒適區。
從這一組的測試中,我們也可以得出結論,資產場景的核心問題是容錯率太低,錯了就是事故,所以該用 PRO 還是得用 PRO。Lite 在這個維度上還沒有達到靠得住的標準。
測試維度 B,內容是耗材的場景:耗材場景里,Lite 是首選
▎場景三:初中生物線粒體結構示意圖
我們在提示詞中要求生成的圖片具有卡通風格,同時中文標注外膜、內膜、嵴、基質。這類圖老師只需要一個示意,需要不斷出新的類似圖片來匹配試卷和題目,學生們也只是看個大概就行,所以放在耗材圖片的場景里。

案例三:線粒體
文字較多的場景就發現 Lite 有些費勁了,基礎字體沒什么問題,但線粒體的嵴 (jí)字就亂碼了,Seedream4.5 的表現也一樣,NB2 還把內膜和外膜都標準反了。這說明在教學場景下,雖然內容是消耗品,但教育內容生僻字出現概率大且需要一定的嚴謹性,這類圖如果當作資產來對待,用 PRO 更穩妥。
視頻方面,用圖片直接搭管線跑出來的視頻反而增加了圖片沒有的標注,導致線粒體內膜被標了三次,其中包含一處標注錯誤和一處文字錯誤。好在基質顆粒和核糖體沒有溢出線粒體之外,整體物理邏輯是完整的。
▎場景四:夏季快干 T 恤的信息流促銷圖
我們在提示詞中的要求的是正方形,中文大字“夏日上新”加一行促銷文案,主要需求是夠用、量產、成本低。

案例四:T恤促銷
這場景基本就看需求和審美了,并且電商場景最重要的是能還原商品圖,本次架空測試屬于零生成的測試場景,僅從結果上來看 Lite 出的圖比較有視覺沖擊力,是大促或者低成本鋪量銷售的首選。NB 2 的出圖兼具真實性和美感,算是中間均衡派。NB PRO 雖然時間和單詞出圖成本最高,但 3D 假人和運動場景能滿足專業運動品牌的特定展示需求,是質量最高的一組。
Omni Flash 的視頻生成結果也沒什么毛病,音樂和運鏡已經圖片元素的解構和動畫效果都滿足場景需求
我們從這組測試中也可以得到結論:促銷圖、批量素材這類量大管飽的需求,Lite 幾乎是完美匹配,它生成的圖片夠快、夠便宜、夠好看。例外的是對于信息密度要求比較高的內容:生僻字和專業標注對準確性的要求,讓“耗材”變成了“資產”,Lite 翻車率太高,得換 PRO。
測試維度 C,介于資產和耗材之間的場景:裝飾用 Lite,信息用PRO
▎場景五:公眾號推文封面圖
我們要求生成一篇 Nano Banana 測評公眾號推文的封面題圖,橫版,把香蕉和科技元素結合,還有中文大標題,內容是選題的陪襯,用于輔助用戶理解,或單純給文章增加視覺多樣性。

案例五:公眾號封面
這類圖主要看賬號調性和排版需求,封面最重要的是直擊主題并吸引用戶點擊。本次屬于腦洞概念生成測試。僅從結果看,Lite 出的是傳統發光科技風,中規中矩,是快速配圖發文的首選。NB2 增加了“剝開香蕉看芯片”的創意,兼具質感與點題深度。PRO 反倒有些出乎意料地拉胯,把香蕉和電子紋路融合在一起,沒有任何邏輯關聯。這場景反而是 Lite 效果不錯,雖然也存在 AI 味依然很強,子標題也有重復的問題。
視頻表現還不錯,電子紋路動畫和香蕉融為一體,沒有不符合標準的圖像,聲音也合乎邏輯。
▎場景六:英偉達季度營收財經數據圖
我們要求生成一張英偉達季度營收的財經數據圖,橫版,柱狀圖加折線,中文標題加一堆數字和百分比標簽。

案例六:數據圖表
這組主要是測數據圖表生成,四個大框架都沒翻車。簡單來說:Lite 出圖最快,帶點科幻風,但里面小字有點糊,適合臨時隨便配個圖;NB 2 表現最亮眼,科技感和數據融合得很好,視覺效果拉滿但稍微有點用力過猛;PRO 最像正兒八經的金融財報,專業度拉滿,就是成本最高;Seedream 則是極簡PPT風,主打性價比,它的字和數字最清晰銳利(雖然橫軸日期邏輯出了點小bug)。
更適合作為自媒體B-roll(輔助素材,如產品特寫、數據圖表、街景空鏡、演示操作等)草稿,不適合直接做品牌級成片。
從這組的測試結果也可以看出:公眾號封面、配圖這類好看就行的需求,Lite 完全夠用。數據圖表這類需要有準確信息的需求,Lite 會編造數字、糊掉小字,拿去做 B-roll 湊合,但要直接發布就危險了。所以中間場景的分水嶺是:圖是裝飾還是信息載體?裝飾用 Lite,信息載體上用 PRO。

05
Nano Banana 2 Lite 還有另一個名字, Gemini 3.1 Flash-Lite Image。Google 也將它定位于高頻交互和大規模調用場景,本質上是用分辨率和部分復雜任務能力,換取更低的推理成本與延遲。
這種取舍也構成了它的能力邊界。Lite 只支持 1K 輸出,不支持 Google Search grounding,在小字、復雜信息圖和事實準確性上更容易暴露問題。實測中線粒體的“嵴”字亂碼、營收圖的數字編造,都與這一能力邊界一致。它能夠生成一張在視覺上符合類型特征的圖片,卻不能保證其中每個文字、數字和標簽都滿足事實約束。因此,Lite 更適合作為視覺工作流的候選生成層,而不是未經校驗直接交付終稿。
一條標準的自動化鏈路至少要包含四個環節:
第一層是生成。 Lite 根據提示詞、參考圖和結構化參數快速產生多張候選素材。它的任務是用低成本生成多張圖片,讓系統有更多結果可選。
第二層是自動校驗。 這一步是硬門檻。OCR 掃一遍標題和小字,規則程序核對價格、日期、參數,圖像相似度判斷商品主體有沒有跑偏,內容審核模型再過濾違規元素。只要踩了任何一條紅線,直接淘汰,根本不會到發布這步。
第三層是模型分流。 對構圖一般、風格不匹配但事實層沒有問題的圖片,可以繼續調用 Lite 重生成;對復雜排版、品牌主視覺和多參考圖一致性任務,則升級到 NB2 或 PRO。模型選擇不應在任務開始前固定,而應由風險和失敗類型動態決定。
第四層是人工驗收。 只有品牌資產、專業知識、商品真實性和公開數據等高風險內容,才進入人工審核。人的時間不再花在從零制作每一張圖,而是集中處理自動校驗無法覆蓋的邊界情況。
假設 Lite 一次生成十張候選只需要約 0.34 美元,但其中有三張存在文字或結構錯誤。如果系統可以自動淘汰,錯誤成本接近于零;如果每張都需要編輯逐一檢查,模型節省的生成費用很快就會被人工驗收時間抵消。因此,判斷 Lite 是否劃算,不能只比較每張 0.034 美元的圖片的生成成本,而要計算總成本。而總成本還包括自動校驗的成本、人工審核、返工、錯誤發布造成的風險成本。
在低風險、高重復、可自動驗證的任務里,生成成本仍然占據重要位置,Lite 的優勢能夠直接體現。到了數據圖表、教學插圖和品牌物料這類場景,生成費用可能只是總成本中最小的一項,錯誤檢測和責任成本才是主要變量。
Lite 真正的意義,是改變圖片在軟件系統中的角色:過去,圖片通常是由人制作并上傳的成品;現在,它可以像文本和接口返回值一樣,在 Agent 執行任務時被即時生成、篩選、丟棄和重做。視覺生成由獨立的創作動作,變成自動化工作流中的一個可調用環節。
當生成速度和價格繼續下降,系統的瓶頸也會從能否生成轉向能否控制錯誤。真正難以復制的,不是4秒出圖,而是針對不同任務建立風險分級、自動校驗和模式選擇:哪些素材可以直接使用,哪些需要升級到更強模型,哪些必須由確定性工具或人工完成。Lite 降低了候選素材的生成成本,卻沒有消除質量成本;它只是把質量控制從生成后的人工補救,前移成工作流內部的工程問題。
當一套系統每小時可以生成一萬張圖時,真正的技術問題已經不是能不能生成圖片,而是圖片生成之后的驗收這一步怎么來做。


上車,帶你看遍全球 AI 頂會精華
可獨家暢覽:
專家演講PPT
大會報告全文
熱門論文解讀
學術新星訪談

掃描上方二維碼
或點擊「閱讀原文」關注專區。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。