Google DeepMind 發表 Agentic Vision:Gemini 3 Flash 學會「反覆放大檢查」再作答
Google DeepMind 於 2026 年 1 月 30 日發表 Agentic Vision,讓 Gemini 3 Flash 具備結合視覺推理與程式碼執行的新影像理解能力,可自主反覆縮放、裁切、標註影像以驗證細節,而非一次掃描就給答案。
Google DeepMind 於 2026 年 1 月 30 日發表新功能 Agentic Vision,內建於 Gemini 3 Flash 模型。這項功能的核心是讓模型在處理影像任務時,不再只是「看一眼、憑印象回答」,而是能像人類仔細檢視照片一樣,主動對影像進行反覆的縮放(zoom)、裁切(crop)與標註(annotate),透過多輪操作逐步驗證細節後才給出最終答案。
技術上,Agentic Vision 把「視覺推理」與「程式碼執行」綁在一起:模型會即時生成程式碼指令,對輸入影像進行局部放大或框選特定區域,重新讀取放大後的像素內容,再把結果送回推理鏈,判斷是否需要再次操作或已可下結論。這種「觀察—操作—再觀察」的迴圈,是本次發表最主要的技術亮點。
技術意義:從單次辨識到多輪自我查核
過去的影像模型多半屬於「單次推論」(single-pass)架構——輸入一張圖,模型輸出一個結果,中間沒有回頭確認的機制。這種方式在圖片解析度高、細節密集(例如密密麻麻的圖表數字、遠處的標示牌文字、產品瑕疵的微小紋理)時,容易因為壓縮取樣或注意力分散而看漏關鍵資訊。Agentic Vision 的做法等於賦予模型「自己動手把畫面拉近再看一次」的能力,本質上是把視覺任務也納入了近年 AI 模型流行的「主動規劃、反覆驗證」(agentic)工作模式,而不再是傳統的一次性感知任務。
與前代及同業比較:影像理解的競賽轉向「精確度」
相較於 Gemini 前代模型或市面上多數影像模型只能對整張圖做一次性描述,Agentic Vision 把重點放在「精確驗證」而非「大致描述」。這也呼應了近期整個產業的走向:多家主要 AI 廠商過去一年都在強化模型的「工具使用」與「自我檢查」能力(例如反覆執行程式碼確認答案),Google 這次等於是把同樣的邏輯搬進了影像理解領域。對於需要辨讀高解析度圖表、密集文字或細微瑕疵的應用場景,這種「能回頭放大確認」的模型架構,可望比傳統一次性辨識模型更不容易出現「看錯、看漏」的錯誤。
業界反應:實用場景聚焦在「細節不能錯」的工作
發表後,業界討論多集中在幾類對「看清楚細節」有高度要求的應用:品質檢驗中辨識微小瑕疵、盤點作業中清點密集堆疊的貨品數量、直播畫面中即時核對商品標示或使用者留言截圖裡的關鍵資訊、工地現場照片判讀安全隱患或進度標記等。這些場景的共同點,是「錯認一個細節」的代價遠高於「多花幾秒鐘反覆確認」,因此 Agentic Vision 這種犧牲一點速度換取精確度的設計方向,被視為切中實際痛點。
對管理者而言,這則新聞真正值得留意的不是「多一個 AI 功能」,而是影像 AI 正從「快速但可能出錯的一眼判斷」轉向「較慢但可交叉驗證的仔細檢查」。若團隊有大量依賴人工目視確認的流程(品管抽驗、盤點清點、工地巡檢紀錄),這類新一代影像模型值得列入下一輪工具評估的觀察名單,但仍建議先用真實現場照片小規模測試準確率,再決定是否導入既有流程。