xAI 發表 Grok-1.5 Vision,首個具視覺能力的 Grok 版本
xAI 於2024年4月12日發表 Grok-1.5 Vision,是 Grok 系列首個具備視覺理解能力的版本,可解析文件、圖表、截圖與照片,目前僅開放受邀測試。
2024年4月12日,馬斯克旗下人工智慧公司 xAI 發表 Grok-1.5 Vision(簡稱 Grok-1.5V),這是 Grok 系列模型首次具備視覺輸入能力。根據 xAI 官方部落格說明,Grok-1.5V 能夠處理多樣化的視覺資訊,包括文件、圖表、螢幕截圖與一般照片,並可針對真實場景圖片回答問題,甚至能將手繪或截圖中的圖表轉換成可執行的程式碼。目前 Grok-1.5V 僅開放少數受邀用戶測試,尚未對外公開發布,一般使用者暫時無法透過 X(原 Twitter)平台的 Grok 功能使用此視覺能力。
技術意義:Grok 補齊多模態的最後一塊拼圖
在此之前,Grok 系列(包含3月17日開源的 Grok-1 與3月29日發表、以長上下文為賣點的 Grok-1.5)都僅限文字輸入輸出,缺乏視覺理解能力,這使其在功能完整度上明顯落後於 OpenAI 的 GPT-4V、Google 的 Gemini 系列。Grok-1.5V 的推出,代表 xAI 正式跨入多模態賽局,補上文字模型長期缺乏的「看」的能力。值得注意的是,官方特別強調其對文件、圖表與螢幕截圖的解析能力,而不僅是辨識照片內容,顯示 xAI 有意瞄準商務辦公與資料分析場景,而非單純的圖片問答娛樂應用。
與競品比較:起步較晚但目標明確
相較於 GPT-4V(2023年即整合進 ChatGPT)與 Gemini 系列的多模態能力,Grok-1.5V 的發表時間明顯較晚,且目前僅供受邀測試,尚無公開產品或 API 可供外部驗證其真實表現。不過從官方展示的案例來看,Grok-1.5V 主打「將圖表轉換為可執行程式碼」的能力,這與其他視覺模型單純描述圖片內容的路線略有差異,顯示 xAI 試圖在辦公室文件理解與資料視覺化這個較窄但實用的切入點上做出區隔,而非與 GPT-4V、Gemini 進行全面性的視覺理解對決。
業界反應:測試階段,效能仍待驗證
由於 Grok-1.5V 目前僅限邀請制的小範圍測試,外界尚無法透過標準化評測來驗證其真實能力,業界普遍抱持觀望態度。多數討論聚焦於 xAI 在短短不到一個月內(從純文字的 Grok-1.5 到具備視覺能力的 Grok-1.5V)推進模型能力的速度,但也有評論指出,「受邀測試、未公開發布」的模式,使得這次發表較偏向技術路線圖的宣示,而非實際可用的產品里程碑。
對管理者的意義
對管理者而言,這則新聞的重點不在於立即可用的工具,而在於一個明確的技術趨勢:AI 讀懂「螢幕截圖、報表、圖表」正逐漸成為各家模型的標準配備,未來把手機拍的現場照片、系統截圖、手寫報表直接丟給 AI 問問題或轉成資料,會愈來愈普及、愈來愈不需要額外開發。現階段可以留意的是,當 Grok 或同類視覺模型正式對外開放後,是否能真正省去「人工謄寫圖表數據」這類重複性工作。