xAI 發表 Grok 4.3 Beta:新增原生影片輸入與對話內生成簡報
xAI 於2026年4月17日釋出 Grok 4.3 Beta,新增原生影片輸入理解能力,並可直接在對話介面中生成簡報投影片,免切換其他工具。
xAI 於2026年4月17日透過官方部落格與 X 平台發表 Grok 4.3 Beta,這是 Grok 4 系列自今年稍早推出以來的重要更新版本。此次更新的兩項核心新功能,分別是「原生影片輸入處理能力」與「對話介面內建簡報投影片生成」,兩者都直接對準日常辦公場景,而非單純的模型能力跑分競賽。
所謂原生影片輸入,代表 Grok 4.3 Beta 可直接接收使用者上傳的影片檔案作為輸入,並對內容進行理解、摘要與問答,不需事先轉成逐格截圖或文字稿。使用者可上傳會議錄影、產線監控片段或產品展示影片,直接請 Grok 描述畫面事件、指出特定時間點內容,或提出後續問題。簡報生成功能則是使用者只要在對話框描述需求,例如「幫我做一份三頁的季度營運簡報」,Grok 便能直接在同一對話介面產出投影片內容,不必再匯出到 PowerPoint 或 Keynote 手動排版。
技術意義:從「拆解」走向「原生理解」
過去多數模型處理影片,是先由外部工具切成關鍵影格或轉成文字稿,模型再分析這些「代理資料」,本質仍是文字或靜態圖像模型。Grok 4.3 Beta 的「原生影片輸入」意味著模型架構本身能直接處理時間序列視覺訊號,理論上可捕捉影格間的動作連續性與聲畫對應關係。這類原生多模態能力是 Google DeepMind、OpenAI、Anthropic 近年都在推進的方向,Grok 4.3 Beta 的加入代表這場多模態競賽又多一位參賽者。
與競品比較:把生成結果留在對話裡
簡報生成本身非新概念,市面已有 Gamma、Tome 等專門工具。Grok 4.3 Beta 的差異在於把功能直接內建於既有通用對話介面,使用者不需跳轉到專門工具重新描述需求,這與 OpenAI 近期把程式碼執行、圖片編輯整合進 ChatGPT 主介面的方向一致,反映各家正把 AI 助理推向「一站式工作台」定位。
業界反應:留存與黏著度的競逐
將影片理解與簡報生成收進同一對話視窗,實質效果是延長使用者在單一平台完成任務的比例,減少跳轉其他 SaaS 工具的機會。這呼應近期業界觀察:AI 對話產品的競爭重心已從「回答準不準」,轉向「能否把原本要開好幾個軟體才能做完的事收攏在同一介面完成」。
對管理者而言,這則新聞的意義在於:影片與簡報這兩類過去仍需人工整理的素材,正逐步被 AI 工具收進日常對話流程,值得留意團隊在會議紀錄整理、產線監看回顧、內部簡報草擬等環節,是否已有可以省下的手工步驟。