Mistral AI 發布 Agentic Search:五個工具讓模型自己翻文件、跨來源比對
Mistral AI 於 2026-08-20 正式推出 Agentic Search,模型用 search/open/navigate/read/grep 五個工具反覆穿梭長文件並跨來源驗證,不需微調即可接既有索引;FinanceBench 準確率由 26.7% 升至 86%,token 用量減少 23.9%。
2026 年 8 月 20 日,Mistral AI 在官網宣布 Agentic Search 正式上線(GA)。這是一套「代理式多步驟文件檢索」能力:模型不再只靠一次向量檢索把片段丟進上下文,而是拿到五個工具——search(搜尋)、open(開啟文件)、navigate(翻頁定位)、read(讀取段落)、grep(關鍵字比對)——反覆執行「搜→開→翻頁→讀→比對」,在長文件裡來回穿梭,並跨多份來源互相驗證後才作答。官方強調三點:
- 不需要針對模型做微調。
- 可以直接接上企業既有的搜尋索引。
- 透過 Mistral Search Toolkit 與 Libraries 在 Studio 與 Vibe 同步可用,另附 Search Starter App 供快速起步。
benchmark 數字:準確率翻倍以上,成本反而下降
Mistral 公布兩組測試結果(皆為完整代理循環、含翻頁工具的設定):
- FinanceBench(368 份 SEC 申報書、150 題):Mistral Medium 3.5 準確率從 26.7% 提升到 86%,token 用量減少 23.9%,p90 延遲從 255 秒縮短到 154 秒。
- OfficeQA Pro(696 份美國財政部公報、133 題):GLM-5.2 準確率提升 45.6 個百分點,由 6.3% 來到 51.9%。
第二組刻意用非 Mistral 自家模型,用意在證明這套工具流程是「模型無關」的架構改良,而非某一款模型的特調。
技術意義:從「一次撈片段」到「像人一樣查資料」
傳統 RAG 的瓶頸在於檢索只做一次,片段切得太碎就失去上下文、切得太大又塞爆窗口,答案分散在多份文件時更常答錯。Agentic Search 把檢索變成多輪決策:先搜到候選文件,打開後翻到相關章節,細讀不夠再 grep 比對數字,發現矛盾就去另一份來源核對。準確率大幅提升的同時 token 反而減少,原因正是「只讀需要的頁」,而非把整包文件硬塞進上下文。
與既有佈局的關係
回看 Mistral 今年路線:4 月 Medium 3.5 與 Vibe CLI、5 月 Le Chat 更名 Vibe、6 月 OCR 4、8 月初 Shieldstral 安全層,這次 Agentic Search 補上「企業文件深讀」這一環。它選擇開放接既有索引而非綁定自家向量庫,對已建好知識庫的企業門檻較低。
對管理者的意義
對要從合約、財報、標案文件、法規公報中找答案的管理者來說,這類工具的關鍵不是「答得快」而是「答得有據」——模型會告訴你翻了哪幾份、對了哪幾頁。評估導入時可先拿自己最常查錯的一類文件做 30 題小測,比較人工答案與模型答案的一致率,再決定是否接上既有索引。