Mistral AI 发布 Agentic Search:五个工具让模型自己翻文件、跨来源比对
Mistral AI 于 2026-08-20 正式推出 Agentic Search,模型用 search/open/navigate/read/grep 五个工具反复穿梭长文件并跨来源验证,无需微调即可接入既有索引;FinanceBench 准确率由 26.7% 升至 86%,token 用量减少 23.9%。
2026 年 8 月 20 日,Mistral AI 在官网宣布 Agentic Search 正式上线(GA)。这是一套“代理式多步骤文档检索”能力:模型不再只靠一次向量检索把片段丢进上下文,而是拿到五个工具——search(搜索)、open(打开文档)、navigate(翻页定位)、read(读取段落)、grep(关键字比对)——反复执行“搜→开→翻页→读→比对”,在长文档里来回穿梭,并跨多份来源互相验证后才作答。官方强调三点:
- 无需针对模型做微调。
- 可以直接接入企业既有的搜索索引。
- 通过 Mistral Search Toolkit 与 Libraries 在 Studio 与 Vibe 同步可用,另附 Search Starter App 供快速起步。
benchmark 数字:准确率翻倍以上,成本反而下降
Mistral 公布两组测试结果(均为完整代理循环、含翻页工具的设定):
- FinanceBench(368 份 SEC 申报文件、150 题):Mistral Medium 3.5 准确率从 26.7% 提升到 86%,token 用量减少 23.9%,p90 延迟从 255 秒缩短到 154 秒。
- OfficeQA Pro(696 份美国财政部公报、133 题):GLM-5.2 准确率提升 45.6 个百分点,由 6.3% 来到 51.9%。
第二组刻意用非 Mistral 自家模型,用意在证明这套工具流程是“模型无关”的架构改良,而非某一款模型的特调。
技术意义:从“一次捞片段”到“像人一样查资料”
传统 RAG 的瓶颈在于检索只做一次,片段切得太碎就失去上下文、切得太大又塞爆窗口,答案分散在多份文档时更常答错。Agentic Search 把检索变成多轮决策:先搜到候选文档,打开后翻到相关章节,细读不够再 grep 比对数字,发现矛盾就去另一份来源核对。准确率大幅提升的同时 token 反而减少,原因正是“只读需要的页”,而非把整包文档硬塞进上下文。
与既有布局的关系
回看 Mistral 今年路线:4 月 Medium 3.5 与 Vibe CLI、5 月 Le Chat 更名 Vibe、6 月 OCR 4、8 月初 Shieldstral 安全层,这次 Agentic Search 补上“企业文档深读”这一环。它选择开放接入既有索引而非绑定自家向量库,对已建好知识库的企业门槛较低。
对管理者的意义
对要从合同、财报、标书文件、法规公报中找答案的管理者来说,这类工具的关键不是“答得快”而是“答得有据”——模型会告诉你翻了哪几份、对了哪几页。评估导入时可先拿自己最常查错的一类文档做 30 题小测,比较人工答案与模型答案的一致率,再决定是否接入既有索引。