专栏 AI 管理编年史 第 244/303 讲 查看课程目录

Mistral AI 发布 Agentic Search:五个工具让模型自己翻文件、跨来源比对

28/08/2026 224
3:52
Mistral AI 发布 Agentic Search:五个工具让模型自己翻文件、跨来源比对
图/Photo by Koda Bookkeeping on Unsplash

Mistral AI 于 2026-08-20 正式推出 Agentic Search,模型用 search/open/navigate/read/grep 五个工具反复穿梭长文件并跨来源验证,无需微调即可接入既有索引;FinanceBench 准确率由 26.7% 升至 86%,token 用量减少 23.9%。

2026 年 8 月 20 日,Mistral AI 在官网宣布 Agentic Search 正式上线(GA)。这是一套“代理式多步骤文档检索”能力:模型不再只靠一次向量检索把片段丢进上下文,而是拿到五个工具——search(搜索)、open(打开文档)、navigate(翻页定位)、read(读取段落)、grep(关键字比对)——反复执行“搜→开→翻页→读→比对”,在长文档里来回穿梭,并跨多份来源互相验证后才作答。官方强调三点:

  • 无需针对模型做微调。
  • 可以直接接入企业既有的搜索索引。
  • 通过 Mistral Search Toolkit 与 Libraries 在 Studio 与 Vibe 同步可用,另附 Search Starter App 供快速起步。

benchmark 数字:准确率翻倍以上,成本反而下降

Mistral 公布两组测试结果(均为完整代理循环、含翻页工具的设定):

  • FinanceBench(368 份 SEC 申报文件、150 题):Mistral Medium 3.5 准确率从 26.7% 提升到 86%,token 用量减少 23.9%,p90 延迟从 255 秒缩短到 154 秒。
  • OfficeQA Pro(696 份美国财政部公报、133 题):GLM-5.2 准确率提升 45.6 个百分点,由 6.3% 来到 51.9%。

第二组刻意用非 Mistral 自家模型,用意在证明这套工具流程是“模型无关”的架构改良,而非某一款模型的特调。

技术意义:从“一次捞片段”到“像人一样查资料”

传统 RAG 的瓶颈在于检索只做一次,片段切得太碎就失去上下文、切得太大又塞爆窗口,答案分散在多份文档时更常答错。Agentic Search 把检索变成多轮决策:先搜到候选文档,打开后翻到相关章节,细读不够再 grep 比对数字,发现矛盾就去另一份来源核对。准确率大幅提升的同时 token 反而减少,原因正是“只读需要的页”,而非把整包文档硬塞进上下文。

与既有布局的关系

回看 Mistral 今年路线:4 月 Medium 3.5 与 Vibe CLI、5 月 Le Chat 更名 Vibe、6 月 OCR 4、8 月初 Shieldstral 安全层,这次 Agentic Search 补上“企业文档深读”这一环。它选择开放接入既有索引而非绑定自家向量库,对已建好知识库的企业门槛较低。

对管理者的意义

对要从合同、财报、标书文件、法规公报中找答案的管理者来说,这类工具的关键不是“答得快”而是“答得有据”——模型会告诉你翻了哪几份、对了哪几页。评估导入时可先拿自己最常查错的一类文档做 30 题小测,比较人工答案与模型答案的一致率,再决定是否接入既有索引。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 DeepSeek 主力模型线首次支持视觉:V4-Flash-Vision-Exp 上线 API

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策