AI资讯

Mistral 发布 Agentic Search:面向企业文档的智能体检索,准确率与引用完整性双提升

发布时间:2026年08月22日 10:00:00

8月22日 Mistral AI 官方博客发布 Agentic Search,一款面向企业知识库与文档场景的智能体式检索产品,通过将传统 RAG 升级为多步检索-推理循环,在法律、合规、研发文档等场景下准确率平均提升 35%,引用缺失率从 18% 降至 4%,可通过 Mistral AI Studio 与 Agents API 直接接入。


Mistral 发布 Agentic Search:面向企业文档的智能体检索,准确率与引用完整性双提升

巴黎时间 8 月 22 日早间,Mistral AI 官方博客正式发布了全新的企业产品 Agentic Search。这款产品将传统检索增强生成(RAG)从「检索一次就回答」升级为「多步检索—推理循环的智能体过程」,在法律合同、合规审计、研发知识库、采购文档等对准确性要求极高的企业场景中,官方数据显示准确率平均提升 35%,引用缺失率(即回答中声称有来源但实际查不到对应原文片段的比例)从 18% 降至 4%

为什么传统 RAG 在企业文档中总是差一口气

过去两年,RAG 已成为企业落地大模型最常见的模式。但大量企业客户反馈在复杂文档场景下仍有明显痛点:

  1. 跨文档推理不足:一个结论可能散落在合同正文 + 两个附件 + 一份历史修订记录中,单次 top-K 检索抓不齐;
  2. 无法处理歧义问题:用户问「这份采购订单中 2026 年 Q4 的付款条款是什么」,系统需要先定位订单编号、再判断日期口径、再从正文与附录中综合条款,无法用一次语义检索搞定;
  3. 幻觉与引用完整性:为了让输出流畅,很多 RAG 系统会在引用片段衔接处自动补一些过渡句,容易被内部审计或外部合规人员质疑「来源不明」。

Mistral 产品博客中直接引述了一位法国 CAC 40 成分公司法务负责人的反馈:「我们去年部署过两款主流 RAG 产品,最后都因为『回答看起来对、但在合规抽查中找不到引用原文』而停用。」

Agentic Search 的核心架构:检索循环 + 子任务拆解 + 引用账本

Agentic Search 在底层把「回答一个问题」变成了一段可审计的智能体执行过程。其核心包含三层:

1. 子任务分解层(Query Decomposer)

输入用户问题后,系统首先产出一组可独立执行、可分别验证的子问题。例如对于「XX 合同 Q4 付款条款」,会被拆解为:

  • 找到合同主体文档与编号;
  • 判断合同中的「季度」口径是自然季度还是财政季度;
  • 抽取 Q4 付款条款(时间节点、金额比例、付款条件、罚息);
  • 检查是否有附件、修订条款对 Q4 付款进行了修改;
  • 汇总并输出引用。

Mistral 在博客中称,这一拆解过程由 Mistral Large 3 的 675B MoE 版本执行,使用了专门在 20 万份法务合同上微调得到的「查询拆解 LoRA」。

2. 多步检索-推理循环(Retrieve → Judge → Rewrite Loop)

对每一个子问题,系统进入「检索—判断—改写查询—再检索」的循环,直到智能体自我判定「当前已有材料足以回答本子问题」为止。与一次 top-K 检索不同:

  • 每次检索后,智能体会根据已拿到的片段重新改写下一次查询(例如:从「付款条款」改写为「Q4 逾期付款罚息 Annex B」);
  • 每一轮检索结果都会被单独打上「证据 ID」,最终输出的每个结论都绑定一串证据链。

公开数据显示:典型企业复杂问题会经历 3–6 轮 循环,单问题总耗时约 2–5 秒,显著慢于一次 RAG(约 0.5 秒),但符合法务、合规等场景「慢但准」的需求。

3. 引用账本(Citation Ledger)

Agentic Search 在最终输出中引入了一个类似「会计分录」的结构:每一句断言都显式绑定到若干「证据 ID + 原文片段 + 文档位置」,并提供「点击跳转原文」的 UI。对于最终回答中没有直接绑定到引用账本的任何文本,系统会自动在旁边打上「未经文档证据支持的 AI 推断,仅供参考」标签。

这一设计直接回应了合规场景的核心痛点:让 AI 输出在形式上可审计、可抽查。

基准测试:35% 准确率提升与 4% 引用缺失率

Mistral 同时公开了一份由第三方咨询公司参与评估的基准报告。测试集包含 1,200 个 来自 8 家大型欧洲企业真实文档场景的人工标注问题,覆盖法律、合规、研发、采购四类文档。关键指标如下:

指标传统 RAG(基线)Agentic Search变化
回答准确率(人工专家打分)61%96%+35 pp
引用缺失率(无来源断言比例)18%4%-14 pp
平均回答长度158 字231 字+46%
平均检索轮数1 轮4.2 轮
端到端平均时延0.52 s3.6 s变慢但合规场景可接受

需要注意的是,本次测试对比的是 Mistral Large 3 分别在一次 RAG 与 Agentic Search 两种管线中的表现,因此差异主要来自「检索—推理范式」而非底层模型本身。

接入方式与定价

Agentic Search 已随 Mistral AI Studio 最新版本上线,并同步开放给 Mistral Agents API 的调用方。企业接入路径:

  • Studio 低代码路径:上传 PDF / DOCX / HTML / Markdown 等 16 种格式文档,系统自动完成分块与向量化;在界面中配置检索策略、是否允许多步循环、引用账本样式;
  • API 全代码路径:通过 mistral.search.start() 发起会话,支持中途人工介入打断、注入外部检索结果;
  • 私有化路径:通过与 IBM watsonx 的合作,可部署在企业自有基础设施中;与 Airbus / BMW 的制造场景私有化版本已在 6 月先行试点。

定价方面采用「每千次智能体运行 + 索引存储」模式:起步价约为每千次问题回答 18 欧元,相比一次性 RAG 的每千次 2–3 欧元显著更贵,但目标场景是合规等高价值问答,因此在早期客户反馈中并未因价格被拒。

行业意义:Mistral 从「卖模型」走向「卖解决方案组件」

Mistral 以高效开源模型起家,过去业界对它的印象往往停留在「参数效率不错的欧洲 LLM 厂商」。但从 Codestral(代码专用)→ Pixtral(多模态)→ Voxtral TTS → Agents API → 今天的 Agentic Search 这条产品线可以看出,Mistral 正在完成从「模型供应商」到「企业 AI 平台组件供应商」的转型。

分析师指出,这一转型与 Mistral 的资本结构高度相关:ASML(光刻机巨头)领投了其 C 轮,而 ASML 背后是大量制造、半导体、科研客户——Agentic Search 的文档检索能力与 Mistral 已发布的制造 AI 方案在客户面上高度重合。对中国同行而言,值得关注的一点是:当国内厂商仍在比拼「谁家通用模型基准榜更高」时,Mistral 已经在一条「垂直问题 × 引用可审计 × 私有化部署」的高利润路径上快速前进。

一句话总结:Agentic Search 的出现标志着企业 AI 搜索从「拼 top-K 效果的简单 RAG 时代」正式进入「拼多步检索推理与合规可审计的智能体时代」。