Mistral 发布 Agentic Search:面向企业文档的智能体检索,准确率与引用完整性双提升
发布时间:2026年08月22日 10:00:008月22日 Mistral AI 官方博客发布 Agentic Search,一款面向企业知识库与文档场景的智能体式检索产品,通过将传统 RAG 升级为多步检索-推理循环,在法律、合规、研发文档等场景下准确率平均提升 35%,引用缺失率从 18% 降至 4%,可通过 Mistral AI Studio 与 Agents API 直接接入。
Mistral 发布 Agentic Search:面向企业文档的智能体检索,准确率与引用完整性双提升
巴黎时间 8 月 22 日早间,Mistral AI 官方博客正式发布了全新的企业产品 Agentic Search。这款产品将传统检索增强生成(RAG)从「检索一次就回答」升级为「多步检索—推理循环的智能体过程」,在法律合同、合规审计、研发知识库、采购文档等对准确性要求极高的企业场景中,官方数据显示准确率平均提升 35%,引用缺失率(即回答中声称有来源但实际查不到对应原文片段的比例)从 18% 降至 4%。
为什么传统 RAG 在企业文档中总是差一口气
过去两年,RAG 已成为企业落地大模型最常见的模式。但大量企业客户反馈在复杂文档场景下仍有明显痛点:
- 跨文档推理不足:一个结论可能散落在合同正文 + 两个附件 + 一份历史修订记录中,单次 top-K 检索抓不齐;
- 无法处理歧义问题:用户问「这份采购订单中 2026 年 Q4 的付款条款是什么」,系统需要先定位订单编号、再判断日期口径、再从正文与附录中综合条款,无法用一次语义检索搞定;
- 幻觉与引用完整性:为了让输出流畅,很多 RAG 系统会在引用片段衔接处自动补一些过渡句,容易被内部审计或外部合规人员质疑「来源不明」。
Mistral 产品博客中直接引述了一位法国 CAC 40 成分公司法务负责人的反馈:「我们去年部署过两款主流 RAG 产品,最后都因为『回答看起来对、但在合规抽查中找不到引用原文』而停用。」
Agentic Search 的核心架构:检索循环 + 子任务拆解 + 引用账本
Agentic Search 在底层把「回答一个问题」变成了一段可审计的智能体执行过程。其核心包含三层:
1. 子任务分解层(Query Decomposer)
输入用户问题后,系统首先产出一组可独立执行、可分别验证的子问题。例如对于「XX 合同 Q4 付款条款」,会被拆解为:
- 找到合同主体文档与编号;
- 判断合同中的「季度」口径是自然季度还是财政季度;
- 抽取 Q4 付款条款(时间节点、金额比例、付款条件、罚息);
- 检查是否有附件、修订条款对 Q4 付款进行了修改;
- 汇总并输出引用。
Mistral 在博客中称,这一拆解过程由 Mistral Large 3 的 675B MoE 版本执行,使用了专门在 20 万份法务合同上微调得到的「查询拆解 LoRA」。
2. 多步检索-推理循环(Retrieve → Judge → Rewrite Loop)
对每一个子问题,系统进入「检索—判断—改写查询—再检索」的循环,直到智能体自我判定「当前已有材料足以回答本子问题」为止。与一次 top-K 检索不同:
- 每次检索后,智能体会根据已拿到的片段重新改写下一次查询(例如:从「付款条款」改写为「Q4 逾期付款罚息 Annex B」);
- 每一轮检索结果都会被单独打上「证据 ID」,最终输出的每个结论都绑定一串证据链。
公开数据显示:典型企业复杂问题会经历 3–6 轮 循环,单问题总耗时约 2–5 秒,显著慢于一次 RAG(约 0.5 秒),但符合法务、合规等场景「慢但准」的需求。
3. 引用账本(Citation Ledger)
Agentic Search 在最终输出中引入了一个类似「会计分录」的结构:每一句断言都显式绑定到若干「证据 ID + 原文片段 + 文档位置」,并提供「点击跳转原文」的 UI。对于最终回答中没有直接绑定到引用账本的任何文本,系统会自动在旁边打上「未经文档证据支持的 AI 推断,仅供参考」标签。
这一设计直接回应了合规场景的核心痛点:让 AI 输出在形式上可审计、可抽查。
基准测试:35% 准确率提升与 4% 引用缺失率
Mistral 同时公开了一份由第三方咨询公司参与评估的基准报告。测试集包含 1,200 个 来自 8 家大型欧洲企业真实文档场景的人工标注问题,覆盖法律、合规、研发、采购四类文档。关键指标如下:
| 指标 | 传统 RAG(基线) | Agentic Search | 变化 |
|---|---|---|---|
| 回答准确率(人工专家打分) | 61% | 96% | +35 pp |
| 引用缺失率(无来源断言比例) | 18% | 4% | -14 pp |
| 平均回答长度 | 158 字 | 231 字 | +46% |
| 平均检索轮数 | 1 轮 | 4.2 轮 | — |
| 端到端平均时延 | 0.52 s | 3.6 s | 变慢但合规场景可接受 |
需要注意的是,本次测试对比的是 Mistral Large 3 分别在一次 RAG 与 Agentic Search 两种管线中的表现,因此差异主要来自「检索—推理范式」而非底层模型本身。
接入方式与定价
Agentic Search 已随 Mistral AI Studio 最新版本上线,并同步开放给 Mistral Agents API 的调用方。企业接入路径:
- Studio 低代码路径:上传 PDF / DOCX / HTML / Markdown 等 16 种格式文档,系统自动完成分块与向量化;在界面中配置检索策略、是否允许多步循环、引用账本样式;
- API 全代码路径:通过
mistral.search.start()发起会话,支持中途人工介入打断、注入外部检索结果; - 私有化路径:通过与 IBM watsonx 的合作,可部署在企业自有基础设施中;与 Airbus / BMW 的制造场景私有化版本已在 6 月先行试点。
定价方面采用「每千次智能体运行 + 索引存储」模式:起步价约为每千次问题回答 18 欧元,相比一次性 RAG 的每千次 2–3 欧元显著更贵,但目标场景是合规等高价值问答,因此在早期客户反馈中并未因价格被拒。
行业意义:Mistral 从「卖模型」走向「卖解决方案组件」
Mistral 以高效开源模型起家,过去业界对它的印象往往停留在「参数效率不错的欧洲 LLM 厂商」。但从 Codestral(代码专用)→ Pixtral(多模态)→ Voxtral TTS → Agents API → 今天的 Agentic Search 这条产品线可以看出,Mistral 正在完成从「模型供应商」到「企业 AI 平台组件供应商」的转型。
分析师指出,这一转型与 Mistral 的资本结构高度相关:ASML(光刻机巨头)领投了其 C 轮,而 ASML 背后是大量制造、半导体、科研客户——Agentic Search 的文档检索能力与 Mistral 已发布的制造 AI 方案在客户面上高度重合。对中国同行而言,值得关注的一点是:当国内厂商仍在比拼「谁家通用模型基准榜更高」时,Mistral 已经在一条「垂直问题 × 引用可审计 × 私有化部署」的高利润路径上快速前进。
一句话总结:Agentic Search 的出现标志着企业 AI 搜索从「拼 top-K 效果的简单 RAG 时代」正式进入「拼多步检索推理与合规可审计的智能体时代」。