伦敦 Inherent 发布 Faraday 智能体:27B 小模型论文复现能力击败 GPT-5.5 与 Claude Opus 4.8,刚完成 5000 万美元种子轮
发布时间:2026年08月23日 11:00:00由前 DeepMind 员工创立的伦敦 AI 实验室 Inherent 于 8 月 23 日公开智能体系统 Faraday——仅基于 270 亿参数的 Qwen 3.6 开源小模型,在已发表科学论文自主复现基准中击败 OpenAI GPT-5.5 与 Anthropic Claude Opus 4.8,所需算力仅为前沿模型的 1/30–1/50;公司同步宣布刚完成 5000 万美元种子轮融资,「小模型 + 专用智能体管线」范式进一步挑战堆参数的单一前沿路线。
伦敦 Inherent 发布 Faraday 智能体:27B 小模型论文复现能力击败 GPT-5.5 与 Claude Opus 4.8,刚完成 5000 万美元种子轮
伦敦时间 8 月 23 日上午,由多位 前 DeepMind 核心研究员与工程负责人 联合创立的 AI 实验室 Inherent 正式公开了其首款产品级智能体系统 Faraday,同步披露已在数周前低调完成 5000 万美元种子轮融资。Faraday 最引人注目的核心卖点是:它并没有自研超大规模前沿模型,而是仅基于 270 亿参数的阿里 Qwen 3.6 开源小模型作为基座,搭配一套专门为「科学论文自主复现」设计的 Agent 管线与仿真验证器,在独立基准测试中击败了 OpenAI GPT-5.5 与 Anthropic Claude Opus 4.8,而单次任务所需算力仅为前沿闭源模型的 1/30–1/50。
Inherent 创始团队:前 DeepMind 员工的二次创业
根据官方通稿与英国公司注册处公开信息,Inherent 由 4 位前 DeepMind 员工 于 2025 年 7 月创立:
- 联合创始人兼 CEO:曾是 AlphaFold 系列的核心工程负责人,主导了 AlphaFold 2 到 AlphaFold 3 的推理管线重构;
- 联合创始人兼 CTO:前 DeepMind 推理基础设施高级主管,负责过大模型分布式推理与大规模 RL 评估集群;
- 联合创始人兼首席科学家:前 DeepMind 强化学习研究科学家,在 AlphaTensor 与基础算法智能体方向上有 6 篇 Nature/Science 论文;
- 联合创始人兼首席运营官:前 DeepMind 商业化部门欧洲生命科学行业负责人,有 10 年以上将 AI 科研结果转化为制药 / 材料行业解决方案的经验。
「我们在 DeepMind 亲眼看到,真正在生物、化学、材料实验室里帮科学家做出成果的 AI 系统,基座模型的参数规模从来不是决定成败的首要因素,决定成败的是:工具链的正确性、实验复现流程的鲁棒性、以及能否自动完成从『读论文』到『跑通实验代码』再到『验证数值一致性』的全闭环。」——CEO 在 8 月 23 日的伦敦发布会上如是说。
Faraday 智能体的工作原理:四层闭环,专为论文复现设计
Faraday 并不是一个通用聊天机器人,而是一套专门为「给定一篇已发表论文的 PDF / arXiv 链接,自主完成实验环境搭建 + 代码实现 + 结果验证并输出复现报告」的垂直领域智能体。其内部有四层工作闭环:
第一层:论文结构化抽取引擎
输入论文后,Faraday 首先用多模态理解能力抽出结构化的「复现契约」:包括数据集名称与版本、模型架构细节(层数、维度、归一化、激活函数、注意力变体)、训练超参数(优化器、学习率曲线、正则项、批大小)、评估协议(指标定义、数据切分方式)、以及明确声明的数值结果(作者报告的 SOTA 分数、误差线等)。Faraday 内部对这一步单独做了 3,000 篇论文人工校对,抽取准确率约 96.4%。
第二层:实验环境搭建器 + 版本化依赖解析
Faraday 不是直接拉一个 PyTorch 最新容器就运行代码,而是拥有一个自研的依赖解析与冲突消解器:根据论文提交时间与依赖版本痕迹,回溯性构造出与论文提交时间窗口相匹配的包版本组合,避免了「论文用的是 PyTorch 2.3 某 nightly 版本,但今天默认装的是 PyTorch 2.9,结果数值有微妙差异」这种常见复现失败点。
第三层:增量式代码实现与调试循环
当论文代码不存在或开源代码无法跑通时,Faraday 会进入「写代码 → 跑 → 看报错 → 定位问题 → 修改」的增量调试循环。与通用编程 Agent 的差异在于:
- 它优先使用论文中的「实现细节描述」作为最高约束,而不是 Stack Overflow 的常见写法;
- 它引入「数值验证器」做中间层:每跑一个小模块就和论文中给出的中间张量维度、数值范围做匹配,发现不一致立刻回滚,而不是等整个训练跑完了才发现指标差 2 倍;
- 调试循环有「论文原文引用证据链」:所有关键代码段都会被标注为「对应论文第 X 页 Y 段落」,供人工审核。
第四层:结果一致性验证器 + 可审计复现报告
当代码跑通后,Faraday 会执行一个独立的验证流程:用论文要求的 3 个不同随机种子重新评估,并把最终结果、与原论文作者结果的偏差、偏差可能来源分析、环境可复现包(Dockerfile + 冻结依赖 + 完整日志)打包为一份结构化复现报告,方便期刊编辑、审稿人与同行核查。
基准测试结果:Faraday 在 PaperRepro-Bench 上击败 GPT-5.5 与 Claude Opus 4.8
Inherent 同步发布了独立第三方在 PaperRepro-Bench v1.2(覆盖机器学习、计算化学、计算生物三个领域 240 篇近年论文的复现基准)上的评估数据。该基准不仅看「能不能跑通」,还对「最终结果与原论文的数值偏差程度」分级打分,满分 100。
| 系统 / 模型 | PaperRepro-Bench 综合得分 | 基座模型规模 | 单任务平均算力成本(估算) |
|---|---|---|---|
| Faraday(Inherent) | 74.1 分 | 27B 参数(Qwen 3.6) | ~$3.80 |
| Claude Opus 4.8 + 通用 Agent 框架 | 70.4 分 | ~1.8T MoE(闭源前沿) | ~$120 |
| GPT-5.5 + 通用 Agent 框架 | 68.9 分 | ~1.2T 稠密(闭源前沿) | ~$190 |
| GPT-5.4 Codex + 通用 Agent 框架 | 65.2 分 | 前沿级别 | ~$55 |
| DeepSeek-V4-Pro 0813 + 通用 Agent 框架 | 66.7 分 | 开源/闭源混合 | ~$14 |
| 直接用 Qwen 3.6-27B(无 Faraday 管线) | 31.0 分 | 27B 参数 | ~$1.20 |
最后一行数据(同样的 Qwen 3.6-27B,无 Faraday 专用管线,得分仅 31.0)最值得玩味:它证明 Faraday 的胜利不是因为 Qwen 3.6 本身是魔法,而是因为「专用 Agent 架构、验证循环、版本化依赖、证据链系统」这一整套围绕科学复现场景的专用设计。
换个角度表述:Qwen 3.6 本身只解决了 31 分的基础能力,而 Faraday 负责把剩下的 43 分用「工程方法论 + 验证闭环」给挣了回来。
融资与商业化路径:5000 万美元种子轮,先做「科研审稿 Copilot」
Inherent 同步确认已在 2026 年 6 月关闭 5000 万美元种子轮,由欧洲三家知名生命科学与深科技 VC 联合领投,若干制药巨头的战略投资部门跟投。本轮估值未披露,但据接近交易人士透露约为「投后 3.5–4 亿美元」——对于一家尚未公开任何产品的 1 年公司,这个价格已相当高。
商业化路线图分三阶段:
- 阶段一(2026 Q3–Q4,已启动早期客户):面向学术期刊、顶级会议出版社推出「论文审稿 Copilot」——审稿人或编辑提交一篇投稿后,Faraday 在数小时内输出一份「自动复现报告 + 与作者声称结果的偏差分析」,作为审稿的辅助参考;
- 阶段二(2027 H1):面向制药企业与材料公司推出「R&D 内部复现审核 SaaS」——内部科学家写好内部论文或提交专利申请前,Faraday 先在公司私有集群里自动把实验复现一遍,从源头上减少「论文里写的能做,内部就是复现不出来」的科研造假与数据失误;
- 阶段三(2027 H2 及以后):从「复现」延伸到「基于已有论文库的假设生成」,进入药物发现与材料设计的上游。
范式意义:「小模型 + 专用场景 Agent 架构」路线的又一次硬验证
2026 年以来,前沿 AI 产业正在并行演进两条路线:
| 路线 | 代表玩家 | 核心假设 | 典型成果 |
|---|---|---|---|
| 堆参数超大模型路线 | OpenAI、Anthropic、Google DeepMind | 只要模型能力足够强,任何场景都能通用搞定 | Astra、Claude Mythos 系列、前沿安全研究 |
| 小模型 + 专用场景 Agent 架构路线 | Inherent Faraday、Mistral Agentic Search、众多垂直领域 Agent 创业公司 | 对于特定场景,用中等规模模型 + 深度工程化的专用工具链、验证循环、状态机,可以在场景内超越超大模型并以数量级的成本优势交付 | SWE-bench 上的开源编程 Agent、法务合规智能体检索、今天的 Faraday 论文复现 |
过去不少人会把后者视为「过渡方案」,认为迟早会被通用大模型能力的上升吞噬。但 2026 年 8 月以来连续出现的几桩实证(SWE-bench 上 Qwen 小模型超 Claude Opus、Pinecone Nexus 检索层在企业知识基准反超前沿模型、今天 Faraday 用 27B 做论文复现超过 GPT-5.5),正在让产业对这一判断产生动摇:
对于有明确输入输出格式、有明确验证规则、允许设计工具链、错误成本极高的垂直场景,「专用 Agent 架构 + 正确的验证器 + 合适的中等模型」的组合,会不会是结构性地优于「一个通用超大模型自由发挥」?——越来越多的数据点在指向「是」。
如果这个判断成立,那么对于 AI 创业者与从业者来说,2026 年下半年的创业窗口就清晰了:不要和 OpenAI、Anthropic 比参数比推理,去找一个有明确验证规则的垂直场景,把 Agent 架构、工具链、验证器这三件事做透,然后用一个开源或中等规模的模型作为底座,就能以一个数量级的成本优势把事情做成。
一句话总结:前 DeepMind 员工创业,用一个 27B 的开源小模型,配上专属的复现验证管线,在论文复现这件硬核任务上,把自己老东家对手(GPT-5.5 / Claude Opus 4.8)的千亿级参数模型给比了下去——这本身就是 AI 产业正在分化、专用智能体时代正在到来的最好证明。