AI资讯

汤森路透基于阿里开源千问3.5打造自研法律大模型Thomson,投入4000万美元摆脱对外部模型依赖

发布时间:2026年08月25日 13:00:00

8月25日汤森路透发布首个自研大语言模型Thomson,底座采用阿里开源的千问Qwen3.5-397B,经与帝国理工学院合作进行安全重塑,投入约4000万美元和两年时间。在调用自有法律数据库时以微弱优势险胜GPT-5.4,但纯网络访问场景下仍落后。该模型已部署于CoCounsel Legal法律AI助手的表格分析功能,公司称CoCounsel仍为多模型设计,Claude仍为主要模型。


汤森路透基于阿里开源千问3.5打造自研法律大模型Thomson,投入4000万美元摆脱对外部模型依赖

8 月 25 日消息,全球领先的法律与信息服务商汤森路透正式发布其首个自研大语言模型 Thomson,底座采用阿里巴巴开源的千问 Qwen3.5-397B,投入约 4000 万美元和两年多时间完成研发。该模型已部署于旗下法律 AI 助手 CoCounsel Legal 的表格分析功能,是大型垂直行业服务商摆脱对外部闭源大模型依赖、构建自主 AI 能力的标志性案例。汤森路透强调,CoCounsel 仍为多模型设计,Claude 仍为主要模型,Thomson 的引入更多是策略性补充而非全面替代。

研发路径:从开源底座到法律专用的三段式重塑

Thomson 的研发路径颇具代表性,其核心思路是‘开源底座 + 领域重塑 + 自有内容精调’。据汤森路透披露,整个研发过程分为三个阶段:

第一阶段为安全与价值观重塑。汤森路透与英国帝国理工学院合作,对 Qwen3.5-397B 底座进行安全、伦理和政治中立性方面的全面重塑,中间模型被命名为 Snowdon(取自威尔士最高峰斯诺登峰名)。这一阶段的目的是消除开源底座可能带来的价值取向偏差,使其符合法律行业对中立性和严谨性的特殊要求。

第二阶段为自有内容预训练与领域专家后训练。汤森路透拥有 Westlaw、Practical Law、Checkpoint、Reuters 等多个权威法律与新闻内容库,这些高质量领域数据是外部通用模型难以企及的核心资产。值得关注的是,目前 Thomson 仅使用了汤森路透不到 10% 的自有内容,意味着模型在数据深度上仍有显著提升空间。

第三阶段为工具环境中的 Agent 强化学习。这一阶段重点训练模型在真实工具调用、文档检索、表格解析等 Agent 场景下的执行能力,使其能够更好地适配 CoCounsel 的工作流。

整个研发投入约 4000 万美元和两年多时间,但最终训练运行的成本仅约 45 万美元,其余投入主要分布在数据准备、安全重塑、人才招募和基础设施搭建等环节。这一成本结构也反映出当前自研大模型的真实成本分布:训练本身并非最大支出,前期工程化和数据治理才是主要成本来源。

性能评测:领域领先与短板并存

汤森路透同步披露了 Thomson 在多个基准测试上的表现,结果呈现出明显的‘长板与短板并存’特征:

基准测试Thomson 表现对比
Stanford LegalBench0.823 分落后 Gemini 3.1 Pro 与 GPT-5.5
Harvey Legal Agent Benchmark略逊于 Opus 4.8
指令遵循、PrBench Legal领先
推理与编码大幅落后

需要指出的是,Thomson 使用了测试时扩展(test-time scaling)技术,而 GPT-5.5 在对比中未启用推理模式,因此两者在 LegalBench 上的比较实际上并不完全对等。这一点也反映出当前大模型评测中普遍存在的‘条件不对等’问题。

更具说服力的是汤森路透自有的 Deep Research 基准结果。在纯网络访问场景下,Thomson 得分 0.53,落后 GPT-5.4 的 0.65;而在访问公司自有内容后,Thomson 得分跃升至 0.83,以微弱优势险胜 GPT-5.4 的 0.82。这一结果清晰地说明:自研模型的价值不在通用能力,而在于将自有高质量内容与模型深度耦合所带来的领域优势。这也是汤森路透选择自研的核心商业逻辑。

部署策略:从表格分析切入,多模型架构并行

Thomson 的首个落地场景是 CoCounsel Legal 的表格分析功能。选择这一场景作为切入点颇具讲究:表格分析属于高量、结构化文档审查场景,对模型的法律专业度要求高,但对通用推理能力的要求相对可控,恰好匹配 Thomson 当前‘领域强、推理弱’的能力画像。

汤森路透 CTO Joel Hron 在发布会上坦言,Thomson 研发过程中已更换开源起点近 6 次,反映出在大模型底座快速迭代的当下,自研团队需要不断评估和切换最优起点。研究主管 Jonathan Schwartz 则表示,‘真正的发现是模型工厂,而不是单个模型’——这一表态暗示汤森路透更看重自研流程与基础设施的可持续性,而非 Thomson 单一模型的性能。

公司同时强调,不依赖任何特定开源模型,这与 OpenAI 推出自研芯片 Jalapeño、River AI 获得 11 亿美元融资帮助企业训练自有模型等行业趋势相互呼应。随着大模型在垂直行业的渗透加深,头部行业服务商越来越倾向于将模型能力内化为自身核心资产,而非长期依赖外部闭源模型供应商。

行业观察:垂直自研时代的开启

Thomson 的发布标志着大型垂直行业服务商进入‘自研大模型’时代的新阶段。过去一年,金融、法律、医疗等领域的头部企业纷纷启动自研模型项目,其共性逻辑包括:第一,自有高质量领域数据是难以被通用模型复制的核心壁垒;第二,对外部闭源模型的长期依赖存在供应稳定性和数据合规风险;第三,自研模型可以更精细地适配业务流程,降低单位调用成本。

但 Thomson 的评测结果也提示,自研模型并非全能解药。在推理、编码等通用能力上,自研模型仍明显落后于头部闭源模型;在纯网络访问场景下,Thomson 仍落后 GPT-5.4。这意味着行业客户在相当长时间内仍需要维持‘自研 + 外部模型’的多模型架构,而非简单的非此即彼。

对汤森路透而言,Thomson 的真正价值在于证明了‘开源底座 + 领域重塑 + 自有内容精调’路径的可行性,以及将自有内容资产转化为模型能力的商业路径。这对国内拥有大量垂直领域数据的法律、金融、医疗企业而言,具有显著的示范意义。随着 Qwen 等开源模型能力的持续提升,预计会有更多行业头部企业沿着类似路径构建自有大模型能力,垂直自研时代正在加速到来。