大模型动态

「ChatGPT之母」穆拉蒂用千问微调出金融AI模型,击败GPT和Claude

发布时间:2026年07月07日 12:00:00

前OpenAI CTO米拉·穆拉蒂创立的Thinking Machines Lab,以阿里Qwen3-235B为基座通过Tinker微调,产出金融信息筛选准确率84.7%的专家模型,超越GPT、Claude和Gemini,推理成本仅为后者的1/14。


7月初(7月7日报道),全球最大对冲基金桥水(Bridgewater Associates)与成立仅一年多的AI初创公司Thinking Machines Lab合作,在对GPT、Claude和Gemini等前沿模型的金融信息筛选测试中,发现了一个令人震撼的结果。

测试结果对比

模型基础提示准确率加强指令准确率能否达到部署门槛(80%)
GPT-5.x~50%~70%
Claude Opus 4.x~50%~72%
Gemini 3.x~50%~70%
Qwen3-235B微调版84.7%

技术方案

Thinking Machines Lab 以开源的阿里 Qwen3-235B 为基座,通过自研 Tinker 微调平台 训练,最终产出了一个在财务文档判断上准确率达 84.7% 的私有专家模型:

  • 推理成本:仅为 GPT/Claude 的约 1/14
  • 核心能力:判断财经新闻是否影响资产价值
  • 部署意义:在金融投资场景中达到可信部署门槛

创始人的战略深意

Thinking Machines Lab 创始人米拉·穆拉蒂(Mira Murati)是前 OpenAI CTO,被誉为"ChatGPT 之母",曾主导 ChatGPT、DALL-E、GPT-4 等核心产品的研发。2024 年 9 月离职后,于 2025 年 2 月创立 Thinking Machines Lab。

她的转变本身就说明问题——亲手将通用大模型推向巅峰的人,创业后瞄准的是"私有化定制"赛道。

行业启示

此次测试揭示了一个深刻的行业趋势:

  • 通用大模型不是终点,在垂直场景中开源的基座模型 + 精细化微调可以超越封闭式通用旗舰
  • 成本优势压倒性:1/14 的推理成本让私有化部署在经济学上可行
  • 中国开源模型的全球竞争力:Qwen3 系列已验证了在国际基准上的竞争力

穆拉蒂用千问打败了自己参与缔造的 GPT,这个隐喻本身比任何评分都更有力。