大模型动态
「ChatGPT之母」穆拉蒂用千问微调出金融AI模型,击败GPT和Claude
发布时间:2026年07月07日 12:00:00前OpenAI CTO米拉·穆拉蒂创立的Thinking Machines Lab,以阿里Qwen3-235B为基座通过Tinker微调,产出金融信息筛选准确率84.7%的专家模型,超越GPT、Claude和Gemini,推理成本仅为后者的1/14。
7月初(7月7日报道),全球最大对冲基金桥水(Bridgewater Associates)与成立仅一年多的AI初创公司Thinking Machines Lab合作,在对GPT、Claude和Gemini等前沿模型的金融信息筛选测试中,发现了一个令人震撼的结果。
测试结果对比
| 模型 | 基础提示准确率 | 加强指令准确率 | 能否达到部署门槛(80%) |
|---|---|---|---|
| GPT-5.x | ~50% | ~70% | 否 |
| Claude Opus 4.x | ~50% | ~72% | 否 |
| Gemini 3.x | ~50% | ~70% | 否 |
| Qwen3-235B微调版 | — | 84.7% | 是 |
技术方案
Thinking Machines Lab 以开源的阿里 Qwen3-235B 为基座,通过自研 Tinker 微调平台 训练,最终产出了一个在财务文档判断上准确率达 84.7% 的私有专家模型:
- 推理成本:仅为 GPT/Claude 的约 1/14
- 核心能力:判断财经新闻是否影响资产价值
- 部署意义:在金融投资场景中达到可信部署门槛
创始人的战略深意
Thinking Machines Lab 创始人米拉·穆拉蒂(Mira Murati)是前 OpenAI CTO,被誉为"ChatGPT 之母",曾主导 ChatGPT、DALL-E、GPT-4 等核心产品的研发。2024 年 9 月离职后,于 2025 年 2 月创立 Thinking Machines Lab。
她的转变本身就说明问题——亲手将通用大模型推向巅峰的人,创业后瞄准的是"私有化定制"赛道。
行业启示
此次测试揭示了一个深刻的行业趋势:
- 通用大模型不是终点,在垂直场景中开源的基座模型 + 精细化微调可以超越封闭式通用旗舰
- 成本优势压倒性:1/14 的推理成本让私有化部署在经济学上可行
- 中国开源模型的全球竞争力:Qwen3 系列已验证了在国际基准上的竞争力
穆拉蒂用千问打败了自己参与缔造的 GPT,这个隐喻本身比任何评分都更有力。