8月24日,汤森路透干了一件挺有意思的事:他们发布了自己的第一款大语言模型,叫 Thomson-1。
有意思的地方不在于”又一家公司做了大模型”,而在于两个细节:第一,这个模型花了大约4000万美元研发;第二,它的底座不是一直合作的 Anthropic Claude,而是阿里开源的 Qwen3.5-397B。
一家加拿大的全球法律和新闻信息巨头,放着现成的 Claude 不用,掏4000万美元基于中国开源模型自己搞——这背后的选型逻辑,比模型本身更值得琢磨。
一、Thomson-1 到底是什么水平
先把事实摆清楚。
Thomson-1 是汤森路透基于阿里 Qwen3.5-397B(也就是 Qwen3.5-Plus)二次开发的模型。整个过程不是简单套壳:他们先跟帝国理工学院合作重新训练基础模型,确保安全、伦理和政治中立性符合新闻机构的要求,然后用自己几十年积累的法律、税务、会计专业内容做预训练和后训练,最后在内部环境里做强化学习。
性能方面,汤森路透给出的说法是:在法律和通用基准测试上,Thomson-1 跟 Claude Opus 4.8 打得有来有回,超过了 GPT-5.5、Claude Sonnet 5 和 Gemini 3.1 Pro。Stanford LegalBench 法律基准上的得分也不错。
当然,这是厂商自己的 benchmark,参考就行,别全信。但有一点是确定的:一个垂直领域公司基于开源底座做的模型,已经敢跟顶级闭源模型正面比了,这在两年前是不可想象的。
落地场景也很明确:Thomson-1 首先用在自家法律 AI 产品 CoCounsel 的表格分析功能里,处理文档审查这类高频、标准化的任务。
二、为什么是 Qwen,不是 Claude
这才是关键问题。汤森路透跟 Anthropic 的关系其实不浅——今年5月他们刚扩大了合作,自家 AI 助手一直接的是 Claude。那为什么自研的时候不继续用 Claude 的底座?
汤森路透 CTO Joel Hron 说了一个挺形象的比喻:“租房子,你头上有屋顶,有人帮你打理,确实挺好。但你没有建立任何长期对你有价值的资产。”
翻译成人话就是:一直调用 Claude API,本质上是在给别人交房租。用得越多,数据和调优经验越沉淀在对方那边,自己手里什么都没留下。而且价格、模型版本、API 政策全是别人说了算——这一点,最近经历过 API 价格波动 的开发者应该都有体会。
选 Qwen3.5 而不是其他开源模型,原因也不复杂:
- 能力够强:Qwen3.5-397B 是当前开源模型里的第一梯队,推理、编程、多模态都在线,做二次开发的起点高。
- 完全开源可控:权重开放,可以自己重新训练、微调、部署,不用看任何人脸色。
- 多语言支持好:Qwen3.5 支持201种语言和方言,对汤森路透这种全球业务的公司很实用。
- 成本低:开源模型没有按 token 计费的推理成本,大规模部署时省下的钱是实打实的。
三、4000万美元的账怎么算
4000万美元听着不少,但放在企业 AI 的账本里,这笔钱可能比你想的要划算。
我们粗算一下:汤森路透这种体量的公司,内部 AI 产品加上客户服务,每天的 token 调用量是亿级甚至十亿级的。如果全靠 Claude Opus 这种级别的 API,一年的推理成本轻松上千万美元,而且随着用量增长还在不断往上走。
4000万美元一次性投入,换来的是:
- 一个完全自主可控的模型,后续推理成本大幅下降
- 几十年专业数据的资产化——这些数据以前只是”存着”,现在变成了模型能力的一部分
- 不被任何厂商锁定的议价能力——以后跟 Anthropic、OpenAI 谈合作,腰杆更硬
而且这4000万里,很大一部分是算力和人力成本,不是付给某个模型厂商的授权费。模型做出来之后,边际成本接近于零,用得越多越划算。
这其实就是企业级 AI 的”买房 vs 租房”问题:短期看租房灵活便宜,但长期大额使用的话,买房的总成本更低,还能增值。
四、这件事对普通开发者意味着什么
汤森路透的选择不是孤例。最近一段时间,从 DeepSeek 被大量企业采用 到 DoorDash 把编程负载迁到 Moonshot,再到西门子、Airbnb 测试国产模型——企业 AI 选型的风向确实在变。
对普通开发者和小团队,有几个直接的启示:
第一,开源模型已经不是”凑合用”的水平了。 Qwen3.5、DeepSeek V4、Llama 这些开源模型,在大多数实际场景里跟闭源旗舰的差距已经很小。如果你做的是垂直领域应用,基于开源模型微调的效果,往往比直接调用通用 API 更好。
第二,成本结构要重新算。 以前大家选模型主要看”哪个效果好”,现在得把账算细:高频调用的场景,开源模型自部署的成本可能只有 API 的十分之一;偶尔用一下的场景,API 依然更划算。多模型路由 这种策略,会越来越重要。
第三,数据是你真正的护城河。 汤森路透敢花4000万自研,底气不是算力,而是他们几十年的法律、税务、新闻数据。对个人开发者来说,你积累的领域数据、用户反馈、调优经验,才是别人抄不走的东西。模型会越来越便宜、越来越强,但你的数据资产只会越来越值钱。
五、老达点评
我看完这条新闻的第一反应是:企业 AI 的”去闭源依赖”时代,可能比我们预想的来得更快。
两年前,”自己做个大模型”还是头部科技公司的游戏。现在,一家法律信息公司花4000万美元就能做出对标 Claude Opus 的垂直模型——而且底座是中国开源的。这说明两件事:一是开源模型的天花板已经足够高,二是模型工程化的门槛在快速下降。
对 Anthropic 和 OpenAI 来说,这不是好消息。它们的客户越用越发现:通用能力我可以用你的,但我核心业务的那部分,我要自己掌握。汤森路透没有完全抛弃 Claude——Claude 依然支撑着他们大部分现有工作。但核心的、高频的、有数据壁垒的场景,开始往自研模型迁了。这个口子一旦撕开,只会越来越大。
对中国的开源模型生态,这是一针强心剂。Qwen 被汤森路透这种级别的国际公司选做底座,说明中国开源模型在能力和 License 友好度上已经得到了全球市场的认可。以后”中国模型只在中国用”这个刻板印象,会慢慢被打破。
最后说一句对普通人的建议:别光盯着哪个模型又刷新了 benchmark。对你真正有价值的问题是——你的业务数据,有没有沉淀成别人拿不走的能力? 模型会越来越便宜、越来越强,但你自己的数据和场景理解,才是长期的护城河。
相关阅读
- 老达AI实践专题:AI 实战方法论与成本优化合集
- AI工具评测专题:主流 AI 工具实测对比
- DeepSeek专题:开源大模型上手与应用指南
- 多模型路由把API成本再砍一截:企业级AI成本优化实操
- AI API价格战整体格局分析:从旗舰降价看模型选型趋势