路透社花4000万美元自研大模型,底座不用Claude用阿里千问:企业AI选型正在悄悄变天

一张办公桌上,左侧是印有Reuters字样的新闻稿和法律文档,右侧是一个发光的蓝色AI大脑模型,中间一条箭头从标有Claude的云服务图标指向标有Qwen的开源代码图标,背景是向下的成本曲线和向上的性能柱状图
内容摘要

汤森路透8月24日发布首款自研大模型Thomson-1,研发投入约4000万美元,底座选了阿里开源的Qwen3.5而非一直合作的Claude。本文梳理技术细节、成本账和选型逻辑,聊聊开源模型正在怎样改变企业AI格局,以及普通开发者能从中学到什么。

8月24日,汤森路透干了一件挺有意思的事:他们发布了自己的第一款大语言模型,叫 Thomson-1。

有意思的地方不在于”又一家公司做了大模型”,而在于两个细节:第一,这个模型花了大约4000万美元研发;第二,它的底座不是一直合作的 Anthropic Claude,而是阿里开源的 Qwen3.5-397B。

一家加拿大的全球法律和新闻信息巨头,放着现成的 Claude 不用,掏4000万美元基于中国开源模型自己搞——这背后的选型逻辑,比模型本身更值得琢磨。

一、Thomson-1 到底是什么水平

先把事实摆清楚。

Thomson-1 是汤森路透基于阿里 Qwen3.5-397B(也就是 Qwen3.5-Plus)二次开发的模型。整个过程不是简单套壳:他们先跟帝国理工学院合作重新训练基础模型,确保安全、伦理和政治中立性符合新闻机构的要求,然后用自己几十年积累的法律、税务、会计专业内容做预训练和后训练,最后在内部环境里做强化学习。

性能方面,汤森路透给出的说法是:在法律和通用基准测试上,Thomson-1 跟 Claude Opus 4.8 打得有来有回,超过了 GPT-5.5、Claude Sonnet 5 和 Gemini 3.1 Pro。Stanford LegalBench 法律基准上的得分也不错。

当然,这是厂商自己的 benchmark,参考就行,别全信。但有一点是确定的:一个垂直领域公司基于开源底座做的模型,已经敢跟顶级闭源模型正面比了,这在两年前是不可想象的。

落地场景也很明确:Thomson-1 首先用在自家法律 AI 产品 CoCounsel 的表格分析功能里,处理文档审查这类高频、标准化的任务。

二、为什么是 Qwen,不是 Claude

这才是关键问题。汤森路透跟 Anthropic 的关系其实不浅——今年5月他们刚扩大了合作,自家 AI 助手一直接的是 Claude。那为什么自研的时候不继续用 Claude 的底座?

汤森路透 CTO Joel Hron 说了一个挺形象的比喻:“租房子,你头上有屋顶,有人帮你打理,确实挺好。但你没有建立任何长期对你有价值的资产。”

翻译成人话就是:一直调用 Claude API,本质上是在给别人交房租。用得越多,数据和调优经验越沉淀在对方那边,自己手里什么都没留下。而且价格、模型版本、API 政策全是别人说了算——这一点,最近经历过 API 价格波动 的开发者应该都有体会。

选 Qwen3.5 而不是其他开源模型,原因也不复杂:

  • 能力够强:Qwen3.5-397B 是当前开源模型里的第一梯队,推理、编程、多模态都在线,做二次开发的起点高。
  • 完全开源可控:权重开放,可以自己重新训练、微调、部署,不用看任何人脸色。
  • 多语言支持好:Qwen3.5 支持201种语言和方言,对汤森路透这种全球业务的公司很实用。
  • 成本低:开源模型没有按 token 计费的推理成本,大规模部署时省下的钱是实打实的。

三、4000万美元的账怎么算

4000万美元听着不少,但放在企业 AI 的账本里,这笔钱可能比你想的要划算。

我们粗算一下:汤森路透这种体量的公司,内部 AI 产品加上客户服务,每天的 token 调用量是亿级甚至十亿级的。如果全靠 Claude Opus 这种级别的 API,一年的推理成本轻松上千万美元,而且随着用量增长还在不断往上走。

4000万美元一次性投入,换来的是:

  • 一个完全自主可控的模型,后续推理成本大幅下降
  • 几十年专业数据的资产化——这些数据以前只是”存着”,现在变成了模型能力的一部分
  • 不被任何厂商锁定的议价能力——以后跟 Anthropic、OpenAI 谈合作,腰杆更硬

而且这4000万里,很大一部分是算力和人力成本,不是付给某个模型厂商的授权费。模型做出来之后,边际成本接近于零,用得越多越划算。

这其实就是企业级 AI 的”买房 vs 租房”问题:短期看租房灵活便宜,但长期大额使用的话,买房的总成本更低,还能增值。

四、这件事对普通开发者意味着什么

汤森路透的选择不是孤例。最近一段时间,从 DeepSeek 被大量企业采用 到 DoorDash 把编程负载迁到 Moonshot,再到西门子、Airbnb 测试国产模型——企业 AI 选型的风向确实在变。

对普通开发者和小团队,有几个直接的启示:

第一,开源模型已经不是”凑合用”的水平了。 Qwen3.5、DeepSeek V4、Llama 这些开源模型,在大多数实际场景里跟闭源旗舰的差距已经很小。如果你做的是垂直领域应用,基于开源模型微调的效果,往往比直接调用通用 API 更好。

第二,成本结构要重新算。 以前大家选模型主要看”哪个效果好”,现在得把账算细:高频调用的场景,开源模型自部署的成本可能只有 API 的十分之一;偶尔用一下的场景,API 依然更划算。多模型路由 这种策略,会越来越重要。

第三,数据是你真正的护城河。 汤森路透敢花4000万自研,底气不是算力,而是他们几十年的法律、税务、新闻数据。对个人开发者来说,你积累的领域数据、用户反馈、调优经验,才是别人抄不走的东西。模型会越来越便宜、越来越强,但你的数据资产只会越来越值钱。

五、老达点评

我看完这条新闻的第一反应是:企业 AI 的”去闭源依赖”时代,可能比我们预想的来得更快。

两年前,”自己做个大模型”还是头部科技公司的游戏。现在,一家法律信息公司花4000万美元就能做出对标 Claude Opus 的垂直模型——而且底座是中国开源的。这说明两件事:一是开源模型的天花板已经足够高,二是模型工程化的门槛在快速下降。

对 Anthropic 和 OpenAI 来说,这不是好消息。它们的客户越用越发现:通用能力我可以用你的,但我核心业务的那部分,我要自己掌握。汤森路透没有完全抛弃 Claude——Claude 依然支撑着他们大部分现有工作。但核心的、高频的、有数据壁垒的场景,开始往自研模型迁了。这个口子一旦撕开,只会越来越大。

对中国的开源模型生态,这是一针强心剂。Qwen 被汤森路透这种级别的国际公司选做底座,说明中国开源模型在能力和 License 友好度上已经得到了全球市场的认可。以后”中国模型只在中国用”这个刻板印象,会慢慢被打破。

最后说一句对普通人的建议:别光盯着哪个模型又刷新了 benchmark。对你真正有价值的问题是——你的业务数据,有没有沉淀成别人拿不走的能力? 模型会越来越便宜、越来越强,但你自己的数据和场景理解,才是长期的护城河。

相关阅读

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *