美团 LongCat-2.5 上线:1.6 万亿参数、100 万上下文,却查不到一份跑分

长上下文模型的发布会台面:一张印着超长参数清单与低价标签的规格纸被压在玻璃下,旁边空荡荡的展台上原本该摆放第三方跑分报告与模型权重盒的位置只有两个空托盘
内容摘要

美团 9 月 25 日上线 LongCat-2.5-Preview,1.6 万亿总参数只激活 480 亿,原生 100 万 token 上下文并新增图片理解,点名适配 Claude Code 等五款开发环境。但跑分表、权重和技术报告一个都没公开,本文说清哪些是事实、哪些还只是厂商说法,并给出选型建议。

9 月 25 日晚,美团在 LongCat API 开放平台上线了新一代大模型 LongCat-2.5-Preview,网页端体验入口同步开放。官方给它贴的核心标签有两个:长程任务和多模态能力。

参数和价格都摆出来了,看起来攻势很足。但有个细节很值得单独拎出来说:这款模型的跑分表、模型权重、技术报告,一个都没公开。

这不是黑它,是选型时最该先搞清楚的事。

官方到底说了什么

把官方更新日志和 API 文档里的说法拆开看,LongCat-2.5-Preview 的核心特性是三条:

  • 多模态理解:这一版新增图片理解能力,可以解析图像内容,支持跨模态问答、内容摘要与复杂视觉推理
  • Coding 能力:官方把代码生成、代码理解与自动化编程任务单列为一项核心特性
  • 开发环境适配:明确点名与 Claude Code、Hermes、OpenClaw、OpenCode、Kilo Code 五款主流开发环境协同

第三点其实是这一版最务实的地方——模型强不强是一回事,能不能顺手接进你现有的工作流是另一回事。官方定位的目标场景包括终端、浏览器、桌面界面、表格和设计工具,讲白了就是要喂给「跑很久的 Agent」用。

参数与价格:能查到的硬事实

  • 架构:延续 MoE 混合专家路线
  • 参数:总参数约 1.6 万亿,单次推理只激活约 480 亿(按参数量算约 3%)
  • 上下文:原生 100 万 token,最大输出 128K
  • 接口:同时提供 OpenAI 兼容的 chat completions 端点和 Anthropic 兼容的 Messages 端点,聊天接口还暴露了 thinking 开关
  • 价格(每百万 token,美元):标准价输入 0.75、缓存 0.015、输出 2.95;限时价输入 0.30、缓存 0.006、输出 1.20,约合四折
  • 福利:官方给老用户赠 500 万 token,余额在使用页可见,既有 token 包在 2.5 和 2.0 上都能用

价格确实有杀伤力。拿一个具体任务算:读 50 万 token 的输入、写 2 万 token 的输出,按限时价大约是 17 美分;同样的事换 Kimi K3 的牌价去算,大概是 1.8 美元。

有个前提得说清楚——这是按价目表算的算术题,不是实测。而且美团自己标注了「限时价」,促销结束之后的价格是未知的。真要写进成本模型,请用标准价算。

查不到的东西,比查得到的更值得看

市面上目前找不到 LongCat-2.5-Preview 的 benchmark 表,也没有 Hugging Face 权重、没有技术报告、没有 GGUF。有模型追踪者在公开渠道直接提问:「参数和价格都发了,跑分在哪?」

这件事本身不罕见。一个带定价、但什么也不给复现的预览端点,是厂商试需求的常见做法。但由此可以推出两条对你有用的结论:

第一,所有参数和价格数字,目前都只是厂商说法。 1.6 万亿这个数来自美团站点元数据和中文媒体报道,不是技术文档。这不是说数字是假的,是说它还没被独立验证过。

第二,预览阶段有文档缺口。 目前的 chat completions 参考文档里,消息内容是纯文本字符串,示例也只展示了文本请求,并没有给出图片输入的格式。想跑「截图喂给模型」这类工作流的人,建议先发一个小请求确认当前的图片输入格式,再考虑迁移生产流水线。

顺带说一个容易被忽略的好消息:通过 OpenCode 等渠道使用的 LongCat-2.5-Preview 免费版,由承接方声明遵循零保留策略、不拿你的数据做训练。对数据敏感又不想自己部署的团队,这一条比参数表有用。

100 万上下文 ≠ 100 万召回

这是长上下文模型最容易被话术盖住的地方。

上下文窗口是规格,说的是「一次能吞多少 token」。召回是能力,说的是「埋在很深处的那条信息,它还找不找得到」。厂商一定会公布前者,因为那是规格;独立评测机构才测后者,因为那是考试。

参考量级:Kimi K3 在独立评测里的长上下文召回分数是 88.67,是目前能找到的最高一档。而 LongCat-2.5-Preview 在同一个指标上没有任何分数——不是低分,是空白。

这个空白不能反推它不行,只能说:没人替你测过。如果你有一个 50 万 token 的输入任务,而你的模型在这个深度上的召回率还没测过,那你省下的那点 token 钱,不是省钱,是一个未知失败率的报价。

另外还有个细节:LongCat-2.0 当时给的就是 100 万 token 上下文和同样的规模数字。所以 2.5 这一版不是参数或上下文的跳跃,真正的增量是图片理解和开发环境适配。

对开发者意味着什么

好消息:双兼容端点(OpenAI 风格 + Anthropic 风格)意味着改两行配置就能试;送 500 万 token 意味着试用成本几乎为零;长程 Agent 场景确实缺便宜的长上下文供应方,多一个玩家对你有利。

需要警惕的:限时价别写进预算;没有独立跑分就自己跑;文档缺口意味着你可能是第一批踩坑的人;预览版的能力和限流随时会变。

老达博客之前拆过 阶跃 Step 5 Preview 那套「1/8 成本」账,也写过 小米 MiMo-V2.6 连 OOM 日志都公开、Kimi 原生兼容 Codex 与 Claude Code 和 Kimi Code 桌面版把权限拆成三档。这两条线放在一起看,2026 年国产模型的动作其实很一致:先把 token 单价打下来,再把模型塞进你已经在用的开发环境里。

选型对比还可以看 Cognition SWE-2 的成本战 和 OpenAI、Anthropic 同日降价;同一天里 腾讯混元图像 3.5 把 2K 生图压到 0.15 元一张,也是同一套「用价格换份额」的打法。想系统追踪这条主线,可以翻 AI 编程工具专题 和 AI 智能体与自动化专题。

老达点评

第一,「参数与价格齐了,验证材料一件没有」这件事,值得成为一个标准检查动作。 看到大模型发布,先别急着算便宜多少,先问三个问题:有没有独立跑分?有没有权重或技术报告?定价是不是限时的?这三个问题问完,你对它的信心水平会自动校准。

第二,窗口是规格,召回是能力。 1M 上下文印在定价页上很好看,但「百万 token 深处那句话说对了没有」才是你真正买的东西。没有召回测试的长上下文,只能当成「可能会省钱的赌注」,不能当成产能规划的地基。

第三,美团做这件事的底层逻辑是真实的。 外卖和到店业务攒了十几年的高并发、长链路、多状态工程的账,如今搬到开发者头上。但「懂工程」不等于「模型强」,工程能力能保证服务稳、价格狠,保证不了模型在长上下文深处不掉链子。这两件事得分开评估。

第四,对普通开发者,这是笔划算的试错。 双兼容端点 + 赠送额度,试一次的成本几乎为零。但请把「试用」和「迁生产」当两件事——在你自己跑出可复现的结果之前,别把主流水线换过去。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *