8 月 28 日,腾讯混元发布了新一代大模型 Hy4 preview,并同步开源。总参数 770B、激活参数 49B、上下文突破 100 万 token,编程跑分直追 DeepSeek 和 GPT 旗舰——这个体量,已经够得着”国产开源第一梯队”的门槛了。
更实际的是:它在 WorkBuddy、CodeBuddy 上限时免费两周,API 也接入了 OpenRouter。也就是说,不用翻墙、不用抢内测,今天就能上手试。但先别急着冲,跑分里有个大坑得说清楚。
一、Hy4 preview 是什么:770B 参数、1M 上下文
先看硬参数。Hy4 preview 是典型的稀疏 MoE 架构:7700 亿总参数、每个 token 只激活 49B,78 层、256 个路由专家加 1 个共享专家。上下文窗口超过 100 万 token——一个大型代码仓库、一摞论文、一长串多轮 Agent 会话,都能完整装下。
对比前代 Hy3(295B 总参),总参翻了 2.6 倍,激活参数翻倍,上下文也大幅拉长。腾讯自己说,迭代节奏从 2026 年 2 月重建预训练与强化学习基础设施算起,平均两个月一个大版本,由首席 AI 科学家姚顺雨主导。
这代模型的定位是”为生产力而生”,重点打磨四个场景:软件工程(长程开发任务的理解、规划、调试与验证,还强调前端视觉审美)、办公分析(复杂办公环境理解、金融分析、跨文件协作,能交付文档表格演示稿)、游戏开发(一句话生成可玩原型)、科学研究(分子动力学、凝聚态物理、基础数学)。
二、跑分到底强不强:数字很亮,但要打折看
腾讯官方列了 12 项 benchmark,对比对象包括 DeepSeek V4 Pro、GPT-5.6 Sol、GLM-5.3、Kimi K3、Claude Opus 5。从公开数字看:
- Terminal Bench 2.1(终端命令行编程):85.4 分,与 DeepSeek V4 Pro 并列,逼近 GPT-5.6 Sol 的 85.7,比前代 Hy3 的 70.8 大涨 14.6 分;
- DeepSWE(软件工程实战):从 Hy3 的 28.0 翻到 64.3,跨过 Qwen 3.8 Max 的 55.6 和 DeepSeek V4 Pro 的 58.8,逼近 GPT-5.6 Sol 的 68.1;
- SWE Atlas Refactoring(代码重构):53.3,高于 DeepSeek V4 Pro 的 48.6;
- 内部盲测:163 名专家、203 个工程任务,Hy4 均分 2.99/4,略优于 GLM-5.3(2.92)和 Kimi K3(2.94)。
最出圈的是腾讯的一段演示:让 Hy4 同时并行跑多个 OpenAI Codex 会话,自己当”监工”,评估每个会话的输出、引导研究方向,声称在 8 项基准上超过独立运行的 Codex。这个”指挥对手的 Agent”的玩法,确实很有画面感。
但必须泼盆冷水:这 12 项跑分全是腾讯自述,发布当天没有任何第三方独立实测——Artificial Analysis 没收录、开源社区没有复现数据,中文媒体的报道基本是通稿转载。”85.4 超越 DeepSeek、与 Claude Opus 5 持平”这类说法,都是官方口径的二手转述。分数可以信方向,别信绝对值。
三、怎么免费用、怎么接 API
目前四个入口,从易到难:
- WorkBuddy / CodeBuddy(国内版和国际版):首发即接入,限时免费两周,到期转付费档。Hy3 在这两个平台的免费期限则延长到 9 月 30 日。如果你是 AI 实践玩家,这就是最省事的体验入口——直接在对话里把模型切成 Hy4 就行。
- 元宝、ima:腾讯自家产品同步首发,日常问答、文档分析场景直接可用。
- 腾讯云 TokenHub:API 方式接入,国内开发者走这条路最顺。
- OpenRouter:国际开发者友好,一行 base_url 的事。定价上,国内输入 6 元/百万 token、输出 18 元/百万 token、缓存命中 0.3 元/百万 token;国际约 0.83 美元/百万输入、2.5 美元/百万输出。比 GPT、Claude 便宜一个数量级,处在国产第一梯队的正常价位。
想试又不想花钱的,两周免费窗口就是为你准备的。反正今天就能体验,跑分信不信的,自己上手跑一个任务就知道了。
四、开源竞品怎么选:DeepSeek、GLM、Kimi
Hy4 不是孤例。8 月这一个月,中国开源模型集体冲量:
- DeepSeek V4 Pro(8 月 13 日):Agent 能力大幅增强,价格屠夫路线,正式版上线后编程能力翻了近 5 倍;
- 智谱 GLM-5.3(8 月 15 日):编程王座易主的主角,还意外练出了网络安全能力,宣称是开源最强 coder;
- Kimi K3:2.8 万亿参数,号称全球最大开源权重模型;
- MiniMax:2.7 万亿参数模型在 Q3 排队。
怎么选?一句话:看你的场景和钱包。 终端命令行重度用户,DeepSeek V4 Pro 和 Hy4 都在第一梯队,价格接近,挑生态熟的;长程 Agent 任务,1M 上下文的 Hy4 和 GLM-5.3 都有优势;想跟腾讯系产品(WorkBuddy、元宝)打通,Hy4 是原生选项;追求极致规模的上限,Kimi K3 可以观望。别被”第一名”的标题绑架——在开源第一梯队里,差异远没有跑分表显示的那么大。
五、老达点评
Hy4 preview 给我的整体印象是:诚意足,但账要自己算。
诚意足的地方:770B 参数、1M 上下文、Apache 2.0 开源、全产品线首发、两周免费——这配置放在半年前是”年度旗舰”待遇,现在是腾讯的日常迭代。中国开源模型的堆叠速度,已经快到让”开源不如闭源”的说法站不住脚。
要自己算的账有两笔。第一笔是跑分:12 项全自述、无第三方复现,”监督 Codex”的演示再酷也是自家场地自家裁判。第二笔是定位:Hy4 强在”生产力场景”(软件工程、办公、游戏、科研),不是通用的全能旗舰——拿它当 Chatbot 用,可能浪费了 1M 上下文;拿它当 Coding Agent 底座,才物尽其用。
最后说句实在的:当 770B 参数的开源模型”限时免费两周”都成了新闻点,真正的看点已经不是”谁最强”,而是”免费还能撑多久”。国内这波开源浪潮,从免费到收费的转折才刚开个头。趁免费窗口,该薅的羊毛抓紧薅,该练的手感抓紧练——这种日子不会一直有。
相关阅读: