9 月 22 日,腾讯混元正式发布混元图像 3.5 预览版(Hy Image 3.5 preview)。官方给的定位是「高性价比的专业级生图模型」,翻译成人话就是:能力往专业场景靠,价格往下砸。
腾讯云 API 的 2K 图定价是 0.15 元一张,国际版 0.024 美元一张,而且只对输出图片收费——你传上去的参考图不单独算钱。这个价格放出去,生图这条赛道的定价线被往下拽了一截。
这次到底发了什么
能力清单不复杂,但每一项都对着真实工作流:
- 文生图 + 图生图,单次最多可上传 5 张图作为参考
- 多轮对话创作,可以基于历史上下文接着改,不用每次从零重来
- 支持多种尺寸比例,最高输出 2K 分辨率
- 计费只在输出侧:腾讯云 API 0.15 元/张(国内)、0.024 美元/张(国际版)
接入面铺得很宽。模型已上线腾讯元宝、专业影视智能平台 WorkRally、剧集与游戏内容制作工具 OnSolo、创意智能体 Miora、办公智能体工作台 WorkBuddy、AI 知识管家 ima 等多款自家应用,同时接入腾讯云媒体处理 MPS 与云点播 VOD,开发者可以走腾讯云 TokenHub 调 API。
其中两个入口值得单独说:元宝里人像编辑、智能 P 图、旅游规划图、知识信息图这些场景直接免费体验;WorkRally 和 OnSolo 面向专业物料创作,限时两周免费。想低成本试的人,先薅这两周就够了。
0.15 元一张,是什么概念
官方的横向对比里,GPT Image、Qwen-Image、可灵、通义万相这批模型的单张成本大多落在 0.16 元到 0.27 元之间;谷歌 Nano Banana Pro 是 1 元一张,大约是它的 6.7 倍。
真正容易被人忽略的是那句「只对输出收费」。很多生图任务是多图参考的——五张参考图喂进去,出一张成品。如果按输入也计费,账就不是那个账了。所以选型的时候别只比单价,要把「一次任务真的花多少钱」算出来。
对批量出图的人(电商物料、短剧分镜、游戏概念图、品牌视觉),单张几毛钱的差距会被放大到月度账单级别。腾讯官方举的例子是 9 月 20 日腾讯视频上线的 AI 精品剧《行镖》,里面就有这套模型的影视物料产出。
升级的重点在三件事上,不在参数上
官方口径是围绕「从意图理解到视觉表达」做系统性升级,具体落在三处:
文本渲染与布局。 生图模型最不擅长的一直是画字。海报、信息图、UI 草稿这些场景,只要画面里的文字写错一个字,整张图就废了。这次把多语言文本渲染和排版单独提出来讲,方向是对的。
真实感与风格表现力。 人像、产品图这类追求「像真的」的场景。
编辑一致性。 这条最实在。先出一张海报,再改文字、换元素、调版式,模型能记住前面的上下文继续修改,而不是重新生成一张跟你原来那张毫无关系的图。
效果验证方面,官方说的是腾讯内部组织数百名专业设计师做了 GSB 盲测(评测者不知道图是哪家模型出的),这一版综合胜率比 Hy Image 3.0 高约 30%,与字节 Seedream 5.0 pro 持平,略优于谷歌 Nano-Banana Pro 与阿里 Qwen-Image-3.0 Pro。另一个侧面数据是:这款模型两个月前就在元宝 App 逐步灰度,期间生图整体请求量提升超过 50%。
三个上手入口
想零成本先试水:打开元宝 App,进「创作」,人像编辑、智能 P 图、知识信息图这些场景可以直接用,不花钱。
做知识库配图:ima 里通过 copilot 把知识库变成可视化网页、PPT 或图片,发一句生图指令就行。这条适合写文章、做内部材料的人。
走开发流:腾讯云 TokenHub 调 API(按 0.15 元/张、只算输出),或者用 ComfyUI 的官方节点——文生图和图生图在同一个模型里切换,ComfyUI 节点侧还能把原生 2K 再往上放大到 4K。做批量流水线的团队,走这条路更容易复现。
短板也得说清楚
- 盲测是内部口径。 数百名设计师的 GSB 盲测是腾讯自己组织的,30% 这个数字要当「厂商自报」看。第三方独立生图榜单上目前还没有它的位置,真实排位要靠你自己拿业务素材试。
- 预览版意味着会变。 预览版的能力、价格、限流都可能调整,现在写进你生产流水线的参数,下个月不一定还成立。
- 专业场景看一致性,不看单张惊艳度。 一张爆款图不重要,一批物料里角色、色调、版式稳不稳定才决定能不能用。
- 「最便宜」是比价话术。 便宜是真的,但生图最后拼的还是「能不能一次出可用的图」,出图失败的隐性成本,价格表上永远看不到。
想先补基础的话,可以看老达博客的 AI 绘图入门:Midjourney 从注册到出图,或者先搞懂 扩散模型到底在干什么。
适合谁、不适合谁
适合:批量出电商物料和社媒配图的运营;做短剧分镜、影视物料、游戏概念图的创作者;要给自己内容配图的自媒体人;想在应用里嵌生图能力的开发者。
不太适合:要求像素级精细控制的专业修图师;需要明确商用授权条款的项目(预览版阶段,商用条款先问清楚);已经深度绑定某家生态、迁移成本高于省下的钱。
替代方案:字节 Seedream 系列(生图侧的老对手)、谷歌 Nano-Banana Pro(效果口碑好但贵得多)、阿里 Qwen-Image 系列(开源路线可自部署)、以及 Midjourney 这类老牌闭源工具(风格库成熟)。
顺带一提,老达博客之前横评过 Seedance、可灵、MiniMax、Runway 的视频生成能力,也写过 DeepSeek 首款视觉模型把看图成本压到 1 分钱 9 张——国产多模态这条线,今年的主旋律一直是「把单位成本打下来」。腾讯自家的上一代产品 混元 Hy4 走的是开源编程模型路线,和这次的生图模型刚好是两条腿。想看更系统的工具选型,可以去 AI 工具评测专题 和 老达AI实践专题 翻一翻。
老达点评
第一,「只对输出收费」比「单价低」更有价值。 生图工作流里参考图常常是三五张一起喂。按输入计费的模型,名义单价再低,一次任务的真实成本也可能反超。选型时先算任务账,再比单价。
第二,判断一家生图模型能不能进生产,看文本渲染和编辑一致性,不看单张惊艳度。 这两条恰好是海报、信息图、UI 草稿的命门。官方声称升级了,但你不拿自己的业务素材跑二十张,就不知道它到底行不行。
第三,30% 这个数字要放对位置。 内部 GSB 盲测是有效的方向性证据,但它不是第三方榜单。国产厂商在生图侧的打法已经很明显了:先用价格换份额,再用份额换数据,最后用数据换质量。对用户来说,价格战阶段是最划算的窗口期——但别把促销价当成长期成本。
第四,多轮编辑才是下一个战场。 生图早就不是「能不能出图」的问题了,是「改第十遍还顺不顺手」。谁把多轮编辑做顺了,谁才能真正接进商业流水线。