阿里 Qwen3.8-Omni-Flash 上线:一次看完两小时视频,音视频输入降价超 93%

深蓝暗色工作台上,胶片带、声波带、文档与照片四种素材经一条发光青色通道汇入中央的环形检视镜头,镜头只挑出少数高亮片段送向右侧一叠发光的琥珀色内存方块,未使用的灰色胶片带垂落到桌面下方,台面下方一只仪表指针向下滑动
内容摘要

阿里把音视频从「看得懂」推进到「能干活」:Qwen3.8-Omni-Flash 用百万级上下文一次吞下两小时视频,靠选择性观看省掉近一半 token,音视频输入价格降幅超过九成。本文拆解它真实的能力边界、这笔成本账该怎么算,以及最可能先跑通的三个使用场景。

视频 AI 的老问题是:模型能看懂,但你不一定付得起。

9 月 18 日,阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash。它支持文本、图像、音频、视频四种输入,带 1M token 上下文,官方定的目标很直白——把全模态模型从”理解内容”推到”规划任务、调用工具、完成创作”。换句话说,不只是给你一段视频摘要,而是让它真的去剪片子、翻字幕、写纪要。

这次发布最值得看的不是跑分,是两条曲线同时往下走:token 消耗降了约 46%,音视频 API 价格降了九成以上。

这次发布的三个硬指标

先把官方口径摆出来。所有数字都来自阿里自己的评测,这一点后面会专门说。

能力: 在累计 29–30 项评测中,Qwen3.8-Omni-Flash 相比上一代 Qwen3.5-Omni-Plus 平均提升超过 25%。分区看更清楚——音视频 Agent 场景 WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,UniClawBench 拿到 69.6 分;长音频 LongAudioSpan 涨 8.3 分,OmniVideoBench 涨 9.6 分。

最能说明问题的是一组会议指标:AliMeeting 的说话人分离错误率(DER)和拼接词错误率(cpWER)从 88.11 / 89.61 降到 3.35 / 17.18。这个跃升幅度已经不像是模型微调能单独做到的,更多是把周边音频处理工程一起重做了——后面会提到分析人士也是这么看的。

长度: 上下文接近 100 万 token(官方口径最大输入约 99.1 万),单次请求最多吃 2 小时视频或 3 小时音频。会议、讲座、短片都不用先切片再喂。

价格: 文本侧 $0.15 / 百万输入 token、$0.47 / 百万输出 token,缓存输入 $0.016 / 百万。按媒体小时折算,音频输入每小时不到 0.01 美元,720p、1 帧/秒的音视频输入约 0.20 美元/小时——注意这还不含模型输出费用。官方给的降幅是:音频输入价格降超 98%,音视频输入价格降超 93%。

作为参照,Google Gemini 3.8 Flash 目前是 $0.75 输入 / $3.75 输出(推广期价格,2027 年 1 月 1 日起翻倍)。阿里自己承认音频能力整体超过 Gemini 3.8 Flash、音视频能力接近它,但在部分纯视频推理基准上 Google 仍然领先。

「选择性观看」是怎么省掉一半 token 的

这是全文最值得抄的一个设计思路。

过去的视频理解模型基本是”固定间隔抽帧”——每 1 秒抓一帧,2 小时视频就是 7200 帧全部塞进上下文。帧越多越贵,但真正有用的信息可能只在其中十几个片段里。

Qwen3.8-Omni-Flash 换了做法,官方叫 agentic perception(智能体式感知):模型先判断”这段素材里该看哪里、该听哪里”,再由粗到细做几轮取证,最后才回答。不是扫描每一帧,而是像人一样先拖进度条找位置。

效果在一个内部长视频基准上是这样的:准确率从 63.4 提到 67.8,而每次查询消耗的 token 从约 145,736 降到 79,117,少了 45.7%

这条曲线的意义在于,它同时解决了两件事。一是钱:token 少一半,单价再降九成,两项叠加之后长视频处理的成本结构就完全不一样了。二是质量:不看全部帧反而更准,因为固定抽帧本身就会漏掉关键瞬间,也会用大量重复帧稀释注意力。

架构上也不再是”文本模型外挂感知编码器”的拼装方案。它直接建在 8 月已经开源权重的 Qwen3.8-Flash-Next 之上,内部是稀疏 MoE:总参数约 1,250 亿,每个 token 激活约 60 亿,512 个专家。这个组合是为了在保住一个大参数池的同时压住推理成本。

有个细节值得注意:这一代只做输入,输出仅文本,不再像上一代的 Omni-Plus 那样能直接生成语音。牺牲语音生成换理解和工具调用能力,是一笔很明确的取舍。

上线渠道与一个提醒

模型已通过千问 AI 平台、阿里云百炼(Model Studio)和 QwenCloud API 开放,覆盖 6 个地域,包括新加坡、东京和法兰克福。这一版本只提供托管服务,没有开源权重——想本地部署的,可以回看我们之前写的 阿里开源 Qwen3.8-27B,那是另一条路线。

提醒是必须给的:上文所有 benchmark 和成本数字都出自阿里自己的发布材料,目前还没有第三方独立评测。分析人士点出的几个开放问题很实在——在阿里的测试集之外、跨语言和跨视频类型时表现如何?长会话里的多步 Agent 任务可靠性如何?当帧密度和工具调用量变化之后,真实成本还差多少?

这几个问题的答案不会来自发布材料,只会来自第一批上手调 API 的开发者。

开源的两个配套件,才是给开发者准备的

这次同步开源了两样东西,含金量比模型本身更值得关注。

Qwen-MM-Plugins(Apache 2.0 协议):它让现成的编程 Agent 工具,包括 Claude Code、Codex、Gemini CLI 和 Qwen Code,能在本地直接读取图片、视频帧和音频,不必每次都把原始文件丢给托管 API。官方给它的定位是”给已有的 agent harness 补齐本地多模态读取能力”。

这个打法很聪明。多模态接入最烦的一步从来不是调 API,而是把视频切成帧、把音频转成片段、再想办法塞进工具链。插件直接铺到别人家的 harness 上,等于不逼你换工具,只让你多装一个扩展。

Qwen-Live Harness:面向实时连续多模态交互。配套还有一个 Realtime SKU,提供低延迟流式响应、口音感知的口语练习,以及能估计声音方向和距离的空间音频提示。发布日期官方还没给。

顺手把两件事串一下:如果你已经在用 MCP 协议 组织工具链,这类插件的接入成本会更低;而 WebMCP 把网页变成工具 的方向,和”让 Agent 直接处理音视频素材”其实是同一件事的两面——都在把多模态输入变成 Agent 的常规输入。

老达点评

第一,音视频正在从”内容”变成”介质”。 过去多模态模型是个理解器:你给它一段视频,它还你一段总结。这一代的定位是执行器:给它一段素材,它规划步骤、调工具、交片子。阿里在发布稿里那句”音频和视频正在从感知输入,变成 Agent 理解环境、推理并执行任务的核心介质”,翻译过来就是这个意思。这个转变成立的前提不是模型更聪明,而是成本先塌下来——单价降九成、token 省一半,才有了”随手跑一遍”的可能。

第二,自报数字要当自报数字看。 26% 的平均提升、46% 的 token 节省、98% 的降价,全部来自同一份发布材料。这不算问题,厂商发新品本就该自报成绩,但你要清楚它们的边界。我的建议是:真正决定要不要上的,不是 WildClawBench-MM 提升了多少分,而是你拿自己业务里最长、最脏的那段音视频跑一次,看账单和结果。尤其是会议转录那个大跳跃,官方材料里没有拆开说明模型和音频工程各占多少——这块最好自己验。

第三,开源插件比开源权重更实用。 这代模型不开权重,短期内也看不到。但 Qwen-MM-Plugins 兼容 Claude Code、Codex、Gemini CLI,意味着你不换主力工具也能吃到它的多模态能力。对普通用户来说,这比”权重开源”更容易转化成生产力。整个 2026 年的模型竞争,胜负手正在从”谁的分数高”转向”谁能更低成本地嵌进你已有的工作流”——Kimi 把百万上下文向全档开放 是这个逻辑,DeepSeek 用非对称架构把 KV 缓存压到四分之一 也是这个逻辑。

三个最可能先跑通的场景

如果你准备试,按”投入产出比”排序,我建议从这三个开始。

一是长会议纪要。 单次 1 小时的音视频输入,直接输出说话人分离、转录、纪要,还能接着调工具去发邮件或者起一段代码。这是官方明确支持的工作流,也是 AliMeeting 指标大幅改善对应的场景,最容易验证。

二是长视频摘要与二次创作。 2 小时素材一次进,做影评、做解说、剪 vlog、翻短视频字幕。这类场景对成本最敏感,而恰好是这代价格降幅最大的部分。

三是本地素材预处理。 装 Qwen-MM-Plugins,让你现在用的编程 Agent 能在本地读图、读帧、读音频。适合有敏感素材、不方便整包上传的情况。

至于实时交互那套(Qwen-Live Harness + Realtime SKU),先别急着排期,官方连发布时间都没定。想了解同类工具怎么选,可以看 AI 工具评测专题 里已有的横评。

常见问题

Q:这一代能生成语音吗?

不能。只支持文本、图像、音频、视频输入,输出只有文本。这是和上一代 Qwen3.5-Omni-Plus 最大的行为差异。

Q:1M 上下文是真的能用满吗?

官方给的最大输入约 99.1 万 token。但真正决定体验的不是上限数字,而是它在长上下文里的检索稳定性——建议用自己的长素材实测,别只看宣传值。

Q:本地能部署吗?

这一版本没有开源权重,只能走千问 AI 平台、阿里云百炼或 QwenCloud API。想本地跑,去看 Qwen3.8-27B

Q:和 Gemini 3.8 Flash 比该选谁?

阿里自己的说法是音频更强、音视频接近、部分纯视频推理仍落后,但价格低一个量级。如果成本是硬约束,值得先压测 Qwen;如果对视频推理精度要求极高,两边都跑同一批素材再决定。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *