8 月 14 日晚,阿里通义千问团队把 Qwen3.8-27B 的权重放上了 Hugging Face 和魔搭社区,Apache 2.0 协议,免费商用。消息一出就冲上 Hacker News 榜首,一天上千赞。
这是最近国产开源模型”轮番上阵”里,最值得普通开发者和个人用户关注的一个:27B(270 亿)参数,是社区呼声最高的尺寸——既不像 2.4 万亿参数的旗舰那样只能靠 API,又能在家用显卡上真正跑起来,还不牺牲太多能力。
下面我把它的性能、硬件门槛和上手路径一次讲清楚。
它到底强在哪:几个关键基准
先看一组阿里官方给出的数据,社区复现还在陆续验证中,先当一个方向性的参考:
- OSWorld-Verified(GUI 智能体操作):63.9 分涨到 84.3 分,涨了 20 分出头
- SWE-bench Pro(软件工程):53.5 分涨到 61.7 分
- Terminal-Bench 2.1(终端智能体):63.4 分涨到 73.0 分
- LiveCodeBench v6(编程):90.3 分
重点不是”比上代 Qwen3.6-27B 涨了多少”,而是”27B 这个量级打到了什么水平”:在 CoWorkBench 长程办公任务上拿到 70.7 分,超过 Anthropic Opus 4.6 Max 的 68.2 分;在 LiveCodeBench v6 上 90.3 分,也压过 Opus 4.6 Max 的 88.8 分。
也就是说,”智能体、长程任务必须靠闭源旗舰”这条默认认知,被这个 27B 的本地模型撕开了一道口子。
硬件门槛:你的电脑跑得动吗
27B 是稠密(Dense)模型,不是 MoE,显存需求直接和量化精度挂钩:
- 4-bit 量化(GGUF):权重约 16GB,算上 KV cache 实际要 20 到 24GB,RTX 4090(24GB)是舒服的下限
- FP8:约 28GB,要 L40S 或 RTX 6000 Ada 这个级别
- BF16 全精度:约 56GB,基本是 H100/H200 的活
好消息是 Mac 党也能玩:4-bit 版本约 16GB,一台 32GB 内存的 MacBook Pro 或 Mac Studio 就能跑。AMD 这边给了 Day 0 支持,Radeon AI PRO R9700(32GB)实测约 51.8 tokens/s。
如果你手头是 12GB、16GB 的中端卡,想舒服跑还得靠 Ollama 的量化版,或者老老实实用 API。别指望把 27B 全精度塞进一张入门卡。
三条上手路径
- 最省事:Ollama,直接
ollama run qwen3.8:27b - 生产环境(OpenAI 兼容接口):vLLM,
vllm serve Qwen/Qwen3.8-27B --tensor-parallel-size 2 - 系统提示词大、多请求共享时:SGLang,前缀缓存能省不少
另外它新增了一个 reasoning_effort 参数,可以按任务难度调思考深度;用 enable_thinking=false 直接关掉思维链,对延迟敏感的场景更实用。
适合谁,不适合谁
适合:
- 想本地私有化部署、数据不出门的中小团队
- 跑长程 Agent 任务、又不想被闭源 API 锁定的开发者
- 想把模型嵌进自家产品的团队,Apache 2.0 没有授权摩擦
不适合:
- 追求极致吞吐的高并发场景,托管 API 在上下文成本上仍有优势
- 显存不足 16GB 的个人用户,跑起来会有点勉强
老达点评
老达对”开源模型跑分超越闭源旗舰”这件事,一直是半信半疑——官方跑分看看就好,真上手才是王道。但 Qwen 这次的信号,不在分数,而在”27B + Apache 2.0 + 消费级硬件”这套组合:它把”本地私有化部署”这件事,从发烧友玩票,拉到了”小团队真能上生产”的门槛上。
配合此前 DeepSeek 开源 Harness、智谱开源 GLM-5.3,国产开源这波已经不是”追赶”,而是在重新定义 AI 基础设施的默认选择。对普通用户来说,最实在的收获是:跑一个不联网、数据不出门、能力还过得去的本地 AI,成本正在肉眼可见地下降。