2026 年 8 月 7 日,AMD 官宣了一笔可能改写 AI 推理格局的收购:将加拿大多伦多的芯片创业公司 Taalas 收入囊中。
这家公司只有 24 个人,成立不到三年,做的芯片却让整个硅谷炸开了锅——它不按常理出牌,干脆不要 HBM 显存,直接把 AI 模型的权重”刻”进硅片里。
结果呢?一颗测试芯片跑 Llama 3.1 8B,每秒输出 16,960 个 token。同场景下,英伟达 B200 GPU 只能跑到它的 1/48。
Taalas 是谁?为什么 AMD 非买不可
Taalas 2023 年成立,三位联合创始人 Ljubisa Bajic、Lejla Bajic 和 Drago Ignjatovic 全部出身 AMD 和英伟达。CEO Ljubisa Bajic 曾是 AMD 集成电路设计总监、英伟达高级架构师,2016 年还联合创立了另一家 AI 芯片公司 Tenstorrent。
简单说,这是一支从 AMD 走出去、对 GPU 架构了如指掌、又回来做了一件”反 GPU”事情的团队。
他们的核心思路叫 MSIC——Model-Specific Integrated Circuit,模型专用集成电路。传统 GPU 做推理时,模型权重存在 HBM 显存里,每次计算都要从显存搬运数据,这个过程既耗电又费时间。Taalas 的做法简单粗暴:把权重直接用掩模 ROM 的方式蚀刻进芯片,模型”长”在硬件上,数据搬运的瓶颈直接消失。
性能有多夸张?
今年 2 月,Taalas 发布了首款测试芯片 HC1,台积电 6nm 工艺,815 平方毫米面积,530 亿晶体管,功耗约 200W。
官方自测数据:
- 运行 Llama 3.1 8B:每秒 16,960 token
- 比英伟达 B200 GPU 快约 48 倍
- 比 Cerebras 晶圆级加速器快 8.5 倍
- 推理成本降至传统方案的约 1/20,功耗降一个数量级
Taalas 还模拟了 DeepSeek R1 671B 的多芯片方案:大约 30 颗定制芯片协同工作,每用户每秒仍可输出约 12,000 token。
第二代芯片 HC2 预计今年夏季推出,单芯片参数量提升到 200 亿。按这个节奏,50 颗 HC2 就能撑起一个万亿参数模型的推理服务。
代价:快是真的快,灵活也是真的不灵活
MSIC 的致命弱点是灵活性。一颗芯片只能跑一个模型,换模型就得重新设计芯片。
Taalas 说,换模型只需要重新设计两层金属掩膜,从模型权重到可部署的 PCIe 卡最快约两个月。但对大多数 AI 公司来说,两个月等一颗新芯片来适配新模型,节奏上很被动。
而且 HC1 在开放测试中也暴露了问题:虽然速度快得离谱,但在”9.9 和 9.11 比大小”和鸡兔同笼这类基础推理题上,它给出了错误答案。速度不等于质量,这也是目前 MSIC 路线需要跨过的一道坎。
AMD 的算盘:GPU 做前处理,Taalas 做生成
AMD 的收购逻辑很清楚:不是用 Taalas 替代 GPU,而是”GPU + Taalas”协同。
具体的架构设想是:AMD Instinct GPU 负责 prompt 处理(预填充阶段),Taalas 加速器负责 token 生成(解码阶段)。预填充需要灵活性处理各种输入,GPU 擅长;解码是重复性极高的自回归过程,MSIC 的速度优势正好发挥。
AMD 还计划将 Taalas 技术整合进 Helios 机架方案,与 EPYC CPU、ROCm 软件栈构成系统级推理平台。交易预计 2026 年 Q4 完成,需监管批准。
对 AI 推理经济意味着什么?
这件事的影响远不止 AMD 和英伟达的竞争。
想象一下:如果推理成本降为现在的 1/20,很多现在”算不起”的事情就变得可行了。实时 AI 对话、大规模 Agent 集群、24/7 自动化工作流——这些场景的瓶颈目前很大程度就是推理成本。老达之前分析过,通过多模型路由优化 API 成本能砍掉 70% 的开销,但如果硬件侧也能同步突破,AI 工具的普及速度会再上一个台阶。就像 DeepSeek V4 Flash 引发的 API 价格战一样,基础设施层面的成本下降,最终都会传导到每个用户手里。
更深一层,MSIC 路线如果跑通,可能会倒逼模型厂商重新思考设计哲学。当一个模型被”烧”进芯片后能稳定运行几个月甚至一年,模型迭代的速度(以及商业模式)都会受到影响。
当然,现在说 Nvidia 的垄断会被打破还为时过早。Taalas 的芯片还没大规模量产,MSIC 的灵活性缺陷也没解决。但方向是对的:AI 推理的硬件创新,在过去两年几乎被 GPU 垄断了话语权,Taalas 的出现至少证明了另一条路是通的。
老达点评
AMD 这笔收购,与其说是买一家芯片公司,不如说是买了一条新路线。
GPU 做推理的本质问题是”通用硬件的浪费”——为了灵活性,付出了巨大的功耗和数据搬运成本。Taalas 用”不要灵活性”换来了 48 倍速度提升,这个取舍逻辑是对的:当某些模型(比如 Llama、DeepSeek 的开源模型)已经在生产环境稳定运行,把它们固化到专用硬件上,经济上完全说得通。
但这条路也有风险。AI 模型迭代太快了,一个模型刚”刻”进芯片,下一代可能已经出来了。AMD 赌的是:不是所有场景都需要最新模型,大部分推理任务是重复性工作,专用硬件的效率优势足以覆盖灵活性损失。
对于普通用户来说,这背后最大的好消息是:AI 推理成本还在降,而且降幅惊人。不管是哪家芯片公司跑出来,最终受益的都是用 AI 的人。
参考来源:AMD 官方公告、Taalas 官方博客、芯东西、凤凰网科技、CNBC 等综合报道。