把大模型“硬刻”进硅片:AMD 收购 Taalas,揭开推理芯片终局的极客死磕

把大模型“硬刻”进硅片:AMD 收购 Taalas,揭开推理芯片终局的极客死磕

在通用 GPU 统治 AI 算力的时代,居然有人敢把特定的 LLM“硬刻”进芯片电路里,做到一款芯片只能跑一个模型。

这听起来像极了上个世界的“反向退化”,但在 AMD 宣布收购 AI 推理专用芯片公司 Taalas 后,这项激进的技术路线获得了产业巨头的最强背书。

Taalas 的测试数据震撼了整个硬件圈:把 Llama 3.1 8B“刻进”芯片后,单用户推理速度飙到了接近 17,000 TPS/user(作为对比,Nvidia H200/B200 处理同款模型的商业推理速度普遍在几百到一千 TPS)。更夸张的是,它的推理成本降到了每百万 Token 只要 0.75 美分,功耗和 TCO(总拥有成本)直接拉到了 GPU 的几十分之一。

当全行业都在为 HBM 缺货发愁、为液冷机柜买单时,Taalas 搞出了这样一台“复古狂魔”。这是纯粹的技术噱头,还是通用 GPU 在推理侧统治力瓦解的信号?

极客暴论:为什么把模型“写死”在硅片上反而成了解药?

理解 Taalas 的逻辑,首先要明白当前 GPU 跑 LLM 推理时有多难受。

大模型推理主要分为两个阶段:预填充(Prefill)解码(Decode)。预填充是计算密集型,处理上下文,GPU 加 HBM 跑得飞快;但解码阶段是典型的内存带宽受限型(Memory-bound),每次生成一个 Token 都需要把巨量的模型权重从内存重新搬进计算核心。

为了在 GPU 上维持低延迟,厂商只能疯狂堆卡、堆 HBM。结果就是:单用户速度拉上去了,系统的整体吞吐效率和能耗直接崩塌。今年 Uber 的 CTO 甚至向媒体抱怨,公司才到 4 月就耗尽了原本为整个 2026 年准备的 AI 预算。

Taalas 的解法极其暴力:彻底撕掉通用计算的包袱。

1. 存内计算(CIM)与掩膜 ROM:它创建了一个由硬件定义的 AI 核心模型,把模型权重直接硬编码到“基于掩膜 ROM 的权重结构”中。计算直接在存储结构内完成,彻底消除了数据在内存和算力单元之间频繁搬运的“内存墙”。 2. 免去 HBM 与液冷:因为模型权重被刻进去了,芯片根本不需要高价且限售的 HBM,也不需要复杂臃肿的 CUDA 软件栈和底层 Kernel 优化。单机架功耗仅 12-15 kW(GPU 机架通常高达 120-600 kW),普通风冷就能搞定。 3. 微调弹性:虽然模型刻死了,但 Taalas 留出了可编程 SRAM 用于存放微调权重(LoRA)和 KV Cache。如果开源模型升级了,Taalas 的自动化工具可以在一周内把新模型转为 RTL 代码,只需要修改 2 层掩膜就能重新出片。

撕开 GPU 护城河:推理不是“一锤子买卖”

AMD 为什么要买下这家只有 24 人的小公司?因为在 AI 算力的下半场,训练是“一锤子买卖”,而推理是永不停歇的“持续运营成本”

在训练阶段,算法天天变,架构月月换,GPU 的通用性是绝对的王道;但在商业化落地的推理阶段,客户第一在乎的是 TPS(实时响应速度),第二在乎的就是 Token 成本。

当千行百业的 AI Agent 真正跑起来,每秒消耗数万 Token 时,用昂贵且娇贵的 GPU 集群去搞简单的 Token 生成,就像用超跑去天天送快递——能送,但财务报表绝对要崩。

Taalas 的路线看似牺牲了通用灵活性,但对于特定高频模型(比如打底的 Llama 系列或 DeepSeek 系列),它把单位算力性价比推到了极致。AMD 将 Taalas 的专用结构与自己的 Instinct GPU 绑定,刚好打出了一套“通用预填充 + 专用极速解码”组合拳。

Kate 的观点与判断

对于硬件产业和企业 AI 部署,我有三个明确的判断:

1. AI 硬件正在走向“剥离通用性”的精细化分工。通用 GPU+CUDA 依然是安全牌,但绝不会是唯一解。从 Groq 的 LPU 到 Etched 的 Transformer 专用 ASIC,再到 Taalas 的“模型刻芯片”,所有人在做的其实是一件事:把算力成本从 GPU 的垄断溢价里解救出来。 2. 端侧和边缘 AI 将是专用推理芯片的终极战场。将模型“刻在芯片里”对于变化莫测的云端是一把双刃剑,但对于边缘侧(如机器人、汽车、工业检测设备)和端侧 AI 硬件,这绝对是杀手锏。端侧设备追求极低的功耗、极高的实时性和绝对的隐私,且不可能频繁更换模型架构。 3. 中国 AI 芯片创业者的绝佳破局点。在云端通用 GPU 受到高带宽内存(HBM)和先进制程围追堵截的当下,专注于无需 HBM、基于开放指令集的 ASIC 专用推理芯片,结合国内成熟的制程与庞大的端侧硬件生态,反而是最接地气、最容易实现商业闭环的战场。

不要试图用一套架构解决所有问题。大模型时代的硬件进化,才刚刚撕开遮羞布。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注