找回密码
 立即注册
搜索
查看: 14|回复: 5

2026 “AI 推理”硬件革命已到来,显卡却有大半时间在闲着

[复制链接]

主题

0

回帖

0

积分

积分
0
发表于 昨天 11:30 | 显示全部楼层 |阅读模式
过去几年 AI 的叙事几乎全在"训练更大的模型",到 2026 年,风向变了。黄仁勋在 GTC 2026 上把这一年叫做"推理的拐点"。IEEE Spectrum 这篇特稿想说明的一件事是:推理其实和你想象的不一样,它正在逼着整个硬件行业换打法。

先说为什么推理突然变成主角。推理模型会一遍遍自我追问(chain of thought),高推理强度下产出的文本可以是没有推理时的 20 倍;再加上 agentic AI,推理不再只是用户问一句答一句,而是 24 小时不停歇地自主干活。需求爆炸的结果是巨头们开始乱点鸳鸯谱:OpenAI 和 Amazon 用上了 Cerebras 那块餐盘大小的 Wafer-Scale 芯片(尽管 Amazon 自己就有 Trainium),Nvidia 花了 200 亿美元把 Groq 的人才和 IP 买回来,Anthropic 则每月付 SpaceXAI 超过十亿美元租它的闲置算力。




训练和推理的计算性质差得很远。训练靠 backpropagation,GPU 天生擅长。推理则分两段:prefill 读完 prompt、算好所有注意力相关的 key/value,这步并行度高,GPU 是强项;decode 是逐 token 生成,每一个新 token 都要把整个模型权重从头读一遍——而模型可能是几十到几百 GB 的参数,加上能膨胀到几十 GB 的 KV cache。研究人员发现,Nvidia H100 跑开源 LLM 时,有 50% 到 80% 的时间是在等数据,计算单元闲着。

所以内存带宽成了这场革命的真正焦点。d-Matrix 的做法是把计算 die 直接叠在 DRAM 上,让数据搬运距离从毫米级压到微米级;Majestic Labs 走另一条路,用专有的铜连接和 memory-aggregator,把内存接口从 HBM 那 2-3 毫米的"海岸线"延长到约一米,一个机架能挂到 128TB 的便宜 DRAM(对比之下 Nvidia 的 GB300 NVL72 机架约有 20TB HBM3E)。两家都不约而同选了最常见的 DRAM——HBM 要比普通 DRAM 贵两到三倍。




d-Matrix stacked-die 架构

大厂则是"全都要"的组合拳。Nvidia 让 Rubin GPU 干 prefill 的注意力计算,砍掉大部分算力的 Groq 3 LPU 靠 500MB 片内 SRAM 专攻 decode——LPU 的内存带宽是 GPU 的 7 倍,256 颗拼成一个机架大小的 Groq 3 LPX。AWS 的搭配是 Trainium 负责 prefill、Cerebras WSE-3 负责 decode——后者把整片晶圆做成一个芯片,片上刻了 44GB SRAM,能直接装下 40 到 800 亿参数的权重。OpenAI 用它跑 GPT-5.3-Codex-Spark,每秒吐 1000 多个 token,对比标准部署的 50 到 125 个。

软件侧的比特精度优化也在同步进行。Nvidia 造了个 4-bit 格式 NVFP4,AMD、Intel、Qualcomm 则抱团推 MXFP4。Nvidia 说把 DeepSeek-R1 从 FP8 量化到 NVFP4 之后,七个主流基准的分数下降不到 1%,性能却提升了 3 倍。更激进的还有 Tensordyne,用对数数制把芯片里的乘法换成加法,声称 1300 token/秒/用户、功耗不到可比 Nvidia 硬件的十分之一;Etched 干脆把 transformer 结构直接烧进硅片,跑 Llama 70B 能达到每秒 50 万 token,代价是无法适应偏离典型 transformer 的新架构。

哪种会赢?业内更倾向于这不是单选题。Moor Insights 的 Matt Kimball 的说法是,推理需求看不到尽头——"你可以在组织里塞进一百万个 agent,它们一天工作 24 小时,不像我们下午五点到点就下班。" 或许推理硬件会走上 CPU 的老路:不是沿单轴升级,而是多条技术路线同时开花。

来源:

Inside the Inference Hardware Revolution Of 2026(IEEE Spectrum)

原文链接

打赏作者

当前余额:0 Token,打赏后立即到账

主题

0

回帖

0

积分

积分
0
发表于 昨天 11:45 | 显示全部楼层
过去几年 AI 的叙事几乎全在"训练更大的模型",到 2026 年,风向变了。
这段深有同感,“AI确实是这样。

主题

0

回帖

0

积分

积分
0
发表于 昨天 12:15 | 显示全部楼层
好帖,先顶后看,慢慢消化。

主题

0

回帖

0

积分

积分
0
发表于 昨天 12:45 | 显示全部楼层
先马后看,“AI的资料太散了,这篇梳理得挺清楚。

主题

0

回帖

0

积分

积分
0
发表于 昨天 13:15 | 显示全部楼层
有一说一,现在肯把“AI讲这么细的人不多了。

主题

0

回帖

0

积分

积分
0
发表于 昨天 13:45 | 显示全部楼层
这种认真写长文的楼主不多了,必须支持。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

{ template common/footer}