文章摘要
文章指出,随着推理需求激增和前沿模型频繁发布,NVIDIA GPU价格飙升,而AMD MI355X以约2.75倍的成本优势成为廉价推理的解决方案。但AMD在软件支持和模型优化上落后于NVIDIA,需要大量工程投入才能运行最新模型,始终处于追赶状态。
文章总结
我们注意到您对AMD的关注。推理需求正急剧增长,远超供应。前沿模型几乎每隔一周就会发布——例如Claude Fable、GLM5.2和Minimax M3——代币热潮愈演愈烈,而Blackwell芯片的供应已无法满足需求。因此,NVIDIA GPU价格迅速攀升,代币成本变得极其昂贵。
此时AMD登场。其MI355X GPU平均价格约为B300的2.75倍,硬件规格相当,为低成本推理提供了显而易见的解决方案——这是Wafer数月来一直强调的观点。尽管AMD的Instinct MI350系列在芯片层面与Blackwell竞争,但NVIDIA的软件优势和首发支持通常能让供应商在其硬件上以更低的摩擦实现更快的推理。
相反,在MI355X/ROCm堆栈上,这些前沿模型很少能开箱即用地实现顶尖性能(有时也能做到)。事实上,能找到运行这些模型的镜像已属幸运。缺乏这种首发支持意味着,为最新模型进行构建和优化可能需要数周的工程和计算工作。到那时,更新的模型已经发布,使得AMD总是处于追赶状态。
但随着智能体在内核和模型优化方面的进步,这一差距正在实时缩小。在Wafer,我们已多次证明这一点。
再次以20k输入/1k输出、60%缓存命中率的工作负载为例,我们实现了每节点2626 tok/s的聚合吞吐量,每秒请求数(RPS)为2.4,且首令牌时间(TTFT)≤5秒——尽管成本低2倍以上,性能仍达到B200的80%。
| 持续RPS | 聚合tok/s/节点 | TTFT p50/p95 | 成功率 | |---------|----------------|--------------|--------| | 0.5 | 449 | 0.59s/0.60s | 100% | | 1.0 | 974 | 0.60s/0.81s | 100% | | 1.5 | 1913 | 0.62s/1.03s | 100% | | 2.0 | 1944 | 0.62s/1.05s | 100% | | 2.25 | 2089 | 0.63s/1.23s | 100% | | 2.4(饱和) | 2626 | 0.81s/2.22s | 100% |
我们还在GLM5.2上实现了213 tok/s的单流性能(10k输入/1.5k输出),遵循Artificial Analysis标准,使用TensorWave的AMD MI355X容量。尽管这一数字未登顶AA排行榜,但在性价比上仍具优势。
我们的实现方法
任何模型工作的第一步是选择量化和框架。我们使用AMD Quark将基础bf16 GLM-5.2量化为MXFP4。与z-ai的官方FP8量化相比,我们的MXFP4是无损的(GPQA-Diamond、tau2、GSM8K)。
| 评估指标 | FP8基线 | MXFP4 | Δ(MXFP4 − FP8) | |---------|---------|-------|-----------------| | GSM8K(200题,5-shot,贪心) | 0.965 ± 0.013 | 0.955 ± 0.014 | −0.010 | | GPQA-Diamond(198题×2种子,温度1.0) | 0.9217 ± 0.027 | 0.9026 ± 0.029 | −0.019 | | tau2宏平均 | 0.819 | 0.834 | +0.015 |
至于推理框架,我们有三个选择——vLLM、ATOM和sglang。我们选择了sglang——vLLM没有可用的MXFP4+GlmMoeDsa路径,因此MXFP4权重无益;而ATOM在长上下文时输出质量下降。Sglang是原生支持摩擦最小的推理引擎,能利用量化优势同时保持连贯性。
提高吞吐量的下一步是启用sglang的推测解码。然而,sglang的ROCm镜像不支持开箱即用。需要两个修复才能使MTP正常工作。
首先,MTP头与其他层一样,其单一共享专家以bf16而非MXFP4存储。但MTP头注册在不同于主解码器堆栈的模块前缀下(Quark将bf16共享专家命名为model.layers.78.mlp.shared_experts.*,而MTP层的实际前缀是model.decoder.*)。由于不匹配,sglang的量化查找失败,默认将该共享专家构建为MXFP4。加载时,它尝试将全宽bf16权重读入半宽4位槽位,导致初始化因形状不匹配而崩溃。Quark将未量化的权重记录为层名列表,我们将第78层条目以sglang实际使用的解码器名称复制到该列表中。此修复解除了推测解码的阻塞,使单流吞吐量提升近3倍。
其次,深度推测解码(如z-ai建议的5/1/6配置)仍被阻塞。用于草稿深度≥4的融合多步元数据内核包含#include <cuda_runtime.h>,且无ROCm保护。修复:添加一个#ifdef USE_ROCM保护。
两个微小但必要的更改,以充分利用推测解码。推测解码正常工作后,结合一些配置优化(如--kv-cache-dtype fp8_e4m3和--enable-aiter-allreduce-fusion),我们达到了213 tok/s的单流解码数字。
但对于聚合吞吐量,尤其是在我们定义的工作负载下,解码优化是必要但不充分的。在20k输入@60%缓存的情况下,工作负载主要受预填充限制。
在TP8配置(针对单流解码优化)下,MI355X能以1461 tok/s/节点运行GLM5.2-MXFP4。切换到TP4×DP2后,该工作负载获得巨大改进,在2.0 RPS下达到1944 tok/s/节点——但仍比我们测量的Blackwell性能(3.0 RPS下3192 tok/s/节点)慢。MI355X预填充性能不佳的一个主要原因是,在sglang镜像上,GLM-5.2的fp4 MoE静默地使用慢速FlyDSL启发式回退(aiter仅为a8w8/fp8路径提供调优配置)。我们自行针对GLM的fp4形状(model_dim 6144, moe_inter 2048, E=256, topk=8)调优了MoE内核选择,从而在2.4 RPS下达到2626 tok/s/节点。效果显著提升。
为何重要
尽管存在一定摩擦,但在MI355X上实现最佳性价比并不特别困难——虽然存在一些框架相关的错误,但与我们对Qwen3.5 397B的工作不同,您会注意到这次我们实际上没有编写任何自定义内核。尽管本研究未考虑多节点性能,但单节点部署在实践中仍然非常普遍。
AMD上的顶尖性能正更多地成为支持问题,而非软件问题。CUDA护城河正在实时侵蚀。
评论总结
根据评论内容,主要观点和论据如下:
性能与成本平衡(评论1,评分None):用户关注AMD在性能功耗比和性价比方面的竞争力,尤其在美国以外电力成本较高的地区。关键引用:"Can you folks add performance per watt as a metric... If AMD is competitive performance per watt and roughly reliable in terms of software support";"outside of China and US electricity tends to at a relative premium"。
毛利率与利用率(评论2,评分None):质疑云服务商是否维持80%以上毛利率,或利用率等因素侵蚀利润。关键引用:"Do these providers have 80+% gross margins or is something eating into them? Maybe utilization?"。
架构优化与算力利用(评论3,评分None):认为针对不同架构的智能编码驱动能释放大量未充分利用的算力。关键引用:"Agentic coding drivers for different architectures is a massive unlock for the world";"So much compute is under utilized waiting for a savant or company to prioritize an architecture"。
性能数据解读(评论4,评分None):指出2600 tok/s是聚合值而非实际吞吐量。关键引用:"The 2600 tok/s is an 'aggregate', not the actual throughput"。
竞争格局(评论5,评分None):认为Rubin在推理性能上比Blackwell快5倍,Blackwell未针对推理优化。关键引用:"Rubin is 5x faster than Blackwell at inference - Blackwell is the last generation Nvidia didn't optimize specifically for inference"。
精度与性能权衡(评论6,评分None):指出从fp8切换到mxfp4时存在明显精度下降。关键引用:"There's noticeable accuracy degradation when they switched from fp8 to mxfp4"。
缓存与量化影响(评论7,评分None):质疑60%缓存命中率和量化模型对性能的实际贡献,尤其与全精度GLM5.2对比。关键引用:"how much legwork the assumed 60% cache hit, plus running a quantised model is doing?";"compared to what the headline half implies is a full fat GLM5.2"。
消费者视角缺失(评论8,评分None):批评未说明对消费者的实际意义,如价格是否低于NVIDIA服务。关键引用:"No word on what this actually means as a consumer. What's the price. Is it lower than NVIDIA serving?"。
平衡总结:评论呈现多元视角,既有对AMD在非美国市场潜力的探讨(关注性能功耗比和供应),也有对技术细节(精度、缓存、量化)和商业指标(毛利率、定价)的质疑。部分评论强调竞争格局变化(Rubin vs Blackwell),另一些则关注实际应用中的权衡(精度损失、算力利用)。整体上,评论者既认可技术进展,也指出信息缺失和潜在问题。