Hacker News 中文摘要

RSS订阅

更小、更快、更安全:大规模运行Kimi与GLM -- Smaller, faster, safer: running Kimi and GLM at scale

文章摘要

Cloudflare通过量化KV缓存、压缩模型权重及保护共享缓存三项技术,成功在GPU上高效运行Kimi和GLM等大型混合专家模型,在保持精度的同时降低成本并提升速度。

文章总结

更小、更快、更安全:大规模运行Kimi与GLM模型

Cloudflare的Workers AI在靠近用户的GPU上运行全球顶尖开源模型,其中Moonshot的Kimi K系列和Z.ai的GLM是两款能力最强、资源需求也最高的模型。它们属于大规模、长上下文、混合专家模型,使用体验出色,但因内存限制,高效服务难度极大。

本文聚焦于三项优化技术:KV缓存量化、模型权重压缩,以及共享缓存保护。这些技术使我们能在不降低模型准确性的前提下,以更低成本支持更多客户。

KV缓存量化:模型生成文本时,会将已处理token的注意力键值存储在KV缓存中。默认采用16位精度(BF16),我们改用8位浮点(FP8),使缓存大小减半。以Kimi K2.6为例,单GPU可容纳的上下文从约68.6万token提升至137万。虽然FP8单次请求速度略慢,但能支持64个并发请求(BF16仅支持32个),总吞吐量达2192 token/秒,比BF16峰值高41%,且每token成本降低约30%。经评估,FP8与BF16缓存对模型输出无显著影响。

模型权重压缩:针对GLM 5.2,我们将权重从8位浮点压缩为4位整数(INT4),模型体积从705GB降至421GB(减少40%),单GPU内存占用从88GB降至52GB,为KV缓存腾出约118万token的空间。解码阶段因需从内存流式读取权重,INT4权重传输数据更少,单请求速度提升55%,并发场景下提升16%-27%。预填阶段因需解压权重,INT4速度略慢(8660 vs 10160 token/秒)。通过分离预填与解码,我们可在解码时用INT4、预填时用FP8,实现最优性能。评估显示INT4与FP8权重准确性无差异。

共享KV缓存保护:上述优化使更多请求共享GPU内存,但数百个请求同时读写同一物理缓存,即使十亿分之一的错误也会频繁出现。我们构建了KV缓存完整性检查机制:为每个物理缓存页分配标签,记录请求对应的页与标签,在解码操作前验证映射关系。若发现不匹配,则终止受影响请求,防止返回错误数据。该检查对吞吐量和尾延迟的影响均低于1%,且可按需启用,无需此功能的部署无额外开销。

未来方向:我们将扩展FP8 KV缓存至更多设备,验证Blackwell架构上的NVFP4权重,并致力于将完整性检查以极低成本全面部署。这些优化将持续支持更多客户,同时保持低成本和高准确性。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 对KV量化透明度的认可(评论2,评分None):评论者赞赏Cloudflare公开KV缓存量化做法,指出其他供应商可能暗中进行,且KV量化对质量影响可能大于权重量化。关键引用:“Nice to see a provider being transparent about KV cache quantisation... KV quantisation can degrade quality more than weight quantisation.”

  2. 对测试不充分的批评(评论2,评分None):认为测试仅针对Kimi K2.6,未涵盖对KV量化更敏感的模型家族;且评估套件缺少编码基准,长期任务中工具调用错误会累积。关键引用:“some model families are more sensitive to KV quantisation than others... evaluation suite... is noticeably lacking coding benchmarks.”

  3. 对量化隐瞒的质疑(评论4,评分None):批评Cloudflare仅在博客中提及量化,未在模型页面警告,且用短上下文任务掩盖差异,认为对编码代理影响严重。关键引用:“serving quantized models without saying so on the 'store' page is fraud... Coding agents will probably be severely negatively affected.”

  4. 对定价不透明的抱怨(评论3,评分None):无法直接查看定价,需跳转仪表板。关键引用:“I wanted to see if it’s worth it to use cloudflare’s endpoint but I can’t even see the pricing.”

  5. 对AI生成内容的怀疑(评论1,评分None):因段落开头“It's worth being precise...”触发“slop detector”,认为内容像AI生成,降低阅读兴趣。关键引用:“my slop detector went off... I love AI, but I really hate reading it.”

平衡性总结: - 正面观点:认可透明度,但要求更详细测试。 - 负面观点:批评量化隐瞒、测试不足、定价不透明及内容疑似AI生成。 - 中立建议:希望明确职位要求(评论5)。