文章摘要
该文章探讨了利用退役的NVIDIA企业级GPU(如K80、P100、V100)进行现代工作负载测试的可行性,指出这些显卡价格低廉且拥有大容量显存,适合用于搭建低成本、高密度的家庭实验室GPU节点。
文章总结
好的,这是根据您的要求,对原文进行中文重述和精简后的版本:
标题:用现代工作负载对15款“电子垃圾”GPU进行基准测试
核心内容:
本文探讨了将已停产的NVIDIA企业级GPU(如K80、P100、V100等)用于现代计算任务的可行性。这些GPU价格低廉(例如,24GB显存的K80仅售60美元),但存在缺乏软件更新和能效较低的问题。作者认为,对于家庭实验室(homelab)场景,这些缺点可以通过使用旧版软件和按需开机来规避。
基准测试内容:
作者开发了一套开源的基准测试工具,用于评估这些GPU在多种现代工作负载下的性能,包括:
- 计算机视觉: 训练和推理ResNet50模型。
- 3D渲染: 使用Blender进行GPU和CPU渲染。
- 视觉Transformer: 图像分析和注意力图生成。
- 大语言模型(LLM): 使用llama.cpp运行Qwen2.5、Llama 3和Qwen1.5 MoE模型,测试提示处理和文本生成速度。
- 科学计算: 分子动力学模拟(Folding@Home)。
- 密码学: SHA-256哈希计算。
- 语音识别: 使用Whisper模型进行语音转文字。
- AI基础设施: 数据从存储加载到GPU内存的吞吐量。
测试硬件:
- GPU: K80, M10, M40, M60, P40, P100, V100, T40
- CPU: E5-2687W (12核), E5-1680 (8核)
- 主板: Asus X99-WS (单路), Supermicro X10DRG-Q (双路)
主要发现:
- GPU代际对比: V100-16GB的性能与更昂贵、更新的T40相当,是性价比很高的选择。P40在LLM任务上优于P100。M60在语音转录(Whisper)任务上表现出色。
- GPU扩展性: 在4U机箱内增加GPU数量,多数测试的性能呈线性增长,没有出现明显的收益递减,这对家庭实验室用户是好消息。但LLM的吞吐量并未随GPU增加而提升,作者推测是llama.cpp配置问题。
- GPU混合: 将高性能GPU(V100)与多块旧GPU(P100)混合使用时,在LLM任务中,V100的性能会被旧GPU拖累。但在其他任务中,GPU数量越多越好。
- CPU对比: 更快的单核CPU性能通常能带来更好的测试分数,尤其是在Whisper和视觉Transformer任务中。核心数量多但单核性能弱的CPU在这些任务中表现不佳。
- 主板对比: 两款工作站级主板(X99-WS和X10DRG-Q)在性能上没有显著差异。
结论与下一步:
作者计划基于测试结果,为他的家庭实验室构建一个低成本的4U GPU节点。他最终选择的配置是:V100 GPU、E5-1680 8核CPU和Asus X99-WS主板,该配置理论上可支持3块V100和一张万兆网卡。作者表示将继续完善测试,并欢迎读者提供反馈。
评论总结
以下是对评论内容的总结,涵盖主要观点、论据及不同视角的平衡性,并保留了关键引用(中英文)。
1. 旧GPU在AI推理中的性价比优势
- 主要观点:旧款GPU(如Tesla P4、Radeon Pro V620)能以较低成本提供可观的AI推理性能,适合预算有限的用户。
- 论据:用户分享实际配置(如6x P4s + Xeon E5),在20-30B模型上达到7-12 t/s的推理速度,但提示加载较慢。另一用户使用Radeon Pro V620(32GB)运行Gemma 4 31b,实现30+ t/s。
- 关键引用:
- "The results showed that these GPUs can still deliver significant compute power at a fraction of the cost of newer models..." (jkonline)
- "I have 6x P4s... gives me a virtual 48GB GPU... typically see scores of at least 7-12t/s on 20-30B Q4KM size dense models." (SillyUsername)
2. 硬件兼容性与维护挑战
- 主要观点:旧GPU存在驱动支持、散热和功耗问题,可能不适合长期稳定使用。
- 论据:用户指出K80因热循环导致故障;旧GPU驱动可能不再维护,且需定制散热方案(如Radeon Pro V620需风扇罩)。同时,低VRAM(<16GB)的GPU对AI模型实验室用处有限。
- 关键引用:
- "A few years ago we got rid of a bunch of K80s... they had gotten glitchy as hell... from the many heat/cool cycles." (SoftTalker)
- "Old GPU use mystery binary BLOB drivers no longer maintained on modern kernels... the key takeaway concept here is 'might'." (Joel_Mckay)
3. 不同应用场景的权衡
- 主要观点:GPU选择取决于具体任务(如AI推理、媒体渲染、游戏),VRAM和现代编解码支持是关键因素。
- 论据:用户强调,对于媒体渲染(如DaVinci Resolve),现代Intel芯片的h265 HDR硬件支持更优;而旧GPU缺乏现代编解码器。另一用户遗憾文章未提及PC游戏,反映GPU用途的多样性。
- 关键引用:
- "Legacy GPU don't support modern codecs, but modern Intel chips have h265 HDR hardware support." (Joel_Mckay)
- "I can’t help but feel an extra twinge of disappointment that there’s no mention of PC gaming anywhere in a post about GPUs." (namuol)
4. 特定型号与配置建议
- 主要观点:用户推荐具体旧款GPU(如V100 16GB、bc-250/PS5芯片)或替代方案(如Intel ARC B70),并分享扩展方案(如Octominer矿机)。
- 论据:V100 16GB被认为比P100更划算($250);bc-250(约$200)因低功耗和推理用途受青睐。用户也建议直接购买新卡(如Radeon AI Pro R9700)以避免兼容性问题。
- 关键引用:
- "I considered the P100s but I think the V100 16GBs are a better deal at $250." (roger_)
- "I was hoping to see bc-250's (aka PS5 chips)... they are only about $200 on ebay... finding a purpose now and not just e-waste." (latchkey)
5. 性能测试与扩展性探讨
- 主要观点:用户对多GPU堆叠(如16x32GB VRAM)和特定模型(如Deepseek-v4-flash、Qwen3.6 27B)的性能感兴趣,但指出旧卡提示加载慢。
- 论据:用户询问堆叠多GPU运行MoE模型的可能性;另一用户测试Qwen 3.6 27B在旧卡上速度尚可。同时,文章因图片过大(~7MB)被批评影响加载。
- 关键引用:
- "Would it possible to stack up to 16x32GB VRAM, and test the performance of a MOE model such as Deepseek-v4-flash?" (rrhjm53270)
- "This site does not like being on the front page of HN. ~7MB for pictures of graphs that probably should have html or svg." (nbf_1995)
总结
评论整体认可旧GPU在AI推理中的性价比,但强调需权衡驱动支持、散热和具体应用场景。用户对特定型号(如V100、P4、bc-250)和扩展方案(如矿机)有深入讨论,同时指出低VRAM和现代编解码缺失的局限性。不同观点平衡了成本优势与维护风险,并呼吁关注更广泛的用途(如游戏、媒体渲染)。