Hacker News 中文摘要

RSS订阅

AMD Strix Halo RDMA集群搭建指南 -- AMD Strix Halo RDMA Cluster Setup Guide

文章摘要

本文介绍了如何搭建双节点AMD Strix Halo集群,通过Intel E810网卡(RoCE v2)连接,实现分布式vLLM推理。步骤包括系统准备、BIOS设置、SSH配置、网络优化、安装工具包并启动Ray集群与vLLM服务。关键脚本会自动检测RDMA设备并配置容器。

文章总结

AMD Strix Halo RDMA集群搭建指南

核心内容概述

本文档详细介绍了如何配置一个由Intel E810网卡(支持RoCE v2协议)连接的双节点AMD Strix Halo集群,用于通过张量并行(Tensor Parallelism)技术实现分布式vLLM推理。

关键概念与技术架构

vLLM:高性能推理引擎,当模型大小超过单个GPU(或APU)处理能力时,通过张量并行技术拆分模型。

Ray:分布式计算框架,vLLM利用Ray协调集群、管理各节点的工作进程,负责控制平面(指令下发)。

RCCL(ROCm集合通信库):AMD版NVIDIA NCCL,负责数据平面——即GPU间张量数据的极速同步。当张量并行度设为2时,两个节点必须在神经网络每一层后交换部分结果,每秒执行数千次。

RoCE v2(融合以太网上的RDMA):允许RCCL直接将数据从一个节点的内存写入另一个节点内存的协议,绕过CPU和操作系统内核。无RDMA时延迟约70-100微秒(TCP/IP开销),有RDMA时延迟约5微秒。

硬件要求

  • 节点:2块Framework Desktop主板,搭载AMD Ryzen AI MAX+ "Strix Halo",128GB统一内存
  • 网卡:Intel Ethernet Controller E810-CQDA1(或类似100GbE QSFP28)
  • 连接:直连铜缆(DAC),双节点无需交换机
  • PCIe注意:Framework主板PCIe插槽物理上为x4,需使用转接卡连接x16网卡

主机配置(Fedora 43)

安装包

安装核心RDMA用户空间工具,无需专有Intel驱动: sudo dnf install rdma-core libibverbs-utils perftest

固件检查

使用ethtool -i <接口名>检查Intel E810固件版本,建议固件不低于4.91版本。

网络配置

为RDMA接口分配静态IP(192.168.100.1和192.168.100.2),设置MTU 9000,并在防火墙中信任该接口。

BIOS与内核配置

  • BIOS:将iGPU内存分配设为最小512MB
  • 内核参数:在GRUB中追加iommu=pt pci=realloc pcie_aspm=off amdgpu.gttsize=126976 ttm.pages_limit=32505856

防火墙规则

将内部RDMA接口完全加入信任区域。

工具箱安装与网络验证

无密码SSH

配置两节点间的无密码SSH访问。

安装工具箱

在两节点上运行./refresh_toolbox.sh,该脚本自动拉取包含RDMA支持和自定义librccl.so补丁的容器。

验证RDMA连接

运行验证脚本/opt/compare_eth_vs_rdma.sh,预期结果:RDMA延迟约5微秒,带宽约50Gbps。

运行集群

使用TUI工具start-vllm-cluster管理Ray集群和vLLM:

  1. 进入工具箱:toolbox enter vllm
  2. 运行集群管理器:start-vllm-cluster
  3. 配置IP地址(选项1)
  4. 启动Ray集群(选项2):节点1选"Head",节点2选"Worker"
  5. 检查状态(选项3):确认显示2个节点和足够的GPU资源
  6. 启动vLLM服务(选项4):选择模型,设置张量并行度为2,启用强制急切模式

故障排除

  • vLLM死锁/挂起:在分布式APU节点上CUDA图捕获可能冻结,启用"强制急切模式"解决
  • 固件问题:确保Intel E810固件为最新版本

备选方案:Thunderbolt网络

若无专用100GbE RDMA网卡,可使用高质量Thunderbolt 4/USB4线缆直连两节点。虽缺乏RDMA的超低延迟,但带宽远超标准以太网,配置更简单。集群脚本会自动检测并利用thunderbolt0作为后端网络。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 技术突破与实用性:评论者高度认可通过RDMA连接两台Strix Halo设备(128GB内存)实现本地AI推理的成果。关键引用:jcastro称“This is amazing!”,sdlkj-表示“This is amazing work - RDMA on these smaller unified memory boxes bridges the gap for consumers”。

  2. 成本与性能权衡:硬件成本较高(Framework主板约$3150/块,100G网卡约$500/块),但相比Mac Studio(96GB内存$6700+)仍具性价比。jmyeet指出“memory bandwidth is the limiting factor”,并对比M3 Ultra的~900GB/s带宽。pixelpoet提到“Strix machines for ~2k eur each, best computers this 90s kid has ever owned”。

  3. 未来展望:评论者认为本地AI正变得实用,但消费硬件价格过高。pixelpoet称“With a bit more speed and model improvements, local AI becomes a reasonable practical thing”。jmyeet预测“we're only a few years away from running 300B+ param models at useful speeds”。

  4. 技术细节讨论:涉及PCIe带宽限制、USB4替代方案、网卡选择等。jmyeet质疑“USB 4.0 for clustering”的可能性,Tepix询问ConnectX-5与ConnectX-3的差异。

不同观点平衡: - 正面:技术方案创新,性能令人印象深刻,为本地AI提供新路径。 - 负面:成本高昂,内存带宽仍不及高端Mac,部分硬件配置存在瓶颈(如PCIe x4限制100G网卡性能)。

关键引用保留: - jcastro: “This is amazing!” / “This memory bandwidth combo is amazing for homelabbers.” - pixelpoet: “With a bit more speed and model improvements, local AI becomes a reasonable practical thing!” / “The biggest problem is all the tech companies making consumer hardware completely unaffordable.” - jmyeet: “The limiting factor with Strix Halo is memory bandwidth, both under 300GB/s.” / “We're only a few years away from running 300B+ param models at useful speeds.” - sdlkj-: “This is amazing work - RDMA on these smaller unified memory boxes bridges the gap for consumers.”