文章摘要
本文介绍了如何搭建双节点AMD Strix Halo集群,通过Intel E810网卡(RoCE v2)连接,实现分布式vLLM推理。步骤包括系统准备、BIOS设置、SSH配置、网络优化、安装工具包并启动Ray集群与vLLM服务。关键脚本会自动检测RDMA设备并配置容器。
文章总结
AMD Strix Halo RDMA集群搭建指南
核心内容概述
本文档详细介绍了如何配置一个由Intel E810网卡(支持RoCE v2协议)连接的双节点AMD Strix Halo集群,用于通过张量并行(Tensor Parallelism)技术实现分布式vLLM推理。
关键概念与技术架构
vLLM:高性能推理引擎,当模型大小超过单个GPU(或APU)处理能力时,通过张量并行技术拆分模型。
Ray:分布式计算框架,vLLM利用Ray协调集群、管理各节点的工作进程,负责控制平面(指令下发)。
RCCL(ROCm集合通信库):AMD版NVIDIA NCCL,负责数据平面——即GPU间张量数据的极速同步。当张量并行度设为2时,两个节点必须在神经网络每一层后交换部分结果,每秒执行数千次。
RoCE v2(融合以太网上的RDMA):允许RCCL直接将数据从一个节点的内存写入另一个节点内存的协议,绕过CPU和操作系统内核。无RDMA时延迟约70-100微秒(TCP/IP开销),有RDMA时延迟约5微秒。
硬件要求
- 节点:2块Framework Desktop主板,搭载AMD Ryzen AI MAX+ "Strix Halo",128GB统一内存
- 网卡:Intel Ethernet Controller E810-CQDA1(或类似100GbE QSFP28)
- 连接:直连铜缆(DAC),双节点无需交换机
- PCIe注意:Framework主板PCIe插槽物理上为x4,需使用转接卡连接x16网卡
主机配置(Fedora 43)
安装包
安装核心RDMA用户空间工具,无需专有Intel驱动:
sudo dnf install rdma-core libibverbs-utils perftest
固件检查
使用ethtool -i <接口名>检查Intel E810固件版本,建议固件不低于4.91版本。
网络配置
为RDMA接口分配静态IP(192.168.100.1和192.168.100.2),设置MTU 9000,并在防火墙中信任该接口。
BIOS与内核配置
- BIOS:将iGPU内存分配设为最小512MB
- 内核参数:在GRUB中追加
iommu=pt pci=realloc pcie_aspm=off amdgpu.gttsize=126976 ttm.pages_limit=32505856
防火墙规则
将内部RDMA接口完全加入信任区域。
工具箱安装与网络验证
无密码SSH
配置两节点间的无密码SSH访问。
安装工具箱
在两节点上运行./refresh_toolbox.sh,该脚本自动拉取包含RDMA支持和自定义librccl.so补丁的容器。
验证RDMA连接
运行验证脚本/opt/compare_eth_vs_rdma.sh,预期结果:RDMA延迟约5微秒,带宽约50Gbps。
运行集群
使用TUI工具start-vllm-cluster管理Ray集群和vLLM:
- 进入工具箱:
toolbox enter vllm - 运行集群管理器:
start-vllm-cluster - 配置IP地址(选项1)
- 启动Ray集群(选项2):节点1选"Head",节点2选"Worker"
- 检查状态(选项3):确认显示2个节点和足够的GPU资源
- 启动vLLM服务(选项4):选择模型,设置张量并行度为2,启用强制急切模式
故障排除
- vLLM死锁/挂起:在分布式APU节点上CUDA图捕获可能冻结,启用"强制急切模式"解决
- 固件问题:确保Intel E810固件为最新版本
备选方案:Thunderbolt网络
若无专用100GbE RDMA网卡,可使用高质量Thunderbolt 4/USB4线缆直连两节点。虽缺乏RDMA的超低延迟,但带宽远超标准以太网,配置更简单。集群脚本会自动检测并利用thunderbolt0作为后端网络。
评论总结
根据评论内容,总结如下:
主要观点与论据:
技术突破与实用性:评论者高度认可通过RDMA连接两台Strix Halo设备(128GB内存)实现本地AI推理的成果。关键引用:jcastro称“This is amazing!”,sdlkj-表示“This is amazing work - RDMA on these smaller unified memory boxes bridges the gap for consumers”。
成本与性能权衡:硬件成本较高(Framework主板约$3150/块,100G网卡约$500/块),但相比Mac Studio(96GB内存$6700+)仍具性价比。jmyeet指出“memory bandwidth is the limiting factor”,并对比M3 Ultra的~900GB/s带宽。pixelpoet提到“Strix machines for ~2k eur each, best computers this 90s kid has ever owned”。
未来展望:评论者认为本地AI正变得实用,但消费硬件价格过高。pixelpoet称“With a bit more speed and model improvements, local AI becomes a reasonable practical thing”。jmyeet预测“we're only a few years away from running 300B+ param models at useful speeds”。
技术细节讨论:涉及PCIe带宽限制、USB4替代方案、网卡选择等。jmyeet质疑“USB 4.0 for clustering”的可能性,Tepix询问ConnectX-5与ConnectX-3的差异。
不同观点平衡: - 正面:技术方案创新,性能令人印象深刻,为本地AI提供新路径。 - 负面:成本高昂,内存带宽仍不及高端Mac,部分硬件配置存在瓶颈(如PCIe x4限制100G网卡性能)。
关键引用保留: - jcastro: “This is amazing!” / “This memory bandwidth combo is amazing for homelabbers.” - pixelpoet: “With a bit more speed and model improvements, local AI becomes a reasonable practical thing!” / “The biggest problem is all the tech companies making consumer hardware completely unaffordable.” - jmyeet: “The limiting factor with Strix Halo is memory bandwidth, both under 300GB/s.” / “We're only a few years away from running 300B+ param models at useful speeds.” - sdlkj-: “This is amazing work - RDMA on these smaller unified memory boxes bridges the gap for consumers.”