Hacker News 中文摘要

RSS订阅

Mesh LLM:基于iroh的分布式AI计算 -- Mesh LLM: distributed AI computing on iroh

文章摘要

Mesh LLM提出了一种分布式AI计算方案,通过整合用户已有的GPU和内存资源,将多台设备组成一个网格,提供兼容OpenAI的API接口。用户可自由添加节点,由网格自动决定模型运行位置,从而摆脱对数据中心和付费API的依赖,降低AI使用成本并增强控制权。

文章总结

好的,这是根据您的要求,对原文进行中文重述和精简后的版本:

标题:Mesh LLM:基于 iroh 的分布式 AI 计算

核心观点:

人们通常认为运行大型语言模型(LLM)需要依赖数据中心、昂贵的GPU和按用量付费的API,这导致了对模型更新、数据流向和硬件成本的失控。Mesh LLM 提供了一种不同的方案:它将您已有的、分散在多台机器上的GPU和内存资源整合起来,形成一个统一的、兼容OpenAI API的计算集群。您可以从一台机器开始,随时添加更多节点,由系统决定模型是在本地运行、路由到其他节点,还是跨多台机器协同工作。

问题与解决方案:

当前主流的AI模型使用模式(通过UI或API调用)虽然方便,但用户失去了对模型、硬件和成本的控制。许多依赖这些模型的企业希望获得更高的控制权、灵活性和更低的成本。他们手头可能已有闲置的GPU,但缺乏一个能将这些机器整合成单一计算资源的系统。

Mesh LLM 的解决方案是:无需购买更贵的GPU即可运行更大的模型;与团队或公开网络共享算力;任何兼容OpenAI的客户端只需指向 http://localhost:9337/v1 即可使用,无需关心计算实际发生在哪里。

技术实现:

Mesh LLM 通过 iroh 网络库构建了一个计算节点网格。一个请求可以通过三种方式处理: 1. 在本地机器的GPU上运行。 2. 路由到已加载该模型的远程节点。 3. 将单个机器无法承载的大模型,按层(Layer)分割成多个阶段(Stage),流水线式地分布在多台机器上运行(内部称为“Skippy”模式)。

整个架构是可插拔的。每个节点都运行一个 iroh 端点,其身份由公钥标识,无需中央服务器。iroh 负责处理网络穿透(NAT traversal)和中继回退,确保任意两个节点之间能建立直接、经过身份验证的 QUIC 连接。Mesh LLM 运行了两个 iroh 中继服务器,为无法直接连接的节点提供备用路径。

通信协议基于 QUIC 的 ALPN 协商,主要分为三类: - mesh-llm/1:主网格通信,包括节点发现、路由、HTTP隧道和插件通道。 - mesh-llm-control/1:所有者控制平面,用于配置同步和所有权认证。 - skippy-stage/2:用于分割模型的高延迟敏感激活数据传输。

mesh-llm/1 连接内部,所有数据流通过一个字节标识其类型,例如节点公告、推理请求、路由查询等。

优势与未来:

iroh 提供了经过身份验证、能穿透NAT的QUIC连接,使得“路由到远程节点”和“向下一流水线阶段传输数据”在本质上与“访问本地主机”相同,只是目标端点ID不同。这极大地简化了网络层面的复杂性。

用户可安装约18MB的轻量级软件,加入公共网格或配置私有部署。系统在 localhost:9337/v1 上呈现为标准OpenAI客户端。未来将推出基于 iroh Swift SDK 的移动应用,并支持新兴的代理标准(ACP),让更多客户端能加入网格。项目的核心理念始终是:更点对点,更少封闭服务器,无供应商锁定。

评论总结

根据评论内容,主要围绕分布式计算模型Mesh LLM的性能、安全性和应用场景展开讨论,观点如下:

1. 性能与实用性争议 - 支持者认为分布式计算无需定制硬件(turtleyacht: "enables distributed compute without having to finangle custom hardware") - 批评者指出网络延迟严重,不适合交互使用(jmercouris: "throughput over a network is incredibly slow. It's not usable for interactive use") - 实测数据:Qwen 235B模型在2节点间达到16 tok/s(SwellJoe: "proven at 16 tok/s across 2 nodes...pretty close")

2. 安全性质疑 - 用户关注节点间数据加密问题(darkpicnic: "Does Mesh LLM encrypt the payload between nodes? Is it possible to read requests from other users?")

3. 现有替代方案 - 已有类似产品cocompute.ai实现类似功能(darkpicnic: "cocompute.ai is already doing this really well")

4. 潜在应用场景 - 有用户设想将分布式LLM用于僵尸网络进化(dwoosley: "polymorphic botnet that runs distributed LLMs...guides evolution of botnet clusters")

5. 开发者回应 - 贡献者i386表示可解答技术问题,并说明其开发的skippy引擎支持跨节点模型拆分("I authored the skippy engine that allows you to split large models across nodes")

6. 硬件门槛 - 部分用户因缺乏硬件无法测试(superposition: "I just wish I had the hardware to try it out")