文章摘要
Hetzner推出了一个实验性的LLM推理服务,提供OpenAI兼容的API,目前仅支持Qwen3.6-35B模型,无计费、无SLA,旨在测试用户需求和系统性能。
文章总结
好的,这是根据您的要求,对原文进行的中文重述,保留了核心细节,并删减了与主题无关的个人化表达和次要信息。
标题:Hetzner 推理服务初探
Hetzner 正在试验大语言模型(LLM)推理服务。这并非一个成熟产品的发布,而是一个早期实验,旨在了解用户需求、系统扩展性、关键功能以及负载能力。目前该服务免费,无服务等级协议(SLA),且仅提供一个模型。
什么是 Hetzner 推理服务?
Hetzner 推理服务是一个兼容 OpenAI API 的接口,运行在 Hetzner 自有基础设施上。用户可通过实验面板创建 API 令牌,将 OpenAI 客户端指向 Hetzner 的地址即可使用。当前唯一可用的模型是 Qwen/Qwen3.6-35B-A3B-FP8,这是一个拥有350亿参数、30亿活跃参数的混合专家模型,支持文本和图像输入,上下文窗口为262K,并使用了FP8量化权重。该模型足够小,无需庞大的GPU集群即可运行,同时也能用于测试真实工作负载。
实际测试体验
由于API兼容OpenAI,集成过程非常简单。一个值得注意的选项是 enable_thinking,它可以防止模型在返回可见答案前消耗过多算力进行推理。在2026年7月23日的小规模测试中,获得了以下粗略数据:
- 在已建立的连接上,7次短请求的中位首次令牌生成时间为 153毫秒。
- 在5次上限为512令牌的较长生成任务中,输出速度为 每秒224个令牌。
这个速度很快,但仅代表单次测试结果,不能作为服务等级承诺。模型本身表现符合预期:能遵循大部分指令,正确处理图像,但在两个简单算术问题上失败。
产品本身比模型更有趣
当前模型并非重点,关键在于 Hetzner 为何要涉足推理服务。开放权重推理是一个商品化市场,切换供应商很容易。要在此市场建立优势,通常需要:能以极低成本购买和运营GPU硬件、能高效利用硬件、或拥有闲置的GPU资源。Hetzner 擅长以高效的成本结构运营硬件,如果它能将推理服务转化为另一个低利润的基础设施产品,它将是可信的候选者。此外,推理API可以跨用户共享GPU容量,提高硬件利用率,将潜在的空闲算力转化为收入。
关键问题在于硬件
Hetzner 目前公开的专用GPU服务器主要提供两种GPU:20GB显存的RTX 4000 SFF Ada和96GB显存的RTX PRO 6000 Blackwell Max-Q。这些是工作站级GPU,足以运行当前的中小型模型(如Qwen模型),但无法满足像GLM-5(7540亿参数)这类需要多GPU系统(如B200/B300级硬件)的超大模型。Hetzner 目前并未在其公开产品线中提供此类高端硬件。当然,其内部用于实验API的硬件可能不同。
因此,关键在于 Hetzner 的未来走向。如果它仅提供一两个小型模型,那么这只是一个有趣的实验。但如果这是迈向更大GPU集群、更丰富模型目录和高端硬件的第一步,那么凭借其数据中心、网络、硬件经验、欧洲定位和激进定价的声誉,Hetzner 将成为一个有力的竞争者。目前,该API快速、免费且有趣,但真正值得关注的问题是 Hetzner 是否会投资于服务大型模型所需的硬件。
评论总结
根据评论内容,总结如下:
主要观点与论据:
技术功能讨论(评分:None)
- 评论1指出
enable_thinking选项的重要性:开启后模型会进行推理,关闭则不会,但默认情况下模型可能消耗大量计算资源进行隐性推理。 - 关键引用:
> "The enable_thinking option is worth mentioning. Without it, the model can spend a surprising amount of the completion budget reasoning before it returns a visible answer."
> "Straight up the opposite, which the name makes abundantly clear, with the option it does reasoning, without it it doesn't..."
- 评论1指出
欧洲AI服务生态(评分:None)
- 评论2、3、6、8关注欧洲本土推理服务商的价值:Hetzner等公司提供高效托管,但缺乏GDPR合规的编码方案(评论8)。评论6提出“美国-专有模型、中国-开源权重、欧洲-高效推理”的分工设想。
- 关键引用:
> "It would certainly be interesting to have a highly respected EU-native inference provider, if only to make the regulatory gods happy"(评论3)
> "Americans - best proprietary models / Chinese - best open weight models / Europeans - best / most efficient inference service"(评论6)
商业策略与成本(评分:None)
- 评论4、7认为Hetzner此举明智:聚焦小模型高效推理,成本趋近于零,但可能难以参与大模型服务竞争(评论7)。
- 关键引用:
> "This seems like a smart move, given their ability to host efficiently... make the cost of inference for smaller useful models slowly approach 'close to zero'"(评论4)
> "I could see them perhaps coming in competitive for models that fit into single cards? Less so playing in the big model serving league"(评论7)
内容质量批评(评分:None)
- 评论5批评文章存在AI生成的“幻觉”内容,如“API is fast, free, and fun to try”等空洞表述。
- 关键引用:
> "Potentially interesting article ruined by AI slop hallucinations like 'For now, the API is fast, free, and fun to try'"(评论5)
平衡性总结:
评论整体对Hetzner的AI推理服务持积极态度,但存在分歧:技术层面认可其效率,商业层面质疑其大模型竞争力;同时批评文章质量,并呼吁更多GDPR合规的欧洲编码方案。