文章摘要
OpenRouter平台上的Ox Alpha是一款专为编程设计的推理模型,由第三方提供商运营,目前Gemini 3.7 Flash限时75%折扣。
文章总结
好的,这是根据您提供的英文内容,用中文重新陈述的文章主要内容,已保留关键细节并删减了无关信息:
文章标题:Ox Alpha - API 定价与提供商
核心内容:
Ox Alpha 是一款由第三方匿名提供商开发的“隐形模型”,专为编程、持续性智能体任务和生产级工作负载而设计。它擅长处理长期软件工程、复杂推理以及结合文本与视觉信息的工作流。
关键特性与细节:
- 定价:该模型目前完全免费,不收取任何提示或补全费用。
- 上下文窗口:支持高达 1,048,576 个令牌(约 1M)的上下文,最大输出为 131,072 个令牌。
- 输入/输出:接受文本、图像和视频作为输入,并返回文本。
- 功能:支持工具调用(函数调用)和结构化输出(JSON 格式,但不强制 JSON Schema)。
- 发布日期:于 2026 年 8 月 20 日发布。
- 托管与路由:该模型由名为“Stealth”的单一提供商托管。OpenRouter 负责将请求直接转发给该提供商,本身并非模型的开发者或所有者。
- 数据隐私:用户的提示和补全数据由提供商保留,不会用于模型训练。其他使用行为受“隐形模型条款”约束。
性能与可用性数据(摘要):
- 提供商:Stealth(免费)。
- 延迟:P50 延迟为 3.36 秒。
- 吞吐量:P50 吞吐量为 38 令牌/秒。
- 正常运行时间:过去 3 天为 100%。
- 缓存命中率:平均为 68.42%。
- 工具调用错误率:平均为 4.45%。
主要应用场景:
根据流量数据,该模型最常用于以下应用: 1. Claude Code:Anthropic 的智能体编码工具。 2. Hermes Agent:Nous Research 的开源、自我改进 AI 智能体。 3. Oh-My-Pi、DeepSeek Harness 和 Z Code 等。
评论总结
根据评论内容,总结如下:
主要观点与论据:
模型来源争议:多数评论认为该模型可能来自中国实验室(如GLM),或疑似小米等公司。论据包括:思维链(CoT)模式类似GLM(评论11)、对敏感话题(如天安门)拒绝回答但提供电子战指导(评论8)、以及速度异常快且输出token数低(评论13)。关键引用:
- "Based on its indecisive and far-too-lengthy thinking traces... this is almost certainly a GLM model."(评论11)
- "It's Chinese. Won't answer anything about Tiananmen Square but will gleefully give you instructions to perform various electronic warfare attacks..."(评论8)
安全与隐私担忧:用户质疑免费模型的数据用途,认为可能收集用户数据(评论3),并讽刺性地建议不要输入敏感信息(评论4)。同时,反对“隐形模型”缺乏透明度(评论5)。关键引用:
- "I'm curious what the model provider is using the prompt/response pairs for..."(评论3)
- "I'm against stealth models—we should know what it is and see a model card..."(评论5)
性能评价:在创意任务上表现优异,甚至超越K3(评论10),但在CSS生成等具体任务上表现糟糕(评论16)。视觉推理能力一般(评论10)。关键引用:
- "On softer/looser/creative matters, this is an extremely impressive model. It's beating K3..."(评论10)
- "It did an absolutely terrible job at generating CSS..."(评论16)
其他观点:部分用户认为匿名模型在arena.ai上常见,不足为奇(评论12);也有用户猜测是西方VC公司烧钱策略(评论14)。关键引用:
- "Anonymous unreleased models are made available on arena.ai all the time..."(评论12)
- "Offering product at cost seems exactly the move that a US VC company would make."(评论14)
平衡性说明:评论中对中国模型来源的猜测占主导,但缺乏确凿证据;性能评价两极分化,创意任务受好评但技术任务受批评;隐私担忧普遍存在,但部分用户认为免费模式可能合理。