Hacker News 中文摘要

RSS订阅

Hy3 -- Hy3

文章摘要

腾讯发布Hy3模型,在预览版基础上优化训练数据并扩大强化学习规模,性能超越同尺寸模型,可媲美参数大2-5倍的开源旗舰模型,在推理、智能体及长文本任务上表现显著提升。

文章总结

2026年7月6日,腾讯正式发布Hy3模型。自4月底Hy3预览版推出后,团队收集了50多个产品的反馈,并利用更高质量的数据扩大了后训练规模。Hy3的性能超越了同尺寸模型,并能与参数规模大2至5倍的主流开源模型相媲美,在多种产品和生产力任务中展现出显著的实用性提升。

在智能体能力方面,Hy3在预览版基础上进一步提升了后训练数据的质量和多样性,并扩大了强化学习训练规模。该模型在推理、智能体和长上下文任务上表现稳健,可与规模更大的旗舰模型竞争。在编程、办公、金融建模、前端设计和游戏开发等生产力场景中,Hy3取得了显著进步,现已成为可靠且高性价比的模型选择。一项由270名专家参与的盲测显示,Hy3得分为2.67/4,优于GLM-5.1的2.51/4,其优势在前端开发、数据与存储以及CI/CD任务中尤为突出。

在产品体验方面,Hy3基于广泛的产品反馈,修复了多项问题,获得了产品团队的一致好评。具体改进包括:工具调用和输出格式的稳定性提升,使模型达到生产级标准,工具调用错误恢复和整体效率得到改善;知识和反幻觉能力增强,通过细粒度数据清洗和训练约束,幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%;复杂上下文保持和多轮意图追踪能力优化,通过联合优化监督微调和强化学习,多轮测试问题率从17.4%降至7.9%,长对话评估表现显著提升,输出更简洁,复杂意图在长时间交互中不会衰减或偏离。

在WorkBuddy的内部测试中,任务成功率从Hy3预览版的72%提升至Hy3的90%,平均完成时间缩短了34%。数据处理、文档工作和研究报告分析等任务均得到明显改善。在令牌效率方面,与GLM-5.2相比,Hy3在文档处理中使用的令牌数减少了47.4%,在演示文稿创建中减少了49%。Hy3已在GitHub、HuggingFace、ModelScope和AtomGit上以Apache 2.0许可证开源。通过软硬件协同优化,Hy3进一步降低了API价格,降低了更多用户和使用场景的采用门槛。API定价为:输入每百万令牌1元,输出每百万令牌4元,缓存输入每百万令牌0.25元。

从1月底重建基础设施,到4月发布Hy3预览版,再到如今推出Hy3并部署于多种产品,团队在六个月内完成了端到端的模型开发循环。混元的重建和演进才刚刚开始,团队将继续扎实扩大训练规模、提升数据质量、优化用户体验细节,同时保持敏捷、透明和开放。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 性能与性价比突出:多数评论认可Hy3模型在较小尺寸下表现出色,且价格低廉。例如,minraws称其“比gpt-5.4-mini更好,接近sonnet 5性能,且极其便宜”("better than gpt-5.4-mini... exceedingly cheap");nshotton指出“模型小得惊人但能力强大,比DeepSeek V4 Flash略大,但某些基准测试上堪比V4 Pro”("shockingly small for how capable it is... around as capable if not more on some benchmarks than V4 pro")。

  2. 与竞品对比:部分评论将其与DeepSeek V4 Flash、GLM 5.2等对比。Catloafdev好奇“与DS4 Flash相比如何,能否在96GB+ RAM系统上竞争”("how people feel about this compared to DS4 Flash... how well it holds up to heavy quantization");james2doyle提到“喜欢Hy3的速度和指令遵循能力,但不如Mimo v2 pro”("speed of Hy3... very happy to follow instructions... not as good as Mimo v2 pro")。

  3. 负面反馈:thot_experiment批评“Hy3浪费了大量时间,宁愿用dense gemma”("I'd rather use dense gemma... wasted more of my time");minimaxir指出“在OpenRouter排名已降至第8/9位,价格与DeepSeek Flash V4相同,无优势”("fallen to 8/9th on the rankings... no reason to use this model over competitors")。

  4. 技术局限与期望:docheinestages希望“在推理或架构上突破,让GLM-5.2级别模型能在48GB Macbook Pro上以100 tokens/秒运行”("breakthrough in inference... allow running GLM-5.2-level models at the size of Qwen 3.6 27b")。

平衡性总结: - 正面:性能接近顶级模型、价格极低、适合本地部署。 - 负面:排名下滑、与竞品价格持平、部分用户体验差、UI演示粗糙。 - 中立:与DeepSeek V4 Flash尺寸相近但能力相当,需进一步量化测试。