文章摘要
OpenAI发布了GPT-5.6 Sol的预览,这是一款下一代模型,旨在提升人工智能的性能与能力。
文章总结
好的,这是根据您提供的英文内容,使用中文重新陈述的文章主要内容,已保留关键细节并删除了与主题无关的导航、页脚和视觉元素。
文章标题:预览下一代模型 GPT-5.6 Sol
核心内容:
OpenAI 宣布开始对 GPT-5.6 系列模型进行有限预览。该系列包括三个型号:旗舰模型 Sol、适用于日常工作的均衡模型 Terra,以及快速且经济的模型 Luna。其中,Terra 的性能与 GPT-5.5 相当,但成本降低了一半;Luna 则以最低成本提供了强大的能力。
安全措施: GPT-5.6 Sol 配备了迄今为止最强大的安全堆栈。OpenAI 加强了针对高风险活动、敏感网络请求和重复滥用的保护,并花费数周时间寻找漏洞、对系统进行压力测试,以抵御现实世界的攻击。安全措施是多层次的,包括模型级别的训练、生成过程中的实时检查、账户级别的信号监控以及差异化访问权限。此外,OpenAI 投入了超过 70 万 A100 等效 GPU 小时进行自动化红队测试,以寻找通用越狱方法,并辅以第三方人类专家的红队测试。
发布计划: OpenAI 计划在未来几周内广泛提供 GPT-5.6 系列模型。作为与美国政府持续接触的一部分,OpenAI 在发布前预览了其计划和模型能力。应政府要求,此次发布从有限预览开始,仅面向一小部分已与政府共享信息的受信任合作伙伴。OpenAI 认为这种政府准入流程不应成为长期默认模式,但作为短期步骤,这是实现更广泛可用性的最佳途径。
模型能力:
GPT-5.6 Sol 是 OpenAI 迄今为止最强大的模型。它引入了新的 max 推理努力级别,让 Sol 有更多时间进行深度推理。此外,还引入了新的 ultra 模式,通过利用子代理来加速复杂工作。
- 编码: 在测试命令行工作流程的 Terminal-Bench 2.1 基准测试中,GPT-5.6 Sol 达到了新的最优水平。
- 生物学: 在评估基因组学和定量生物学分析的 GeneBench v1 上,Sol 使用更少的 token 取得了比 GPT-5.5 更强的结果。
- 网络安全: Sol 在长期安全任务(如漏洞研究和利用)上提升了性能效率。在 ExploitBench 上,Sol 仅用约 1/3 的输出 token 就与 Mythos Preview 模型竞争。在 ExploitGym 基准测试中,Sol、Terra 和 Luna 均表现出随着推理能力增强而提升的网络能力。
安全与网络能力平衡: GPT-5.6 Sol 在帮助发现和修复漏洞方面比可靠地执行端到端攻击更出色。根据 OpenAI 的评估,该模型并未跨越其“准备框架”下的“网络关键阈值”。例如,在针对 Chromium 和 Firefox 的评估中,它能识别漏洞和利用原语,但未能在测试条件下自主生成完整的功能性利用链。
定价与可用性: GPT-5.6 系列按每百万 token 定价: * Sol: 输入 $5 / 输出 $30 * Terra: 输入 $2.50 / 输出 $15 * Luna: 输入 $1 / 输出 $6
该系列还引入了更可预测的提示缓存功能,包括显式缓存断点和至少 30 分钟的缓存生命周期。此外,OpenAI 还计划于 7 月在 Cerebras 平台上推出 GPT-5.6 Sol,速度可达每秒 750 token。
评论总结
根据评论内容,总结主要观点如下:
1. 模型命名争议(多数评论提及) - 批评命名混乱:从“nano/mini/standard/pro”改为“Sol/Terra/Luna”,被认为模仿Anthropic且不直观。 - 关键引用:rvz “Other than the worst naming I have ever seen (Sol / Terra / Luna)”;ddwrll “Why does OpenAI insist on having the most inconsistent and confusing model and product names possible?”
2. 定价与性价比质疑(部分评论) - 认为价格昂贵,且存在“强制升级”趋势:旧模型被淘汰,新模型价格更高但实际提升有限。 - 关键引用:rvz “The OpenAI casino has never been more ready to take your money”;HyperL0gi “Can't we just stay with the models we actually want? ... forcing us to upgrade in a slow and painful way.”
3. 版本号与“下一代”宣称不符(部分评论) - 质疑为何不直接叫GPT-6,认为“5.6”不足以称为新一代。 - 关键引用:loufe “If it was the next generation, why isn't it a major version change?”;ChrisLTD “If it's a new generation why isn't it GPT-6?”
4. 安全审查与政府干预(部分评论) - 批评模型发布受美国政府限制,以及安全监控可能侵犯用户隐私。 - 关键引用:duggan “Having them be the gatekeepers of technological progress in 2026 is fucking lame.”;dagriftshift “Every conversation ... will be monitored and joined up ... expect people to be falsely flagged.”
5. 性能对比与竞争(部分评论) - 认为GPT-5.6可能落后于Anthropic的Fable 5,尤其在编码和智能体任务上。 - 关键引用:ddp26 “GPT-5.6 Sol is significantly behind Claude Fable 5”;firasd 提供的排行榜显示Claude Fable 5在文本和智能体任务中领先。
6. 对LLM架构的反思(少数评论) - 指出当前LLM在长期规划、模块化、内部表示等方面的根本性局限。 - 关键引用:vatsachak “their long term planning capabilities are worse than worms ... LLM architecture is not modular ... I wish that companies can start working on the next generation of architectures before the bubble pops”
7. 其他零散观点 - 对编码能力表示期待(jdw64);对欧洲用户可能受限表示担忧(submeta);对安全审查感到厌倦(nsingh2)。