文章摘要
poolside.ai发布Laguna S 2.1模型,总参数118B,每token激活8B参数,支持百万token上下文。该模型在长周期编码任务中表现优异,训练到发布仅用九周,并公开所有评估轨迹。
文章总结
今天,我们发布了Laguna S 2.1,这是我们在开发能够处理更长周期任务并有效运用推理能力的模型方面迈出的重要一步。
Laguna S 2.1是一个总参数量为118B的混合专家模型,每个令牌激活8B参数,支持高达100万令牌的上下文窗口,可在思考和非思考模式下运行。从训练开始到发布,整个过程不到九周时间。在长周期编码基准测试中,它的表现足以与比它大数倍的模型相抗衡。对于我们今天发布的每一个基准分数,我们都会在trajectories.poolside.ai上发布最终评估集中每次试验的完整轨迹。
Laguna S 2.1是我们所能衡量的、在其重量级别中能力最强的智能编码模型,且优势明显。它在启用思考模式的情况下,在Terminal-Bench 2.1上获得了70.2%的分数。其紧凑的尺寸使其特别适合在本地机器上执行复杂任务。
在DeepSWE v1.1上,Laguna S 2.1在思考模式下获得了40.4%的分数。值得注意的是,这个分数是在我们自己的智能体框架中获得的,而DeepSWE排行榜使用的是不同的框架。虽然这使得分数不完全可比,但我们认为这并未给我们带来特别有利的地位,因为据报道,许多模型在其原生框架中的表现与在mini-swe-agent中相当或更好。最终评估运行中的每条轨迹都可以在trajectories.poolside.ai上查看和下载。
为了更直观地理解模型的工作方式,我们分享了三个真实世界任务的案例。在第一个案例中,Laguna S 2.1在50分钟内,从零开始构建了一个可工作的HTML/CSS渲染引擎,并通过与真实浏览器对比来验证其渲染效果。在第二个案例中,它通过自动化循环优化了我们自己的智能体框架,使其速度提升了5.2%,内存分配减少了约70%。在第三个案例中,它独立重新发现了埃尔德什问题#397的一个证明,该问题在GPT-5.2 Pro于2026年1月首次解决之前,已悬而未决超过50年。
Laguna S 2.1有两种思考模式:关闭和最大(默认启用)。最大思考模式将其在Terminal-Bench 2.1上的分数从60.4%提升至70.2%,在DeepSWE上从16.5%提升至40.4%。
该模型也存在一些已知局限性,包括对特定智能体框架的过拟合、嵌套工具调用问题以及可能过长的思考时间。我们正在为下一个迭代版本解决这些问题。
Laguna S 2.1是Laguna XS系列的扩展,使用了完全相同的预训练数据。其大部分能力提升来自后训练阶段,包括监督微调和强化学习。训练语料库包含409,000个智能体和非智能体环境,其中83,000个用于终端用例,168,000个针对标准软件工程工作流程。
我们专注于两个核心方向:持续提升智能编码能力,以及通过强化学习从人类记录中恢复思考过程。Laguna S 2.1展示了在不到三个月内,以更小的运行规模实现更强模型的能力。
Laguna S 2.1现已通过Hugging Face、NVIDIA、vLLM、SGLang、Ollama等多个平台提供。开发者可以在Baseten、OpenRouter、Vercel AI Gateway等托管服务上使用,也可以通过Kilo、Hermes Agent、pi、OpenCode、OpenClaw、Cline以及我们自己的终端编码代理pool来使用。
评论总结
根据评论内容,总结如下:
主要观点:
性能惊艳,与DeepSeek V4 Flash竞争(高认可度)
- 多数评论认为该模型(118B参数,8B活跃MoE)性能出色,与DeepSeek V4 Flash相当甚至更优。
- 关键引用:
- "competitive with DS4-Flash indeed" (Lwerewolf)
- "This is the first US release that's competitive with DeepSeek V4 Flash" (mchusma)
适合本地部署,硬件友好(高认可度)
- 模型大小适合Strix Halo、DGX Spark等设备,MoE架构在有限带宽下运行快速。
- 关键引用:
- "this model will run very well on Strix Halo... DGX Spark" (Iolaum)
- "Realistically self-hosted, Good Enough intelligence, MoE so it's fast on limited bandwidth systems" (SwellJoe)
开源权重,社区期待(中等认可度)
- 开源权重和长上下文推理能力受到欢迎,社区已开始量化适配。
- 关键引用:
- "open weights and similar performance to deepseek v4" (tosh)
- "open weights - music to my ears" (kamranjon)
实际应用表现良好(中等认可度)
- 在代码审查等任务中表现优异,甚至发现GPT-5.2才能找到的问题。
- 关键引用:
- "it found things that only gpt-5.2 managed to find" (Lwerewolf)
- "we already got a usable PR of work out of it" (river_otter)
平衡观点: - 有评论指出模型存在“愚蠢的初始错误”(Lwerewolf),但整体评价积极。 - 部分用户期待更低量化版本以适配64GB内存设备(mft_)。