文章摘要
Meta发布Muse Spark 1.1模型,这是多模态推理模型的重大升级,在工具使用、编程和多模态理解方面显著提升,旨在推进个人超级智能愿景,现已通过Meta Model API和Meta AI应用提供。
文章总结
Meta 超级智能实验室今日发布 Muse Spark 1.1 模型,这是对前代 Muse Spark 的重大升级。该模型专为智能体任务设计,在工具使用、计算机操作、编程和多模态理解方面取得显著进步,进一步推动了性能与效率的平衡。此次发布与本周推出的 Muse Image 共同推进了个人超级智能的愿景,即帮助用户实现目标、创造想象、深化关系并专注于重要事务。
同时,Meta 推出了 Meta Model API 的公开预览版,开发者可通过该接口访问 Muse Spark 1.1。该模型现已在 Meta AI 应用和 meta.ai 的“思考”模式中上线。
在智能体任务中,Muse Spark 1.1 表现出色,能零样本适应新工具、MCP 服务器和自定义技能。它通过训练优化多智能体系统协调,显著提升复杂项目的处理速度:作为主智能体,它能收集上下文、制定计划并分配任务给并行子智能体;作为子智能体,它能明确职责、善用工具并在必要时上报。模型可主动管理 100 万 token 的上下文窗口,记忆操作、检索早期信息并压缩保留关键步骤。
在计算机使用方面,Muse Spark 1.1 擅长跨多应用的工作流,能适应动态变化的信息,在长时间会话中保持上下文,并最小化人工干预。它懂得何时自动化(如编写脚本)何时直接操作界面,并能在每一步生成批量操作。例如,在组织晚宴时,它能自动感知订单变化并做出调整。
编程性能大幅提升,能处理大型复杂代码库中的错误诊断、新功能实现和代码迁移。在创建网页应用和端到端问答等场景中,表现远超前代。模型支持规划模式、目标条件设定、子智能体委派和上下文压缩等特性。例如,在调试演示中,它能构建聊天应用、自动截图识别故障、追溯代码并修复问题。Meta 内部开发者已将其用于日常开发,在内部编码评估中显著优于前代,并与主流竞品竞争。
多模态能力同样突出,擅长视觉到代码的生成、图像视频描述和智能体工作流执行。它能同时处理感知与行动,如通过手机视频提取照片并自动在 Facebook Marketplace 上架商品。
安全方面,模型经过严格评估,在化学与生物、网络安全和失控等前沿风险类别中均处于安全范围,对越狱攻击和提示注入有强抵抗力,幻觉率和谄媚行为更低。
开发者现可通过 Meta Model API 公开预览版使用 Muse Spark 1.1。早期合作伙伴称赞其为完整的智能体基础模型,兼具长上下文处理、强推理和编程能力。Replit 首席执行官 Amjad Masad 表示,该模型集百万 token 上下文、多模态支持、搜索引用、结构化输出和并行工具调用于一体;Cline 首席执行官 Saoud Rizwan 认为其定价适合大规模编程工作负载;Box 的 AI 产品副总裁 Yashodha Bhavnani 指出其在企业级工作流中具有竞争力。Meta 超级智能实验室表示,更强大的模型正在训练中,未来将分享更多进展。
评论总结
根据评论内容,总结如下:
主要观点与论据:
定价极具竞争力:多数评论认为Meta新模型定价低廉,尤其是缓存读取价格。例如:
- "Very strong pricing, cheaper than Grok 4.5, particularly the cached reads." (redox99)
- "The pricing is insane: $1.25/$4.5 for 1M tokens, and $0.15 for cached input!" (Tiberium)
性能与基准测试争议:部分评论质疑基准测试的公正性,认为Meta可能“作弊”。例如:
- "Has there been any independent analysis to confirm they didn't cheat on benchmarks again?" (phillipcarter)
- "This disqualifies the results... overriding either is disqualification." (GodelNumbering) 指出测试中资源限制被违反。
竞争促进市场:多数评论认为更多竞争对消费者有利,尤其是美国本土模型。例如:
- "The more competition, the better for regular consumers." (kilroy123)
- "Competition for cheaper and efficient models is a good thing... especially from US based labs." (Jcampuzano2)
开放权重缺失:部分评论对模型非开源表示失望。例如:
- "This is not open-weights, right?" (zb3)
- "Not opensource." (jedisct1)
区域限制与可用性:部分用户反映无法访问API。例如:
- "Model API is not available in your region." (eugene3306)
- "Tried to get access to the API, apparently the model API is not available in my region..." (minraws)
平衡性总结: - 正面:定价低、竞争利好、工具调用能力强("very good at successful tool calls" - EgregiousCube)。 - 负面:基准测试可信度存疑、非开源、区域限制、对Meta信任度低("I cannot think of a worse company to trust with additional personal data" - qpricjalcbeu)。