Hacker News 中文摘要

RSS订阅

介绍Toast 1 -- Introducing Toast 1

文章摘要

Toast 1是一款新型专业搜索代理,性能媲美Claude Opus 5和GPT-5.6 Sol,但成本降低10倍、速度提升12倍。它能独立完成搜索循环,将复杂查询分解、收集证据并整理上下文,让前沿模型专注于推理和最终答案生成。

文章总结

好的,这是根据您的要求,对原文进行的中文重述,保留了核心细节,并删减了与主题无关的营销和推广性内容。


文章标题:Toast 1 介绍

核心内容:

Mixedbread 发布了其首个专用搜索智能体 Toast 1。该模型旨在提供顶尖的搜索质量,其性能可与 Claude Opus 5 和 GPT-5.6 Sol 等前沿模型媲美甚至超越,但成本最高可降低 10 倍,速度提升 12 倍。虽然与 Mixedbread Search 配合使用效果最佳,但它也能兼容任何搜索后端。

背景与设计理念:

当前,前沿模型已能胜任复杂的知识工作,如推理、分析和在大量文档中查找信息。然而,这些模型成本高昂。因此,市场迫切需要能够以更低成本匹配其能力的专用智能体。Toast 1 正是为此而生。它可以作为独立的专用检索智能体运行,也可以作为前沿模型可依赖的多个子智能体之一。它完全接管了搜索循环:根据初始查询,将其分解为子查询、收集证据、检查来源,并在返回结果前整理出相关上下文。这使得主模型能够将其上下文和计算资源集中在需要通用、前沿能力的任务上:即推理、行动和生成最终答案。

性能表现与成本效益:

这种智能体劳动的专业化不仅显著降低了搜索成本,还在许多实际任务中取得了更优的端到端结果。在多个基准测试中,Toast 1 在任务成本和速度方面建立了新的帕累托前沿。

  • 金融分析 (OfficeQA Pro V2): 在 Databricks 发布的复杂企业财务问答基准测试中,将 GPT-5.6 Sol 与作为子智能体的 Toast 1 结合使用,达到了 70% 的答案正确率,每任务成本约 1.15 美元。这不仅是该测试中的最高分,也建立了质量和效率方面的新标杆。相比之下,此前的最佳表现者 Claude Fable 5 在 Databricks Genie 上达到 60% 的正确率,但每任务成本约为 4 美元。而 GPT-5.6 Sol 在不使用 Toast 1 时,正确率仅为 33%。性能提升源于对证据收集经济性的重新设计:Toast 1 能生成高质量、高令牌效率的证据包,为推理过程留出充足资源。

  • 法律智能体基准 (Firm Knowledge): 在 Harvey LAB 的法律机构知识基准测试中,使用 Toast 1 作为搜索子智能体,在保持相同答案质量(得分均为 55)的前提下,将令牌消耗从原始智能体的 8060 万大幅削减至 2300 万,减少了 3.5 倍,成本降低超过 60%。这表明,Toast 1 通过提高搜索质量,极大地提升了令牌效率,释放了前沿模型的上下文窗口,使其能专注于得出正确答案。

技术细节与可用性:

  • 性能与成本: 在多项深度搜索基准测试中,Toast 1 的性能与 GPT-5.6 Sol 等前沿模型处于同一水平。其标准运行成本约为每查询 0.016-0.023 美元,中位延迟为 8 秒。最高质量的融合配置成本约为每查询 0.05-0.07 美元,中位延迟为 11 秒。与达到类似性能的系统相比,Toast 1 的成本低 7-11 倍,速度也快得多。

  • 兼容性: Toast 1 与 Mixedbread Search 协同设计,性能最强,但同时也保持后端无关性,可运行于现有检索索引之上,无需迁移现有后端。

  • 集成方式: 可通过 Mixedbread 的聊天补全 API 将其作为检索工具添加到现有智能体工作流中。也支持与编码智能体(如通过 OpenCode)集成,或直接在 Mixedbread 的存储(Stores)中通过设置 agentic: True 来启用。

总结:

Toast 1 是一个轻量级、高性能的专用搜索智能体,旨在以极低的成本和延迟提供前沿级别的检索能力。它通过专业化分工,优化了证据收集的经济性,从而在多个复杂任务上实现了更优的性能和成本效益。

评论总结

根据评论内容,主要观点和论据如下:

  1. 对专用搜索LLM的积极评价(评论2,评分None):作者认为专用LLM在搜索中能显著提升复杂问题的解决效率,通过多轮交互和上下文扩展(10倍-100倍)实现“一击即中”。关键引用:“An LLM that can do that quickly seems like a slam dunk.” 和 “I wonder what other problems benefit from that 10x-100x increase in context + 2-5 rounds with the LLM.”

  2. 对品牌命名的困惑(评论4、5、6,评分None):多位评论者对“Mixedbread Search”这一名称感到困惑,认为容易与恶搞页面混淆,且缺乏明确解释。关键引用:“Dunno about this branding/naming scheme - every time it comes up we have to double-check that it isn't some spoof/joke page” 和 “Article should probably explain what 'Mixedbread Search' is.”

  3. 对Google搜索的对比(评论7,评分None):有评论者认为Google的搜索概览和Gemini功能已足够快速,优于其他替代方案。关键引用:“I find search overviews and asking gemini to search for things way faster than any alternative.” 和 “it seems to be more like the AI equivalent of algolia than google.”

  4. 技术细节与幽默调侃(评论8、9,评分None):评论8以“Bread-first search”双关调侃,评论9询问基准测试是否保持相同框架。关键引用:“Bread-first search, is it?” 和 “Are the benchmarks comparing just the models while keeping the harness the same?”

  5. 失望与期待偏差(评论10,评分None):有评论者表示失望,原以为是与面包板相关的公司。关键引用:“I’m disappointed this is some AI thing and not a breadboard company.”

总结:评论整体对专用搜索LLM的潜力持积极态度,但对其命名和解释存在困惑;部分用户认为Google现有方案已足够,而技术细节和幽默调侃则反映了社区对产品定位的多元看法。