文章摘要
我们发布了开源权重模型Inkling,这是一个975B总参数、41B活跃参数的混合专家Transformer,支持百万token上下文,在多模态数据上预训练,旨在构建可扩展人类意志的AI。
文章总结
好的,这是根据您的要求,对原文进行的中文重述,保留了核心细节,并删减了与主题无关或过于技术性的细节。
标题:Inkling:我们的开放权重模型
我们的使命是构建能够延伸人类意志和判断力的人工智能。今天,我们通过发布一个完全开放权重的模型来推进这一使命,让人们可以将其定制为己所用。
这个名为 Inkling 的模型是一个总参数量为 9750 亿的混合专家(MoE)Transformer,其中活跃参数为 410 亿。它支持高达 100 万 token 的上下文窗口,并在 45 万亿 token 的文本、图像、音频和视频数据上进行了预训练。Inkling 是一个多模态模型,能原生处理文本、图像和音频,并通过可控的思考努力来平衡成本与性能。它并非目前最强的模型,但其多模态能力、高效思考以及在 Tinker 平台上可微调的特性,使其成为一个优秀的开放权重基础模型。
为了让定制化更易用,Inkling 现已可在 Tinker 平台上进行微调。同时,我们在 Tinker 控制台中新增了 Inkling Playground,这是一个面向开发者的聊天界面,方便用户与模型互动。
核心能力
- 通用模型:Inkling 被设计为一个广泛、均衡的通用模型,在智能体、推理、编码、多模态和音频等多个任务上表现均衡,而非在单一领域上过度优化。
- 智能体编码与工具使用:Inkling 在智能体编码基准测试中表现优异。它能一次性构建功能性的网页应用,并驱动内嵌的 AI 助手通过自然语言指令操作界面。在 Design Arena 的智能体网页开发排行榜上,它位列最强开放权重模型之一。
- 可控思考努力:Inkling 支持可控的思考努力,允许用户在性能与 token 效率之间取得平衡。例如,在 Terminal Bench 2.1 基准测试中,达到相同性能时,Inkling 消耗的 token 数仅为 Nemotron 3 Ultra 的三分之一。
- 多模态能力:Inkling 的音频和视觉组件均从零开始训练。它能转录语音、遵循语音指令、回答关于录音的问题,并能描述图像内容、回答视觉问题。在多项音频和视觉基准测试中,它都处于开放权重模型中的领先水平。
- 认知能力:我们训练 Inkling 具备良好的校准能力、指令遵循能力和抵抗审查的能力。在预测任务上,其表现与顶尖模型相当。我们通过强化学习,使用两种自动评分器(清单评分器和事实性评分器)来提升其指令遵循能力并减少幻觉。同时,模型被训练在不确定时给出“不知道”或谨慎的猜测,而非强行回答。此外,Inkling 在可能被审查的话题上表现出强烈的非顺从性。
- 安全性:在 FORTRESS 基准测试中,Inkling 展现了最强的内置安全防护,能有效拒绝有害请求,同时不会过度拒绝良性的类似请求。
模型性能
在多项基准测试中,Inkling 的表现与当前顶尖的开放权重模型(如 Kimi K2.5、GLM 5.2 等)处于同一梯队,并在某些领域(如智能体编码、音频处理)展现出优势。例如,它在 SWEBench Verified 上得分为 77.6%,在 AIME 2026 上得分为 97.1%。
Inkling 的构建
- 架构:Inkling 采用混合专家(MoE)架构,每层包含 256 个路由专家和 2 个共享专家,每个 token 激活 6 个路由专家。注意力机制采用滑动窗口和全局层以 5:1 的比例交错,并使用相对位置嵌入。
- 训练:模型在 45 万亿 token 的数据上进行了预训练,并采用了混合优化策略。后训练阶段覆盖了数学、编码、工具使用、音频、图像、对话和安全等多个领域,其中大部分计算资源用于大规模的强化学习。
- 大规模强化学习:通过超过 3000 万次的大规模异步强化学习,模型的推理性能实现了对数线性提升。训练过程中,模型的思维链也自发地变得更加简洁高效。
Inkling-Small
我们还发布了 Inkling-Small 的预览版,这是一个总参数量 2760 亿(活跃参数 120 亿)的模型。它在许多基准测试上表现接近甚至超越其更大的兄弟模型 Inkling,同时拥有更低的成本和延迟,非常适合对成本敏感的编码、评分或生成合成数据等任务。
定制与可用性
Inkling 现已通过 Tinker 平台提供,支持 64K 和 256K token 的上下文长度。用户可以通过 Inkling Playground 免费体验。其完整权重已在 Hugging Face 上发布。此外,我们与多家生态系统合作伙伴(如 Together、Fireworks、Databricks、Hugging Face 等)合作,支持用户部署在 Tinker 上微调后的模型。
评论总结
根据评论内容,总结如下:
主要观点与论据:
积极评价(开放权重与多模态)
- 评论2(alansaber):“best western open weights model- very cool”
- 评论5(ianbutler):“It's nice to see a strong long context open weights model that is multi-modal”
- 评论10(bobkb):“Happy to see an open weight model! This has all the right ingredients for success.”
性能对比与局限
- 评论3(verdverm):“If it's ~30% bigger and not as good as GLM 5.2, why would I tinker with this model?”
- 评论4(Reubend):“particularly good at instruction following, but not as strong at coding as others”
- 评论9(janalsncm):“better than Nemotron, worse than GLM... best American open weights model”
质疑与批评
- 评论16(MaxPock):“Raised 2 billion dollars... debuts at 41 on the Artificial Analysis Intelligence Index... What a joke.”
- 评论13(bbstats):“too bad we'll never know how good it is, since they used a radar plot”
技术细节与可用性
- 评论6(amarble):“276B A12B version... might actually be able to fit in 128GB when quantized to 2 bits”
- 评论11(solomatov):“HuggingFace shows Apache-2.0 but they have AUP. How does it work together?”
- 评论8(raverbashing):“Cool, now we just need the GPU that supports it”
战略与前景
- 评论1(ls_stats):“America needs its own DeepSeek... root for open chinese models to win”
- 评论18(mhluongo):“training a bespoke model for what you need will make economic sense”
- 评论17(minraws):“gaining some faith in American Open research labs again”
平衡性总结:
评论整体呈现两极分化:一方面认可其作为美国首个开放权重多模态模型的价值,尤其在指令遵循和长上下文方面;另一方面批评其性能不及中国开源模型(如GLM),且基准测试展示方式不透明。部分评论关注其商业策略(定制化训练)和硬件需求,同时指出许可协议(Apache-2.0与AUP)的潜在矛盾。