BF16 | NVFP4 | Playground | Tinker Cookbook | Acceptable Use
Inkling-Small 是一款通用多模态模型,可接受文本、图像和音频输入并生成文本输出。它适用于英语及其他多种语言,同时支持多种编程语言。该模型专为开发人员构建 AI 驱动的应用程序而设计,包括智能体系统、工具使用系统、编码助手、聊天机器人和检索增强生成系统,也适用于通用对话、指令遵循以及其他自然语言和多模态任务。模型以开放权重形式发布,旨在支持研究、微调以及下游开发人员将其集成到第三方产品中。
语言支持: 英语,并具备跨其他语言的通用多语言处理能力。
可在 Tinker Playground 上试用 Inkling-Small,或通过 Tinker Cookbook 调用 API 进行访问。
Inkling-Small 支持通过以下开源库进行本地部署:
此外,还可通过第三方推理服务提供商获取 API 访问权限。
多模态自回归Transformer
42层仅解码器Transformer,采用稀疏混合专家(MoE)前馈骨干网络:每个token被路由至256个专家中的6个,外加2个对所有token均激活的共享专家。注意力机制采用局部与全局层混合架构。该模型原生支持多模态——图像通过分层补丁编码器进行编码,音频通过离散token编码——所有模态均被投影至共享隐藏空间,并由解码器联合处理。
总计2760亿,激活120亿
BF16和NVFP4
Inkling-Small支持文本、图像和音频输入:
Inkling-Small生成的输出为UTF-8编码文本。
训练数据包含多种内容类型,包括文本、图像、音频、视频。
模型的训练数据来源于公开可用资源、第三方获取,或通过合成生成及增强处理。公开可用数据包括来自公共互联网和可公开访问的存储库的内容。
训练数据的整理过程包括数据集的清洗、处理和修改。这些处理步骤因数据类型而异,可能包括去重、过滤以移除垃圾数据或其他低质量数据,或为提升安全性及其他目标而进行的处理。
| 开源权重 | 闭源权重 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Inkling-Small | Qwen3.5 397B-A17B | MiMo V2.5 | Minimax M2.7 | DeepSeek V4 Flash | Nemotron 3 Ultra | Inkling | Claude 4.5 Haiku | Gemini 3.5 Flash-Lite | GPT 5.6 Luna | |
| 模型信息 | ||||||||||
| AA指数 (v4.1) | 40.0% | 34.0% | 37.0% | 38.0% | 40.0% | 38.0% | 41.0% | 30.0% | 36.0% | 49.0% |
| 参数规模(B) (激活/总计) | 12 / 276 | 17 / 397 | 15 / 310 | 10 / 230 | 13 / 284 | 55 / 550 | 41 / 975 | – | – | – |
| 智能体(代码) | ||||||||||
| SWEBench Verified | 80.2% | 76.4% | 71.0% | 79.9% | 79.0% | 70.7% | 77.6% | 73.3% | 75.0% | 93.0% |
| SWEBench Pro (公开版) | 55.9% | 50.9% | 56.1% | 56.2% | 52.6% | 46.4% | 54.3% | 39.5% | 54.2% | 62.7% |
| Terminal Bench 2.1 (最佳测试框架) | 64.7% | 51.3% | 63.7% | 55.4% | 61.8% | 56.4% | 63.8% | 44.2% | 54.0% | 82.5% |
| SciCode | 48.7% | 42.0% | 43.1% | 47.0% | 44.9% | 39.9% | 46.1% | 43.3% | 40.9% | 50.0% |
| 智能体(通用) | ||||||||||
| GDPval-AA v2 | 1269 | 962 | 1145 | 1159 | 1189 | 1164 | 1238 | 911 | 1139 | 1530 |
| MCP Atlas (公开版/完整版) | 79.6/79.2% | 74.2%/– | – | 49.4%/– | 69.0%/– | 47.4/44.7% | 78.8/76.0% | 41.2/40.2% | 79.8/76.8% | 77.0/75.0% |
| Tau 3 Banking | 15.5% | 13.4% | 6.6% | 8.9% | 22.9% | 13.8% | 23.7% | 9.1% | 16.5% | 24.3% |
| BrowseComp (含上下文管理) | 77.4% | 78.6% | – | 76.3% | 73.2% | 63.0% | 77.1% | – | – | 84.0% |
| Toolathlon Verified | 54.4% | 40.7% | 49.1% | 47.5% | 50.9% | 34.3% | 45.5% | 26.9% | 57.1% | 67.9% |
| AA-Briefcase | 917 | – | – | – | 833 | 870 | 839 | 612 | – | – |
| 推理(通用) | ||||||||||
| GPQA Diamond | 89.5% | 89.3% | 84.9% | 87.4% | 89.4% | 86.7% | 87.2% | 67.2% | 83.8% | 89.5% |
| HLE (仅文本) | 31.6% | 27.3% | 25.2% | 28.1% | 32.1% | 26.6% | 29.7% | 9.7% | 17.5% | 35.6% |
| HLE (含工具) | 47.8% | 48.3% | 40.0% | 40.3% | 45.1% | 37.4% | 46.0% | 17.8% | 42.5% | 48.9% |
| AIME 2026 | 95.5% | 93.3% | 93.6% | 87.7% | 95.8% | 94.2% | 97.1% | 85.1% | 82.2% | 97.6% |
| HMMT Feb 2026 | 9 | 93.9% | 78.8% | 86.3% | 66.7% | 63.6% | 98.5% | |||
| CritPt | 8.3% | 1.7% | 3.7% | 0.6% | 7.1% | 3.1% | 5.4% | 0.0% | 0.0% | 20.6% |
| 推理(抽象) | ||||||||||
| ARC-AGI-1 | 84.0% | – | – | – | – | – | 79.5% | 47.7% | – | 87.7% |
| ARC-AGI-2 | 40.1% | – | – | – | – | – | 36.5% | 4.0% | – | 47.6% |
| 事实性 | ||||||||||
| SimpleQA Verified | 20.6% | 26.0% | 16.1% | 13.5% | 34.1% | 32.4% | 43.9% | 5.9% | 44.1% | 41.7% |
| AA Omniscience (指数) | -9.0 | -29.8 | -9.3 | 0.7 | -22.9 | -1.0 | 2.1 | -4.2 | 6.9 | -11.6 |
| 对话 | ||||||||||
| IFBench | 82.2% | 78.8% | 67.1% | 75.7% | 79.2% | 81.4% | 79.8% | 54.3% | 78.6% | 67.3% |
| Global-MMLU-Lite | 86.7% | 90.0% | 83.5% | 83.9% | 88.4% | 85.6% | 88.7% | 83.4% | 89.4% | 88.7% |
| 安全性 | ||||||||||
| StrongREJECT | 98.4% | 99.4% | 99.3% | 99.4% | 97.4% | 98.7% | 98.6% | 98.6% | 97.6% | 98.7% |
| FORTRESS (对抗性) | 71.6% | 77.3% | 64.8% | 86.3% | 32.0% | 77.6% | 78.0% | 91.3% | 70.7% | 83.8% |
| FORTRESS (良性) | 96.9% | 95.4% | 94.6% | 90.1% | 99.2% | 90.6% | 95.9% | 94.1% | 95.5% | 97.8% |
| 视觉 | ||||||||||
| MMMU Pro (Standard 10) | 74.0% | 77.3% | 75.4% | – | – | – | 73.5% | 58.6% | 79.0% | 78.6% |
| Charxiv RQ (原始 / 带python) | 77.4/81.3% | 80.8%/– | 81.0%/– | – | – | – | 78.1/82.0% | 57.4%/– | 70.0%/– | 81.4%/– |
| 音频 | ||||||||||
| Audio MC | 54.9% | – | 30.4% | – | – | – | 56.6% | – | 33.6% | – |
| MMAU | 77.0% | – | 73.6% | – | – | – | 77.2% | – | 75.2% | – |
| VoiceBench | 90.1% | – | 86.4% | – | – | – | 91.4% | – | 85.9% | – |
我们在发布前进行了安全性评估,涵盖日常人机交互和危险能力测试。由于Inkling-Small是多模态模型,我们特别关注其安全行为在文本、音频和图像输入中是否保持一致。在发布前,我们已采取缓解措施以降低风险。
在日常交互方面,我们评估了模型的谄媚行为、受有害操纵的可能性以及心理伤害模式(如类社会关系依赖和对妄想推理的认同),包括通过多轮、开放式的外部红队测试,旨在发现那些仅在较长对话中才会显现的问题。我们还评估了模型是否会拒绝真正有害的请求,同时不会过度拒绝良性请求。在化学、生物、放射和核(CBRN)以及网络安全领域,我们通过内部评估、外部测试以及移除安全防护的拒绝抑制变体,来评估知识和程序提升能力,以估计其潜在能力。在失控风险方面,我们评估了模型的代理能力、策略性欺骗和破坏潜力,并与公开的前沿模型进行基准对比,发现该模型的能力明显低于前沿水平。
综合所有领域的评估,我们得出结论:Inkling-Small不会带来超出开源模型生态系统现有水平的实质性能力提升风险。
我们的评估中发现的残余风险——具体而言,Inkling-Small偶尔会倾向于遵从涉及有害主题的角色扮演和间接框架提示——与任何开源模型的表现一致,且最好通过纵深防御来解决,而非仅依赖模型自身的拒绝机制。常见的下游 moderation 工具(如Llama Guard)与Inkling-Small兼容,可以作为模型的外层防护,用于捕捉越狱尝试、过滤不安全输出并执行特定用例的策略。我们建议将此类输入/输出分类作为部署堆栈的一部分,尤其是在面向消费者或高流量的应用中,这些场景更可能遭遇对抗性提示。
Inkling-Small 可能存在基础模型常见的一般性局限,包括幻觉(生成看似合理但与事实不符或缺乏支持的内容)、偶尔无法精确遵循指令,以及在长对话轮次中性能下降。与其他基于网络数据和合成数据训练的大规模模型一样,Inkling-Small 可能会反映其训练数据中存在的偏差,包括人口统计、文化或语言偏差,并且在训练期间代表性不足的语言、方言或主题领域上的表现可能不均衡。
Inkling-Small 的知识仅限于其训练截止日期前可获取的信息,可能无法反映此后发生的事件、发展或变化。
我们建议下游开发者和部署者在高风险或安全关键场景中对输出内容进行适当的人工监督和审查,而非未经核实就依赖 Inkling-Small 的输出。