跳到正文
原文
Hugging Face Blog·· 2026-07-15精选AI 评分77

Thinking Machines 发布多模态开源模型 Inkling 与 Inkling-Small

Welcome Inkling by Thinking Machines

AI 导读

Thinking Machines 发布开源模型 Inkling,原生支持图像、文本和音频,总参数 975B、激活 41B,上下文 1M。

推荐理由

Inkling给出975B总参数的原生图文音频架构、Small变体和多档显存部署配置,读者可据此比较开源超大模型的接入成本。

正文 · AI 翻译
Inkling 现在推出了更小的尺寸 🤗 Thinking Machines Lab 发布了 Inkling-Small。我们已更新本文,补充了 Inkling-Small 与 Inkling-Small-NVFP4 变体的性能和部署配置。这里是包含所有 Inkling 模型的合集。我们让你能在 Inference Endpoints 上一键部署 Inkling-Small(最高可达 160 TPS)。我们还提供了实时语音与图像演示,你可以在其中与模型互动。

Inkling 是一个大型(1T 参数!)开放模型,可原生接受图像、文本和音频输入。

TLDR;Thinking Machines 的 Inkling 已在 Hugging Face 上发布。Inkling 是一个超大规模多模态 LLM,能够理解所有模态(图像、音频、文本),具备智能体能力,并支持 1M 上下文。它提供完整 BF16 版本以及经过良好校准的 NVFP4 变体,并包含用于加速推理的推测式 MTP 层。transformers、SGLang、vLLM 和 llama.cpp 均提供首日支持。Thinking Machine Labs 还发布了 Inkling-Small,总参数 276B、激活参数 12B,并支持 MXFP8 和 NVFP4 权重,架构与 Inkling 相同。

Inkling 有何特别之处?

Inkling 是首个拥有约 1T 参数和1M 上下文窗口、可原生接收图像、文本和音频输入的大型开放模型,训练数据为45 万亿个文本、图像、音频和视频 token。它专注于跨音频、图像和文本等模态的推理,并旨在通过微调进行领域适配。我们已用这个模型做了一些演示并探索其架构,我们认为它非常适合构建新一波多模态推理应用。

整体能力与架构

Inkling 是一个 decoder-only 多模态 Mixture-of-Experts 模型,总参数 975B,激活参数 41B。其中内容很多,下面我们逐一拆解:

  • Decoder-only:这意味着该架构支持因果自回归生成,与大多数最先进的 LLM 一样。
  • 多模态:该模型可以接收文本、音频和图像。
  • 混合专家(MoE):每一层内部的前馈网络是稀疏的,因而推理更快,因为任意时刻只有 41B 参数处于激活状态。该模型有 256 个专家,稍后我们会看到。

下面快速看一下该架构。

相对注意力:Inkling 没有使用 RoPE(在 transformer 模型中注入位置信息的常用方法),而是使用相对注意力来编码位置信息。每个注意力层直接在注意力 logits 中学习位置。除 key-query-values 之外,还有第四个投影,用于产生逐 token、逐头的相对特征 R。随后,该投影张量会用距离信息(key 与 query 向量之间的距离)进行调整,并传入注意力模块。

Inkling relative attention architecture

混合注意力:解码器层在全局注意力(一次性关注完整上下文长度)与滑动窗口注意力(以滑动方式关注固定上下文窗口)之间交替。该架构中滑动窗口注意力层与全局注意力层的比例为 5:1。这种混合注意力方案提高了计算效率。最后一层使用全局注意力,以帮助构建特征丰富的表示。

短卷积:该模型在隐藏状态上使用一种独特的短一维卷积,即 SConv。SConv 读取当前 token 以及此前的 W-1 个隐藏状态,其中 W 为滑动窗口大小。这里的直觉是,SConv 有助于局部注意力,同时使注意力模块和 MoE 模块不必承担局部表示。

Inkling short convolution architecture

带共享专家 sink 的 MoE:在 Inkling 中,路由器会同时为路由专家和共享专家打分。Top-k 选择在 6 个专家上执行,另有 2 个共享专家始终处于激活状态。

视觉理解:该模型包含一个由若干线性层组成的简单分层 MLP patchifier。每一层逐步合并像素,直到最后一层为每个 patch 生成一个嵌入。

音频理解:该架构采用离散化的梅尔频谱图,其中每个音频块(100 ms)都会被转换到梅尔尺度,然后被归类到精确的梅尔频谱图 bin。

多模态塔是相对简单的模块,不同于其他为每种模态采用独立编码器的模型。每个图像 patch 经过图像嵌入塔,音频块经过音频嵌入塔,从而得到两种媒体嵌入。图像输入还包含一个额外的时间维度,用于视频处理。我们预计这一能力对下游微调会有帮助,但尚未评估开箱即用的视频性能。该塔会折叠 patch 网格,将相邻 token 组成的一小块局部区域堆叠到通道维度,并经过 hMLP。音频波形被转换到梅尔尺度,然后被归类到一个离散的梅尔 bin。这些梅尔 bin 值会在音频嵌入塔中进行嵌入,随后将这些嵌入相加,构成最终的音频输入。

推理支持

Inkling 提供 day-0 transformers 支持,并在 SGLang 和 vLLM 等主流推理引擎中得到支持。

这个模型非常大。bf16 检查点需要 2 TB 显存,而 nvfp4 版本需要 600 GB 显存。你可以通过 Inference Providers 等无服务器推理路由来试用该模型,也可以使用 ggml 量化,借助 llama.cpp 进行本地部署。

Transformers

直接使用 transformers 进行推理的最简单方式是使用 any-to-any pipeline。你可以在 Hopper 或更新的 GPU 上使用 16 位 "thinkingmachines/Inkling",或在 Blackwell Nvidia GPU 上使用量化的 NVFP4 检查点 "thinkingmachines/Inkling-NVFP4"。请确保使用最新版本的 transformers(5.14.0 已于今日发布)(pip install -U transformers)。

from transformers import pipeline

model_id = "thinkingmachines/Inkling"
# model_id = "thinkingmachines/Inkling-NVFP4"

pipe = pipeline("any-to-any", model=model_id)

初始化 pipeline 之后,你可以按如下方式传入 prompt。

image_url = (
    "https://huggingface.co/datasets/merve/vl-test-suite/"
    "resolve/main/pills.jpg"
)
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image",
                "image": image_url,
            },
            {
                "type": "text",
                "text": "Do components in this supplement interact with each other?",
            },
        ],
    },
]
output = pipe(
    messages,
    max_new_tokens=2000,
    return_full_text=False,
    reasoning_effort="medium",
)
output[0]["generated_text"]

再下一层,你可以使用 Auto 类。进行推理时,模型可以使用 AutoModelForMultimodalLM 类,处理器可以使用 AutoProcessor 类。对于不同的推理任务,分词器接受一个 reasoning_effort 参数。现有的推理力度选项为 "none"、"minimal"、"low"、"medium"、"high"、"xhigh" 和 "max"。

from transformers import AutoModelForMultimodalLM, AutoProcessor

model_id = "thinkingmachines/Inkling"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForMultimodalLM.from_pretrained(
    model_id,
    dtype="auto",
    device_map="auto",
)

messages = [
    {"role": "system", "content": "You should only answer with a number."},
    {"role": "user", "content": "What is 17 * 23?"},
]

inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
    reasoning_effort="high",
).to(model.device)

output = model.generate(**inputs, max_new_tokens=2000)
generated_tokens = output[0][inputs["input_ids"].shape[1] :]
print(processor.decode(generated_tokens, skip_special_tokens=False))

对于多模态推理,你可以使用相同的类。我们在模型卡中为每种不同模态提供了示例片段。

文本与图像推理

from transformers import AutoModelForMultimodalLM, AutoProcessor

model_id = "thinkingmachines/Inkling"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForMultimodalLM.from_pretrained(
    model_id,
    dtype="auto",
    device_map="auto",
)

image_url = (
    "https://huggingface.co/datasets/merve/vl-test-suite/"
    "resolve/main/pills.jpg"
)
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image",
                "image": image_url,
            },
            {
                "type": "text",
                "text": "Do any of the components in this supplement interact?",
            },
        ],
    },
]

inputs = processor.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    reasoning_effort="medium",
    return_dict=True,
    return_tensors="pt",
).to(model.device)
input_len = inputs["input_ids"].shape[-1]

outputs = model.generate(**inputs, max_new_tokens=2000)
response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)

processor.parse_response(response)

Inkling 也接受音频输入。下面是一个推理示例片段,它仍然使用同一个 AutoModelForMultimodalLM 类。

文本与音频推理

from transformers import AutoModelForMultimodalLM, AutoProcessor

model_id = "thinkingmachines/Inkling"

processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForMultimodalLM.from_pretrained(
    model_id,
    dtype="auto",
    device_map="auto",
)

audio_url = (
    "https://huggingface.co/datasets/merve/vl-test-suite/"
    "resolve/main/example_audio.mp3"
)
messages = [
    {
        "role": "user",
        "content": [
            {"type": "text", "text": "Transcribe the following speech to text."},
            {
                "type": "audio",
                "audio": audio_url,
            },
        ],
    },
]

inputs = processor.apply_chat_template(
    messages,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
    add_generation_prompt=True,
).to(model.device)
input_len = inputs["input_ids"].shape[-1]

outputs = model.generate(**inputs, max_new_tokens=512)
response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)

processor.parse_response(response)

如需在由多个节点组成的集群中进行更贴近实际的并行部署,请参阅下方的 Slurm 部分。

SGLang

SGLang 是 Inkling 发布时最快的部署框架之一,因为它包含自定义模型实现。下面的启动命令将模型分片到 8 块 GPU 上,并在端口 30000 上提供兼容 OpenAI 的 API。

pip install sglang

python3 -m sglang.launch_server \
 --model-path thinkingmachine/Inkling \
 --tp-size 8 \
 --served-model-name inkling \
 --host 0.0.0.0 \
 --port 30000

将 --tp-size 设为与你的 GPU 数量一致。如果需要为 KV cache 留出更多余量,请添加 --mem-fraction-static(例如 0.85)。

vLLM

vLLM 擅长生产环境服务。一条 vllm serve 命令即可从 Hub 下载权重,通过张量并行将模型分片到你的各块 GPU 上,并在端口 8000 上启动兼容 OpenAI 的服务器。你可以在此处查看该模型的 vLLM Recipe,以便根据你的硬件进行定制。

# Requires nightly or vllm>=0.26 (once released)
uv pip install -U vllm --pre \
  --extra-index-url https://wheels.vllm.ai/nightly/cu130 \
  --extra-index-url https://download.pytorch.org/whl/cu130 \
  --index-strategy unsafe-best-match

vllm serve thinkingmachines/Inkling-NVFP4 \
  --trust-remote-code \
  --tokenizer-mode inkling \
  --tensor-parallel-size 8 \
  --enable-auto-tool-choice \
  --tool-call-parser inkling \
  --reasoning-parser inkling \
  --served-model-name inkling

实际使用中,你可能需要多个节点以及 SLURM 之类的分布式工具(见下文)。关键参数是将 --tensor-parallel-size 设为你节点上的 GPU 数量;如果遇到 KV-cache 内存限制,则使用 --max-model-len 来限制上下文窗口。

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "inkling",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

使用 Hugging Face Inference Providers 进行远程推理

你可以通过 Hugging Face 使用多家推理服务商对该模型进行推理。你可以在此处查看所有用于调用的代码片段。下面展示如何配合 OpenAI 客户端使用。

import os

from openai import OpenAI

client = OpenAI(
    base_url="https://router.huggingface.co/v1",
    api_key=os.environ["HF_TOKEN"],
)

completion = client.chat.completions.create(
    model="thinkingmachines/Inkling:auto",
    messages=[
        {
            "role": "user",
            "content": "What is the capital of France?",
        },
    ],
)

print(completion.choices[0].message)

使用 “:auto” 后缀会路由到你在设置中的首选服务商;你也可以使用 “cheapest” 或 “:fastest”。本次发布中,我们为所有人承担发布后 2 小时内的推理费用。

注意:Inference Providers 中的音频支持仍在开发中,即将添加。

使用 llama.cpp 和 Unsloth 进行本地推理

你可以使用 llama.cpp 在有限的硬件上运行该模型的量化版本。Unsloth 已将该模型量化至 1-bit 精度,相比原始模型将显存占用降低了 95%。

llama serve -hf unsloth/inkling-GGUF:UD-IQ1_S

这会启动一个运行于 http://localhost:8080/v1 的兼容 OpenAI 的服务器,你可以在偏好的工具或客户端中连接它。前往该处后,你可以开始与模型对话,配置你喜欢的 MCP,方便地传入图片或文件,等等!

Llama cpp 还自带支持工具、mcp 和智能体工作负载的内置 UI。在 llama 应用中查看以 1-bit 精度运行的 Inkling:

Inkling 的 GGUF 也可在 Unsloth Studio 中运行,其动态 1-bit GGUF 在体积缩小 86% 的同时保留约 74.2% 的 top-1% 准确率。

Inkling running in Unsloth Studio

使用场景

使用 Pi 进行智能体编程

Pi 是一个极简的编程智能体框架,可与不同的语言模型配合使用。安装后,你可以将以下内容添加到 ~/.pi/agent/models.json 中,从而通过推理引擎服务器端点(例如 llama.cpp)或 Hugging Face 上的 Inference Providers 来使用 Pi。

{
  "providers": {
    "inference-providers": {
      "baseUrl": "https://router.huggingface.co/v1",
      "api": "openai-completions",
      "apiKey": "hf_...",
      "models": [
        {
          "id": "thinkingmachines/Inkling"
        }
      ]
    }
  }
}

然后你可以在项目目录中调用 pi 来启动 Pi,即可开始使用!在这个演示中,我们给模型一道困难的数学推理题,它使用 pi 中的工具来求解。

Visual reasoning gif demo

Inkling 专注于广泛的多模态推理和较低的 token 消耗,因此不妨用文档处理或音频任务来试用它。

多 Token 预测草稿模型

MTP 为模型增加额外层,这些层一次预测多个 token,而不仅仅是下一个。推理期间,这些额外层充当推测解码的“草稿模型”,在不牺牲性能的情况下加快生成。使用 MTP 时,生成输出完全相同,生成速度可成倍提升,显存开销很小(因为需要服务草稿模型)。Thinking Machines 也在本次发布中提供了 MTP 草稿模型。

import torch
from transformers import AutoModelForMultimodalLM, AutoProcessor

processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
model = AutoModelForMultimodalLM.from_pretrained(
    "thinkingmachines/Inkling",
    dtype=torch.bfloat16,
    device_map="auto",
)

# Preprocess the inputs.
...
generated = model.generate(
    **inputs,
    max_new_tokens=1000,
    do_sample=False,
    use_mtp=True,
)
print(processor.decode(generated[0], skip_special_tokens=True))

多模态视觉

我们准备了一小套来自专家级来源和大学入学考试的推理题。我们拍摄了屏幕照片,截图中带有水印,用以挑战该模型。该模型在高推理强度下全部解出,在最高和中等推理强度下有一题失败,因此我们提供模型答案的链接,供你查看模型的表述如何,并给出模型解答每道题所消耗的 token 数。请注意,这些 vibe 评估中我们没有提供系统提示词,而这些推理题通常应配合良好的系统提示词来运行。vibe 评估的图片和结果见 此处。

类别 问题 Token 数量(推理强度:中等) Token 数量(推理强度:高) Token 数量(推理强度:最高)
开放式药物相互作用 这里哪些成分会相互作用? 1,893 ✅ 2,367 ✅ 3,688 ✅
物理题(MMMU-Pro) 回答图片中的问题。 1,357 ✅ 3,323 ✅ 3,314 ✅
多语言物理题 回答图片中给出的土耳其语问题。 1,435 ✅ 2,129 ✅ 3,162 ✅
律师资格考试 回答图片中的问题。 1,117 ✅ 2,137 ✅ 1,676 ✅
信息图问答(开放式) 根据所呈现的信息,北极预计的夏季变暖期大约是已观测到显著北极变暖的时长的多少倍? 1,378 ❌ 3,859 ✅ 6000(超出 token 预算)

关于 vibe 的几点说明:

  • 模型没有直接回答信息图上的问题,而是先把图片上的文字转成文本,以便让自己有据可依。
  • 提示词对节省推理中的 token 非常重要,例如,对着药片背面的图片提出“这里哪些成分会相互作用?”这类模糊问题时,模型首先需要弄清我们这里所说的相互作用指什么。
  • 多选题的答案对模型组织自身推理帮助很大;与 MCQA 相比,模型在开放式问题上更为吃力,不过这是许多模型的常见问题。通常的思维链是 OCR → 刻画 → 逐一评估每个选项 → 作答。
  • 0.7 的推理强度(中等)似乎提供了不错的权衡。

多模态音频

我们使用 BigBenchAudio 中的一些音频推理样例,以及 GlobeAudio 的若干多语言音频样例(俄语和中文多选题,询问转写中的最后一个词),对该模型做了 vibe 评估。我们测试的 BigBenchAudio 样例由逻辑陈述和问题组成,这些问题要么考察形式谬误(某个论证能否从音频给出的上下文中逻辑推导出来),要么考察物体计数(音频中陈述多个不同物体,询问其中某一类的总数)。尽管该基准最初是为语音到语音推理设计的,我们只是想看看该模型的音频推理能力。对于 GlobeAudio,问题相对直接,因此我们以 0.1 的推理强度运行。我们运行了 GlobeAudio 中每种语言的第一个样例。除最低推理强度下的第二个形式谬误样例外,所有测试在全部问题和强度下均通过,因此我们只提供每道题在不同推理强度下所消耗的 token 数。vibe 评估结果和音频文件见 此处。

GlobeAudio 问题 补全 token 数量(推理强度:最低) 补全 token 数量(推理强度:中等)
俄语(询问最后一个词) 音频录音中的最后一个词是什么? 1. 俄罗斯 2. 证人 3. 莫斯科 4. 事件 选择唯一正确的选项,并用其确切文本作答。 130 179
俄语(询问说话者的职业) 说话者最可能从事什么职业? 1. 记者 2. 博主 3. 历史老师 4. 娱乐节目主持人 选择唯一正确的选项,并用其确切原文作答。 105 136
中文(询问语速) 播报员的语速有何变化? 1. 突然变快 2. 突然变慢 3. 保持不变 4. 时快时慢 选择唯一正确的选项,并用其确切原文作答。 111 289
Big Bench Audio 补全 token 数(最低) 补全 token 数(中等) 补全 token 数量(最高)
形式谬误(10) 285 335 444
形式谬误(39) 275(失败) 555 778
物体计数(680) 150 233 161

关于整体观感的一些说明:

  • 与视觉类似,模型会先转录语音,然后再回答问题。
  • 它能抵抗干扰项:在俄语测试中,尽管音频中出现了其他答案,模型仍选出了正确答案。
  • 与视觉类似,通常的思维链是转录 → 刻画特征 → 评估每个选项 → 作答。
  • 这些投入有助于推理,而非听觉。音频问答比图像便宜得多。

后训练

如果你想使用 Inkling 进行后训练,Thinking Machines 构建了 tinker,这是一个用于对开放权重模型进行后训练的托管工具。他们的手册包含微调、蒸馏和强化学习的示例。

我们使用 tinker 和 OpenEnv(一种智能体强化学习环境工具)对 Inkling 进行了后训练。我们使用了 ECHO 算法,该算法训练模型在没有验证器的情况下预测环境,对环境产生的 token 施加下一 token 交叉熵损失,同时对智能体动作进行常规策略学习。这使策略学到一个隐式世界模型,而无需单独的模型、教师或额外的 rollout。请查看示例。

Inkling post-training metrics

使用 Tinker 和 OpenEnv 的强化学习示例

git clone https://github.com/huggingface/OpenEnv.git
cd OpenEnv

# Add TINKER_API_KEY=... to .env, then run:
uv run --env-file .env \
  examples/echo_world_model/backends/tinker_echo_demo.py

如果你正在使用 Transformers Reinforcement Learning,我们建议在知识蒸馏设置中将 Inkling 用作教师模型。例如,利用 Inkling 的文档理解能力来提升较小(端侧)模型的性能。在此示例中,我们使用 transformer reinforcement learning 库和 GOLD 算法来蒸馏知识。GOLD 在这里很方便,因为它能在不同分词器之间匹配 token logits,因此你可以蒸馏到 hub 上的任何模型。

部署 Inkling 和 Inkling-Small

下面你可以找到每个 Inkling 检查点及其显存需求。

模型变体 合计显存 推荐的 GPU 配置 部署说明
Inkling (BF16) 2 TB • 8× NVIDIA B300 / GB200
• 16× NVIDIA H200
全精度部署;H200 集群需要多节点互连。
Inkling (NVFP4) 600 GB • 4× NVIDIA B300 / GB200 (W4A4)
• 8× NVIDIA H200 (W4A16)
W4A4 需要 Blackwell 架构(SM100+)。
Inkling-Small (BF16) 600 GB • 4× NVIDIA B300 / GB200 (W4A4)
• 8× NVIDIA H200 (W4A16)
不需要 Blackwell 架构;可轻松部署到 8× H200。
Inkling-Small (NVFP4) 180 GB • 1× NVIDIA B300 (W4A4)
• 2× NVIDIA H200 (W4A16)
W4A4 支持单块 Blackwell GPU;W4A16 支持 2× H200。

在集群上部署 Inkling

要在集群上部署 Inkling,我们提供了使用 transformers API 进行服务的 SLURM 脚本,以及如何用不同模态查询端点。你可以通过更新命令将这些脚本适配到 vLLM 或 SGlang。这些脚本位于此处。

在 Inference Endpoints 上部署 Inkling-Small

你可以使用 Inference Endpoints 部署 Inkling-Small 的 NVFP4 检查点。我们提供经过预先测试的配置,将其部署在 8 块 RTX PRO 6000 上,合计显存为·768 GB,为 KV 缓存留出充足空间,每小时运行费用为 $ 22(未使用时缩减至零)。要进行部署,请使用 Hugging Face CLI 运行 hf endpoints catalog deploy --repo thinkingmachines/Inkling-Small-NVFP4,或者前往 https://endpoints.huggingface.co/new/thinkingmachines/Inkling-Small-NVFP4。在此配置下,你可以达到 140 TPS(单用户推理,已准备好通过连续批处理支持多用户)

端点启动后,你可以按如下方式进行查询。

curl "YOUR_ENDPOINT_HERE" \
-X POST \
-H "Authorization: Bearer $HF_TOKEN" \
-H "Content-Type: application/json" \
-d '{
    "model": "thinkingmachines/Inkling-Small-NVFP4",
    "messages": [
        {
            "role": "user",
            "content": [
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://endpoints.hf.co/media-examples/img1.png"
                    }
                },
                {
                    "type": "text",
                    "text": "Describe this image in one sentence."
                }
            ]
        }
    ],
    "stream": true,
    "max_tokens": 100
}'

基准测试结果

Inkling Small Inkling Nemotron 3 Ultra Kimi K2.5 Kimi K2.6 GLM 5.2 DeepSeek V4 Pro Gemini 3.1 Pro(高) Claude Fable 5(最大) GPT 5.6 Sol(超高)
推理
HLE(仅文本) 31.6% 29.7% 26.6% 29.4% 35.9% 40.1% 35.9% 44.7% 53.3% 47.2%
HLE(使用工具) 47.8% 46.0% 37.4% 50.2% 54.0% 54.7% 48.2% 51.4% 64.5% 55.0%
AIME 2026 95.5% 97.1% 94.2% 95.8% 96.4% 99.2% 96.7% 98.3% – 99.9%
GPQA Diamond 89.5% 87.2% 86.7% 0 87.9% 91.1% 89.5% 88.8% 94.1% 92.6% 94.1%
智能体(编程) 0
SWEBench Verified 80.2% 77.6% 70.7% 76.8% 80.2% – 80.6% 80.6% 95.0% –
SWEBench Pro(公开) 55.9% 54.3% 46.4% 50.7% 58.6% 62.1% 55.4% 54.2% 80.0% 64.6%
Terminal Bench 2.1(最佳评测框架) 64.69 63.8 56.4 51.3 71.3 82.7 64 73.8 84.6 89.5
GDPVal-AA v2 1269 1233 1164 1009 1190 1514 1307 962 1760 1748
智能体(通用)
MCP Atlas 79.2% 74.1% 44.7% 64.0% 68.1% 77.8% 73.2% 78.2% 83.3% 81.8%
Tau 3 Banking 15.5% 23.7% 13.8% 13.2% 20.6% 26.8% 25.8% 16.5% 26.8% 33.0%
事实性 0
BrowseComp(含上下文) 77.4% 77.1% – 74.9% 83.2% – 83.4% 85.9% 88.0% 89.4%
SimpleQA Verified 20.6% 43.9% 32.4% 36.9% 38.7% 38.1% 57.0% 77.3% 68.3% 71.6%
AA Omniscience -9 1.0% -1.0% -8.0% 6.0% 4.0% -10.0% 33.0% 40.0% 22.0%
对话 0
IFBench 82.2% 79.8% 81.4% 70.2% 76.0% 73.3% 76.5% 77.1% 63.5% 72.7%
Global-MMLU-Lite 86.7% 88.7% 85.6% 84.0% 88.4% 89.2% 89.3% 92.7% 93.3% 91.8%
视觉 0 0 0
MMMU Pro(标准 10) 74.0% 73.3% – 75.0% 79.0% – – 82.0% 84.2% 83.0%
Charxiv RQ 77.4% 78.1% – 77.5% 80.4% – – 80.2% 86.5% 84.7%
Charxiv RQ(使用 Python) 82.3% 82.0% – 78.7% 86.7% – – 89.9% 89.4% 87.8%
音频 0
Audio MC 54.9% 56.6% – – – – – 66.8% – –
MMAU 77.0% 77.2% – – – – – 82.5% – –
VoiceBench 90.1% 91.4% – – – – – 94.3% 0 – –
安全 0
FORTRESS(对抗) 71.6% 78.0% 77.6% 54.1% 65.6% 71.3% 36.0% 65.2% 96.0% 82.4% 静止
FORTRESS(良性) 96.9% 95.9% 90.5% 98.3% 97.2% 90.0% 98.5% 98.0% 55.1% 98.1%
StrongREJECT 98.4% 98.6% 98.7% 99.5% 99.8% 98.5% 98.6% 98.0% 98.7% 98.5%

来源:Hugging Face Blog · huggingface.co