Google DeepMind发布实验性开源模型DiffusionGemma,文本生成最高快4倍
DiffusionGemma: 4x faster text generation
Google DeepMind发布实验性开源模型DiffusionGemma,这款26B MoE以文本扩散整块并行生成文本,在专用GPU上最高可实现4倍加速。
DiffusionGemma把本地文本生成从逐token解码改成整段并行起草,并交代相对Gemma 4的速度、显存和质量取舍,便于判断它适合哪些交互式本地工作流。
Jun 10, 2026
|
我们最新的开放实验模型在专用 GPU 上可实现高达 4 倍的推理加速,并为探索对速度至关重要的交互式本地工作流打开了大门。
Brendan O'Donoghue
研究科学家
Sebastian Flennerhag
研究科学家
今天,我们推出 DiffusionGemma,这是一款探索文本扩散的实验性开放模型,而文本扩散是一种异常快速的文本生成方法。该模型以 Apache 2.0 许可证发布,这个 26B 混合专家(MoE)模型突破了典型自回归大语言模型(LLM)逐 token 的顺序处理方式。相反,它同时生成整块文本,在 GPU 上实现高达 4 倍更快的文本生成。
DiffusionGemma 建立在我们 Gemma 4 系列业界领先的单位参数智能以及前沿的 Gemini Diffusion 研究 之上,集成了一个旨在最大化生成速度的新型扩散头。虽然自回归 Gemma 4 模型仍是高质量生产输出的标准,但 DiffusionGemma 专为探索对速度至关重要的交互式本地工作流的研究人员和开发者而设计,例如行内编辑、快速迭代以及生成非线性文本结构。
为开发者解锁新价值
构建实时交互式 AI 应用的开发者常常受困于本地推理的延迟瓶颈。DiffusionGemma 直接应对这些挑战,但也伴随一些关键权衡:
- 极速推理:通过将解码瓶颈从内存带宽转移到计算,DiffusionGemma 在专用 GPU 上可实现高达 4 倍更快的 token 输出。(单块 NVIDIA H100 上超过 1000 tokens/秒,NVIDIA GeForce RTX 5090 上超过 700 tokens/秒)。 1
- 易于承受的硬件占用:作为一个总参数量为 26B、推理时仅激活 3.8B 参数的混合专家(MoE)模型,DiffusionGemma 在量化后可轻松处于高端专用消费级 GPU 的 18GB 显存限制之内。
- 双向注意力:每次前向传播并行生成 256 个 token,使每个 token 都能关注所有其他 token。这为非线性领域带来显著优势,例如行内编辑、代码填充、氨基酸序列或数学图。
- 智能自我纠正:模型会迭代优化自身输出,从而能够一次性评估整个文本块并实时修正错误。
- 实验状态与生产建议:由于它优先考虑速度和并行布局生成,DiffusionGemma 的整体输出质量低于标准 Gemma 4。对于要求最高质量的应用,我们建议部署标准 Gemma 4。
你可以通过微调来提升 DiffusionGemma 在特定任务上的表现。在下面的示例中,Unsloth 对 DiffusionGemma 进行了微调,使其能够玩数独——这是自回归模型难以胜任的任务,因为每个 token 都依赖于未来的 token。DiffusionGemma 的双向注意力使这项任务容易得多。
经过微调的 DiffusionGemma 正在求解数独。
为什么用扩散来生成文本?
尽管 AI 研究界多年来一直在探索基于扩散的文本生成,但将其应用于大模型仍然是一项挑战。DiffusionGemma 通过改变模型使用硬件的方式改变了这一点。
与传统模型的权衡
大多数语言模型的工作方式像一台打字机,从左到右一次生成一个 token。在云端,这种方式很高效,因为服务器可以把成千上万的用户请求一起批处理,以分摊硬件负载。但在本地为单个用户运行时,这种逐词处理会让你专用的 GPU 或 TPU 得不到充分利用——它大部分时间只是在等待下一次“击键”。
DiffusionGemma 扭转了这种低效。它不是按顺序预测词语,而是同时起草一整段 256 个 token 的段落。通过一次性给计算机处理器更大一块工作,DiffusionGemma 能充分发挥你的硬件潜力。它把模型推理从一台单一、顺序工作的打字机,升级为一台能同时印出整块文本的大型印刷机。
Hugging Face 的 DiffusionGemma 文本转 3D SVG 演示。逐步生成。
这意味着 DiffusionGemma 的加速是为本地和低并发推理设计的。在高 QPS 云端服务中,自回归模型可以被部署来高效地跑满算力,因此 DiffusionGemma 的并行解码收益递减,并可能导致更高的服务成本。吞吐量优势在单个加速器上、低到中等批大小时最为显著。
文本扩散如何工作
类似于会从视觉噪点开始并迭代精修成清晰图像的 AI 图像生成器,DiffusionGemma 将这一方法应用于文本:
- 画布:模型从一块由随机占位 token 组成的画布开始。
- 迭代精修:模型进行多次遍历,锁定正确的 token,并将它们用作上下文线索来精修其余部分。
- 最终打磨:文本收敛为高质量输出。
由于模型在生成时可以处理整段文字,它解锁了新的模型行为模式,比如完美闭合复杂的 markdown 格式,或近乎实时地生成并渲染代码。
今天就开始
- 下载权重:立即在 Hugging Face 上获取实验性模型权重(以宽松的 Apache 2.0 许可证发布)。
- 集成与学习:在我们的DiffusionGemma 开发者指南中了解更多。或深入阅读DiffusionGemma 可视化指南,以理解其底层机制。
- 使用你喜欢的开发工具:使用 MLX、vLLM(集成由 Red Hat 支持)以及 Hugging Face Transformers 高效地服务该模型。为便于快速实验,我们发布了一份使用 Hackable Diffusion 的微调教程,这是一个专为可组合性设计的模块化 JAX 工具箱。你也可以探索使用 Unsloth 和 NVIDIA NeMo 进行微调。此外,对 llama.cpp 的官方支持即将到来。
- 体验优化后的性能:我们与 NVIDIA 合作,在其整个硬件栈上进行优化,确保兼容消费级配置(针对 GeForce RTX 5090 和 4090 GPU 进行量化),同时在企业级系统上实现高性能(Hopper 和 Blackwell 使用先进的 NVFP4 内核),包括用于本地桌边部署的 NVIDIA DGX Spark 和 DGX Station,以及面向 AI 专业人士的 RTX PRO。对 NVFP4(4 位浮点)的原生支持可加速计算吞吐量,使模型能以更快的速度运行,同时保持近乎无损的精度。
- 按你的方式尝试:在桌面专用 GPU 上运行,或通过云端的 Gemini Enterprise Agent Platform Model Garden 或 NVIDIA NIM。
来源:Google DeepMind · deepmind.google