跳到正文
原文
Google DeepMind·· 2026-04-03精选AI 评分81

Google DeepMind 发布开源模型 Gemma 4

Gemma 4: Byte for byte, the most capable open models

AI 导读

Google DeepMind 发布开源模型家族 Gemma 4,包含 E2B、E4B、26B MoE 与 31B Dense,权重以 Apache 2.0 许可提供。

推荐理由

官方一次放出四档开源权重并采用 Apache 2.0,读者可按硬件与端侧条件对照本地推理和智能体能力。

正文 · AI 翻译

Apr 02, 2026

|


Clement Farabet

研究副总裁,Google DeepMind

Olivier Lacombe

产品管理总监,Google Deepmind


Gemma 4

收听文章

[[duration]] 分钟

本内容由 Google AI 生成。生成式 AI 尚处于实验阶段

今天,我们推出 Gemma 4——迄今为止我们最智能的开放模型。Gemma 4 专为高级推理和智能体工作流打造,带来前所未有的单位参数智能水平。这一突破建立在令人瞩目的社区势头之上:自第一代发布以来,开发者下载 Gemma 的次数已超过 4 亿次,构建了拥有 10 万多个变体、充满活力的 Gemmaverse。我们认真倾听创新者下一步突破 AI 边界所需的能力,Gemma 4 便是我们的答案:在 Apache 2.0 许可证下广泛提供的突破性能力。

截至 4/1,开放模型在 Arena.ai 聊天竞技场上的性能与规模对比。

Open model performance vs size on Arena.ai’s chat arena

Gemma 4 源自与 Gemini 3 相同的世界级研究与技术,是你能够在自有硬件上运行的最强模型系列。它们与我们的 Gemini 模型互为补充,为开发者带来业界最强大的开放工具与专有工具组合。

业界领先的能力与移动优先的 AI

我们以四种灵活规模发布 Gemma 4:Effective 2B (E2B)、Effective 4B (E4B)、26B Mixture of Experts (MoE) 和 31B Dense。整个系列超越简单聊天,能够处理复杂逻辑和智能体工作流。我们较大的模型在各自规模上实现了最先进的性能,其中 31B 模型目前在行业标准 Arena AI 文本排行榜上排名全球开放模型第 3,26B 模型位列第 6。在该榜单上,Gemma 4 的表现超过了规模为其 20 倍的模型。对开发者而言,这种新的单位参数智能水平意味着以显著更低的硬件开销实现前沿级能力。

在边缘侧,我们的 E2B 和 E4B 模型重新定义了端侧实用性,优先考虑多模态能力、低延迟处理和无缝的生态系统集成,而不是原始参数数量。

强大、可及、开放

为驱动下一代开创性研究与产品,我们专门设定 Gemma 4 模型的规模,使其可在硬件上高效运行和微调——从全球数十亿台 Android 设备,到笔记本电脑 GPU,再到开发者工作站和加速器。

借助这些高度优化的模型,你可以对 Gemma 4 进行微调,从而在特定任务上达到最先进的性能。我们已经看到这种方法取得了非凡成功;例如,INSAIT 创建了开创性的保加利亚语优先语言模型(BgGPT),我们还与耶鲁大学合作开展 Cell2Sentence-Scale,以发现癌症治疗的新路径,以及许多其他成果。

以下是 Gemma 4 成为我们迄今能力最强的开放模型系列的原因:

  • 高级推理:Gemma 4 能够进行多步规划与深度逻辑推理,在需要这些能力的数学和指令遵循基准测试中表现出显著提升。
  • 智能体工作流:原生支持函数调用、结构化 JSON 输出和原生系统指令,使你能够构建可与不同工具和 API 交互并可靠执行工作流的自主智能体。
  • 代码生成: Gemma 4 支持高质量的离线代码生成,将你的工作站变成以本地优先的 AI 代码助手。
  • 视觉与音频: 所有模型都能原生处理视频和图像,支持可变分辨率,并擅长 OCR 和图表理解等视觉任务。此外,E2B 和 E4B 模型具备原生音频输入,可用于语音识别与理解。
  • 更长上下文: 无缝处理长篇内容。边缘模型配备 128K 上下文窗口,而更大的模型最高可达 256K,让你能在单次提示中传入代码仓库或长文档。
  • 140+ 种语言: Gemma 4 原生基于超过 140 种语言进行训练,帮助开发者为全球用户构建包容、高性能的应用。

面向多样化硬件的多用途模型

我们正发布针对特定硬件与用例定制尺寸的 Gemma 4 模型权重,确保你在任何需要的地方都能获得前沿级推理能力:

26B 与 31B 模型:前沿智能,可在个人电脑上离线运行

经过优化,可在可及的硬件上为研究人员和开发者提供最先进的推理能力,我们未经量化的 bfloat16 权重可高效地装入单块 80GB NVIDIA H100 GPU。对于本地部署,量化版本可在消费级 GPU 上原生运行,为你的 IDE、编程助手和智能体工作流提供动力。我们的 26B Mixture of Experts (MoE) 侧重于延迟,推理时仅激活其全部参数中的 3.8 billion 个,从而提供极快的每秒 token 数;而我们的 31B Dense 则最大化原始质量,并为微调提供强大基础。

这些模型针对大量不同的数据集和指标进行了评估,以覆盖文本生成的不同方面。更多基准测试请见我们的 模型卡。

Gemma 4 Table

E2B 与 E4B 模型:为移动与 IoT 设备带来全新水平的智能

这些模型从零开始设计,以实现最高的计算与内存效率,推理时激活有效的 2 billion 与 4 billion 参数规模,从而节省 RAM 和电池续航。在与我们的 Google Pixel 团队以及 Qualcomm Technologies、MediaTek 等移动硬件领导者的紧密合作下,这些多模态模型可在手机、Raspberry Pi 和 NVIDIA Jetson Orin Nano 等边缘设备上完全离线运行,且延迟近乎为零。Android 开发者现在即可在 AICore Developer Preview 中原型化智能体流程,以便与 Gemini Nano 4 向前兼容。

开源许可证

你们给出了反馈,我们倾听了。构建 AI 的未来需要协作方式,我们相信应在没有限制性壁垒的情况下赋能开发者生态。因此,Gemma 4 以商业宽松的 Apache 2.0 许可证。 发布。

这一开源许可证为完整的开发者灵活性与数字主权奠定基础;让你完全掌控自己的数据、基础设施和模型。它允许你在任何环境中自由构建并安全部署,无论是本地还是云端。

建立在信任与安全的基础之上

这些模型遵循与我们专有模型相同的严格基础设施安全协议。选择 Gemma 4,企业与主权组织将获得可信、透明的基础,在满足最高安全与可靠性标准的同时提供最先进的能力。

一个选择丰富的生态系统

  • 几秒内即可开始实验:即时获取 Gemma 4 的访问权限,马上开始构建。在 Google AI Studio(31B 和 26B MoE)或 Google AI Edge Gallery(E4B 和 E2B)中探索 Gemma 4。对于 Android 开发,用它为 Android Studio 中的 Agent Mode 提供支持,并借助 ML Kit GenAI Prompt API 开始构建可投入生产的 Android 应用。
  • 使用你喜欢的工具:凭借对 Hugging Face(Transformers、TRL、Transformers.js、Candle)、LiteRT-LM、vLLM、llama.cpp、MLX、Ollama、NVIDIA NIM 和 NeMo、LM Studio、Unsloth、SGLang、Cactus、Baseten、Docker、MaxText、Tunix、Keras 的首日支持,你可以灵活选择最适合项目的工具。
  • 下载模型:从 Hugging Face、Kaggle 或 Ollama 获取模型权重。
  • 按你的具体需求定制 Gemma 4:使用你偏好的平台训练并适配模型,例如 Google Colab、Vertex AI,甚至你的游戏 GPU。
  • 在 Google Cloud 上扩展至生产环境:虽然本地端侧推理非常适合离线使用,但 Google Cloud 消除了所有算力上限。你可以通过 Vertex AI、Cloud Run、GKE、Sovereign Cloud、TPU 加速服务,以及面向受监管工作负载的最高合规保障,按自己的方式部署。在此处了解更多关于在 Google Cloud 上入门的信息。
  • 跨多种硬件平台加速你的 AI 开发:Gemma 4 开箱即针对业界领先硬件进行了优化。在从 NVIDIA Jetson Orin Nano 到 Blackwell GPU 的 NVIDIA AI 基础设施上体验最高性能,通过开源 ROCm™ 技术栈与 AMD GPU 集成,或部署在 Trillium 和 Ironwood TPU 上,以实现大规模与高效率。
  • 为影响力而竞赛:参加 Kaggle 上的 Gemma 4 Good Challenge,打造能为世界带来有意义的积极改变的产品。

来源:Google DeepMind · deepmind.google