Google 发布 Gemma 4 12B:无编码器的统一多模态模型

Introducing Gemma 4 12B: a unified, encoder-free multimodal model

来源 Google DeepMind Blog 日期 英语原文

Google DeepMind 推出 Gemma 4 12B,这是其首款直接在笔记本电脑上运行的多模态模型。采用创新的无编码器统一架构,无需额外编码器即可直接处理视觉和音频输入。

报道核心

Google DeepMind 正式发布 Gemma 4 12B,这是一款面向笔记本级别的多模态模型,填补了边缘端 E4B 和高级 26B MoE 架构之间的空白。Gemma 4 系列已在全球累计超过一亿五千万次下载。

架构创新

Gemma 4 12B 最突出的特点是其无编码器统一架构——视觉和音频输入直接流入大语言模型主干,无需独立的图像或音频编码器。这也是 Google 首款原生支持音频输入的中型模型。

应用生态

社区已基于 Gemma 4 构建了从可穿戴机械臂到企业级 AI 安全的多样化应用。新模型在保持移动端高效算力的同时,提供了先进的推理能力。

对 AI 行业的影响

Gemma 4 12B 的无编码器设计标志着多模态模型的架构简化趋势。直接在笔记本上运行多模态推理意味着 AI 应用不再依赖云端,这对隐私敏感场景和离线应用意义重大。Google 通过 Gemma 系列建立开源生态护城河,与 Meta 的 Llama 和 Mistral 形成直接竞争,同时为企业开发者提供了一个低成本的多模态模型选项。


原文参考

来源:Google DeepMind Blog · 2026-06-09