ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Gemma 4 Technical Report翻译

Gemma 4 Technical Report翻译 ⚠️ 在开始阅读之前如果你对实时 Agent / 数字人 / 多模态系统 / LiveKit 架构感兴趣欢迎先到 GitHub 给项目点一个 ⭐ Star这是对开源作者最大的支持。AlphaAvatar 项目地址强烈建议先收藏该项目正在持续更新维护 https://github.com/AlphaAvatar/AlphaAvatarAIPapers 项目地址具有更全的有关LLM/Agent/Speech/Visual/Omni论文分类 https://github.com/AlphaAvatar/AIPaperNotes摘要我们推出了 Gemma 4这是 Gemma 模型家族中新一代开源、原生多模态语言模型。Gemma 4 模型套件旨在提升计算效率和推理能力包含密集架构和混合专家架构参数量从 2.3B 到 31B 不等。除了针对所有模型规模改进的视觉和音频编码器外我们还为 12B 模型提出了一种统一的无编码器架构该架构能够直接接收原始音频和图像块。此外我们还集成了一种思考模式使 Gemma 模型能够在响应之前生成推理轨迹。通过关键的设计选择我们提高了推理速度、内存占用和计算效率以及长上下文处理能力。Gemma 4 在 STEM、多​​模态和长上下文基准测试中均实现了性能飞跃并在人类评测任务中与规模更大的前沿开源模型相媲美。1.Introduction大语言模型的快速发展推动了对具备强大多模态理解、推理和计算效率的开放权重模型的需求。基于其前代模型的基础我们推出了 Gemma 4这是迄今为止 Gemma 模型家族中最强大、最高效的一代。Gemma 4 提供原生多模态架构能够无缝处理文本、图像和音频并在高度复杂的推理任务上实现前沿级的性能。Gemma 4 系列旨在服务于各种设备端硬件。该模型套件包含密集架构2.3B、4.5B、12B 和 31B 参数以及混合专家模型变体该变体激活了 3.8B 参数总参数量为 26B。我们引入了多项架构和方法论创新Thinking mode for advanced reasoning。我们在 Gemma 4 模型中引入了思考模式。通过在响应之前输出推理轨迹模型在数学和编程等推理密集型领域展现出更强的能力。Long-context efficiency。扩展上下文会导致键值缓存内存爆炸。我们保持局部滑动窗口与全局自注意力机制 5:1 的比例2.3B 模型为 4:1并使用 p-RoPE 作为位置编码。结合键值缓存共享和全局层中键值对的复用这些优化措施可将全局键值缓存占用空间减少高达 37.5%。Compute efficiency。我们发布了一个自回归多 token 预测 (MTP) 草稿头专为推测性解码而设计以提高我们模型的解码速度。Memory efficiency。我们提供使用量化感知训练方法QAT训练的模型的量化版本以减少其参数内存占用和延迟同时最大限度地减少对质量的影响。Encoder-free architecture。Gemma 4 模型的视觉和音频编码器是固定的。我们为 12B 模型引入了一种统一的无编码器架构该架构将原始的 40 毫秒音频块和图像块投影到 LLM 嵌入空间中从而无需单独的编码器并减少内存碎片。在本技术报告中我们概述了 Gemma 4 在不同模型规模下的架构以及其预训练和后训练流程。通过全面的基准测试和人工评估例如 Arena我们证明 Gemma 4 在文本、图像和音频模态方面均达到了与更大规模的前沿开源模型相媲美的水平。我们以 Apache 2.0 许可证发布 Gemma 4 模型使世界各地的开发者和研究人员能够在此基础上进行构建、定制和扩展。2.Model ArchitectureGemma 4 模型采用仅解码器 Transformer 架构。我们的模型采用了具有 RMSNorm 的 pre-norm 和 post-norm以及 QKNorm。Dense and MoE。Gemma 4 系列模型包含密集架构有效参数数分别为 2.3B (E2B)、4.5B (E4B)、12B 和 31B以及一个 MoE 模型该模型激活参数数为 3.8B总参数数为 26B (26B-A4B)。E2B 和 E4B 采用与 Gemma 3n 相同的逐层嵌入方法因此它们分别在 5B 和 8B 总参数数中有效参数数分别为 2.3B 和 4.5B。Long-context efficiency。我们的局部注意力与全局注意力比例模式遵循 Gemma 团队 (2025a) 的方法即 E2B 模型采用 4:1 的局部注意力块比例其余模型采用 5:1 的比例。我们通过在全局注意力层中复用 key/value 来提高内存效率E2B 和 E4B 模型除外即 key value。我们在全局注意力层中使用 p-RoPE 编码位置信息p 0.25在局部注意力层中使用 RoPE 编码位置信息从而有效地将全局键值缓存减少了 37.5%。全局注意力层和局部注意力层的 RoPE 频率分别设置为 1M 和 10k。最后我们为 E2B 和 E4B 模型分别以 ​​20/35 和 18/42 的比例共享键值缓存。2.1 Vision modalityE2B 和 E4B Gemma 模型配备 150M 视觉编码器而更大的模型则使用 550M 编码器统一的 12B 模型除外。两者均为视觉 Transformer 模型图像块大小为 16其架构差异详见附录表 10。我们的视觉编码器支持可变宽高比参见图 2 和算法 1并结合了轴向 2D-RoPE带有非因果注意力机制和 2D 绝对位置嵌入。我们将最大 token 数NmaxN_{max}Nmax​限制为 70、140、280、560 和 1120实现细节参见算法 1。2.2 Audio modalityE2B 和 E4B Gemma 模型使用一个 305M 的音频编码器以 40 毫秒为单位处理音频块并采用梅尔滤波器组作为输入。该编码器架构基于通用语音模型USM由两个下采样卷积层和十二个 Conformer 层组成。虽然架构与 Gemma 3n 类似但我们将参数数量减少了 55%从 680M 减少到 305M。我们不使用矢量量化LLM 直接接收音频编码器生成的连续表示。与视觉编码器一样我们在预训练期间保持权重不变。2.3 Encoder-free architectureGemma 4 12B 基于一种全新的、统一的、无编码器的模型范式从零开始训练用轻量级的投影模块取代了独立的视觉和音频编码器。对于视觉模态Gemma 4 12B 接收 48×48×3 的 RGB 图像块但用一个包含 35M 参数的大型矩阵乘法器取代了原有的 550M 视觉编码器。通过在最终的 LayerNorm 层之前将基于二维坐标的位置嵌入直接添加到图像块表示中来保持空间感知能力。对于音频完全舍弃了基于 305M USM 的构型编码器。原始音频被分割成 16kHz、40ms 的片段每个片段生成 640 维向量。这些向量直接投影到 LLM 嵌入空间。由于音频是时间序列因此不需要额外的位置编码。2.4 Pre-training我们遵循与 Gemma 3 类似的预训练过程。Training data。我们的预训练数据集是一个大规模、多样化的数据集合涵盖了广泛的领域和模态包括网页文档、代码、图像和音频适用于 E2B、E4B 和 12B截止日期为 2025 年 1 月。Tokenizer。我们使用与 Gemini 团队 (2025) 相同的 tokenizer即带有数字分割、保留空格和字节级编码的 SentencePiece 分词器。词汇表包含 26.2 万个条目。Filtering。我们对数据进行过滤以净化基准数据降低出现不必要或不安全言论以及背诵的风险。2.5 Quantization-Aware Training我们提供不同格式的量化模型和编码器以及原始检查点。基于最流行的开源量化推理引擎例如 llama.cpp以及高效的硬件支持我们重点关注两组权重表示移动端量化每个通道低比特宽度权重int2 和 int4 的混合和激活量化int8。Q4_0 量化分块量化通常称为 Q4_0。表 3 列出了原始模型和量化模型在有无 KV 缓存的情况下对 32k 个 token 序列的内存占用情况。此外为了在 fp16 框架下实现稳定的推理我们在每个数据块中引入标量尺度以限制激活值范围使其符合 fp16 框架的要求。我们还对图像和音频编码器应用了 QAT。在 150M 图像编码器上将激活值和权重量化到 8 位精度W8A8可使前向传递的总内存占用减少一半从 400 MB 减少到 200 MB包括设备端编译开销并且相对于新硬件上的 Gemma 3n设备端延迟降低了 44%。在音频编码器上我们进一步将激活值精度降低到 8 位权重精度降低到{2,4,8}\{2, 4, 8\}{2,4,8}位具体数值取决于层簇。总体而言我们实现了磁盘占用空间减少 78%从 Gemma 3n 的 390 MB 减少到此版本的 87 MB。2.6 Multi-Token Prediction Drafter我们使用模型训练了一个小型自回归 MTP 生成器头用于推测性解码。在我们的 MTP 流程中模型上一步的最后一层激活值和 token 嵌入被输入到 MTP 生成器头中。MTP 生成器头使用一个独立的嵌入器和一个 4 层 Transformer 模块按顺序生成未来的 token该模块交叉关注主模型的键值对图 1从而无需 MTP 预填充并支持任意长度的草稿。Transformer 模块的模型维度为E2B 和 E4B 为 25626B-A4B 和 31B 为 1024包含三个局部注意力层和一个全局注意力层。Efficient MTP Decoding。对于 E2B 和 E4B 草稿头我们通过将对整个词表的投影操作替换为对 token 簇的 top-k 操作来降低解码开销。因此最终的矩阵乘法从d×262,000d × 262,000d×262,000减少到d×4096d × 4096d×4096同时保持了相近的接受率。2.7 Compute Infrastructure我们使用表 2 中所示的 TPUv4 和 TPUv6e 来训练模型。每种模型配置都经过优化以最大限度地缩短训练步骤时间。对于较大的模型我们利用了切片粒度弹性当出现局部故障时可以使用较少的 TPU 芯片“切片”进行持续训练。这种重新配置将中断造成的延迟从几分钟缩短到几秒钟。优化器状态使用 ZeRO-3 的实现进行分片。对于多 pod 训练我们使用 Barham 等人 (2022) 提出的 Pathways 方法在数据中心网络上执行数据副本缩减。我们使用 JAX 和 Pathways 的单控制器编程范式以及 GSPMD 分区器 和 MegaScale XLA 编译器。3.Instruction Tuning预训练模型通过与 Gemma 3 类似的后训练处理方法转化为指令微调模型。一个显著的区别是增加了思考模式在该模式下模型可以在回答问题之前输出推理过程。Data filtering。我们精心优化后训练使用的数据以最大限度地提升模型性能。我们过滤掉包含特定个人信息、不安全或有害模型输出、错误自我识别数据以及重复样本的示例。此外纳入能够促进更佳上下文归因、对冲和拒绝最小化幻觉的数据子集也能在不降低模型在其他指标上性能的前提下提升事实性指标的性能。PT versus IT formatting。所有模型共享同一个 tokenizer其中一些控制分词符专门用于 IT 格式。一个关键区别在于PT 模型在生成结束时输出eos分词符而 IT 模型在生成结束时输出turn|分词符。表 11 给出了 IT 模型的示例。因此对任何一种模型进行微调都需要添加它们各自的结束分词符。表 11 详细说明了如何激活思维以及模型如何处理函数调用。AppendixConversation format。我们在表 11 中给出了一个对话示例其中包括思考、函数定义和函数调用。Vision。我们在表 10 中详细介绍了视觉编码器架构。然后我们在图 2 中展示了图像在输入视觉编码器之前如何调整大小并在算法 1 中详细介绍了调整大小的算法。我们在表 12 中展示了 Gemma 4 模型在低分辨率 (Nmax280N_{max} 280Nmax​280) 下的视觉基准测试得分。
返回列表