NVIDIA Nemotron Nano 2 是一种混合 Mamba-Transformer 语言模型,旨在提高推理工作负载的吞吐量,同时在与其他类似规模的模型相比时达到最先进的准确性。该模型基于 Nemotron-H 架构,将常见 Transformer 架构中的大多数自注意力层替换为 Mamba-2 层,以在生成推理所需的长时间思维轨迹时提高推理速度。
Nemotron-Nano-9B-v2 首先在 20 万亿个 token 上使用 FP8 训练配方预训练了一个 120 亿个参数的模型 (Nemotron-Nano-12B-v2-Base),然后通过 Minitron 策略进行压缩和蒸馏,以实现单 NVIDIA A10G GPU (22GiB 内存,bfloat16 精度) 上高达 128k token 的推理。与现有的类似规模模型(例如 Qwen3-8B)相比,Nemotron-Nano-9B-v2 在推理基准测试中实现了相当或更好的准确性,同时在推理设置(例如 8k 输入和 16k 输出 token)中实现了高达 6 倍更高的吞吐量。
该模型使用了多种数据集和训练配方,包括:
- 预训练数据:包括高质量的策展数据和合成数据,涵盖一般网络爬取数据(英语和多语言)、数学数据、代码数据、学术数据、STEM 数据、数学数据、多语言数据、代码数据和 SFT 风格数据。
- FP8 训练配方:整个预训练运行使用 DeepSeek 的 FP8 训练配方,使用 E4M3 对所有张量进行量化,使用 128x128 量化块对权重进行量化,并使用 1x128 瓦片对激活值进行量化。
- 超参数:训练在 20 万亿个 token 的 token 范围内进行,使用 8192 的序列长度和 768 的全局批处理大小,并使用 WSD 学习率计划。
- 长上下文扩展:为了确保 Nemotron-Nano-12B-v2-Base 可以进行长上下文推理,在预训练的第三阶段之后添加了一个长上下文阶段,使用 512k token 的上下文长度进行连续预训练。
Nemotron-Nano-9B-v2 通过以下步骤进行对齐和压缩:
- 对齐:使用大规模的 SFT 阶段、GRPO、DPO 和 RLHF 对齐基础模型,以提高指令遵循和对话能力。
- 压缩:使用 Minitron 策略压缩对齐的 12B 模型,通过剪枝和蒸馏将模型压缩到 9B 参数,以在 NVIDIA A10G GPU 上进行长上下文推理。
最终,Nemotron-Nano-9B-v2 在准确性方面与现有最先进模型相当或更好,同时在推理设置中实现了更高的吞吐量。该模型已开源,并发布了 Nemotron-Nano-9B-v2、Nemotron-Nano-9B-v2-Base 和 Nemotron-Nano-12B-v2-Base 检查点,以及大部分预训练和后训练数据集。