小米MiMo-7B系列开源:小模型RL训练登顶AIME24,挑战32B级推理能力

小米MiMo-7B系列通过精心设计的预训练与后训练策略,使7B模型在推理任务上达到甚至超越32B模型的水平。

小米MiMo-7B系列正式开源,小模型实现大突破

2025年5月30日, Xiaomi正式发布并全面开源MiMo-7B系列大语言模型。该系列包含四个关键版本:基础模型(Base)、监督微调模型(SFT)、基于基础模型训练的强化学习模型(RL from Base)、以及基于SFT模型训练的强化学习模型(RL from SFT)。所有模型可在Hugging Face与ModelScope平台获取**,权重完全开放。评测均采用温度参数 temperature=0.6。

核心成果之一是MiMo-7B-RL-0530在AIME24测试集上的表现最终超越DeepSeek R1,达到79.8分。该模型仅为70亿参数规模,却实现了此前普遍被认为只属于32B甚至更大规模模型的推理能力。

突破性技术路径:预训练与后训练协同优化

MiMo团队提出核心理念:模型推理能力的释放,必须兼顾预训练阶段的潜力挖掘与后训练阶段的策略优化。这打破了行业普遍依赖大型基座模型进行RL训练的惯常做法。

预训练方面,团队通过三阶段数据混合策略,使MiMo-7B-Base在约25万亿token上完成训练。技术细节包括:优化文本提取工具与数据过滤流程、增加推理模式密度、生成大量多样化的合成推理数据。值得注意的是,模型引入了**Multiple-Token Prediction(MTP)**作为额外训练目标,该机制可提升性能并加速推理;MTP层在预训练与SFT阶段调优,RL阶段冻结,在speculative decoding中 acceptance rate约90%。

后训练阶段,团队构建了独特的强化学习方案:

  • RL训练数据精选13万数学与代码问题,由基于规则的验证器校验,避免 reward hacking
  • 针对代码难题引入** test difficulty driven code reward **:按测试用例难度分级打分,提供稠密奖励信号
  • 实施数据重采样策略,对简单问题进行采样优化,提升rollout效率与策略更新稳定性

专用RL基础设施:训练与验证速度显著提升

MiMo团队自研了Seamless Rollout Engine,专为高效RL训练设计。其采用连续rollout、异步奖励计算与早停机制,训练速度提升2.29倍、验证速度提升1.96倍。该引擎同时增强了vLLM推理引擎在RL系统中的鲁棒性,并集成MTP支持。

MiMo-7B-RL系列模型还获得SGLang官方支持,可通过speculative decoding参数配置启用加速推理能力(如--speculative-num-draft-tokens 2)。

模型对比与实用建议

下表总结MiMo-7B系列与同类模型的关键对比特征(基于公开数据):

模型系列参数规模训练阶段 מיוחד RL训练起点AIME24表现不同点
MiMo-7B-RL-05307BRL from Base/SFT79.8小模型RL直接登顶; cold-start SFT即能强性能
DeepSeek R1--79.8 (基准)行业参照模型
OpenAI o1-mini--匹配服务质量对标
通用RL模型32B+32B基座-主流RL需大模型基座

落地建议:

  1. 适合资源受限但追求推理能力的团队使用MiMo-7B基座进行进一步SFT微调,或直接部署MiMo-7B-RL-0530用于数学/代码推理任务。
  2. 若 intend to deploy speculative decoding加速推理,建议采用MiMo官方fork的vLLM 0.7.3,或通过SGLang接入。
  3. MTP功能启用需指定num_speculative_tokens=1参数,但冻结态MTP参数在RL阶段已不可训练。

写在最后

MiMo-7B证明了小模型通过精心设计的预训练数据与后训练策略,完全可能在推理能力上匹敌更大规模模型,为轻量化高效推理提供新路径。