小米MiMo-7B系列正式开源,小模型实现大突破
2025年5月30日, Xiaomi正式发布并全面开源MiMo-7B系列大语言模型。该系列包含四个关键版本:基础模型(Base)、监督微调模型(SFT)、基于基础模型训练的强化学习模型(RL from Base)、以及基于SFT模型训练的强化学习模型(RL from SFT)。所有模型可在Hugging Face与ModelScope平台获取**,权重完全开放。评测均采用温度参数 temperature=0.6。
核心成果之一是MiMo-7B-RL-0530在AIME24测试集上的表现最终超越DeepSeek R1,达到79.8分。该模型仅为70亿参数规模,却实现了此前普遍被认为只属于32B甚至更大规模模型的推理能力。
突破性技术路径:预训练与后训练协同优化
MiMo团队提出核心理念:模型推理能力的释放,必须兼顾预训练阶段的潜力挖掘与后训练阶段的策略优化。这打破了行业普遍依赖大型基座模型进行RL训练的惯常做法。
预训练方面,团队通过三阶段数据混合策略,使MiMo-7B-Base在约25万亿token上完成训练。技术细节包括:优化文本提取工具与数据过滤流程、增加推理模式密度、生成大量多样化的合成推理数据。值得注意的是,模型引入了**Multiple-Token Prediction(MTP)**作为额外训练目标,该机制可提升性能并加速推理;MTP层在预训练与SFT阶段调优,RL阶段冻结,在speculative decoding中 acceptance rate约90%。
后训练阶段,团队构建了独特的强化学习方案:
- RL训练数据精选13万数学与代码问题,由基于规则的验证器校验,避免 reward hacking
- 针对代码难题引入** test difficulty driven code reward **:按测试用例难度分级打分,提供稠密奖励信号
- 实施数据重采样策略,对简单问题进行采样优化,提升rollout效率与策略更新稳定性
专用RL基础设施:训练与验证速度显著提升
MiMo团队自研了Seamless Rollout Engine,专为高效RL训练设计。其采用连续rollout、异步奖励计算与早停机制,训练速度提升2.29倍、验证速度提升1.96倍。该引擎同时增强了vLLM推理引擎在RL系统中的鲁棒性,并集成MTP支持。
MiMo-7B-RL系列模型还获得SGLang官方支持,可通过speculative decoding参数配置启用加速推理能力(如--speculative-num-draft-tokens 2)。
模型对比与实用建议
下表总结MiMo-7B系列与同类模型的关键对比特征(基于公开数据):
| 模型系列 | 参数规模 | 训练阶段 מיוחד RL训练起点 | AIME24表现 | 不同点 |
|---|---|---|---|---|
| MiMo-7B-RL-0530 | 7B | RL from Base/SFT | 79.8 | 小模型RL直接登顶; cold-start SFT即能强性能 |
| DeepSeek R1 | - | - | 79.8 (基准) | 行业参照模型 |
| OpenAI o1-mini | - | - | 匹配 | 服务质量对标 |
| 通用RL模型 | 32B+ | 32B基座 | - | 主流RL需大模型基座 |
落地建议:
- 适合资源受限但追求推理能力的团队使用MiMo-7B基座进行进一步SFT微调,或直接部署MiMo-7B-RL-0530用于数学/代码推理任务。
- 若 intend to deploy speculative decoding加速推理,建议采用MiMo官方fork的vLLM 0.7.3,或通过SGLang接入。
- MTP功能启用需指定
num_speculative_tokens=1参数,但冻结态MTP参数在RL阶段已不可训练。
写在最后
MiMo-7B证明了小模型通过精心设计的预训练数据与后训练策略,完全可能在推理能力上匹敌更大规模模型,为轻量化高效推理提供新路径。