智谱大模型团队负责人罗福莉首度公开MiMo-V2.6强化学习训练的详细进展。数据显示,其Pro版本训练耗时约一天十九小时,总耗资八十九万美元,展现出极高的训练效率。该模型通过创新的数据合成与奖励建模策略,大幅提升了复杂指令遵循与长程任务规划能力。这一进展不仅验证了强化学习在降本增效方面的巨大潜力,也为后续完全自训练体系的规模化部署提供了关键工程范式,进一步巩固了国产开源生态的技术优势。
关键要点
- Pro版训练仅需一天十九小时且耗资控制在八十九万美元
- 创新数据合成策略显著提升复杂指令遵循能力
- 为国产完全自训练体系规模化部署提供工程范本