热点资讯

  • Home
  • 小米MiMo大模型训练耗资347万美元,罗福莉详解背后故事

小米MiMo大模型训练耗资347万美元,罗福莉详解背后故事

9月22日,小米正式发布了其全新一代的MiMo大模型项目,包含全模态旗舰模型MiMo-V2.6-Pro与高效推理模型MiMo-V2.6-Flash,同时推出了Pro版本的超高速模式V2.6-Pro-UltraSpeed和MiMo Desktop桌面客户端的正式版,后者也随之上线了会员订阅服务。根据第三方评测平台Artificial Analysis的综合智能指数数据显示,MiMo-V2.6-Pro以46分的成绩在当前开源权重模型中位居首位,超越了Kimi K3的44分和GLM-5.3的45分,更显著地高于其前一代MiMo-V2.5-Pro的仅有26分,而在榜单中,GPT-6 Astra与Claude Fable 5.1则以53分位列前茅。

在同一平台的智能指数单任务成本排行榜上,MiMo-V2.6-Pro的单任务成本为0.13美元。小米方面指出,在相同智能水平下,该模型的价格仅为海外同类模型的二十分之一至六十分之一,API定价策略沿用V2.5系列。

而在本次发布的五天前,小米已提前公开了训练过程。9月17日凌晨,小米MiMo大模型团队的负责人罗福莉在X平台上发表了关于MiMo-V2.6正处于强化学习中间阶段的公告,并上线了实时训练页面,让外界得以掌握进度、Token消耗以及成本数据。这种将后训练阶段以实时数据公开的做法在国内大模型厂商中尚属首次。 金年会

小米的强化学习训练过程也首次进行直播,整个训练耗时不到六天,Pro版本的训练成本约为262万美元,而Flash版本则为85万美元,训练共完成30个步骤,累计走过约75万条轨迹。罗福莉在发文中表示,这六天的训练成果背后,实际上是长达半年的基础研究积累与工程实践的结果。根据公开数据,在9月17日下午,两个版本的累计成本已突破135万美元,每小时的支出约为3.1万美元。

about image

除了训练成本,公开页面同时展示了训练所采用的配置。罗福莉介绍,本次训练在三个方面进行了规模扩展:首先是在算力上,使用了大Batch与全异步架构,单次更新中采用了1568个样本,同时支持百万级上下文长度的训练,单步训练Token达到了2.7B至3.7B;其次是在环境与工具的构建上,搭建了覆盖代码、通用、视觉及安全等多种任务的训练体系,并运用混合的多个Harness框架进行运算;最后在评估计算方面,通过组内相对比较的方式,为长程任务提供了更为精准和多样的奖励信号。

经过这一系列的训练调整,结果显示任务的平均通过率在不同版本之间有了显著提升,Flash版本的评测通过率提高了25%,Pro版本则提升了12%。在样本外长程软件工程评测基准DeepSWE v1.1中,Flash版本的得分从48.8上升至65.68,而Pro版本更是从58.4跃升至72.57。罗福莉指出,MiMo-V2.6或许是目前国产开源模型中计算资源投入最多的模型之一。 金年会

投行的分析又提供了另一个视角。高盛在一份研究报告中指出,依据avg@3的标准,两个版本在DeepSWE基准中最高获得了67.86分与72.57分,Flash版本的分数提升超过19分,而Pro版本也提升了超过14分。折算成成本,Flash模型每百万Token的成本在10美元左右,而Pro版本则在35美元,同样支出情况下,Flash的得分提升幅度更为显著。高盛的分析认为,这些训练过程中出现的中途干预情况,如基建错误重启、不良模式数据集、零梯度任务与GPU显存不足,表明强化学习的瓶颈已经开始转向工程优化。

在罗福莉的声明中,她把问题归结为“强化学习究竟能扩展到什么程度”。她指出,强化学习是模型自我提升路径中一个具有较强可扩展性的方向,而小米将此次发布视为探索递归自我改进(RSI)路径的一次关键性进展。

另一个重要方面是本次发布的开源资源。小米除了提供Pro与Flash模型的权重及技术报告外,还同步开放了蒸馏版本MiMo-V2.6-Distill-Qwen-9B以及相应的强化学习代码,涵盖7000多项高质量任务环境、端到端训练框架与轻量化Harness。小米表示,开放这些资源的初衷是为了助力研究者们复现和验证相关的研究成果。在该蒸馏模型为基点进行训练时,其在SWE-bench Verified的得分由61.1提升至66.2,在Terminal Bench 2.1中的得分也从37.1上升至52.8。 金年会

尽管MiMo-V2.6-Pro以46分登顶开源模型排行榜,但与全球最强模型仍存在一定差距。榜单显示,MiMo-V2.6-Pro之前还有GPT-6 Astra、Claude Opus 5、Fable 5.1以及Muse Spark 1.3等四款闭源模型,而小米在前五名中是唯一一款开源权重模型。小米方面表示,在多数智能体评测中,MiMo-V2.6-Pro已经能够与Claude Opus 5和GPT-5.6 Sol相媲美,但在综合智能指数上仍与榜首存在7分的差距。

在价格方面,单任务成本指标的下调再次强调了大模型竞争所面临的传统课题:在相同智能水平下,如何降低成本以应对日益激烈的市场竞争。

发表评论