沉寂半年后,小米罗福莉再次卷入大模型“厮杀”战场,并全程直播大模型训练过程。
9月17日凌晨,小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉在X平台发文表示,目前正在研究强化学习(RL)能走多远。
目前,小米旗下最新大模型MiMo-V2.6正处于其RL运行的中途,在此期间,团队正在进行三方面扩展:第一是计算资源(每步约20亿token,1568个提示×16次rollout,完全异步),第二是环境和测试框架(多任务代理式RL,在一次运行中混合多个测试框架),第三是评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励),并透露将在未来几周逐步开源细节。
罗福莉分享了MiMo-V2.6的实时训练页面,这也是外界首次看到这一代模型强化学习阶段的部分训练状态。

从罗福莉公开的训练页面来看,MiMo-V2.6正在进行一次大规模Agent(智能体)强化学习实验。页面展示模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化,目前训练页面中包含两个版本,分别是MiMo-V2.6-Pro和MiMo-V2.6-Flash。
据统计,两个版本当前累计训练成本已经超过128万美元,其中MiMo-V2.6-Pro时长为1天19小时,耗费89万美元,平均每小时耗费超2万美元;MiMo-V2.6-Flash训练时长1天14小时,耗费39.7万美元,平均每小时耗费超1万美元。
雷军此前曾多次提到小米在AI方面的进展。今年3月,雷军在微博发文称,万亿参数大模型 Mimo-V2-Pro在全球大模型综合智能排行榜 Artificial Analysis 上,位列全球第八。按大模型品牌来排名,排在全球第五,超过了xAI Grok,此后还会快速迭代增强。
罗福莉是雷军从DeepSeek挖来的“95后”AI领军科学家。
公开资料显示,罗福莉本科毕业于北京师范大学计算机专业,硕士阶段进入北京大学计算语言学深造。硕士毕业后,罗福莉加入阿里巴巴达摩院,担任机器智能实验室研究员,负责开发多语言预训练模型VECO,并推动AliceMind项目的开源工作。
2022年,罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作,后又担任DeepSeek的深度学习研究员,参与研发DeepSeek-V2等模型。
去年11月12日,澎湃新闻记者独家获悉,罗福莉在朋友圈发文:“智能终将从语言迈向物理世界。我正在Xiaomi MiMo,和一群富有创造力、才华横溢且真诚热爱的研究员,致力于构建这样的未来,全力奔赴我们心目中的AGI。”这也是罗福莉首次正式宣布,自己已经加入小米,亦是对此前传言的回应。