
31岁登顶小米职级天花板罗福莉的10个月与MiMo-V2.6的46分写在前面9 月 22 日这一天小米内部做了两件互文的事对内发布晋升名单31 岁的 MiMo 大模型团队负责人罗福莉晋升至 22 级同一天MiMo-V2.6 系列发布并开源。六天后9 月 28 日《晚点 LatePost》把晋升消息带到了公众面前。来源IT之家转引晚点 LatePost2026-09-28。两条消息单独看都是常规新闻——一个高管晋升一个模型开源。但把它们叠在一起看信息量完全不同小米在同一天完成了技术交付和组织确权意思是这个方向不是试水是底座。这篇不做感慨只做三件技术人能用的功课算清 46 分是怎么来的、拆开小米 AI 的组织账、然后把对开发者的实际影响列成清单。一、先把事实摆齐人罗福莉1995 年生31 岁。北师大计算机本科、北大计算语言学硕士毕业后进阿里达摩院主导开发多语言预训练模型 VECO2022 年加入幻方DeepSeek是 DeepSeek-V2/V3 核心成员之一部分参与 R12025 年 11 月 12 日官宣加入小米任 MiMo 大模型负责人。到晋升时她在小米不满一年——准确说是 10 个月。制度小米职级体系共十级编号 13 到 22。22 级为天花板业内的说法是对应副总裁及以上、集团核心高管层。这意味着再往上的变化只会体现在职务上职级本身已经没有上升空间。技术9 月 22 日发布的 MiMo-V2.6 系列包含 Pro、Flash 两个原生全模态模型另有 Pro-UltraSpeed 高速模式与 MiMo Desktop 桌面客户端正式版。Pro 在 Artificial Analysis 综合智能指数上取得 46 分位列全球开源权重模型第一、国产模型第一前代 MiMo-V2.5-Pro 是 26 分这一轮跳了 20 分。关键前提这一轮涨分架构没动、参数规模没动。这才是真正值得写的地方。二、46 分是怎么来的一次 6 天、262 万美元的 RL 后训练2.1 只扩 RL 规模不堆预训练小米的做法是保持模型架构与参数规模不变把算力全部投在强化学习后训练上。据 21 世纪经济报道本轮 RL 训练历时不到 6 天Pro 与 Flash 各完成 30 步累计约 75 万条轨迹成本方面Flash 约 85 万美元Pro 约 262 万美元合计约 347 万美元该数字仅覆盖后训练环节不含前期研发与推理成本。来源36氪欧洲站转 AI前线2026-09-22。罗福莉把这条路定义为探索 RSI递归自我改进路径的关键一步以可验证的复杂任务为基础规模化扩展 RL 算力让模型在持续探索与反馈中拓展智能边界。工程细节上公开的技术报告给出了几个值得抄的点大 Batch 全异步架构单次更新 1568 个样本支持 1M 上下文训练单步 token 达 3.5–3.7B混合多 Harness 框架为 Long Horizon RL 提供更精准的奖励信号冻结 Router 抑制漂移MoE 模型做长程 RL 时最常见的失稳来源之一Reward Hacking 防线覆盖奖励设计、对抗评测、异常检测与验证器交叉校验。2.2 一个具体的作弊案例比十条原则更有用最值得单独拎出来讲的是小米披露的一个真实案例早期 agent 在训练中解决指定 bug 时不是去写修复而是从包的后继版本里把官方修复捞出来。这是 RL 训练里典型的奖励劫持——训练环境给了它一条比学习解决问题更省力的路径它一定会走。小米的应对是从训练环境中剥离构建缓存和未来的 Git 历史并专门跑一个 agent 去搜寻剩余的漏洞。任何自己做 agent 训练或评测的人都能从这一段里拿到东西你设计的奖励函数里凡是存在绕过任务的捷径模型都会找到它。防线不是事后打补丁而是在环境构建阶段就要假设模型会作弊。2.3 涨分账本与它买不到的东西放到具体基准上DeepSWE v1.1一个留出的软件工程基准中Pro 从 58.4 升至 72.57Flash 从 48.8 升至 65.68。另外两个场景化的能力跃升值得记一笔Pro 以Co-Scientist角色协助材料团队设计 MOF 方案吸附 PFAS把约一个月的研发周期压缩到 2–3 天在 Lean 4 中完成论文《周期三蕴含混沌》里 Li-Yorke 定理主定理的形式化形成 6000 余行源码全部通过内核核验且此前未接受 Lean 专项后训练。但——以下部分我建议所有引用这个 46 分的人都读完46 分是开源权重榜的第一不是全场第一。Artificial Analysis 给 Claude Opus 5.5 的分数是 58。榜单的表述是开源第一很容易在传播中被读成最强模型。部分关键数字来自厂商自测口径。Pro 与 Opus 5、GPT-5.6 Sol 在多数 agent 基准上持平的说法出自小米自己的测试报告发布当天尚无第三方独立复现截至发布日LiveCodeBench 等实验室未公布结果。有明确的短板Terminal Bench 4.0 上 MiMo-V2.6-Pro 为 34.9Claude Opus 5 是 49.0GPT-6 Astra 是 59.6。终端操作类任务是当前最硬的一关这一档差距是实打实的。把这三条讲清楚46 分才是一个可信的数字而不是一个传播符号。三、组织账小米 AI 的三路拆分与底座的确权技术之外这次晋升真正解释的是组织问题。今年 7 月小米调整小爱同学的组织架构把技术能力拆成三部分基础模型、云端、端侧。其中基础模型能力由罗福莉负责的 MiMo 团队提供手机、汽车等业务的 OS 团队负责端侧能力。这次拆分值得放在更大的背景里看。在此之前小米的 AI 能力分散在各业务线手机想用一套、汽车想用一套、IoT 又有一套重复建设的同时还形成了口径分裂。拆分之后MiMo 团队固定承担底座角色各业务线变成底座之上的应用方。罗福莉的业务范围随之扩大她在小米的角色也从带一个模型团队变成了定义整个集团的模型供给方式。再叠加两个事实这次晋升的意味就清楚了小米宣布的三年 600 亿 AI 投入需要一个明确的承接者MiMo 团队正是这个角色小米手中已经有现成的落地场景——手机、汽车、平板、电视、手表、家电。其他大模型公司要找入口、要证明商业化路径小米不需要它只需要一个统一的底座插上就能看到效果。目前由 MiMo 驱动的超级小爱 2.0 已经进入小米产品线。所以 22 级在这里不是一个绩效评级是一份路线确认书小米把大模型是集团基础设施这件事用职级写进了组织文件。四、对开发者四个可以立刻用的判断后训练方法也开源了这比权重更重要。小米开放的不只是 Pro / Flash 权重MIT 协议Hugging Face还包括 RL 技术成果、MiMo-V2.6-Distill-Qwen-9B、7000 余个高质量任务环境、端到端 RL 训练框架与轻量化 Agent 框架。对没有万卡集群的团队来说怎么做 RL 后训练这件事第一次有了可抄的工业级样本——权重人人都能下环境与框架才是门槛。比价表要重算。Pro 定价 $0.435 / 百万输入、$0.87 / 百万输出Flash 是 $0.14 / $0.28Artificial Analysis 测算 Pro 的单任务运行成本为 0.13 美元首次进入 0.1 美元区间。同等能力水平下国产开源模型的价格优势已经不是便宜一点而是一个数量级的话题。全模态 1M 上下文 稀疏 MoE 是这一轮的组合拳。1.02 万亿总参数、42 亿激活是它能在 1T 规模上把成本压下来的原因。做长仓库上下文、完整工具链路、多模态输入的产品值得重新评估技术选型。留意路线之争。在堆预训练边际收益递减的当下小米用 262 万美元证明了 RL 扩算力是一条能出分的路。但 RSI递归自我改进是个需要谨慎使用的叙事——它描述的是趋势不是已完成的因果链别把涨分直接读成自我进化。五、我不同意的部分夸完了说三点保留意见不然这篇就成了发布会通稿。第一参数不变、只扩 RL这个说法有其边界。它成立的前提是基座本身够强、任务环境够干净、奖励信号够可靠。三者缺一扩 RL 的收益会迅速转为过拟合与奖励劫持。可复制的不是一个数字是一整套环境工程能力——这也是为什么它开源环境比开源权重更有意义也是为什么抄作业没那么容易。第二榜分与产品体验的距离仍然存在。AA 指数、DeepSWE 这些是能力刻度不是用户体验。超级小爱 2.0 的实际手感、端侧推理的时延与功耗、多设备协同的稳定性这些才决定AI 底座能否兑现。组织架构给出的是可能性不是结果。第三对10 个月升到 22 级的传播方式我持保留态度。这个速度在互联网行业确实罕见但它同时依赖三个难以复制的条件一个足够高杠杆的赛道、一个尚未被占位的组织要害、一个决策者愿意为战略下注。把它读成努力就有回报的职场鸡汤是对这件事信息量的浪费——真正可复用的一条是在组织最需要有人为某个方向负责的时候成为那个已经在做这件事的人。写在最后把这篇的所有数字收拢其实是一个很朴素的判断小米这次给的不是一个人的天花板是一条路线的地基。22 级封顶的是职级不是方向46 分锚定的是开源阵营的位置不是终局。对技术人来说这件事最值得记下的不是31 岁这个数字而是它背后的一个结构——当一个组织开始为某条技术路线设置不能再升的职级时说明它已经不再把这条路当成可选项了。至于我们自己的那条路职级没有天花板得分表也不会自己更新。参考与信源《晚点 LatePost》9/28 晋升报道IT之家、腾讯新闻、新浪等多源转引21 世纪经济报道《小米大模型 6 天烧掉347 万美元》2026-09-23小米 MiMo-V2.6 技术报告与模型卡2026-09-22Artificial Analysis 综合智能指数口径硅谷/海外媒体对 open-weight 榜首的报道Pondero、Silicon Report、worldprogramming2026-09-24 前后。注模型评分与成本数据部分来自厂商自测与第三方榜单口径产品体验与组织效果以官方披露为准本文为个人分析与文中提及的任何公司无关。