九游体育博客文章 - 九游体育 (中国)官方网站-九游体育 (中国)… - 九游体育 (中国)官方网站-九游体育 (中国)官方网站

九游体育 (中国)官方网站-九游体育 (中国)官方网站

9月22日,小米MiMo团队正式对外发布并开源了MiMo-V2.6系列,其中包含旗舰型号MiMo-V2.6-Pro以及注重效率与成本控制的MiMo-V2.6-Flash。此外,小米还推出了专为低延迟场景设计的MiMo-V2.6-Pro-UltraSpeed,据官方介绍,在保持相同模型质量的前提下,其输出速度最高可达到标准Pro版本的20倍。

小米最新发布的系列旗舰模型

与单纯扩大模型参数不同,MiMo-V2.6此次着重于强化学习阶段的计算扩展。小米将其描述为探索RSI(Recursive Self-Improvement,递归自我改进)路径的一次尝试:在编程、通用智能体、视觉任务和网络安全等具有可验证结果的复杂环境中增加强化学习投入,让模型通过反复探索、环境反馈和结果评估改善任务完成能力。

不过,从目前披露的信息来看,MiMo-V2.6所体现的“自我改进”,主要发生在由训练系统、任务环境和评估器共同组成的强化学习闭环中,尚不意味着模型已经能够脱离人类设计的训练框架,自主修改自身架构或启动下一轮训练。

据介绍,MiMo-V2.6-Pro和MiMo-V2.6-Flash均采用稀疏混合专家架构,并原生支持文本、图像、视频和音频输入,最长上下文窗口为100万Token。

其中,MiMo-V2.6-Pro拥有1.02万亿总参数,每次推理激活约420亿参数;MiMo-V2.6-Flash总参数为3090亿,激活参数约为150亿。两款模型使用相同的视觉和音频编码器,并配置五层多Token预测模块,用于推测式解码。

从定位上看,Pro面向复杂编程、长程智能体和研究任务,Flash则试图以更少的激活参数降低推理成本。两款模型的权重已在Hugging Face上以MIT许可证发布。

MiMo-V2.6系列还包含一款由Qwen架构蒸馏而来的90亿参数模型,但小米此次的主要产品仍是Pro和Flash两个版本。Hugging Face的模型集合目前共收录三款MiMo-V2.6模型。

模型发布后,小米大模型负责人、前DeepSeek研究员罗福莉在x上发帖将MiMo-V2.6的研发过程概括为“一条艰难的强化学习扩展之路”。

她表示,按计算投入衡量,MiMo-V2.6“很可能是迄今开源模型团队开展的最大规模单次强化学习训练之一”。在算力资源仍然非常紧张的情况下,小米依然选择投入数十人的团队,集中完成这一次大规模RL训练。

Benchmark表现如何?

那么,这系列模型的基准测试表现怎样?

根据小米公布的测试结果,MiMo-V2.6-Pro在DeepSWE v1.1上取得71.9分,明显高于上一代MiMo-V2.5-Pro的19分;Flash为67.9分。在Terminal Bench 2.1上,两款模型分别为89.9分和87.6分。

通用智能体测试中,Pro在AutomationBench v1.0.6上获得53.1分,高于对比表中的Claude Opus 5、GPT-5.6 Sol和Claude Fable 5;Flash为52.3分。在OSWorld-Verified上,两款模型分别取得82分和80.8分。

但这些结果也显示,MiMo-V2.6并未在所有项目上领先。Pro在ProgramBench上取得26.5分,低于Claude Opus 5的37分;Terminal Bench 4.0得分34.9,低于Claude Opus 5的49分。在Toolathlon-Verified、GDPval-AA 2.1等测试中,Pro也不是最高得分模型。

小米还引用Artificial Analysis Intelligence Index v4.3的结果称,MiMo-V2.6-Pro得分为46.32,并将其描述为当前得分最高的开源模型。

此次发布,MiMo-V2.6值得关注的一个点是,小米开始尝试把编程能力扩展到更广泛的生产任务。

基准测试结果看起来很强大,实际应用效果如何?小米给我了几组官方案例。

在官方展示的案例中,模型可以根据文本、图片或视频描述,将游戏开发任务拆解给多个智能体,分别完成3D场景构建、交互逻辑编写和视觉验证,并根据渲染结果反复修改。小米将这种由自然语言驱动、从软件开发延伸至交互式世界构建的方式称为“Vibe World”。

在3D建模场景中,模型可以控制Blender,根据文字或参考图片生成物体和场景;再比如在具身仿真环境中,模型可以读取多路摄像头画面,通过视觉反馈控制Franka Panda机械臂,完成抓取、颜色匹配和物体放置。

MiMo-V2.6还展示了前端页面、演示文稿、视频剪辑和音乐创作能力。

例如,MiMo-V2.6可提供端到端的高质量视频创作服务。对于创意和产品宣传视频,它可以根据用户需求处理视觉设计、镜头和动态序列、音乐创作以及节拍同步剪辑。对于教育视频,它可以将傅里叶分解等抽象概念转化为通俗易懂的解释和连贯的动画,并利用MiMo-V2.5-TTS生成与画面精准同步的旁白。这实现了从概念分解到最终视频输出的全流程自动化,将复杂的知识转化为观众易于理解的生动内容。

这些案例反映出MiMo-V2.6的目标不只是生成代码,而是让代码、视觉理解、工具调用和计算机操作共同服务于一个完整任务。

此外,小米还公布了两个科研案例。

第一个案例涉及材料研究。小米材料专家要求MiMo-V2.6-Pro设计一种能够吸附全氟和多氟烷基物质的金属有机框架材料。模型完成了文献及专利检索、假设提出、创新性分析,并调用开源计算工具开展模拟,计算不同材料与目标物质之间的结合强度,筛选进入湿实验阶段的候选结构。

第二个案例是形式化数学证明。在研究人员设计的探索策略和多智能体协作流程下,MiMo-V2.6-Pro参与完成了经典论文《周期三意味着混沌》主要定理的Lean 4形式化。最终项目包含超过6000行Lean代码,并通过Lean内核验证,没有保留未完成的证明占位符。

但需要注意的是,这些工作均不是模型独立完成:材料案例由专业人员经过多轮提示和筛选推进,数学案例同样依赖研究人员设计探索策略,并进行了后续修订与整合。因此,从这个角度来看,它们更能说明模型作为科研辅助工具的潜力,而不是证明模型已经具备自主开展科研的能力。

6天完成约150万条轨迹,强化学习成本超过340万美元

MiMo-V2.6最值得关注的变化并不是参数规模,而是强化学习训练方式。

有意思的是,在正式发布MiMo-V2.6之前,小米MiMo团队曾将这轮强化学习的生产训练过程公开直播,对外展示两款模型的训练进度、任务得分和资源消耗。

与发布模型后再披露结果不同,这次直播把一场持续近6天的大规模RL训练直接摆到外界面前:模型是否持续提升、训练中途是否出现波动,以及算力投入能否换来能力增长,都可以从实时曲线中观察。如今随着模型与技术报告发布,这场直播背后的训练规模和技术细节也进一步浮出水面。

小米披露,MiMo-V2.6-Pro和MiMo-V2.6-Flash分别在不到6天的时间内完成30个强化学习步骤,每款模型处理约75万条轨迹。

Flash的训练成本约为85万美元,Pro约为262万美元,合计约347万美元。

其单步训练批次包含1568个提示,每个提示生成16条轨迹,单步处理约35亿至37亿Token,训练上下文最高达到100万Token。

与分别针对编程、视觉或智能体进行独立强化学习不同,小米将编程、通用智能体、视觉和网络安全任务混合在同一轮训练中,希望不同任务中形成的策略能够互相迁移。

在奖励环节,MiMo团队没有仅使用“通过或失败”的二元信号,而是引入组内比较机制:评估智能体对同一道任务产生的多条轨迹进行横向比较,为已经完成任务的方案进一步区分质量,并将更高奖励分配给路径更短、Token消耗更少或执行质量更高的结果。

这套方法的直接目的,是解决长程智能体训练中的一个问题:两条轨迹可能都通过测试,但它们在执行效率、步骤合理性和稳定性方面存在明显差异,仅靠最终测试结果无法体现这种差别。

为了控制奖励作弊,小米称其在训练中加入了环境加固、异常检测、对抗性评估及不同验证器之间的交叉检查,并冻结了MoE模型的路由器,以减少大规模强化学习过程中专家选择策略发生漂移。

按照官方公布的训练曲线,经过30步强化学习后,Flash和Pro在训练任务上的平均通过率分别相对提高约25%和12%。

在未直接用于训练的长程软件工程测试DeepSWE v1.1上,两款模型分别从48.8分和58.4分提升到65.68分和72.57分。

小米据此认为,强化学习带来的提升能够部分迁移到训练分布之外。

小米同时开放了技术报告、训练环境和强化学习代码。相比只发布最终权重,这使外界有机会进一步检查其任务设置、奖励设计与训练过程,但相关结果能否被独立复现,仍有待开发者和研究机构后续验证。

MiMo-V2.6提升如此快,技术上如何实现的?

从技术报告看,MiMo-V2.6的性能并不是由某个单点创新带来的,是模型架构、预训练、中期训练、强化学习规模、奖励设计和训练基础设施共同作用的结果。

其中最关键的变化,是小米不再只把计算资源用于增加预训练数据和模型参数,而是将大量算力投入模型与真实任务环境的交互,让模型在一次次执行、验证和纠错中学习如何完成长程任务。

简单来说,MiMo-V2.6的路线可以概括为:先用大规模预训练建立知识和多模态理解能力,再通过面向智能体的中期训练扩展模型的“探索空间”,最后在可验证的复杂任务上大规模生成轨迹,利用更精细的奖励机制筛选出更好的解决路径。

第一层:混合注意力与稀疏MoE兼顾规模和长上下文

MiMo-V2.6-Pro采用稀疏混合专家架构,总参数为1.02万亿,每次推理激活约420亿参数。

Flash总参数约3100亿,激活约150亿参数。两款模型每层只激活8个专家,由此在扩大模型容量的同时,避免让全部参数参与每一次计算。

模型主干采用“滑动窗口注意力+全局注意力”交替排列的混合架构。滑动窗口注意力只处理附近Token,将计算开销控制在较低水平;周期性插入的全局注意力,则负责重新汇总长距离信息。

这种设计针对的是长程智能体任务中的现实矛盾:模型需要读取代码库、工具返回结果、历史操作和多轮上下文,但如果每一层都对全部Token执行全局注意力,100万Token上下文的计算和显存成本会非常高。

MiMo-V2.6-Pro共包含70层,其中60层使用滑动窗口注意力,10层使用全局注意力;Flash共48层,其中39层为滑动窗口注意力、9层为全局注意力。其滑动窗口大小为128个Token。

这使模型可以用大量局部计算处理细节,再由少数全局注意力层完成跨区域信息交换。它并不会消除长上下文的计算成本,但相比全程使用全局注意力,更适合处理代码仓库和长时间智能体轨迹。

视觉编码器也采用了类似思路。MiMo-ViT在局部滑动窗口层中交替使用行优先和列优先的Token排列,让视觉信息能够分别沿水平和垂直方向传播,再通过周期性的全局注意力聚合完整画面。官方称,该视觉编码器使用超过4万亿个图像Token预训练。

音频部分则先把音频转换成离散Token,再把连续四帧合并成一个音频Patch,将输入主模型的音频序列频率从每秒25个降至6.25个,以缩短序列长度。

因此,所谓“原生全模态”并不是简单地把多个独立模型串联起来,而是将文字、图像、视频和音频编码为统一序列,交给同一套语言模型主干处理。MiMo-V2.6的模型卡显示,两款模型均支持四种模态及100万Token上下文。

第二层:预训练之后,先进行一次面向智能体的“中期训练”

技术报告披露,MiMo-V2.6采用两阶段预训练。

第一阶段只训练语言模型主干,数据包括公开网页、书籍、学术论文、代码和STEM材料;第二阶段接入视觉与音频编码器,在图文、OCR、GUI、视频、视觉编程、语音识别和音频描述等数据上联合训练。

MiMo-V2.6-Flash的预训练数据量为48万亿Token,其中纯文本阶段26万亿Token,全模态阶段22万亿Token;Pro共训练30万亿Token,其中270亿——更准确地说是27万亿——来自文本阶段,3万亿来自全模态阶段。

预训练时,模型上下文窗口从3.2万Token逐步扩展到25.6万Token。此后,小米的做法是增加了一个面向智能体的中期训练阶段。

这一阶段的数据不仅包括高质量文本、代码、图像和音视频,也包括编程、通用智能体、视觉与科研场景中的真实任务轨迹。模型先在25.6万Token上下文上训练,最后再扩展至100万Token。

技术报告对这一步的解释是:预训练提供知识,中期训练则在预训练与大规模强化学习之间建立桥梁,让模型提前接触“观察环境—调用工具—读取结果—继续行动”的任务形式。

如果没有这一阶段,模型虽然可能掌握大量知识,却未必能够在强化学习开始时有效探索。大量轨迹可能消耗在格式错误、工具调用失败或者无法维持长程上下文等基础问题上。

小米还在中期训练阶段将部分参数的优化器从AdamW切换到Muown。传统AdamW按参数元素调整更新幅度;Muown则利用权重矩阵的结构,对更新矩阵进行正交化处理。小米认为,在超大批次训练中,这种方式能够维持更好的数据效率。

模型同时接受MXFP4量化感知训练,使其在训练期间提前适应低精度计算,为后续FP4推理减少质量损失。

第三层:一次强化学习生成2.5万条轨迹

MiMo-V2.6性能提升最直接的来源,是强化学习规模的大幅扩张。

小米在每个强化学习步骤中抽取1568个任务,每个任务生成16种候选解法,也就是一次产生约2.5万条智能体轨迹。这些轨迹合计包含27亿至37亿个训练Token,平均每条约11万至15万个Token。

这和普通问答式强化学习存在明显区别。MiMo-V2.6面对的不是一道题、一段回答,是持续数十步甚至更长的智能体任务。一条轨迹可能包括:

• 阅读代码仓库; • 检索相关文件; • 修改代码; • 运行测试; • 根据报错继续修改; • 调用外部工具; • 最终提交结果。

MiMo-V2.6-Pro和Flash均完成30个强化学习步骤,分别处理约75万条轨迹。Pro的强化学习成本约为260万美元,Flash约为90万美元。