9月22日,小米正式发布并开源全新一代MiMo大模型:全模态旗舰模型Xiaomi MiMo-V2.6-Pro、高效推理模型Xiaomi MiMo-V2.6-Flash,并同步上线MiMo-V2.6-Pro的超高速模式V2.6-Pro-Ultraspeed,以及MiMo Desktop桌面客户端正式版。
据全球权威大模型测评平台Artificial Analysis综合智能指数榜单显示,Xiaomi MiMo-V2.6-Pro以46分的成绩登顶全球开源大模型第一、国产模型第一,超越Kimi K3、Qwen3.8 Max成为最强国产模型。值得一提的是,MiMo-V2.6-Pro首次支持文本、图片、视频、音频等全模态,成为全球开源模型阵容中唯一的全模态Pro模型。
Artificial Analysis综合智能指数榜单。
在智能水平跻身全球第一梯队的同时,MiMo-V2.6系列维持了价格不变,其中MiMo-V2.6-Pro的单位任务成本维持在0.13美元(约为0.9元人民币),在同等智能水平下,价格仅为海外模型的1/20至1/60。
早在9月17日凌晨,小米MiMo大模型团队负责人罗福莉就在社交平台发文分享了小米MiMo-V2.6的最新进展。值得注意的是,当时罗福莉还直接晒出了MiMo-V2.6的实时训练页面,让外界首次看到这一代模型强化学习阶段的部分训练状态。
据小米方面透露,MiMo-V2.6 RL后训练耗时约6天,其中Flash版本训练成本约85万美元,Pro版本约262万美元,两个版本合计训练成本超过347万美元,累计约 75 万条轨迹。在长程软件工程能力评测中,Flash版本得分从48.8提升至65.68,Pro版本从58.4提升至72.57,提升幅度分别为17分和14分。
据介绍,在技术实现上小米主要从三个维度持续拓展RL后训练的算力。首先是更大的Batch和更高吞吐,通过大Batch和全异步架构,实现了更高的吞吐量;其次是采用更复杂的任务和更多元的Harness框架; 第三是为奖励信号提供更多算力,在打分机制上为Long Horizon RL任务提供更精准、多样的奖励信号,形成模型自我改进闭环,并引导模型以更短路径、更少Token完成任务。
采写:南都N视频记者 林文琪
编辑:易福红