小米开源MiMo-V2.6系列模型,Grok 4.7接入Devin但表现存疑

2 阅读

小米开源MiMo-V2.6系列,多款模型覆盖不同场景

小米近期在Hugging Face上一口气发布了三款基于MiMo-V2.6的新模型:MiMo-V2.6-Pro-RL、MiMo-V2.6-Flash-RL以及MiMo-V2.6-Distill-Qwen-9B。这些模型分别针对强化学习训练、轻量级本地部署和知识蒸馏优化,显示出小米在开源大模型生态中的持续投入。

大黑

其中最受关注的是MiMo-V2.6-Pro-RL。根据Arena.ai公布的WebDev AutoEval评分,该模型得分为1628分,比前一代提升了153分,在开源权重模型中排名大约第三位,成功挤进Code Arena榜单前十。不过需要注意的是,这一结果目前仅基于自动评估,尚未经过真人投票验证,实际表现可能还有调整空间。

另外两款模型也各有侧重。Flash-RL版本主打推理速度和资源效率,适合在消费级硬件上运行;而Distill-Qwen-9B则是通过知识蒸馏技术从更大模型压缩而来,参数量控制在90亿左右,兼顾性能与部署成本。对于本地AI开发者来说,这三款模型提供了从高性能到低资源的不同选择。

Grok 4.7能力提升但表现不一

xAI旗下的Grok 4.7最近动作频频。一方面,它在Browser Use的Long Horizon Browser Use Benchmark v2评测中拿到了39.9分,相比Grok 4.6的31.2分有明显进步,说明其长程网页浏览和操作能力确实在增强。但另一方面,这个分数仍远低于GPT-6 Astra和DeepSeek V4.1 Flash等领先模型,差距依然显著。

更让人困惑的是Grok 4.7在开发工具中的表现。Cognition宣布已将Grok 4.7接入其AI编程助手Devin,并称在FrontierCode 1.1 Extended基准测试中达到了59.4%的成绩。然而同一条消息的另一项评测却显示,Grok 4.7在某些真实软件工程任务上的表现甚至略逊于Grok 4.6。这种前后矛盾的结果让人对Grok 4.7的实际能力产生疑问——究竟是评测标准不一致,还是模型本身存在稳定性问题?

目前Grok 4.7已在Cline等平台上线,提供限时折扣。开发者如果感兴趣,不妨亲自测试其在具体任务中的表现,而不是完全依赖厂商公布的分数。

Runway扩展视频工作流能力

视频生成平台Runway近期对其Workflows功能进行了重要扩展。新加入的节点包括合成(Compositing)、Alpha通道处理、HDR调整、深度图生成以及RGB Depth等。这些新增功能让创作者可以在同一个工作流中完成更多后期处理步骤,减少在不同工具间切换的麻烦。

例如,用户现在可以直接在Runway中生成带深度信息的视频,然后利用深度图进行背景虚化或3D效果合成,最后再通过HDR节点优化画面动态范围。整个流程无需导出中间文件,提高了创作效率。对于短视频创作者或独立电影制作人来说,这种一体化的工作流能显著降低技术门槛。

不过需要注意的是,这些高级功能对硬件要求较高,尤其是涉及实时渲染的部分。Runway虽然提供了云端处理选项,但免费额度有限,重度用户可能需要考虑订阅付费计划。

Yandex发布80B稀疏激活模型

除了小米和xAI的动作,俄罗斯科技公司Yandex也发布了新的开源大模型AliceAI-Foundation-80B-A3B-Base。这款模型总参数量达到800亿,但采用稀疏激活机制,每次推理仅激活约30亿参数。这种设计既保留了大模型的容量优势,又控制了计算开销,特别适合本地部署场景。

Yandex明确表示,这款模型的目标是与Qwen和DeepSeek等主流开源模型竞争。从架构上看,它采用了自定义的稀疏激活方案,而非直接复用现有框架。对于关注本地推理性能的开发者来说,这提供了一个新的选择,尤其是在处理多语言任务时可能有独特优势。

目前该模型已在Hugging Face上线,支持商业用途。不过由于Yandex主要面向俄语市场,模型在非拉丁语系上的表现还需要社区进一步验证。

OpenAI组建数学家顾问组

在行业动态方面,OpenAI宣布将与一个独立的数学家顾问组合作。这个小组由多位专业数学家组成,旨在帮助OpenAI完善AI生成数学成果的评估标准、传播规范和学术伦理。

具体来说,顾问组将参与制定如何判断AI辅助证明的有效性、如何标注AI在数学发现中的贡献,以及如何避免错误结论的传播等问题。长远来看,OpenAI希望通过这一合作推动AI更好地支持数学研究和教育,比如开发专门的数学推理工具或教学辅助系统。

这一举措反映出大模型公司在专业领域应用中面临的挑战:通用模型虽然能生成看似合理的数学推导,但缺乏严格的验证机制。引入领域专家参与标准制定,或许是解决这一问题的务实路径。其他AI公司如Google DeepMind也在类似方向有所布局,未来可能会看到更多跨学科的合作模式。