小红书开源280B参数长程Agent模型:dots3-note preview如何攻克复杂任务?

10 阅读

从IMO满分到长程任务:dots3-note preview的开源之路

上个月,小红书自研大模型dots-note-3.0在国际奥数竞赛中斩获满分42分,成为AI首次在该赛事中获官方认证满分。这一成就让社区对模型的开源充满期待。今天,dots实验室正式开源dots3-note preview,这是dots3系列的首个开源版本,总参数280B,激活参数16B,支持512K超长上下文,具备文本、视觉与语音多模态理解能力,并针对复杂推理、Agent和多模态感知进行了优化。

图片

与dots3系列其他版本不同,dots3-note preview将重心放在长程任务上,这类任务没有唯一答案,时间跨度可能长达数小时甚至数天。这踩中了当前Agent发展的主线:AI开始被要求独立承担越来越长、越来越完整的工作。OpenAI曾披露,今年5月超过70%的用户让Codex处理需要人类一小时以上才能完成的工作;到6月,内部使用量最高的1%活跃用户每天产生超过60小时的agent turns。

图片

然而,当任务落到不同场景,难度差异显著。与数学、代码等Agent表现成熟的场景不同,真实生活环境更开放、需求更模糊。dots3-note preview选择将“考场”设在这里,对自身的长程规划、判断与纠错能力提出了更高要求。

图片

实测:模型如何应对复杂任务?

图片

接管《杀戮尖塔II》

图片

模型事先未针对该游戏专门训练,却能根据战斗反馈学习卡牌和敌人机制,同时管理生命、牌组、金币与药水,在商店、营地和精英战之间权衡,一路玩到33层。这展示了模型在动态环境中的适应能力。

图片

从零破解ARC-AGI 3

图片

在规则完全未知的ARC-AGI 3任务中,模型逐步发现方块同步、镜像规律,并摸索出危险格、压力开关等机制。每当假设出错,它会启动Self-Critiquing机制重新评估,将修正后的规则写入memory.md,最终通过320步操作解开全部6关。

读图解决装修难题

同时上传户型图和冰箱参数截图,并补充厨房墙面已有1.5米台面的信息,模型结合多模态信息计算出剩余空间,给出适配结论,并提醒用户现场复尺。这体现了视觉空间理解、复杂推理和工具调用的综合能力。

图片

端到端跑通visionOS应用开发

模型接到“参考小红书设计,开发Apple Vision Pro原生应用”的任务后,先理解需求并参考9张界面图,自主确定技术路线,生成12个Swift文件、1876行代码,实现信息流、个人主页、私信、商品等界面,并接入USDZ 3D模型。随后自行生成Xcode工程、调用xcodebuild编译,在visionOS Simulator中验证,最终显示“BUILD SUCCEEDED”。

图片

核心技术:TEMPO与Self-Critiquing

图片

dots3-note preview最突出的能力是边探索、边记住新信息,遇到变化或判断失误后再调整。这依赖于两个关键机制:学习并记住有用信息,以及及时发现并修正偏差。

图片

dots实验室构建了数千个不依赖先验知识的超长程新颖环境,让Agent在陌生场景中持续探索,学习新规则。当任务长度超过上下文窗口,模型通过强化学习学会保留对后续有用的信息。

图片

长程任务的探索成本极高,传统强化学习方法效率低下。dots实验室提出TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization),将长轨迹切分为多个macro-step,每个包含多轮交互。模型在阶段结束后从actor切换到critic,通过推理和工具调用估计当前状态价值,并作为训练信号。TEMPO的优势在任务深水区显现,随着交互轮次增加,GRPO和Base checkpoint得分停滞,TEMPO仍能提升。

图片

Self-Critiquing机制进一步增强了自我评价能力。即使问题未解,模型也能从两个相似中间状态中判断哪个更有希望。在IMO 2026参赛中,模型一边生成证明,一边通过工具调用反复检查并修改,最终满分。

评测基准:揭示长程Agent的短板

小红书开源了两套评测基准:VibeSearchBench和VibeLifeBench。VibeSearchBench考察“用户未一次说清需求时,Agent能否理解”,覆盖20个领域、200项任务;VibeLifeBench强调时间和环境变化,覆盖10个领域、20项任务,每项包含20-30个阶段,设置1247项atomic checks。结果显示,Claude Opus 5、GPT-5.5等头部模型均未达到及格水平,说明长程任务仍是Agent的短板。

图片

未来展望

dots3-note是dots3系列中最轻量级的版本,preview版本仍有优化空间。dots实验室透露,dots3-note正式版将于近期开源,未来还将推出jazz和aria版本,覆盖不同任务复杂度、响应速度和计算成本的需求。

小红书的“主动记忆+超长轨迹强化学习+中途自评”组合,为长程Agent进入现实世界提供了一种具体解法。随着正式版及更多版本的发布,AI在真实生活场景中的应用将更加值得期待。