小红书开源 Iris 搜索智能体:35B 小模型逼近万亿参数效果

1 阅读

Iris 是什么

Iris 是小红书 AllSpark 团队开源的一款搜索智能体,有两个版本:35B 参数的 Iris-mini 和 397B 参数的 Iris-pro。它不是简单地把用户问题丢给搜索引擎然后拼接结果,而是能自己决定搜什么关键词、怎么读网页内容、什么时候该继续搜、什么时候可以停下来作答。

在真实网络环境中,Iris 会边搜索、边推理、边组织答案,整个过程像一个有耐心的研究员。它在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 HLE 这四个主流搜索智能体评测基准上,都拿到了同量级开源模型中的最好成绩。更让人意外的是,35B 的 Iris-mini 在 BrowseComp 上得分 82.2,已经非常接近 Kimi-K2.6 这类参数量大几十倍的万亿级模型。

它到底强在哪

能真正“跨页”找答案

很多所谓的搜索智能体其实只是关键词匹配高手——问题里提到“iPhone 16 发布时间”,它就去搜“iPhone 16 发布时间”,然后从结果里挑一句看起来最顺的。但现实中的复杂问题往往没这么直接。

比如:“某位 2023 年获得图灵奖的学者,其博士导师曾在哪所大学任教?”这个问题需要至少两步:先确认获奖者是谁(Avi Wigderson),再查他的导师(John Gill)及其任职机构(斯坦福大学)。中间没有任何一个网页会直接写出完整答案,必须跨多个页面串联信息。

Iris 的设计目标就是解决这类问题。它不会满足于单页快照,而是主动点击链接、跳转新页面,直到证据链闭合。

数据是怎么“造”出来的

传统做法是人工出题,但成本高、规模小、难扩展。Iris 团队搞了一套全自动的“反向造题”流程:

  1. 选种子页面:比如维基百科上某位科学家的条目,把它当作“标准答案”。
  2. 顺链接建图谱:沿着页面里的超链接,爬取相关人物、机构、事件,形成一个局部知识图谱。
  3. 生成题目:基于图谱关系自动出题,比如“X 的导师 Y 曾在 Z 大学工作”。
  4. 抹掉线索:把题干中的实体名替换成描述性语言,比如不说“Avi Wigderson”,而说“2023 年图灵奖得主”,防止模型靠字符串匹配作弊。
  5. 双重筛选:先用一个强参考模型尝试“闭卷”回答,答不出的保留;再给它提供所有相关网页,看是否能唯一确定答案。只有同时满足“够难”和“可解”的题目才进入训练集。

这套方法完全自动化,只要有新的网页语料,就能持续生成高质量训练数据。

训练方式:SFT–RL Climbing

Iris 的训练不是一次性完成的,而是采用 SFT(监督微调)和 RL(强化学习)交替进行的“爬坡”策略:

  • SFT 阶段:用更强的教师模型在真实搜索工具上跑出完整轨迹(包括查询、阅读、推理步骤),经过结果过滤和“判官”模型对每一步打分后,用来训练学生模型。
  • RL 阶段:让学生模型自己上网搜索,在真实环境中边做边学。每轮结束后,把两类轨迹回灌到下一轮 SFT:一类是最难做对但最终成功的,另一类是最高效解出的。

随着模型能力提升,题目难度也自动升级,形成自适应课程。这种“越练越难、越难越练”的循环,让模型逐步逼近人类研究员的搜索策略。

工程细节也很关键

判分和摘要不依赖外部 API

很多研究项目在训练时依赖第三方服务做摘要或评分,但网络波动、API 限流会严重干扰训练稳定性。Iris 把判分模型和摘要器都部署在内部训练集群里,全程不碰外部接口。更重要的是,训练时用的摘要器和线上推理时用的是同一套,避免了“训练一套、上线一套”导致的能力错位。

超长会话不断连

搜索任务有时会拖得很长,比如连续打开十几个页面。传统做法是整段丢弃超时会话,浪费算力。Iris 改为在请求级别中断——如果第 8 步卡住,就保存前 7 步的上下文,下次从第 8 步继续。这样 GPU 在同步调度下能保持高利用率,训练更稳定。

评测协议对齐

为了公平比较,Iris 团队要求所有对比模型在完全相同的条件下测试:用同一套搜索工具、同样的上下文长度限制、同一个判分模型,且只允许单个 ReAct 智能体(不允许用 Swarm 多智能体堆数量)。这排除了框架层面的取巧,让分数真正反映模型本身的能力。

小模型也能打

Iris-mini(35B)的表现尤其值得关注。在 BrowseComp 英文基准上,它拿到 82.2 分,而 Kimi-K2.6 单智能体版本是 83.2 分——两者差距不到 1 分,但参数量相差近 30 倍。这意味着在垂直领域(如搜索),精心设计的小模型完全可以挑战通用大模型。

这种高参数效率得益于两点:一是训练数据高度聚焦搜索任务,没有浪费容量在无关知识上;二是上下文管理策略(如截断、压缩)让小模型也能处理长链路推理,不至于中途“失忆”。

能力还会“外溢”

更意外的是,Iris 没有专门训练过通用工具调用或办公任务,但在 BFCL、τ-bench、OfficeQA、APEX 等 benchmark 上表现也不错。这说明“搜索”本身是一种基础原子能力——学会如何与外部世界交互、如何验证信息、如何组织证据,这些技能可以迁移到其他需要工具调用的场景。

比如在 OfficeQA 任务中,模型需要读取用户上传的 Excel 表格并回答问题。Iris 虽然没练过这个,但它习惯于从非结构化文本中提取关键信息、交叉验证数据,这种思维模式自然适配办公场景。

怎么用起来

想试试 Iris?步骤很直接:

  1. 克隆代码仓库:git clone https://github.com/AllSpark-Research/Iris
  2. 从 HuggingFace 下载模型权重(Iris-mini 或 Iris-pro)
  3. 安装依赖(如 vLLM 或 SGLang 推理框架)
  4. 配置搜索引擎接口(联网是必须的)
  5. 用 ReAct 智能体形式加载模型,把搜索工具注册进去
  6. 输入问题,看它自动规划、搜索、推理、作答

Loomy

整个流程对开发者友好,文档也齐全。如果你在做 Agent 相关产品,Iris 可以作为一个高性价比的底座模型。

应用场景不止搜索

虽然叫“搜索智能体”,但 Iris 的能力边界比名字更广:

  • 深度调研:适合写行业报告、竞品分析,能自动收集多方证据,避免片面结论。
  • 事实核查:辟谣或尽职调查时,必须找到原始出处,Iris 的跨页推理能力正好匹配。
  • 中英混合检索:在 BrowseComp 和 BrowseComp-ZH 上都表现优异,适合处理跨境信息。
  • 通用 Agent 底座:工具调用能力可直接用于构建客服、助理等智能体。
  • 办公助手:无需额外训练就能处理文档问答、流程任务,嵌入企业办公系统门槛低。

开源的意义

相比 Kimi-K2.6 等只开源权重但隐藏训练细节的模型,Iris 把数据构造方法、训练配方、评测代码全部公开。这意味着社区可以复现结果、改进方法,甚至基于它的思路开发新应用。在当前大模型越来越“黑箱”的趋势下,这种透明度尤为珍贵。

总的来说,Iris 不只是一个性能强的模型,更提供了一套可复制的 Search Agent 构建范式——从数据生成到训练策略再到工程优化,每一步都经得起推敲。对于想在搜索或工具调用方向深耕的团队来说,它是个值得研究的标杆。