Mint-Agent如何重塑金融AI:可审计性驱动的Agentic基础模型新范式
近年来,大模型在通用领域的突破令人瞩目,但在高风险、强监管的金融场景中,仅靠“看起来合理”的回答已远远不够。金融机构真正需要的,不是另一个能侃侃而谈的聊天机器人,而是一个能在复杂任务中自主行动、全程留痕、结果可被审计的智能体。正是在这一背景下,由华东师范大学上海人工智能金融学院孵化的 Mint-Agent 项目,提出了“金融原生 Agentic Foundation Model”的全新范式,并以实际性能与商业落地验证了其可行性。

Mint-Agent 的核心突破在于重新定义了金融 AI 的成功标准:不再仅仅追求最终答案的准确率,而是将整个研究过程转化为一条可恢复、可验证、可复核的证据链。这一理念直接体现在其在 FinanceAgentBench v2 上的表现——27B 参数的 Mint-Ag 模型以 60.49% 的得分超越 GPT-5.6-Sol 与 Claude Opus 4.8,同时单题推理成本分别仅为后者的约 22% 和 10%。这意味着,性能提升并非依赖更高的计算预算,而是源于对金融任务本质的深度建模。

金融任务的本质:从“知道”到“做完”

传统金融 LLM(Large Language Model)往往止步于知识问答层面,即便引入推理能力,也多局限于封闭环境下的数值计算。然而,真实世界的金融研究远比这复杂。例如,要估算某公司下一季度的营收,分析师需主动检索 SEC 文件、识别正确的财报附录(如 EX-99.1)、确认报告期间、抽取关键指标、统一货币单位、处理非经常性项目,并交叉验证多个来源的数据一致性。任何一步出错,最终结论都可能失之千里。

Mint-Agent 将此类任务视为一条“可恢复链”:从原始来源出发,经事实抽取、口径校准、计算执行,最终形成结论。这条链上的每一个节点——实体、报告期、指标、数值、单位、来源位置——都被显式记录并绑定。因此,评估一个任务是否完成,不仅要看答案是否正确,更要看证据是否有效、计算是否闭合、过程是否可重放。这种设计从根本上改变了金融 AI 的评估逻辑,使其从“黑箱生成”转向“白盒执行”。

三位一体技术栈:Data、Harness 与 Algorithm 的协同

Mint-Agent 的能力并非来自单一模块的堆砌,而是 Data(数据定义)、Harness(执行框架)与 Algorithm(训练算法)三者的深度耦合,共同服务于“金融正确性”这一统一标准。

Data 引擎:先定义“什么算对”

Mint-Agent 的训练数据并非简单爬取的金融文本,而是通过结构化引擎从 EDGAR、XBRL、交易所公告、FRED 数据库及会计分类体系中提取的原子任务。每个事实均绑定六大要素:实体、报告期、指标、数值、单位和原始位置。只有那些具备明确证据支持、计算路径可重放且答案唯一的样本,才被纳入训练集。

更关键的是长程任务的构造方式。系统会预先构建“隐藏证据图”,仅向模型暴露研究目标(如“估算台积电2025年Q1营收”),而不透露所需材料的具体位置。模型必须在开放网络环境中自主搜索、筛选、验证并整合信息。这种设计确保了任务的正确性不依赖题面提示,而是落脚于一组可机器核验的事实节点与运算关系。
MintHarness:让证据不随上下文消失
在传统 Agentic 系统中,随着对话轮次增加,早期检索到的关键证据可能因上下文压缩而丢失,导致后续推理脱节。Mint-Agent 通过 MintHarness 解决了这一问题。该框架将研究过程转化为有状态的执行循环:模型决定下一步行动(如调用 SEC 搜索工具),Harness 则负责校验工具调用合法性、预算消耗及输出格式,并将有效结果写入“证据账本”(Evidence Ledger)。
证据账本独立于模型上下文,持久保存所有已确认的事实及其元数据。即使任务经历网页失效、搜索转向或多轮对话压缩,已锁定的证据(如某份财报中的具体数值)仍保持不变。审计者可随时调取完整轨迹,复核每一步操作的有效性。这种设计使得“偶然正确”不再被接受——若证据无法支持或计算不可复现,即便答案碰巧对,任务仍被视为未完成。
Algorithm:双核训练,融合推理与执行
Mint-Agent 的训练策略同样体现其对金融任务复杂性的尊重。团队发现,擅长金融计算的模型未必善于长程搜索,而精通工具调用的智能体也可能在单位换算或口径校准上犯错。为此,他们采用“双核训练”路径:从同一基础模型出发,分别强化金融推理(计算、分析、验证)与 Agentic 执行(搜索、工具调用、失败恢复)两大能力。
两条路径均经历完整的 SFT(监督微调)→ OPD(在线偏好蒸馏)→ RLVR(基于可验证反馈的强化学习)→ 多教师融合的训练流程。最终,通过自研算法将两类专长整合为统一智能体。这一过程借鉴人脑的功能分工,但摒弃了易丢失的短期记忆依赖——所有关键状态均由外部证据账本与轨迹日志维护,确保能力的持久性与可扩展性。
轨迹即证据:从 AMD 到台积电的真实案例
Mint-Agent 的可审计性在实际任务中得到充分验证。以 AMD 收入指引任务为例,模型在 13 步、23 次工具调用中,先是错误地选择了某个 accession 编号,随后主动扩大 SEC 检索范围,最终定位到四个季度的 EX-99.1 文件,并在输出前重新打开 Q3 来源进行复核。整个过程清晰记录了失败、修正与验证的完整路径,原始文件与中间数值均可追溯。
更复杂的案例来自台积电 2025 年 Q1 营收推演。该任务历经 37 步长程执行,期间遭遇申报页面受阻、误选年度数据、统计窗口偏差等多重挑战。但模型始终保留已确认的 2025 年 Q1 指引与月度营收记录,在恢复 2022–2024 年三年历史口径后,重新计算 3 月增速,最终推演出 NT$825,110 百万的季度营收。由于汇率换算与指引中值均被锁定在证据账本中,最终结果与预期的 NT$8,010 百万差额可沿原始证据链完整复核。
这两个案例共同说明:可审计性不仅是给结论附加引用,而是在长程执行中持续维护证据的有效性与状态的一致性。系统允许可见的失败,但拒绝无法解释的“正确”。
从技术验证到产业落地:亿元订单背后的信任逻辑
Mint-Agent 的商业订单已超亿元,这一数字背后是金融机构对其“敢用”能力的认可。在投研、风控、审计等核心场景中,模型必须满足三大条件:性能达标、成本可控、过程可审计。Mint-Agent 通过性能—成本前沿的突破与可验证执行框架的构建,同时满足了这三项要求。
更重要的是,该项目形成了“模型研发—金融问题定义—工程部署—真实场景反馈”的闭环。团队不仅包含大模型与强化学习专家,还融合了来自头部金融机构的业务理解者,确保技术方案紧贴实际需求。这种跨学科协作模式,使其在金融 AI 的基础设施竞争中占据先机。
当前,Mint-Agent 正推进新一轮战略融资,并计划围绕“模型—Agent—安全—应用”构建一体化技术体系。随着金融机构从“尝试使用”走向核心业务深度部署,可信、安全、可审计的金融 AI 能力将成为最具壁垒的基础设施环节。而 Mint-Agent 所代表的 Agentic Foundation Model 范式,或许正是通往这一未来的正确路径。