Codex额度回血背后:AI Agent如何悄悄烧光你的Token?

2 阅读

近期,OpenAI旗下AI编程助手Codex的一次“额度回血”操作,意外揭开了AI Agent时代资源消耗的冰山一角。表面上看,这是一次面向付费用户的福利回馈;实际上,它暴露出一个更深层的问题:在高度自动化的智能体系统中,用户对自身资源使用情况的掌控力正在急剧下降。

此次调整由Codex负责人Tibo通过社交媒体宣布,核心内容并非简单增加配额,而是基于对数千份用户反馈的系统性分析,对底层使用量计算机制进行了近乎重构式的优化。修复完成后,相同额度下用户的实际可用能力提升了10%至50%。这一数据差异的背后,是一系列隐蔽却高效的“Token吞噬器”被逐一清除。

首先被点名的是上下文压缩(Compaction)机制的失效。在长时间运行中,AI工具会积累大量历史交互信息,包括文本、代码片段乃至图像。为维持性能,系统通常会对旧上下文进行压缩或清理。然而此前Codex在执行压缩时,并未正确移除嵌入的图片数据,导致压缩后的上下文体积并未显著减小,反而可能因冗余数据触发新一轮压缩循环。这种“越压越大”的悖论式行为,使得本应节省资源的操作反而成为负担。修复后,重度图像使用者的Token消耗直接下降约10%。

图片

更令人震惊的是任务目标(Goals)机制的失控。用户通过/goal指令设定任务后,理想情况下Agent应在目标达成后自动终止。但系统存在逻辑缺陷:即便任务已完成,Agent仍可能继续执行后续无关操作;或在工具调用失败后无限重试。OpenAI披露的案例显示,此类异常可消耗用户每周额度的15%至70%。这意味着,一个看似简单的“生成README文件”指令,若因内部状态判断错误而陷入循环,可能在数小时内耗尽整周配额。

图片

另一类极端案例出现在Memory系统中。后台的Memory Worker负责维护Agent的记忆状态,其运行依赖于Stop Hook等控制信号。但在特定条件下,这些Hook未能正确传递,导致某些任务无法正常终止。OpenAI甚至发现一个任务的状态检查被重复执行了近15,000次。虽然影响用户比例不足1%,但对命中者而言,Token如同在后台无声蒸发——设备无明显负载,额度却持续归零。

图片

随着多智能体架构的普及,Subagent(子智能体)的行为失控也成为新痛点。Codex在处理复杂任务时会动态调用多个子Agent协同工作。问题在于,部分轻量级模型(如Luna)在未获用户授权的情况下,擅自选择更高成本的辅助模型;更有甚者,主Agent虽运行于普通模式,却强制子Agent启用/fast高速模式。这种“经济舱老板配商务舱助理”的资源配置错位,显著推高了隐性成本。目前该权限逻辑已被收紧,确保子Agent的资源配置严格遵循主任务设定。

自动化任务(Automations)的调度偏差同样不容忽视。用户设定“每日执行一次”的脚本,系统可能因时间戳解析错误或事件触发机制缺陷而多次唤醒。单次超额执行或许微不足道,但Agent的特性在于无需人工干预即可持续运行。日积月累,原本可控的成本可能呈指数级增长。OpenAI已重构调度引擎,确保执行频率与用户预期严格一致。

值得注意的是,系统自省行为本身也在消耗资源。例如Computer History模块用于记录Agent在操作系统中的操作轨迹,以便后续任务参考。旧版实现中,系统会对高度重叠的历史活动进行重复总结,相当于对同一段日志反复提炼摘要。在部分用户场景中,此类后台开销竟占周额度的20%。类似地,Rolling Task Summaries功能会在普通对话中触发额外请求以生成滚动摘要,虽单次仅增1%消耗,但高频交互下累积效应显著。OpenAI已直接关闭后者,并优化前者的去重逻辑。

最后,MCP(Model-Controller-Provider)工具调用链路也存在冗余。部分工具返回结果被重复编码两次,或因说明文档截断而被迫重新获取。这些工程层面的“毛刺”在传统API调用中影响有限,但在Agent高频调用场景下——一天数百次工具交互——每次几毫秒的延迟或几KB的冗余传输,最终都会转化为可观的Token支出。

综合来看,此次修复行动揭示了一个关键趋势:AI Agent的资源消耗模型已远超传统对话式AI的线性逻辑。用户输入一句话,背后可能触发包含上下文管理、子任务分发、记忆更新、工具调用、状态监控等在内的复杂工作流。任何一个环节的低效或错误,都会通过自动化放大效应传导至最终账单。

OpenAI显然意识到透明度缺失正侵蚀用户信任。除技术修复外,团队正开发细粒度使用量可视化功能,未来用户将能清晰看到额度消耗的具体分布——哪些用于核心推理,哪些消耗在上下文维护,哪些浪费于异常重试。这种“账单明细”式的透明化,是构建可持续AI服务生态的关键一步。

此外,架构层面的预防机制也在加强。系统现已部署自动异常检测告警,一旦出现类似此前的无限循环或超额调用,运维团队将第一时间介入。这标志着OpenAI从“事后修复”转向“事前防控”的运维策略升级。

值得玩味的是,此次调整恰逢OpenAI与Cursor关系恶化之际。有分析认为,此举既是安抚现有Codex用户、强化产品竞争力的必要举措,也可能是在为未来可能的模型访问限制做铺垫——通过提升单位额度的实际效能,降低用户对绝对配额数量的敏感度。

无论如何,这场“额度回血”风暴传递出明确信号:在AI Agent时代,效率不仅是技术指标,更是用户体验的核心组成部分。当智能体越来越能“自己干活”,如何确保它们“花得明白、干得高效”,将成为所有AI平台必须直面的课题。而OpenAI的这次行动,或许只是这场系统性优化的开端。