GPT-5.6重塑超级App争议:额度刺客与用户体验的双重崩塌

1 阅读

OpenAI在2026年中旬发布的GPT-5.6模型及其配套的ChatGPT桌面端大改版,原本被寄予厚望成为通往通用人工智能(AGI)的关键入口,却在发布后迅速陷入舆论风暴。这一变革不仅涉及底层模型的升级,更是一次彻底的产品形态重构——将Codex代码解释器、Agent代理功能与传统的聊天模块强行整合进一个所谓的“超级App”。然而,理想化的产品愿景与残酷的用户现实之间出现了巨大裂痕,导致口碑迅速崩塌。这场争议揭示了AI产品在追求功能无限扩展的同时,如何在技术能力、资源消耗与用户体验之间寻找平衡点,已成为行业面临的核心挑战。

OpenAI 官方弹窗截图,展示 Codex 应用正式更名为

额度消耗的失控与Token经济学的悖论

社交媒体截图,内容为关于GPT-5.6模型使用建议的讨论,与

在AI服务中,Token的使用效率直接关系到用户的经济成本与使用门槛。OpenAI官方宣称,GPT-5.6在Sol架构下的Agent编程任务中,Token效率提升了54%。这一数据由CEO Sam Altman亲自背书,旨在证明模型在推理能力增强同时,资源利用更加优化。然而,实际测试数据却给出了截然不同的反馈。多位博主及普通用户的实测表明,这种效率提升并未在直观感受中体现,相反,Token的消耗速度呈现出前所未有的激增态势。

社交媒体推文截图,内容涉及GPT-5.6 Sol模型在代理编

对于订阅Pro档位的用户而言,额度耗尽的速度成为了最直观的痛点。OpenAI内部员工随后解释了这种差异的根源:GPT-5.6 Sol提供了从Medium到Ultra的多档推理强度选择。其中,Ultra档位被形容为“猛兽”,其Token消耗量可能是Medium档位的5到10倍。这意味着,用户若选择更高性能以解决复杂问题,必须付出呈指数级增长的成本。这种设计将性能选择权完全抛给用户,却未充分提示潜在的财务风险,导致“额度刺客”的标签不胫而走。

社交媒体截图,展示了关于模型 Medium 和 Ultra

更严重的是,这种高消耗模式并非孤立存在。Codex、ChatGPT Work、Workspace Agents等多个功能模块共享同一个额度池,而普通的文本对话并不在此列。这种额度分配机制的复杂性,使得用户对资源消耗的预判变得极其困难。当模型在后台进行深度思考或调用多个子Agent时,Token的消耗往往是不可见的,直到用户收到限额通知时才恍然大悟。这种黑盒化的资源管理机制,严重削弱了用户对付费服务的掌控感与信任度。

社交媒体截图,包含关于 Sol 模型性能与推理水平关系的观点

严重故障与信任危机:从误删文件到系统崩溃

软件界面截图,展示了使用量限制(Usage)的进度条和剩余百

如果说额度问题是经济层面的摩擦,那么GPT-5.6引发的技术故障则触及了用户对AI安全性的底线。在代码执行与文件操作场景中,AI代理的容错率极低。知名科技博主Matt Shumer遭遇了一起惊悚事件:在开启最高推理档位的GPT-5.6-Sol后,AI代理在“深度思考”后,竟然误删了其Mac电脑上几乎所有的文件。

科技博主关于超级应用时代的推文截图,包含观点内容

这一事件之所以引发广泛关注,不仅因为损失巨大,更因为它发生在一个标榜为2026年最前沿、具备强大推理能力的模型上。用户普遍认为,此类低级错误应发生在早期的GPT-3.5时代,而非如今强调安全对齐与逻辑推理的高级版本。OpenAI团队虽随后介入排查,但无法立即消除用户心中的恐慌。对于依赖AI辅助工作的专业用户而言,数据安全性是不可妥协的底线。当AI代理具备直接操作系统文件的能力时,缺乏足够严格的沙箱隔离与二次确认机制,无异于将用户的数字资产置于高风险之中。

社交媒体截图,展示了关于GPT-5.6-Sol意外删除Mac

此类事故频发,反映了当前AI代理在自主性与安全性之间的失衡。虽然OpenAI试图通过提升模型智能来减少错误,但在缺乏完善的人机交互校验机制前,过度赋予AI自主权反而可能放大错误的影响。这不仅损害了单个用户的利益,更对整个行业的技术信任体系造成了冲击。用户开始质疑:在追求智能突破的同时,是否牺牲了必要的安全冗余?

ChatGPT Work 应用界面的截图,展示了任务管理、插

产品设计的混乱:超级应用还是臃肿操作系统?

ChatGPT Work 界面截图,展示了工作模式切换及欢迎

除了技术与安全问题,新ChatGPT桌面端的用户体验设计也遭到了毁灭性批评。OpenAI试图打造一个集聊天、编码、任务管理于一体的超级应用,但在具体执行上却呈现出严重的逻辑混乱。新应用默认进入“ChatGPT Work”模式,而非用户熟悉的普通聊天界面。对于大多数普通用户而言,这一默认设置造成了极大的认知错位,他们试图寻找下拉菜单切换回普通ChatGPT,却发现该选项缺失,取而代之的是难以理解的“ChatGPT Codex”。

文章正文截图,展示了关于ChatGPT Mac应用评测的标题

核心功能的边缘化是此次改版的一大败笔。原本作为ChatGPT核心竞争力的聊天功能,被压缩为一个从底部弹出的对话框,并被埋没在侧边栏的次级菜单中。这种设计违背了用户的使用习惯,迫使习惯简单对话的用户去适应一个复杂的IDE(集成开发环境)布局。用户讽刺道:“一个名为ChatGPT的产品,默认不让你Chat。”

关于ChatGPT产品设计和用户量讨论的社交媒体截图

此外,功能模式的命名与区分也令人困惑。ChatGPT Work与ChatGPT Codex在功能上被认为几乎完全一致,仅仅是UI风格的差异。这种“换皮”式的设计不仅没有增加新功能,反而增加了用户的学习成本。沃顿商学院教授Ethan Mollick等专业人士对此表示不解,认为这种区分缺乏明确的业务逻辑支撑。Django联合创始人Simon Willison更是直接质疑,这种设计是否纯粹是内部组织架构在UI上的投影,而非基于用户需求的产品决策。

社交媒体截图,展示了关于ChatGPT Work和Codex

从原生Mac应用到Electron套壳的转变,也带来了性能上的肉眼可见下降。应用响应速度变慢、内存占用增加,进一步加剧了用户的负面体验。有用户将其比作“新版Windows”,暗示其臃肿与低效。这种批评并非空穴来风,它反映了用户对大厂在推出重大更新时,往往忽视基础体验优化的普遍不满。

关于ChatGPT Codex与ChatGPT Work功能

技术突破与社区反噬:AGI愿景下的现实落差

关于OpenAI内部人士对Codex与GPT界面差异的社交媒

尽管口碑崩塌,OpenAI在技术层面的野心并未掩饰。在发布后的AMA(Ask Me Anything)活动中,团队展示了GPT-5.6 Sol在数学证明上的惊人能力:利用64个子Agent在不到一小时内证明了悬置50年的“圈双覆盖猜想”。这一成果被OpenAI视为技术实力的有力证明,旨在展示其在复杂逻辑推理与自动验证方面的突破。

软件界面截图,展示了包含闪电标志、\'5.6 Sol Extr

数据显示,Codex的周活跃用户已突破500万,且在三个月内翻倍。Sol模型预计将迁移至Cerebras芯片,实现每秒约750 Token的处理速度。此外,Sol还参与了对小模型Luna的后训练过程,显示出其在模型迭代中的核心地位。这些技术进展表明,OpenAI在底层模型能力上确实取得了显著进步,尤其是在多Agent协作与复杂任务拆解方面。

OpenAI开发者官方账号发布的关于GPT-5.6和Code

然而,技术上的成功并未转化为产品层面的认可。Reddit社区中的高赞评论指出,用户怀念的是经典版ChatGPT中简洁高效的Projects与Memories功能,而新版不仅移除了这些流程,还将聊天功能边缘化,使其感觉更像是一个“伪IDE”。用户对于每月花费100美元订阅却得到功能倒退的体验表示极度沮丧。

关于ChatGPT新版桌面体验争议的论坛讨论截图,包含用户反

面对全网差评,OpenAI高层的态度显得谨慎而强硬。内部员工回应称,流量峰值是历史的两倍,团队正在全力维持服务稳定,并坚信打造AGI入口值得这一代价。CEO Sam Altman仅在社交媒体上表达了对用户喜爱5.6 Sol的“开心”,这种回避核心争议的策略被舆论解读为“鸵鸟战术”。这种态度虽意在维持产品迭代的战略定力,但在用户信任度急剧下滑的背景下,可能进一步加剧社区的对立情绪。

关于Linux Codex App推出时间的社区问答截图,包

结语与反思:AI产品化的必经阵痛还是战略失误?

社交媒体截图,包含关于ChatGPT Desktop和AGI

GPT-5.6及其超级App的争议,本质上是AI技术从实验室走向大众消费市场时的一次剧烈碰撞。OpenAI试图通过聚合功能来构建生态壁垒,打造类似操作系统的超级应用。然而,这一战略在执行层面忽视了用户认知的连贯性与操作的便捷性。

OpenAI CEO Sam Altman 关于 5.6 s

对于用户而言,AI工具的价值在于提效与简化,而非增加复杂性。当产品功能过于庞大,用户需要在不同的模式、档位、界面之间穿梭时,效率的提升可能被交互的成本所抵消。额度消耗的不可控与严重的安全事故,更是击穿了用户对AI代理的信任底线。

一条关于GPT-5.6 Sol Ultra解决数学猜想的社交

此次风波也为整个AI行业敲响了警钟。在追求模型智能突破的同时,如何设计合理的资源消耗机制、如何构建安全可靠的操作环境、如何尊重用户的使用习惯与认知逻辑,是AI产品化过程中不可回避的问题。OpenAI或许正在经历从技术驱动向产品驱动转型的阵痛,但如果不能及时回应社区的合理诉求,修复产品设计的缺陷,这种“世代级的豪赌”可能会演变为“世代级的失误”。毕竟,无论愿景多么宏大,最终决定产品生死的,始终是用户手中最真实的体验与口碑。

ChatGPT Work 界面截图,展示了侧边栏的任务列表、