2026年9月3日AI大模型日报:Gemini 3.8 Flash发布,Anthropic缓存降价75%
今日重点动态
Google三周内再推新模型,直指编码与企业智能体
Google在9月2日发布了Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两个版本,距离上一次模型更新仅三周时间。据《华尔街日报》报道,新模型在编码能力上有显著提升,“明显缩小了与领先者的差距”。

官方将Gemini 3.8 Flash定位为“迄今最智能的Flash模型”,专为长时程软件工程、自主智能体和复杂企业工作流设计。该模型已向Glean客户开放持续推理能力。而Cyber版本则聚焦网络防御场景,呼应当前行业向“AI防守”转型的趋势。
这一快速迭代节奏表明,Google正将资源集中于编程智能体和企业级应用两大战场,试图在OpenAI和Anthropic占据优势的领域夺回主动权。
Anthropic缓存价格大降75%,被视作加入价格战
Anthropic在9月1日正式上线Claude Fable 5.1,并同步调整了定价策略:缓存读取价格从原来的每百万token $1.00降至$0.25,降幅达75%。这意味着在高Agent负载场景下,用户成本最高可降低约45%。
值得注意的是,Fable 5.1的输入/输出基础定价仍维持$10/$50不变,但缓存机制的优化让长期对话和重复查询的成本大幅下降。这种“不动表价、动结构”的策略,既避免了直接降价引发的恶性竞争,又实质性降低了用户使用成本。
与此同时,Fable 5.1在Terminal-Bench-Science基准上的得分从Fable 5的24.7跃升至52.6,性能翻倍。Anthropic还推出了面向网络防御和生命科学领域的可信访问版本Mythos 5.1,体现其对前沿能力进行分级管控的思路。
OpenAI生态继续扩张,GPT-5.3 Instant成默认模型
OpenAI在9月1日开始将GPT-5.3 Instant作为ChatGPT的默认日常模型推送。官方表示,新版改进了回复语气,减少了“卖关子式”的表述,更注重日常场景的准确性而非炫技。
在企业市场方面,GPT-5.6家族(Sol/Terra/Luna)已于9月2日上线Amazon Bedrock。澳大利亚团队现在可以通过悉尼和墨尔本区域的“全球跨区域推理”功能访问这些模型,进一步扩大了OpenAI在亚太地区的覆盖范围。
此外,GPT-5.3-Codex作为专门的agentic编程模型,运行速度比前代快约25%。与Cerebras合作的Spark版本则继续在低延迟编程赛道推进,满足对实时性要求极高的开发场景。
行业并购与安全议题升温
Palo Alto Networks高价收购智能体初创公司
网络安全巨头Palo Alto Networks以约5亿美元(现金加股票)的价格收购了智能体IT支持初创公司Console。这一价格远高于Console此前1.57亿美元的估值,溢价超过三倍。
Console的核心技术是利用AI智能体自动处理企业IT支持请求,如密码重置、软件安装、故障排查等。收购完成后,Palo Alto计划将其整合到现有的Prisma Cloud和Cortex XSOAR平台中,打造端到端的自动化安全运维体系。
这笔交易释放出明确信号:Agentic AI已进入并购整合期。头部企业不再满足于自研,而是通过收购快速获取垂直领域的智能体能力。此前Cognition Labs估值已达470亿美元,也印证了市场对编程智能体的高度认可。
平台大厂纷纷设立“网络超级智能实验室”
随着进攻型AI能力加速进化,防守型AI的紧迫性日益凸显。除了Google推出Gemini 3.8 Flash Cyber、Anthropic发布Mythos 5.1外,多家平台大厂内部已设立专门的“网络超级智能实验室”。
这些实验室的目标很明确:利用大模型实时分析网络流量、识别异常行为、自动响应攻击,并生成防御策略。传统基于规则的安全系统难以应对AI驱动的新型攻击,而大模型的推理和泛化能力恰好能弥补这一短板。
OpenAI、Anthropic和Google此前曾联合呼吁,将网络安全列为AI发展的首要优先级。如今,这一共识正快速转化为产品和组织架构的实际落地。
算力需求持续火爆,供应仍是瓶颈
黄仁勋G20呼吁加快数据中心建设
英伟达CEO黄仁勋在G20数字部长会议上发出警告:“只谈AI风险而不建设基础设施是危险的。”他敦促各国政府加快数据中心审批流程,简化电力接入,并投资液冷等新型散热技术。
这一表态背后是现实的供需矛盾。HPE最新财报显示,其第三季度营收同比增长34%至122亿美元,并新签了35亿美元的服务器大单。但公司同时承认,受GPU和其他关键组件供应约束,无法完全满足市场需求。
算力需求正由训练和推理双轮驱动。一方面,模型参数量和上下文长度持续增长;另一方面,Agentic AI的普及使得推理负载呈指数级上升。这种双重压力下,数据中心、电力、网络等基础设施已成为制约AI发展的关键瓶颈。
国内厂商保持高密度更新
中国AI力量在9月初继续保持高强度迭代。阿里Qwen3.8-Flash-Next在8月26日发布,基于Qwen4架构,自报DeepSWE得分58.7;智谱GLM-5.3-Flash同日上线,作为首个原生多模态GLM-5模型,定价激进($0.15/$0.50),自报DeepSWE得分63.4。
DeepSeek-V4-Pro在8月13日推出正式版,采用1.6T参数MoE架构,支持百万上下文,并首创峰谷定价(闲时半价)。月之暗面Kimi的开发商Beijing Lab估值已达200亿美元,吸引全球资本目光。
这些进展表明,中国AI厂商不仅在追赶国际先进水平,还在定价策略、开源模式、应用场景等方面探索差异化路径。
编码能力竞赛进入白热化
周级迭代成新常态
过去一个月,主流厂商在编码能力上的竞争已进入“周级迭代”节奏。Google三周内两次更新Gemini Flash系列;Anthropic Fable 5.1在Terminal-Bench-Science上的得分翻倍;OpenAI GPT-5.3-Codex速度提升25%;智谱GLM-5.3-Flash自报DeepSWE得分63.4。
《华尔街日报》等主流财经媒体开始用“缩小编码差距”来描述这一竞争格局,说明编程能力已成为衡量大模型实用价值的核心指标。企业用户越来越关注模型能否真正替代程序员完成实际开发任务,而非仅停留在聊天或内容生成层面。
评测基准转向真实任务
传统SWE-bench等静态代码补全基准正在被Terminal-Bench-Science、DeepSWE、SWE-Pro等agentic/真实场景基准取代。这些新基准要求模型在终端环境中执行完整开发流程:理解需求、编写代码、调试错误、部署测试。
目前各厂商公布的分数多为自报数据,缺乏第三方统一验证。但可以预见,未来几个月将出现更多独立评测机构对这些“真实任务”能力进行横向对比,帮助用户做出理性选择。
开源与闭源策略持续摇摆
Meta近期的动向引发社区关注。The New Stack报道称,Meta正从开源Llama转向闭源Muse Spark;而Axios早前披露的消息则称,Meta计划开源下一代模型以追赶对手。两条看似矛盾的信息,反映出公司在开源与商业化之间的艰难平衡。
相比之下,中国厂商在开源方面更为坚定。Qwen4架构已发布开源预览版;GLM采用MIT许可证开放权重;DeepSeek全系模型保持开源。这种策略既吸引了开发者生态,也为国产模型在全球范围内建立了技术影响力。
开源分叉填补缺口的现象也开始出现。当官方停止更新某个开源模型时,社区会自发维护和改进分支版本,确保技术延续性。这种去中心化的协作模式,或许将成为AI开源生态的新常态。