国产算力效率革命:是石科技拓元如何榨干千亿Token算力潜能
中国人工智能基础设施的建设正迎来一场深刻的范式转移。过去几年,行业关注的焦点主要集中在智算中心的规模扩张与芯片数量的堆叠上,智能算力总规模已突破1000 EFLOPS,拥有超过50个大型智算中心。然而,随着“十五五”期间预计7万亿元的算力产业投资落地,单纯的硬件堆砌已触及边际效益递减的天花板。真正的瓶颈不再是有多少张显卡,而是如何让这些显卡真正跑出可用的价值。在这一背景下,清华系团队旗下的是石科技在WAIC 2026上发布了一款名为“拓元”(Vectron)的国产Token优化工具,其核心主张极为明确:让每一份算力都转化为有效Token。这不仅是技术层面的优化,更是对中国AI算力经济模型的一次重新定义。
当前中国算力市场面临着一个显著的结构性矛盾:一方面,国产芯片种类繁杂,昇腾、昆仑芯、天数智芯、太初、瀚博半导体、摩尔线程、沐曦、燧原等十余种芯片各自为战,形成了一个个算力孤岛;另一方面,大模型应用对长上下文、多模态处理的需求激增,导致显存压力与推理成本呈指数级上升。传统解决方案往往依赖于增加硬件投入来缓解性能瓶颈,但这在大规模集群中既昂贵又低效。是石科技提出的解法,不是制造更多的芯片,而是通过软件栈与算法的深度融合,构建一套完整的AI Infra优化体系,即“拓元”。这套系统旨在打通从底层芯片到上层应用的全链路,将国产大集群从简单的“点亮”状态推向“跑满”的高效状态。
拓元的核心竞争力在于其对异构算力的统一纳管与深度调度能力。在真实的商业场景中,企业往往混合部署多种国产芯片,而传统的调度平台难以跨越硬件差异进行高效资源分配。拓元通过任务自适应优化机制,能够根据请求画像自动匹配最优计算链路。这意味着,对于不同类型的推理任务,系统可以动态分配最合适的算力资源,避免“一把抓”带来的资源浪费。更关键的是,它在算子库层面进行了硬件专属的融合编译优化,充分释放了每颗国产芯片的极限算力。这种“榨干”芯片性能的做法,使得不同厂商的芯片能够在同一个算力池中被统一管理,实现了极高的业务并发量,每日Token吞吐量达到千亿级别。
长上下文处理是大模型落地应用中的另一大痛点。随着应用场景向知识库检索、复杂逻辑推理延伸,模型需要处理百万级甚至更长的文本序列,这导致KV Cache(键值缓存)占用显存急剧增加,推理成本难以控制。传统的方法多依赖输入阶段的静态信息价值判断,但在动态变化的业务场景中,这种策略往往失效。拓元引入了结果感知驱动的KV Cache压缩技术,在不牺牲模型输出质量的前提下,显著降低显存占用。这项技术基于对模型最终输出结果的反向追踪,动态识别并保留关键Token,舍弃冗余信息。对于企业而言,这意味着可以使用更少的显存资源运行更大的模型,或者在相同的硬件条件下支持更长的上下文窗口,从而大幅降低长期运营的边际成本。
除了显存优化,拓元还在全模态推理和智能体记忆机制上进行了创新。在多模态场景中,文本、视频、语音等不同模态的数据密度和重要性差异巨大。拓元提出了基于模态自适应的免训练Token压缩方法,能够自动筛选出具有最高信息熵的关键Token,减少无效计算。此外,针对智能体(Agent)在执行长程复杂任务时容易出现的“记忆丢失”或“幻觉”问题,拓元设计了目标导向的信息记忆策略。这一机制突破了稀疏信息监测难、长程建模资源受限的瓶颈,通过记忆引导的重读机制,确保模型在长时间推理过程中能够准确判断哪些信息已被丢弃,哪些是缺失的关键线索。这使得AI系统能够从被动响应指令,转变为具备自我优化和持续学习能力的智能体,显著降低了人工反馈与调优的成本。
从技术演进的角度来看,拓元的发布标志着国产AI基础设施进入了“软硬协同优化”的新阶段。此前,国产芯片的性能释放往往受限于生态适配与软件栈的成熟度。是石科技依托国家级计算中心的工程经验,构建了深厚的技术护城河,其核心团队成员来自清华大学计算机系、航院等顶尖学术机构,具备大规模集群稳定运营的实际经验。这种产学研用的深度结合,使得拓元不仅仅是一个理论上的优化方案,而是经过数百个重点客户验证的产品级解决方案。目前,其已适配20余个主流模型,覆盖了互联网大厂、航空航天、生物制药等多个高门槛行业。
这一产品的出现,对国产算力生态具有战略意义。它充当了国产芯片与上层应用之间的关键“中间件”,屏蔽了底层硬件的异构差异,使得上层开发者无需关心底层是昇腾还是华为海思,只需关注业务逻辑本身。这种标准化与抽象化的能力,加速了国产算力生态的成熟与普及。当算力调度变得如云计算般透明且高效时,中小型企业也能以更低的成本调用强大的AI算力,从而激发出更多创新的应用需求。据测算,如果整体算力利用效率提升十到二十个百分点,将释放出万亿级的算力价值空间。这不仅是技术胜利,更是经济账本上的巨大突破。
在AI基础设施的竞争下半场,决定胜负的关键已不再是单一的参数指标,而是系统级的稳定性、兼容性与能效比。是石科技通过拓元,证明了通过软件定义算力、算法优化硬件的可行性。这种从“拼卡数”到“拼效率”的转变,正是中国AI产业从粗放式增长迈向高质量发展的必经之路。未来,随着大模型向通用人工智能(AGI)演进,对算力的精细化需求将更加苛刻。拓元所代表的Token优化思路,或将引领行业建立起一套新的效能标准,让中国的算力不仅“大”,而且“精”、“准”、“稳”。对于整个产业链而言,这意味着算力基础设施将从一种消耗性资源,转变为一种可精确度量、高效流转的核心生产要素,为国产AI的全球化竞争提供坚实底座。