国产算力效率突围:是石科技拓元工厂如何日吞吐千亿Token?

0 阅读

随着全球人工智能基础设施建设的加速,算力竞争的逻辑正在发生深刻的结构性转变。过去几年,行业关注的焦点集中在算力规模的扩张与硬件参数的堆叠上,然而,当中国智能算力总规模突破1000 EFLOPS大关后,单纯的硬件堆砌已无法直接转化为产业价值。真正的瓶颈在于:如何让昂贵的算力资源转化为稳定、高效且可量化的Token产出?在2026年世界人工智能大会(WAIC)上,清华系团队创立的是石科技给出了这一时代命题的新解法——推出国产Token优化工具“拓元”(Vectron)。这一举措不仅揭示了国产算力从“点亮”到“跑满”的技术路径,更标志着AI基础设施竞争正式进入以效率为核心的下半场。

国产算力的现实困境与效率觉醒

中国作为全球AI算力建设的重要阵地,已建成50多个智算中心,智能算力规模庞大。然而,数据揭示了一个不容忽视的现状:平均利用效率远未饱和。在许多实际运行场景中,“算不快”、“长上下文响应延迟”以及多模态任务下的性能衰减成为普遍痛点。这种低效不仅浪费了巨额的基础设施投资,更限制了AI应用向垂直行业的深度渗透。

是石科技创始人兼董事长闫博文在发布会上指出,算力基础设施的价值不在于芯片数量的简单累加,而在于能否将芯片、互联、内存、散热及软件栈整合为一个稳定高效的大规模系统。如果算力利用效率能提升10%至20%,即可释放出万亿级的算力价值空间。这一判断基于一个核心共识:AI发展的下一个阶段,不再是规模的竞赛,而是效率的角逐。在此背景下,“拓元”的诞生并非偶然,它是基于国家级计算中心工程经验积淀,针对国产异构算力特性量身打造的系统性优化方案。

拓元的核心架构:从单点优化到全链路融合

拓元不仅仅是一个单一的软件工具或模型,而是一套完整的AI基础设施优化体系。其核心设计理念在于打破底层硬件壁垒,实现从芯片到应用的超智融合全链路优化。

首先,在任务自适应优化层面,拓元引入了请求画像机制。系统能够根据推理任务的类型、复杂度及实时负载,动态匹配最优计算链路。这种精细化的资源分配策略,避免了传统模式下“一刀切”的资源浪费,确保每一颗算力核心的运算能力都能被精准调用。

其次,算子库的硬件专属融合编译是提升性能的关键。通过对不同国产芯片指令集的深度挖掘,拓元实现了算子的极致优化,充分释放硬件极限算力。这意味着国产芯片不再仅仅是“能用”,而是被挖掘出了最佳性能边界。

在模型与推理框架层面,拓元展现了强大的兼容性。它全面适配昇腾、昆仑芯、天数智芯、太初、瀚博半导体、摩尔线程、沐曦、燧原等10余种主流国产芯片,并兼容20余个主流大模型。通过异构深度调优,拓元成功打破了跨地域、多芯片的算力孤岛,实现了统一纳管与调度。这种能力使得企业无需因底层硬件差异而重构应用架构,极大地降低了AI落地的门槛与成本。

关键技术突破:解构长上下文与多模态难题

在具体的技术实现上,拓元针对大模型推理中的几个核心难点提出了创新性解决方案,这些突破直接指向了企业使用大模型时的成本与体验痛点。

KV Cache压缩技术:终结长文本的高昂代价

在大模型应用中,上下文长度的增加往往导致显存占用呈指数级增长,KV Cache(键值缓存)的累积成为制约长文本处理的主要瓶颈。传统方法多依赖静态规则或简单的阈值判断来筛选信息,但在动态变化的真实业务场景中,这种静态策略往往失效。

拓元提出了结果感知驱动的KV Cache压缩技术。该技术通过实时分析模型推理过程中的注意力分布与信息熵,动态识别并保留关键Token,压缩冗余信息。实验表明,在不牺牲模型生成效果的前提下,该技术能显著降低显存压力,使得长文本、大规模多轮对话等应用场景在经济上变得可行。这对于需要处理海量文档的企业知识库、复杂智能助手等场景具有重要意义。

全模态Token压缩:让AI学会“抓重点”

随着多模态大模型的发展,输入数据从纯文本扩展至图像、音频、视频等多种形式。然而,不同模态的数据密度与价值分布差异巨大,如何有效筛选关键信息成为新的效率挑战。

拓元在全模态场景下引入了基于模态自适应的免训练Token压缩方法。该方法针对不同模态的数据特性,自动识别并保留具有高信息密度的Token,去除无效或低价值信息。这种机制不仅减少了计算资源的消耗,还提升了模型对复杂多模态任务的理解能力。在多模态时代,能够“抓重点”的AI系统将具备更强的竞争力。

长上下文优化:百万级信息的高效处理

对于企业级应用,具备超长记忆能力的大模型往往面临训练成本高、推理速度慢的问题。拓元通过混合位置索引合成的长上下文偏好训练方法,以及记忆引导的重读机制,有效解决了这一难题。

该技术能够在远小于同类方法的训练数据量下,显著提升模型对长上下文的遵循能力与信息检索精度。此外,其提出的智能体长程任务记忆机制,通过目标导向的信息策略,突破了稀疏信息监测难、长程建模资源受限及注意力机制二次复杂度开销大的技术瓶颈。这使得智能体在执行复杂、长程的检索与推理任务时,能够保持更高的稳定性与准确性。

可靠深度推理:从人工调教到自我优化

传统大模型部署后,往往依赖大量人工反馈进行持续优化(RLHF),这不仅成本高昂,且难以规模化扩展。拓元提出的“基于元奖励的可扩展奖励建模方法”,实现了从“养模型”到“部署自优化系统”的转变。

该系统能够理解企业特定的业务标准与价值观,在复杂场景中持续输出符合预期的高质量结果。这种自我优化能力大幅降低了AI落地的运维成本,使得AI应用能够真正融入企业的核心业务流程,实现从辅助工具到核心生产力的跃迁。

清华系基因与商业化落地之路

是石科技的核心团队源自清华大学计算机系,具备深厚的国家级计算中心工程化经验。创始人闫博文及其核心成员在高性能计算、人工智能领域拥有多年深耕,构建了坚实的技术护城河。

目前,是石科技已服务超过200家重点客户,涵盖互联网大厂、头部大模型公司、航空航天、生物制药及新能源等关键行业。拓元的发布,标志着其技术能力完成了从实验室到标准化产品的关键一跃。通过提供兼容异构算力、统一调度管理的产品,是石科技正在填补国产芯片生态中“中间件”角色的空白,助力构建自主可控、高效可用的AI技术体系。

展望未来,随着“十五五”期间中国算力产业总投资的持续加大,算力效率将成为决定AI产业竞争力的关键因素。拓元所代表的优化能力,不仅有助于降低各行各业使用AI的成本,更将激发出更多的应用创新需求。正如闫博文所言,技术的终极目的是创造产业价值。当国产算力从“规模扩张”转向“效率深耕”,中国AI产业将具备更强大的全球竞争力,迈向更加智能化、高效化的新阶段。