推理成本倒逼技术重构:中昊芯英须臾芯片与国产TPU集群的杭州样本

0 阅读

推理经济学的崛起:专用架构的回归

当人工智能的浪潮从模型训练的狂欢转向推理应用的落地,算力市场的底层逻辑正在经历一场深刻的重构。在过去十年间,通用图形处理器(GPU)凭借其在图形渲染领域的积累和CUDA生态的护城河,主导了AI计算的大部分场景。然而,随着大语言模型(LLM)从实验室走向大规模商业部署,成本结构发生了显著变化。训练阶段是一次性的高额资本支出,而推理阶段则转化为持续发生的运营支出,用户每次交互消耗的Token都直接关联着计费账单。

这种成本压力的传导,迫使业界重新审视专用集成电路(ASIC)的价值。TPU(张量处理单元)早在2016年由谷歌推出时,便确立了“牺牲通用性以换取特定任务高能效”的设计哲学。如今,在智能体(Agent)反复调用模型、长上下文窗口增加输入负载的背景下,单位Token的性价比成为衡量算力价值的核心指标。国产芯片厂商不再盲目追求通用算力峰值,而是转而寻找更具体的落地场景,试图在模型适配、集群稳定性和调用成本之间找到最优解。

中昊芯英发布的第二代自研TPU芯片“须臾”,以及随之落成的华东首个国产TPU千卡集群,正是这一趋势下的典型产物。这不仅是一次硬件迭代的展示,更是对国产算力生态能否在推理密集型负载中站稳脚跟的一次实战检验。

架构演进:PD分离与资源精细调度

当前大模型推理面临的一个核心痛点,是负载的不均衡性。传统上,模型的预填充(Prefill)阶段和逐Token解码(Decode)阶段在同一套资源中运行。Prefill阶段需要处理巨大的输入上下文,对内存带宽和并行计算能力要求极高,但计算密度相对较低;而Decode阶段则是逐字生成,计算密度高,但对延迟和持续输出能力极为敏感。若将两者混合调度,往往导致部分计算单元闲置,而另一部分则排队等待,造成整体效率低下。

中昊芯英创始人杨龚轶凡指出,推理正在走向PD分离。这一架构调整允许集群将资源划分为不同的逻辑区域:一部分资源专攻高速上下文处理,另一部分资源专注于低延迟持续输出。这种解耦带来了配置上的灵活性,使得系统能够针对不同类型的负载进行精细化调整,从而显著提升整体吞吐量。

TPU之所以在此时重新回到台前,正是因为它天生契合这种专用负载。与GPU从图形处理转型而来不同,TPU从诞生之初就瞄准深度学习中的张量运算。它通过专门的矩阵乘法单元和高效的内存层级结构,在固定算法流程中实现了极高的数据复用率。对于国内而言,虽然GPU生态依然占据主导,但在推理这一特定细分领域,专用架构在能效比上的优势日益凸显,为国产芯片提供了弯道超车的潜在机会。

须臾芯片:硬件重构与生态适配

中昊芯英第二代芯片“须臾”的具体性能指标展示了其在硬件层面的突破。据悉,该芯片混合精度浮点算力达到896TFLOPS,8-bit推理算力高达1792TOPS,整体性能约为上一代的三倍,同时单芯片额定功耗控制在600W。这一数据背后,是公司在计算流水线、封装技术和存储架构上的系统性重构。

中昊芯英联合创始人兼CTO郑瀚寻将性能提升归因于三项关键硬件调整:首先是计算流水线的深度重构,优化了数据流向以减少等待周期;其次是采用双芯粒同基板封装技术,提升了集成密度和信号完整性;最后是片上存储容量和带宽的大幅提升,缓解了内存墙问题,确保计算单元不会因数据供给不足而空转。

然而,硬件性能的飞跃仅是第一步。在AI芯片行业,从“可用”到“好用”之间横亘着漫长的工程化鸿沟。模型适配不仅仅是代码的移植,更涉及算子优化、编译工具链调试以及调度策略的调整。目前,中昊芯英已完成对通义千问(Qwen)、DeepSeek、GLM等主流开源模型的基础适配。这意味着开发者可以在这些模型上初步跑通训练和推理流程,但要实现生产环境下的高吞吐、低延迟和高性价比,仍需在软件栈层面进行持续的迭代与打磨。

集群落地:异构环境下的系统集成挑战

技术的最终价值体现在规模化部署中。此次在杭州落成的千卡集群,由杭州电信、中兴通讯和中昊芯英三方共建,是中国电信体系内首个大规模国产TPU集群部署项目。这一合作模式具有典型意义:芯片厂商提供核心算力,设备商解决网络和系统集成问题,运营商则负责将底层算力转化为面向企业的服务。

运营商角色的转变也是观察这一案例的重要视角。过去,电信运营商主要提供服务器、存储和带宽租赁;如今,随着企业对AI应用需求的深化,直接获取模型调用能力或按Token购买服务成为新趋势。杭州电信并未将TPU视为唯一选择,其现有算力池中依然保留GPU资源,并探索其他国产芯片路线。未来的智算中心将长期保持异构状态,GPU处理复杂通用任务,TPU专注高能效推理,运营商通过统一的调度平台将异构资源组织起来,屏蔽底层硬件差异。

这种异构调度对系统集成能力提出了极高要求。中兴通讯在集群建设中承担了关键的网络和系统集成功能。随着集群规模从千卡向万卡扩展,芯片间的通信带宽成为制约整体效率的新瓶颈。计算能力的提升速度远超网络存储和散热技术的进步速度,如何确保万卡集群下的线性加速比,是智算中心走向规模化后绕不开的难题。

从杭州样本看国产算力未来

杭州电信透露,经过数月的软硬件联合调优,该TPU集群的Token输出效率较年初提升了超过10倍。这一数据并非单一芯片性能的提升,而是模型版本迭代、算子实现优化、服务器配置调整、网络带宽扩容以及调度策略改进共同作用的结果。它印证了一个事实:专用芯片的价值往往建立在完整的软硬件体系之上。

对于国内AI芯片产业而言,单点技术的突破已不再是最大障碍,全产业链的协同能力成为关键。中昊芯英与杭州电信、中兴通讯的合作,提供了一种可复制的生态构建范式:芯片厂商专注于核心算力架构的创新,设备商致力于解决大规模互联与系统集成,运营商则发挥其场景优势和客户基础,推动算力服务的商业化闭环。

这一样本表明,国产TPU在推理场景下具备与GPU竞争的实力,尤其是在对成本和能效敏感的大规模部署中。尽管生态迁移门槛依然高昂,但随着主流模型的持续适配和调度平台的成熟,国产专用芯片有望在AI推理市场占据重要一席。未来,随着更多此类异构集群的落地,中国的人工智能算力基础设施将更加多元、高效且具备韧性,为千行百业的智能化转型提供坚实底座。