端侧AI爆发:存算一体如何重塑家庭Token经济与新硬件范式

0 阅读

从云端到指尖:AI算力的结构性迁徙

过去十年,人工智能的叙事逻辑主要围绕“中心”展开——庞大的数据中心、昂贵的GPU集群以及以十亿美元为单位的资本投入。这种集中式的算力架构虽然强大,却伴随着高昂的传输成本、隐私泄露风险以及难以忽视的时延痛点。然而,随着2026年智能硬件市场的爆发,一种全新的计算范式正在悄然重构产业格局:算力正从集中的云端向分布式的终端设备大规模迁移。

在这一变革中,后摩智能及其核心的“存算一体”技术成为了关键变量。不同于传统芯片在存储与计算单元之间频繁搬运数据所导致的效率瓶颈,存算一体技术将计算直接嵌入存储内部,实现了数据“原地”运算。这种架构革新不仅解决了能效比的根本难题,更催生了诸如“巴掌大小的铝合金盒子运行千亿参数大模型”这类令人震撼的产品形态。当联想推出AI主机P7,长城电脑发布N90Pro AI PC时,一个名为“Agent Computer”的全新硬件品类正式成形,标志着AI应用入口的彻底下沉。

存算一体:打破冯·诺依曼架构的效率困局

要理解存算一体的颠覆性,首先需要审视传统冯·诺依曼架构的局限性。在传统GPU或TPU中,计算与存储分离,数据如同货物在仓库(存储器)和工厂(处理器)之间不断往返。在大模型时代,这种往返变成了每秒数十万次的极端拥堵,电力消耗和时间延迟成为不可承受之重。

后摩智能CEO吴强曾形象地比喻:GPU如同拓宽了高速公路的车道,但车还是要跑,油还是要烧;而存算一体则是直接在仓库里建工厂,数据无需移动即可完成运算。这种技术路线并非全新概念,早期多应用于低功耗场景(如耳机中的NOR Flash存内计算)。但后摩智能选择了一条更具挑战的路径:基于SRAM的纯数字存内计算,旨在大幅提升精度与算力密度。

从2020年创立到2026年量产,后摩智能M50芯片的演进历程印证了这一技术从学术概念走向商业落地的艰难与必要。M50芯片以仅10瓦的功耗实现了160TOPS的算力,能够流畅运行百亿至千亿参数的大语言模型。这种能效比的飞跃,使得在端侧部署高性能大模型不再是实验室里的玩具,而是具备大规模商业可行性的现实方案。

“免费Token工厂”:重构AI的经济模型

大模型普及带来的最大痛点之一是持续消耗的Token成本。云端推理遵循的是“用越多、付越多”的运营支出(OPEX)逻辑,这对于依赖订阅服务的B端企业或价格敏感型消费者构成了长期负担。特别是对于陪伴机器人等强隐私、高互动场景,云端方案不仅成本高昂,还面临数据隐私的合规挑战。

存算一体技术的商业化,正在将AI推理从“持续消耗”转变为“一次性投入”。当大模型在本地终端完成推理时,边际成本趋近于零。后摩智能提出的“免费Token工厂”概念,正是指通过端侧硬件买断,用户无需为每一次Token生成付费。这种经济模型的转变,有望将AI从一种云服务转化为类似家电的资本投入(CAPEX)。

尽管目前端侧芯片的成本仍处于下降通道,且尚未达到完全普及的临界点,但其带来的确定性收益已吸引大量客户。从联想、长城电脑到运营商的AI RAN边缘服务器,再到深圳涌现的Agent硬件创业公司,市场需求呈现出爆发式增长。尤其是对于注重隐私的高端陪伴机器人和智能终端,本地算力已成为提升体验的核心竞争力。

国产创新的非对称竞争策略

在半导体行业,中国厂商长期面临英伟达等巨头的生态压制。然而,存算一体赛道为中国企业提供了一个“换道超车”的战略机遇。与传统GPU路线不同,存算一体在国际上仍处于早期探索阶段,巨头如英伟达因历史包袱沉重,难以彻底推翻现有架构,更多采取改良或收购(如收购Groq)的策略。

后摩智能并未陷入“国产替代”的情感叙事,而是强调“国产创新”。其核心竞争力在于利用全新的技术架构,在特定场景下实现比肩甚至超越传统GPU的能效表现。这种非对称竞争策略,使得中国芯片在国际市场上具备了独特的性价比优势。特别是在海外市场,针对网络环境不佳或隐私要求极高的地区,无需联网、小巧智能的“本地Token工厂”具有极强的吸引力。

此外,随着多模态大模型的发展,端侧芯片的需求正从单一的大语言模型向视觉、语音等多模态融合迁移。后摩智能已布局针对Dense多模态模型的专用芯片,以应对未来更高的算力和带宽需求。这种对技术趋势的敏锐捕捉,进一步巩固了其在大算力存算一体赛道的领先地位。

未来展望:端云协同与生态壁垒

尽管端侧AI前景广阔,但并不意味着云端算力的终结。未来的主流模式将是“端云协同”:轻量级、低时延、隐私敏感的任务在端侧完成,而复杂训练或超大规模推理仍依赖云端。这种分工优化了整体系统的成本与性能平衡。

然而,挑战依然存在。端侧推理的生态壁垒不如云端训练深厚,竞争焦点将集中在持续的效率提升和技术迭代上。行业整合不可避免,未来端边算力芯片市场可能收敛至五家以内的头部玩家。对于后摩智能而言,最大的威胁或许并非来自现有巨头,而是来自采用全新颠覆性技术的新兴创业公司。

此外,要实现“家家户户拥有Token工厂”的愿景,仍需等待杀手级应用的爆发。只有当某一应用场景让用户产生强烈的本地算力依赖时,硬件成本的临界点才能真正被击穿。在此之前,如何平衡组织扩张与技术创新,如何在激烈的市场竞争中保持技术领先,将是所有从业者需要直面的长期课题。

这场从云端到端侧的迁徙,不仅是技术的演进,更是AI民主化的重要一步。它让算力变得触手可及,让隐私得到更好保护,也让AI的经济模型变得更加可持续。在这个新范式下,每一个家庭都可能成为一个智能的超节点,共同构建起分布式的人工智能未来。