物理AI破局:Om AI如何用流式多模态重构端侧智能架构?
从数字喧嚣到物理静默:2026年AI的价值锚点
站在2026年的夏天,人工智能行业的叙事重心正发生着深刻的位移。如果说2023年至2025年是生成式大语言模型在数字空间狂欢的“云端时代”,那么当下则是AI深入物理世界、与实体硬件深度融合的“地面时代”。在这一转折点上,物理AI(Physical AI)不再是硅谷实验室里的概念炒作,而是成为了全球资本与产业界争夺的高地。2026年上半年,全球物理AI领域单季度融资便突破64亿美元,这一数据背后,是工业机器人、自动驾驶、无人机乃至人形机器人向智能化跃迁的迫切需求。
然而,繁荣背后暗流涌动。行业对于物理AI的终极架构仍处于“寒武纪大爆发”般的探索期。以语言为中心的视觉语言动作模型(VLA)、以像素为中心的视频生成、以3D结构为中心的仿真引擎,以及以视觉表征为主的JEPA等路线并存且争议不断。在这一混乱而充满机遇的赛道中,Om AI联汇选择了一条少有人走的路——端侧原生流式多模态。其创始人兼CEO赵天成博士,用长达七年的时间验证了一个“反共识”的判断:在物理世界中,视频不是图像的集合,而是持续流动的河流。只有顺应这种“流式”特性,AI才能真正理解并介入物理现实。

重新定义物理AI:超越VLA与世界模型的迷思
在探讨Om AI的技术路径之前,必须先厘清物理AI的本质。目前市场上流行一种观点,认为VLA已死,世界模型将取而代之。这种二元对立的视角往往陷入技术名词的迷雾,却忽略了物理智能的第一性原理。
赵天成指出,真正的物理AI智能体必须具备四种核心能力,而非单一维度的突破。第一是语义认知,即识别物体及其属性;第二是几何感知,理解三维空间结构与深度;第三是决策执行,将认知转化为动作控制;第四是时序预测,基于前三者预判未来状态的发展。VLX(Vision-Language-X)模型的提出,正是基于对这四维能力的整合。其中,“X”代表无限的可能性,象征着模型在语义、几何、预测和决策上的通用性与延展性。

世界模型虽然热度极高,但其本质是在语义和几何理解基础上的新增能力,而非替代。如果基础的多模态交互能力缺失,所谓的“世界模拟”就如同空中楼阁。因此,Om AI并未陷入概念之争,而是回归本质,致力于构建能够同时处理语义、几何、动作与预测的通用底层架构。这种架构不仅要求模型“看懂”世界,更要求它“预判”世界,并在毫秒级时间内做出“行动”。
流式多模态:物理世界的唯一原生语言
为何Om AI坚决押注“流式”而非主流的“离线抽帧”?这源于对物理世界信息本质的深刻洞察。
在数字世界,信息的载体是文本,以Token为单位线性输入,处理逻辑是离散且批量的。然而,物理世界的原生信息流是视频。视频流中蕴含着巨大的冗余信息,同时也包含关键的时空动态特征。人类的视觉系统在观察世界时,并非每一帧都同等对待,而是通过注意力机制抓取重点,并基于连续的运动趋势进行预测。如果强行将视频流拆解为孤立帧进行处理,不仅计算资源浪费巨大,更会丢失时间维度上的因果关联,导致推理滞后与判断偏差。
“流式多模态”意味着模型像水流一样持续接收输入,实时进行感知与推理。这种架构对于物理AI至关重要,因为物理交互具有极高的实时性要求。例如,一架无人机在复杂环境中避障,或一个机器狗在不平路面上保持平衡,任何微小的延迟都可能导致灾难性后果。离线模型无法应对这种“流”的动态变化,而流式模型则能实现“持续感知+精准定位+行动决策”的闭环。

Om AI的VLX系列模型,从Day 1便针对端侧算力约束进行了架构创新。它打破了传统大模型对云端算力的依赖,将复杂的推理能力下沉至边缘端。通过Flow、Seek、Go三层能力定义,VLX在同一条视频流上实现了不可分割的能力融合,而非三个独立模型的拼凑。这种原生的流式处理机制,使得模型在面对开放、动态的物理场景时,展现出远超传统小模型的泛化能力。

端侧智能:分布式安全与商业落地的必然选择

尽管云端大模型拥有强大的算力,但在物理AI的终局图中,端侧智能(Edge AI)具有不可替代的战略价值。

首先,安全性是物理交互的红线。云端模型一旦出现故障,可能导致机器人摔落、车辆失控等严重后果。物理世界的容错率极低,任何“黑天鹅”事件都可能带来不可逆的损失。因此,物理终端必须具备独立、快速、安全的本地决策能力,形成分布式的智能网络,而非依赖单一的云端“大脑”。这种去中心化的架构,符合物理世界的去中心化本质,也规避了单点故障的风险。
其次,带宽与延迟的物理瓶颈限制了云端方案的普及。数以亿计的摄像头、机器人、无人机产生的视频数据量是天文数字,将所有数据上传至云端处理不仅成本高昂,且网络延迟无法满足实时交互需求。端侧原生模型通过模型压缩、架构优化,在有限的算力下实现高性能推理,成为规模化落地的唯一路径。
Om AI的商业逻辑正是建立在这一认知之上。其采取“一脑多形”策略,将成熟的端侧多模态能力赋能于从成熟硬件(如AI PC、安防摄像头)到新兴本体(如无人机、机器狗、人形机器人)的各类终端。这种策略不仅加速了市场教育,更通过硬件成熟度的梯度递进,实现了技术的平滑过渡与规模化变现。目前,Om AI已在工业物联、内容创作、安防监控等领域实现以亿为单位的营收,完成了从技术验证到PMF(产品市场契合度)的商业闭环。

数据飞轮与长期主义:构建深层护城河
在AI行业,技术迭代速度极快,但数据积累却是难以逾越的壁垒。Om AI的核心竞争优势,不仅在于流式多模态的架构创新,更在于其构建的数据飞轮效应。
由于端侧模型在真实物理场景中持续运行,每一次交互、每一个决策都产生了宝贵的真实世界数据。这些数据反馈回云端,用于模型的迭代优化,进而提升端侧模型的性能,形成正向循环。赵天成坦言,Om AI自2018年起便深耕多模态研究,比大多数竞争者早了三到四年。这段漫长的沉淀期,使其在模型训练、场景探索和数据处理上建立了深厚的先发优势。
这种“长期主义”在早期曾面临巨大的市场质疑。当行业追逐生成式AI热潮时,Om AI坚持不做纯文本模型,不追短期风口,而是死磕视觉与语言的深度融合。核心团队的稳定性与创始人的定力,使得公司在技术路线上始终保持专注。2023年,Om AI意外发现其多模态模型在监控卫生管理等开放场景中,泛化能力远超传统CV小模型。这一“无心插柳”的案例,进一步坚定了其押注物理AI的信念。
此外,开源策略也是Om AI构建生态的重要手段。通过开源VLX系列模型,公司不仅展示了技术自信,更吸引了全球开发者社区的反馈与支持。用户的实际应用场景与痛点反馈,成为模型迭代的重要驱动力。这种开放共生的模式,加速了标准的形成与行业的普及,使得Om AI在物理AI生态中占据了枢纽地位。
展望:从技术深耕到全球竞争
随着VLX-Seek 1.5及VLX-Go等新一代模型的发布,Om AI在轻量化端侧部署与高性能应用之间找到了更好的平衡点。其在准确性、效率、可靠性及部署灵活性上的全面提升,标志着物理AI正从实验室走向规模化商用。

展望未来,物理AI的竞争将是生态与算力的双重博弈。Om AI凭借其原生的流式架构、丰富的数据积累以及成熟的端侧落地经验,有望在全球市场中占据一席之地。特别是在海外市场,中国企业在端侧多模态领域的技术优势,有望转化为产品力优势,实现业务全球化。
然而,挑战依然存在。物理世界充满了长尾场景与不确定性,模型泛化能力的提升永无止境。此外,商业模式也需要不断迭代,从单纯的订阅制向按效果付费、价值分润等创新模式演进。
Om AI的故事,是一个关于判断力、定力与执行力的商业样本。在瞬息万变的AI时代,跑得快或许能赢得一时,但看得远、守得住,才能抵达终局。当物理AI从概念验证期迈入场景验证期,那些真正理解物理世界本质、坚持长期技术投入的企业,将成为重塑人类生产生活方式的关键力量。Om AI的流式未来,或许正是物理智能时代的一个缩影:在流动中感知,在实时中决策,在端侧中进化。