商汤林达华:为何多模态是AI Coding之后的下一个决胜战场?

0 阅读

在人工智能技术迭代的浪潮中,大语言模型(LLM)的崛起无疑重塑了内容创作的边界。然而,当文本生成能力趋于饱和,技术发展的下一站究竟指向何方?在2026年世界人工智能大会(WAIC)期间,商汤科技首席科学家林达华提出的“盆景之问”,为这一困惑提供了极具洞察力的答案。他指出,人类能用语言清晰描述一盆盆景每一片叶子的精确位置吗?答案往往是否定的。这种感知细节与语言表达之间的鸿沟,正是当前纯文本大模型面对真实物理世界时无法逾越的隐形边界。

这一观察直击痛点,也揭示了商汤战略转向的核心逻辑:多模态,特别是视觉与语言的深度融合,才是AI从“认知”走向“行动”、从“数字世界”迈向“物理世界”的必经之路。商汤并未盲目追随AI Coding的热潮,而是基于对技术本质的深刻理解,选择了一条更为硬核但更具长远价值的道路——从底层重构语言与视觉的统一基座。

为什么多模态是Coding之后的下一个战场

当前,AI编程助手在开发者社区中广受欢迎,商业化路径相对清晰。然而,林达华敏锐地指出,纯文本代码生成的天花板正在显现。无论代码逻辑多么严密,由AI生成的前端界面往往缺乏“苹果级”的高级审美与空间美感。这是因为高级的设计感与空间布局无法仅通过文本逻辑推导实现,这是纯文本模态的天然盲区。

行业巨头的动向也印证了这一趋势。以Anthropic为例,其在Opus 4.8版本中显著强化多模态能力,表明当后端逻辑代码能力趋同、价格战白热化时,竞争高地必然向用户体验、视觉交互前端转移。对于商汤而言,与其在纯文本领域进行同质化竞争,不如发挥其在计算机视觉领域多年积累的绝对优势,切入AI设计与视觉交互的新赛道。

关于人机交互的终极形态,业内存在一种观点认为未来的AI Agent将回归纯文本命令行(CLI)交互。林达华对此持反对意见。他认为,CLI是面向机器的语言,而视觉交互才是面向人类体验的核心载体。无论是办公汇报、海报设计,还是游戏开发、影视制作,高频的大众场景本质上都离不开视觉。因此,打造能在物理世界中思考、行动的“全能智能”,必须打破模态壁垒,让视觉与语言在底层大脑中融为一体。

这种融合并非易事。语音和文本属于同构模态,映射相对直接;而视觉与语言是完全异构模态,像素无法简单对应文字词元。攻克异构模态的深度融合,是多模态领域长期以来的核心难点,也是商汤选择“原生统一架构”的根本原因。

从“拼接”到“原生”:U1 Pro的技术突破

长期以来,多模态大模型的主流路线是“拼接式架构”,即在成熟的大语言模型外挂独立的视觉编码器(VE)。这种方式虽工程门槛低,但本质是将图像“翻译”成文本,导致精细化感知细节丢失,视觉与语言的融合效率低下,并非真正的“看见”。

商汤团队坚持长期主义,致力于消除这种翻译带来的信息损耗。2025年,团队联合南洋理工大学S-Lab率先验证了原生融合的设想,并于同年9月发表论文,系统阐述了彻底移除视觉编码器、建立深层融合的原生多模态NEO架构。2026年3月,商汤正式发布原生统一架构NEO-unify,彻底移除了主流的视觉编码器和变分自编码器。

支撑NEO-unify运转的是商汤自研的Mixture-of-Transformers(MoT)架构。在这一架构下,语言和视觉信息在模型的每一层计算中完成深度交融,而非简单的后期拼接。这种从架构层面的重构意义深远,其效率令人瞩目:NEO-unify仅使用3.9亿图像文本示例(约为业界同等性能模型数据量的1/10),便涌现出了顶尖的视觉感知和推理能力。

基于此架构开源的SenseNova U1模型,展示了真正的“图文交错思维链”能力,能在同一上下文中写字边插图,确保图文在风格与逻辑上高度一致。而在2026年7月推出的商用旗舰模型SenseNova U1 Pro,更是将这一能力推向新高度。它直接输出高达原生8K顶级画质成片,在设计领域具备了对标全球顶尖模型的实力,标志着多模态技术从实验室走向深水区的关键一步。

用“魔鬼题库”炼成专业设计师

市面上能画出精美图片的AI不少,但在复杂的商业设计场景中,许多模型显得力不从心,难以处理密集信息排版和长需求描述。“画画”靠的是审美概率,而“设计”靠的是精准的逻辑与控制。为了让U1 Pro具备专业设计能力,商汤构建了一个规模过亿、甚至逼近数十亿级别的超大型“多模态题库”。

这些数据并非天然存在,而是通过超级Agent驱动的自动化数据合成管线人工与算法精准创造而成。在这些高阶数据中,单张设计图对应的文字描述长达上千字。训练过程分为三个阶段:预训练阶段吞吐数十亿级图文数据打下认知地基;持续预训练阶段利用高比例合成数据高强度拉升专业能力;后训练阶段精选千万级黄金数据进行精雕细琢,沉淀成品级交付质感。

林达华强调,核心技术的突破是一场坚守长期主义的马拉松。商汤摒弃外界杂音,以坚定的战略定力进行饱和投入,旨在改变行业底层范式,而非追逐短期流量热点。这种对数据极端严苛的需求,直接映射在U1 Pro的训练流中,使其具备了超越普通生图工具的逻辑控制力。

70%交付率:打通商业化的最后一公里

AI设计走向高端商业化的核心瓶颈在于“交付率”。学术界可能容忍100个字中出现1个错误,但在真实商业世界里,一张海报错一个字就是废纸。林达华指出,评判多模态模型优劣的唯一标尺就是交付率——即生成内容无需大幅修改,可直接付费给专业设计师的标准。

U1 Pro的最新交付率数据稳定在70%。这一数字虽然看似不高,但在全球范围内,只有商汤U1 Pro和OpenAI的GPT-Image-2超越了60%的商业可交付基准线。70%的交付率背后是严苛的全维度品控:文字错误率控制在千分级,图形元素、空间布局、色彩搭配等细节错误同步控制在千分级。

实现这一突破的核心在于商汤独创的“视觉拆解思维链”学习模式。模型被训练成“会思考的设计师”,在训练过程中,先自动拆解高质量海报的全部视觉组件,逆向推理设计师的版式布局逻辑与色彩搭配思路,生成完整设计思维链。这使得模型不仅学形似,更抓思路、抓神韵。

在生成阶段,U1 Pro采用多轮智能体生成闭环:首先基于文本需求拆解信息并规划版式,形成设计方案;其次依靠内生能力完成全图生成;最后启动全局自检,识别文字错误、布局瑕疵与审美问题,反向迭代修改,直至符合交付标准。此外,商汤组建了一支由200名美院学生和专业设计师组成的“人类审美团”,通过大规模找茬和打分,打磨出模型的“高级感”。

从二维设计到三维世界模型的演进

U1 Pro的定位虽为设计师,但其技术底座已展现出更广阔的潜能。林达华透露,U1 Pro已具备初步的空间推演能力,甚至能玩魔方,这意味着它正在触摸三维世界的边缘。在商汤的“1+X”战略下,世界模型、具身智能(如大晓机器人的“开悟”模型)均被视为多模态底座上的自然分支。

与此同时,商汤发布的视觉大模型SenseNova-Vision,让视觉成为通用基础模型的原生能力,在目标检测、图像分割、3D重建等任务上超越了专用模型,展示了视觉作为通用基础的强大延展性。

展望未来,商汤下一代模型U2将真正走向三维,融入视频的理解与生成,实现感知、理解、生成、行动的一体化。终极形态将是模态从视觉、语言扩展到几十种传感器信号,构建完整的“世界模型”。尽管物理规则复杂、数据组合量级指数级暴涨,林达华认为未来可能通过对世界属性进行解耦,拆分出专用子模型协同推理来突破瓶颈。

当被问及最想攻克的下一个技术山头时,林达华毫不犹豫地回答:“物理世界的AGI。”这一愿景不仅体现了商汤对多模态技术本质的深刻洞察,也昭示了AI从数字空间迈向物理现实的未来路径。在这场充满未知的科学马拉松中,多模态不仅是技术演进的下一个战场,更是构建通用人工智能的关键基石。