合肥再出奇招:智象未来3月融资21亿,押注原生全模态为何赢?
资本风向标:从LLM泡沫到视觉赛道的理性回归
2026年盛夏,人工智能领域迎来了一次罕见的资本共振。7月23日,智象未来(HiDream.ai)宣布完成15亿元C轮融资,这是其在近三个月内完成的第三轮融资,累计融资金额突破21亿元,估值正式跨越10亿美元门槛,跻身全球AI独角兽行列。
这一事件的标志性意义,远不止于数字本身。更值得玩味的是其背后的投资方阵容:社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,合肥产投等老股东持续加注,同时吸引了上影新视野、华策影视等产业资本入局。这种国家级资金、地方国资、市场化VC与产业方罕见扎堆的现象,揭示了当前一级市场对AI技术路线判断的深刻分歧与共识重构。
过去两年,资本疯狂追逐大语言模型(LLM),参数规模成为唯一的估值锚点。然而,随着开源模型的普及和头部企业技术差距的缩小,单纯依靠文本生成能力的溢价空间急剧收缩。市场开始意识到,LLM本质上是“符号系统内的思想者”,其智能被限制在人类已编码的知识范畴内。当“做大模型”不再等同于高确定性回报时,资金开始寻找新的阿尔法收益源。
此时,多模态赛道,尤其是具备物理世界理解能力的视觉模型,成为了新的共识高地。2026年国内AI视觉领域融资总额逼近300亿元,大厂动作频频,独立创业公司接连落地大额融资。智象未来的爆发,正是踩中了这一范式切换的关键节点。资本不再是盲目追逐热点,而是基于对技术底层逻辑的重新评估,进行精准的资源配置。
多元资本的交集:为何是智象未来?
观察智象未来的投资人名单,可以发现一条清晰的逻辑主线:不同属性的资本,从各自的战略坐标出发,在这个项目上找到了价值交汇点。
对于社保基金等国家级资本而言,关注的是技术路线的战略安全性与基础性。原生全模态世界模型若最终跑通,将构成下一代AI基础设施的核心组件,具有极高的战略壁垒。这是对国家科技自主可控长远布局的直接响应。
对于合肥产投等地方国资而言,这是一笔典型的“产业账”。合肥过去十年通过投资长鑫科技、京东方等案例,证明了其在硬科技领域“黎明期下重注”的能力。在AI进入贴身肉搏阶段的当下,寻找并培育具有底层架构创新能力的标志性企业,是城市产业竞争力的核心体现。智象未来被置于与当年京东方相似的战略位置,承载着带动当地AI产业集群发展的期望。
而对于上影新视野、华策影视等影视产业资本,投资则是内容生产范式革命的前置卡位。双方已达成多项深度协同,涉及新型内容创制、院线场景升级及AI大屏制片标准制定。这并非简单的财务投资,而是产业链上下游的深度融合,旨在通过AI重构内容生产流程,降低成本,提升效率。
市场化机构如东方富海、敦鸿资本的入局,则更多基于对技术落地能力的理性判断。多家机构首次布局视觉大模型赛道,印证了智象未来在技术差异化与商业化可行性上的稀缺性。这种多元化的股东结构,为智象未来提供了资金、政策、场景等多维度的支持,构成了其独特的竞争护城河。
架构革新:打破“缝合怪”的原生全模态路径
智象未来获得资本青睐的核心底气,源于其在底层架构上的激进创新。当前主流的多模态模型大多采用“LLM+视觉编码器”的拼接模式,本质上是一种“缝合怪”架构。在这种架构下,文本作为主轴,视觉、音频等模态作为插件,信息在不同模块间传递时需经过多次编码与解码,导致信息损耗严重,且难以实现真正的模态融合推理。
智象未来选择了一条更为艰难但更具潜力的道路:构建原生全模态架构UiT。这一架构的核心在于“统一Tokenization”,即不设置独立的文本编码器或VAE传导介质,而是将图像像素、文本Token、视频体素、音频信号等原始数据,统一映射到同一套Transformer网络中。
这意味着,模型不再是将不同模态的信息强行拼接,而是在同一空间内进行理解、生成和推理。文生图、长文本渲染、指令编辑、主体驱动、故事板生成等任务,均由同一个模型完成。这种端到端的设计,不仅减少了信息损耗,更使得模型能够捕捉到模态间深层的语义关联与物理规律。
这一技术路径的理论依据,可以追溯到杨立昆等学者对“世界模型”的倡导。世界模型旨在让AI不仅仅处理符号,而是理解物理世界中的空间、时间、因果和交互关系。智象未来的UiT架构,正是试图通过视觉像素这一高信息密度的模态入手,构建起通往物理智能的桥梁。
从评测登顶到实战验证:技术实力的双重背书
技术路线的创新需要市场验证。2026年5月,智象未来在第三方评测平台上交出了一份令人瞩目的答卷。其开源版本HiDream-O1-Image(8B参数)以“Peanut”匿名身份,在Artificial Analysis的文生图榜单中击败众多大厂模型,登顶开源模型第一,且是前20名中参数最小的版本。随后发布的商用版HiDream-O1-Image-1.5,更以在光影渲染、复杂构图及中英文处理上的卓越表现,位列全球前三。
这一成绩的意义在于,它证明了原生全模态架构在性能上不仅不输于传统架构,甚至在资源效率上具有显著优势。在参数规模受限的情况下,通过架构优化实现性能突破,是AI走向普惠化的关键一步。
然而,评测榜单只是起点,真正的考验在于商业落地。智象未来构建了“1+1+3”的商业化体系:底层是HiDream全模态大模型底座,中层是HiHarness企业能力中台,上层聚焦商业营销、影视创作、社媒创作三大垂直场景。
其中,近期发布的vivago R1多模态创作智能体,代表了其在视频生成领域的最新突破。针对行业长期存在的视频时长受限、画面跳变、人设错乱等痛点,vivago R1引入了长链路叙事规划能力。它摒弃了传统的“抽卡式”随机生成,先进行整体脚本与镜头规划,再分段生成并智能纠错。这一架构革新,使得AI内容商用有效成功率提升至85%,跨过了企业规模化商用的核心门槛。
风格还原与物理理解:AI进化的新标尺
在创作者社群中,流传着一个关于vivago R1的测试案例,极具代表性。用户输入了生成“叶什尔查姆风格”荒诞科幻短片的指令。叶什尔查姆是土耳其上世纪的商业电影黄金时代,其特点是低成本、粗粝感与独特的幽默感,如《土耳其星战》中使用的硬纸板怪兽服、泡沫塑料石头等道具。
对于AI而言,理解并还原这种“不完美”的风格,远比生成一张精美的图片困难得多。它要求模型不仅要理解物理规则,还要理解文化语境、审美偏好,甚至是要在“假”与“可笑”之间精确踩中风格阈值。大多数模型倾向于输出“好看但失真”的画面,而vivago R1却精准复现了那种廉价却真实的质感,同时保持了镜头间的叙事连贯。
这一案例揭示了AI能力进化的新方向:从单纯的图像生成,走向对风格、意图和叙事逻辑的深度理解。真正的创作工具,不应只是像素的堆砌者,而应是意图的执行者。vivago海外版已覆盖全球100多个国家,服务超5000万用户,并在Product Hunt登顶,获得了硅谷知名人士“Think Claude Code, but for video”的高度评价。这标志着中国在多模态应用层的商业化能力已稳居第一梯队。
结语:物理智能时代的起跑线
智象未来的崛起,不仅是单一公司的成功,更是中国AI产业从跟随模仿走向底层架构创新的一个缩影。当LLM的红利逐渐消退,AI的竞争焦点已从“文本智能”转向“物理智能”。世界模型赛道才刚刚拉开帷幕,真正的竞赛,比拼的是谁能更深刻地理解物理世界,并将这种理解转化为生产力。
合肥的这次押注,以及多元资本的集体行动,为这条技术路线提供了强有力的背书。随着UiT架构的持续迭代和商业化场景的不断拓展,原生全模态模型有望成为连接数字世界与物理世界的桥梁。对于行业而言,这不仅是技术范式的跃迁,更是AI真正融入实体经济、重塑生产方式的关键一步。在这场从纸上谈兵到走进物理世界的旅程中,智象未来的表现,值得长期追踪。