3个月融资21亿,智象未来如何以原生全模态重构AI视觉叙事?
资本风向标下的多模态突围
近期,人工智能领域的资本流动呈现出显著的结构性变化。7月23日,多模态大模型公司智象未来(HiDream.ai)宣布完成15亿元人民币的C轮融资。这并非其近期的唯一一次资本动作,在近三个月的时间内,该公司累计融资规模已突破21亿元,估值正式跨越10亿美元大关,跻身全球AI独角兽行列。
这一现象级的资本聚集,并非孤立事件,而是整个AI行业进入“范式切换”期的缩影。过去两年,资本几乎无例外地追捧大语言模型(LLM),以参数规模、推理速度和Benchmark分数作为核心估值锚点。然而,随着开源模型能力的快速迭代,LLM的技术红利逐渐见顶,单纯依靠文本生成的溢价空间被大幅压缩。市场共识正在形成:LLM本质上是“书斋里的思想家”,其智能局限于人类已编码的符号系统,难以直接理解物理世界的空间、时间与因果关系。
与此同时,AI视觉赛道迎来了爆发期。2026年国内AI视觉领域融资总额逼近300亿元,字节系、可灵等大厂背景项目及独立创业公司接连落地大额融资。多模态,尤其是视觉与世界的交互能力,正成为继AI Coding之后,商业化确定性最高的新赛道。智象未来之所以能吸引如此大规模的资本,正是因为它踩中了这一从“文本智能”向“物理智能”跃迁的关键节点。
多元资本背后的价值锚点重构
深入剖析智象未来的投资方阵容,可以清晰地看到不同属性资本对同一技术标的的多维价值判断。本轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管等联合领投,厦门国贸资本、上影新视野基金等机构跟投,老股东合肥产投等持续加注。
这种“国家队+产业资本+市场化VC”的罕见组合,揭示了其投资逻辑的复杂性:
国家战略层面的路线押注:社保基金作为LP首次投资多模态大模型,工银资本首次出手该方向,表明国家级资本看好“全模态世界模型”作为下一代AI基础设施的战略潜力。这不仅是商业投资,更是对技术自主可控与未来算力基建布局的认可。
产业协同的深度卡位:影视巨头上影股份、华策影视的入局,远超财务投资范畴。双方已在新型内容创制、院线场景升级及AI制片标准制定等方面达成深度合作。影视行业作为内容生产的头部场景,亟需AI重构工作流,这种产业协同为技术落地提供了天然的试验田与变现通道。
地方国资的产业账本:合肥产投等地方国资的持续加注,延续了合肥在高科技领域“敢于在黎明期下重注”的投资风格。从长鑫科技到京东方,再到如今的智象未来,地方政府意在通过资本纽带,培育具有全球竞争力的标志性AI项目,带动本地产业链升级。
市场化机构的专业研判:东方富海、敦鸿资本等顶级VC的首次布局,则是基于对技术稀缺性与落地能力的理性评估。在激烈的竞争环境中,资金总是流向具备差异化优势与硬核落地能力的头部玩家。
UiT架构:打破“缝合怪”范式
资本涌入的背后,是智象未来在底层架构上的差异化选择。当前主流的多模态模型多采用“主从架构”,即以LLM为中枢,外挂图像编码器(如CLIP)和视频生成模块,各模态独立处理后再通过某种机制拼接。这种“缝合”方式导致信息在跨模态传输中产生损耗,且难以实现真正的端到端推理。
智象未来推出的UiT(Unified Interface Transformer)架构,试图颠覆这一传统。其核心逻辑在于:图像像素蕴含着极高的物理世界信息密度,包括空间关系、光影变化、材质纹理等。UiT摒弃了独立的文本编码器,不再依赖VAE作为模态间的传导介质,而是将图像像素、文本Token、视频体素、音频及动作信号统一进行Tokenization。
这意味着,所有原始信号在同一套Transformer网络中完成理解、生成与推理。无论是文生图、长文本渲染、指令编辑还是主体驱动,均由同一个模型端到端处理。这种原生全模态架构不仅减少了信息转换的损耗,更让模型能够像人类感知世界一样,同时处理视觉、语言与逻辑信息,为构建真正的“世界模型”奠定了技术基础。
评测登顶与商业化闭环
技术路线的可行性,最终需由市场与数据验证。2026年5月,智象未来旗下HiDream-O1-Image(8B参数开源版本)在Artificial Analysis平台匿名参与评测,凭借出色的光影表现、复杂构图能力及指令跟随能力,在开源模型中登顶,并在全球前20名模型中参数最小。随后的商用版HiDream-O1-Image-1.5再次刷新纪录,位列全球前三。
这一成绩的意义在于,它证明在“世界模型是否可行”的行业争论中,已有一条技术路线跑出了可验证的标杆。
更重要的是,智象未来并未止步于技术秀,而是构建了“1+1+3”的商业化体系:
- 1个底座:HiDream全模态大模型,提供算力与算法支撑。
- 1个中台:HiHarness企业能力中台,输出标准化、可复用的模型能力。
- 3个场景:聚焦商业营销、影视创作、社媒创作,打造专属AI智能体。
其中,最新发布的vivago R1多模态创作智能体,直击行业痛点。传统AI视频生成存在时长受限、画面跳变、人设错乱等问题,导致商用成功率低。vivago R1引入了长链路叙事规划能力,摒弃“抽卡式”随机生成,先进行整体脚本与镜头规划,再分段落地生成并智能纠错。单段任务失败可独立重试,不影响整体进度。这一架构革新将AI内容商用有效成功率提升至85%,跨过了规模化商用的门槛。
风格理解:从“好看”到“对味”的质变
商业落地的说服力,往往体现在极端案例的测试中。近期,创作者社群中流传着一个极具挑战性的测试案例:要求vivago R1生成一部“叶什尔查姆(Yeşilçam)风格”的荒诞科幻短片。
叶什尔查姆是土耳其上世纪六七十年代的电影黄金时代,以其高产、低成本、粗粝感和夸张表演著称。这种风格的核心在于“不完美”——硬纸板做的怪兽、泡沫塑料石头、手绘背景与真实爆炸镜头的拼贴。对于AI模型而言,既要符合物理逻辑,又要刻意保持低成本的粗糙质感,并在“假”与“可笑”之间找到精确的风格阈值,极具挑战性。
多数模型倾向于输出“精美但失真”的画面,而vivago R1的生成结果被反馈为“精准捕捉到了那种荒谬感”。它不仅复现了廉价特效的质感,更保持了镜头间的叙事连贯性。这一案例的价值不在于画面有多精美,而在于证明了模型已具备对“风格”、“意图”及“物理世界逻辑”的深度理解,而非简单的像素堆砌。
目前,vivago海外版已覆盖100多个国家,服务超5000万用户,并在Product Hunt登顶。硅谷知名Product Hunter Chris Messina将其评价为“视频界的Claude Code”,肯定了其作为核心生产力工具的潜力。
走向物理智能的长期主义
智象未来的崛起,标志着AI竞争焦点的转移。如果说前两年的竞赛是比谁更能“读懂”人类已有的知识,那么现在的竞赛则是比谁更能“看懂”并“推演”物理世界。
原生全模态架构的探索,是一场从符号智能到物理智能的范式跃迁。尽管世界模型的路径仍充满不确定性,但智象未来通过UiT架构的差异化创新,以及在视频生成等垂直场景的扎实落地,为国产AI突破底层架构瓶颈、跨越“纸上谈兵”提供了有价值的范本。
随着21亿融资尘埃落地,世界模型的牌桌正式摆开。对于行业而言,这不仅是一家公司的胜利,更是多模态AI从概念验证走向产业深水区的重要信号。未来,谁能更好地理解物理世界的因果与交互,谁就能在下一轮AI浪潮中掌握定义权。智象未来的演进节奏,值得长期追踪。