3个月狂揽21亿!智象未来如何用原生全模态重构AI商业版图?
资本风向标:从LLM到多模态的估值重构
在人工智能行业经历了一轮激烈的参数军备竞赛后,资本市场的注意力正在发生显著偏移。近期,多模态赛道成为一级市场最炙手可热的焦点。智象未来(HiDream.ai)的这一轮融资动作,不仅刷新了单月融资纪录,更折射出行业对AI底层逻辑的重新评估。
7月23日,智象未来宣布完成15亿元人民币C轮融资。这并非孤立的资本事件,而是其在近三个月内完成的第三轮融资。累计超过21亿元的投入,使其估值正式突破10亿美元大关,跻身全球AI独角兽行列。这一里程碑式的估值,并非仅靠热度支撑,而是基于投资人名单中展现出的极高共识度。
此次融资阵容堪称豪华且多元:社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野、华策影视等产业资本跟投,老股东合肥产投等持续加注。这种国家级资本、地方国资、产业方与顶级市场化VC的罕见扎堆,释放出一个强烈信号:在LLM(大语言模型)估值溢价逐渐见顶的背景下,多模态,特别是视觉世界模型,被视为AI商业化的下一个确定性高地。
技术范式转移:为何“世界模型”是下一站?
理解智象未来的价值,首先需要理解AI行业正在经历的范式转移。过去几年,行业主流叙事遵循“规模法则”,即认为参数规模、数据量和算力直接决定模型智能水平。然而,随着开源模型的密集发布和Benchmark分数的内卷,单纯依靠堆砌参数的边际效应正在递减。
杨立昆等顶尖学者曾直言不讳地指出,LLM本质上是“书斋里的思想家”,其智能局限于人类已编码的符号系统内。它擅长处理语言逻辑,却难以真正理解物理世界中的空间、时间、因果和交互关系。相比之下,视觉作为信息密度极高的模态,一张图片即可定格物理世界的完整状态。
因此,构建能够理解物理世界的“世界模型”成为通往通用人工智能(AGI)的关键路径。智象未来选择的正是这条艰难但前景广阔的原生全模态路线。它不再将图像视为文本的插件,而是试图从视觉像素出发,构建一套统一的底层架构。这种转变意味着AI将从“读懂文字”进化为“看懂世界”,从而在内容创作、仿真模拟、自动驾驶等更广泛的物理交互场景中实现突破。
架构差异化:UiT如何打破“缝合怪”困境
在众多追逐多模态概念的公司中,智象未来的核心竞争力在于其底层架构的彻底革新。传统的多模态模型往往采用“缝合架构”,即在强大的语言模型外挂图像理解或生成模块,不同模态分别编码,最后在高层拼接。这种架构导致信息在模态间转换时产生损耗,且难以实现深度的语义对齐。
智象未来推出的UiT架构,旨在解决这一根本性缺陷。该架构的核心思想是“统一令牌化”(Unified Tokenization)。它摒弃了独立的文本编码器和VAE(变分自编码器)作为传导介质的传统做法,将图像像素、文本Token、视频体素、音频及空间关系等原始信号,统一映射到同一个Transformer网络中。
在这种架构下,文字不再是主轴,所有模态地位平等。模型可以在同一网络中并行完成理解、生成和推理任务。这意味着文生图、视频生成、指令编辑等任务不再依赖多个独立模型的串联,而是由一个端到端的单一模型完成。这种设计不仅减少了推理延迟,更提升了多模态之间语义的一致性。
技术落地的初步验证已经到来。智象旗下的HiDream-O1-Image开源版本,以仅8B的参数量在Artificial Analysis的文生图榜单中名列前茅,成为前20名中参数最小的模型。这一成绩证明了其架构在能效比上的巨大优势,也为后续更大规模模型的部署降低了算力门槛。
商业化闭环:从技术炫技到生产力工具
技术架构的创新最终需要服务于商业落地。智象未来并未停留在实验室阶段,而是构建了“1+1+3”的商业化体系。第一层是HiDream全模态大模型底座,提供底层算力与算法支持;第二层是HiHarness企业能力中台,输出标准化能力;第三层则聚焦商业营销、影视创作、社媒创作三大垂直场景。
在这一体系中,最新发布的vivago R1多模态创作智能体成为了技术落地的标杆。针对行业长期存在的视频生成时长受限、画面跳变、人设错乱等痛点,vivago R1引入了长链路叙事规划能力。它摒弃了传统的“抽卡式”随机生成,而是先进行整体脚本与镜头规划,再分段生成并智能纠错。这种机制使得单段任务失败不会影响整体进度,将AI内容商用的有效成功率提升至85%。
这一突破标志着AI内容生产从辅助工具向核心生产力的转变。在实际测试中,面对要求生成“叶什尔查姆风格”(土耳其低成本山寨科幻片风格)的复杂指令,vivago R1不仅还原了硬纸板怪兽、手绘背景等“廉价”质感,还保持了镜头间的叙事连贯性。这种对“不完美”风格的理解和精确复现,证明了模型对物理世界逻辑的深层把握,而不仅仅是像素级的模仿。
产业协同与资本逻辑:合肥模式的再次验证
资本的支持离不开产业协同的预期。投资方中包含的上影股份、华策影视等头部影视上市公司,并非单纯财务投资,而是旨在卡位内容产业革命。双方已在新型内容创制、院线场景升级、AI跨屏整合营销等领域展开深度合作。这种“资本+产业”的双轮驱动,为智象未来提供了丰富的落地场景和数据反馈闭环。
对于合肥而言,投资智象未来是其一贯“投硬科技、押未来赛道”策略的延续。从长鑫科技到京东方,合肥产投在过去十年中多次在行业黎明期下重注,成功培育出多个国家级产业集群。此次押注多模态独角兽,同样是合肥在AI新时代寻找新增长极的关键落子。地方国资的入局,不仅提供了资金,更带来了政策资源与本地产业生态的嫁接机会。
同时,社保基金、工银资本等国家级资本的首次多模态布局,也反映了监管层与大型金融机构对这一技术路线的战略重视。他们认为,世界模型若最终跑通,将成为下一代AI基础设施的重要组成部分,其战略意义远超单一商业场景。
全球视野下的竞争力与挑战
在国际市场上,智象未来同样展现出强劲的竞争力。其海外版产品已覆盖全球100多个国家和地区,服务用户超过5000万。今年5月,灰度版产品登顶Product Hunt日榜第一,获得硅谷知名Product Hunter的高度评价。这表明,无论在国内还是海外,原生全模态架构带来的高效能和高可用性,都是获取用户认可的关键。
然而,竞争格局依然严峻。随着字节系、可灵等大厂的深入布局,以及众多初创公司的涌入,AI视觉赛道的融资总额在2026年已逼近300亿元。榜单排名的变动周期从季度缩短至月度,技术迭代速度极快。智象未来需要在保持架构优势的同时,持续投入算力与数据优化,以维持技术领先地位。
此外,如何将技术优势转化为可持续的盈利模式,也是所有AI公司面临的共同挑战。vivago R1的商业化成功只是第一步,如何在更多垂直行业(如工业设计、教育、医疗等)实现规模化复制,将是检验其商业模式韧性的试金石。
结语:物理智能时代的序幕
智象未来的崛起,不仅是单一企业的胜利,更是AI行业从文本智能向物理智能跃迁的缩影。当行业还在争论世界模型是否可行时,已经有公司通过原生全模态架构交出了可验证的答卷。这标志着大模型正在跨越“纸上谈兵”的阶段,真正走进物理世界。
对于投资者和行业观察者而言,关注智象未来,实际上是在关注AI下一代基础设施的可能形态。在多模态赛道成为资本共识的今天,技术路线的差异化、商业落地的确定性以及产业协同的深度,将成为决定头部玩家地位的关键要素。随着世界模型牌桌的正式摆开,这场从认知智能到物理智能的竞赛,才刚刚鸣枪。未来几年,谁能在原生全模态的道路上跑通规模化商业闭环,谁就有可能定义下一代人工智能的标准。