合肥再押注AI独角兽:3个月21亿融资背后的多模态逻辑

0 阅读

在科技创投圈,合肥这座城市早已不再仅仅是一个地理名词,它更像是一个敏锐捕捉技术风向标的观察员。从京东方到长鑫科技,再到如今的智象未来(HiDream.ai),合肥连续三次在关键半导体与人工智能节点上下注成功,这种“赌术”背后其实是一套严密的产业逻辑。2026年7月,智象未来宣布完成15亿元C轮融资,这是其近三个月内完成的第三轮融资,三轮合计融资超21亿元,估值正式突破10亿美元大关,正式跻身全球AI独角兽行列。

这一融资事件之所以引发行业剧烈震动,不仅因为金额庞大,更因为其背后的投资方阵容堪称“神仙打架”。社保基金四川振兴科创基金、工银资本首次跨界多模态领域联合领投,厦门国贸资本、上影新视野、华策影视等产业资本强力跟投,而老股东合肥产投、东方富海等持续加注。这种国家级资本、地方国资、产业方与市场化VC罕见扎堆的局面,折射出资本对AI行业未来路径的重新评估。

范式切换:从LLM红利到视觉模型爆发

智象未来融资的高光时刻,恰好踩中了AI行业的一个关键拐点。过去两三年,大语言模型(LLM)凭借其在代码生成、文本交互等领域的卓越表现,占据了资本与市场的绝对C位。投资者习惯于为更大的参数规模、更高的Benchmark分数买单。然而,随着新一代开源模型密集发布,模型能力的迭代速度远超预期,导致“领先窗口”急剧缩短。单纯依靠堆砌参数和文本能力的模式,已经逼近工程上的天花板,估值溢价也随之出现分歧。

相比之下,AI视觉赛道呈现出截然不同的生命力。2026年,国内AI视觉领域融资总额逼近300亿元,字节系的Seedance、可灵等大厂产品数据飙升,独立创业公司接连落地大额融资。市场共识逐渐形成:大语言模型的领先优势具有短暂的排他性,而多模态,特别是视觉模型,被视为继AI Coding之后,商业化确定性最高的赛道之一。资本的目光从“AI现在能做什么”,转向了“AI未来能成为什么”。在许多人看来,理解物理世界的视觉智能,才是通向通用人工智能(AGI)更坚实的路径。

资本博弈:不同坐标下的价值共识

尽管赛道火热,但并非所有玩家都能获得如此多元资本的青睐。智象未来的投资人结构揭示了一个有趣的现象:不同属性的资金在这里看到了不同的价值锚点,却达成了罕见的共识。

对于社保基金和工银资本等国家级资本而言,他们关注的是战略路线。全模态世界模型若最终跑通,将不仅仅是一个商业产品,更可能成为下一代AI基础设施的核心组件。这种对基础技术路线押注,具有极高的战略价值。

影视产业资本的入局则更具针对性。上影股份、华策影视作为头部内容公司,其投资并非简单的财务布局,而是旨在卡位内容产业革命的前置节点。双方已在新型内容创制、院线场景升级、AI跨屏整合营销等方面展开深度合作。对于影视行业而言,AI不仅是工具,更是重塑工作流和生产力标准的关键变量。

地方国资,特别是合肥产投,算的是一笔精细的产业账。合肥在过往的高科技投资中,反复证明了自身在行业黎明期下重注的能力。智象未来被摆在了与当年京东方相似的位置。而对于敦鸿资本、东方富海等顶级市场化VC来说,他们的入局基于对硬核技术落地价值的专业判断。多家机构“首次出手”多模态赛道,侧面印证了智象未来的技术路线、团队积淀与商业化能力具备稀缺性。这种多元资本的结构,恰恰说明了智象未来在不同维度上都具备不可替代的价值。

技术突围:颠覆“缝合怪”的原生全模态架构

不同背景资本的共同押注,归根结底是因为智象未来在底层架构上做出了一次大胆且差异化的选择。要理解这一点,必须回顾当前AI行业面临的根本性路线分歧。

主流叙事长期受困于“规模法则”,即认为参数越大、数据越多,模型越聪明。然而,以杨立昆为代表的学者指出,LLM本质上是“书斋里的思想家”,其智能被局限在人类文明已编码的符号系统之内。LLM擅长处理语言符号,却难以真正理解物理世界中的空间、时间、因果和交互关系。世界模型的兴起,正是为了解决这一先天缺陷,让AI从处理符号走向理解物理世界。

传统的多模态模型,往往被视为“缝合怪”。它们在强大的语言模型之外,外挂一个图片理解模块,再补一个生成模块,各模态分别编码,最后在外层拼接。这种架构以文字为轴心,其他模态作为插件,信息在不同模块间传递时不可避免地产生损耗。智象未来选择了一条更难但更彻底的路:构建原生全模态架构。

其核心创新在于UiT架构。该架构颠覆了传统范式,不设独立的文本编码器,也不使用VAE作为模态间的传导介质。相反,它将图像像素、文本Token、视频体素以及音频、动作、空间关系等原始信号,统一进行Tokenization,由同一套Transformer网络完成理解、生成和推理。这意味着文生图、长文本渲染、指令编辑、主体驱动、故事板生成等多任务,全部由同一个模型端到端地处理。这种设计消除了模态间的壁垒,使得模型能够像人类一样,直接在像素和信号层面进行多感官的综合认知。

落地验证:从榜单登顶到商业闭环

技术路线的正确性需要数据验证,而商业价值则需要产品落地。智象未来在2026年5月迎来了两个重要里程碑:其8B参数的开源版本HiDream-O1-Image(代号Peanut)在Artificial Analysis平台文生图榜单中,以最小的参数量夺得开源模型第一;商用版HiDream-O1-Image-1.5则位列全球前三,在光影、复杂构图、指令跟随和中英文字渲染上表现突出。

然而,榜单排名只是起点。智象未来更令人关注的是其搭建的“1+1+3”商业化体系。第一层是HiDream全模态大模型底座,提供算力与技术创新支撑;第二层是HiHarness企业能力中台,输出标准化模型能力;第三层则聚焦商业营销、影视创作、社媒创作三大垂直场景,打造专属AI智能体。

在此体系下,最新发布的vivago R1多模态创作智能体成为了核心标杆。针对行业视频生成中常见的时长受限、画面跳变、人设错乱等痛点,vivago R1引入了长链路叙事规划能力。它摒弃了传统“抽卡式”的随机生成,而是先进行整体脚本与镜头规划,再分段落地生成并进行智能纠错。这种架构使得单段任务失败不会牵连整体创作,极大地提升了稳定性。

数据显示,vivago R1将AI内容商用的有效成功率提升至85%,跨过了企业规模化商用的核心门槛。这一数据背后的意义在于,AI正式从辅助性的“画图工具”,升级为内容生产的核心生产力。

场景试金石:理解“荒诞”才是真智能

技术能力的深度,往往在极端场景下才能被检验。近期流传的一个测试案例极具说服力:用户输入指令,要求生成一部“叶什尔查姆风格”的荒诞科幻短片。叶什尔查姆(Yeşilçam)是土耳其上世纪六七十年代的电影黄金时代,以其低成本、粗粝道具、拼贴素材和夸张表演著称,代表作《土耳其星战》中甚至出现了真人套着喷银漆的硬纸板怪兽服、泡沫塑料石头道具等“廉价”特效。

对于大多数AI模型而言,面对此类指令,往往会输出画面精美但缺乏神韵的内容,或者因为过度追求“真实”而丢失风格特征。这种风格要求模型理解“不完美”,既要符合物理规则,又要刻意保持低成本的质感,精准踩中“假”与“可笑”之间的阈值。

vivago R1在处理这一指令时,精准复现了硬纸板怪兽、手绘背景、廉价特效的质感,同时保持了镜头间的叙事连贯。这一案例表明,真正可用的创作工具,必须具备理解风格、执行意图以及保持叙事逻辑的能力,而不仅仅是生成漂亮的单帧画面。这种对“风格”的深度理解,实际上是模型对物理世界和人类文化认知深度的体现。

目前,vivago海外版已覆盖全球100多个国家和地区,累计服务超5000万用户,并曾登顶Product Hunt日榜第一,被硅谷知名产品专家Chris Messina评价为“视频领域的Claude Code”。这标志着智象未来在商业化落地能力上已稳居行业第一梯队。

结语:通往物理世界的长期主义

智象未来的崛起,不仅是合肥产业投资逻辑的胜利,更是中国AI从“追随者”向“原创者”转变的一个缩影。当行业还在争论LLM的天花板时,智象未来通过UiT架构率先在原生全模态领域建立了差异化优势。从榜单数据的验证,到vivago R1在复杂创作场景中的表现,再到多元化资本的长期背书,这一切都指向一个结论:AI的竞争正在从文本智能向物理智能跃迁。

世界模型的牌桌已经摆开,真正的竞赛才刚刚鸣枪。随着这一轮融资尘埃落地,智象未来面临的挑战也将从技术验证转向更广阔的市场应用与生态构建。对于整个行业而言,这条“原生全模态”的路径能否最终跑通,将决定AI是继续停留在数字符号的游戏中,还是真正走进充满不确定性的物理世界,成为推动文明进化的核心力量。这不仅是智象未来的命题,也是所有AI从业者在2026年及以后必须直面的时代考题。