高德发布 ABot-Earth 0.7:输入文字或卫星图,10 分钟生成公里级 3D 城市
输入一张图或一段话,10 分钟生成真实感 3D 城市
高德最近上线了 ABot-Earth 0.7,一个能快速生成大范围 3D 城市场景的系统。它的核心能力很直接:你上传一张卫星图像,或者写几句话描述某个地方,比如“上海陆家嘴金融区,高楼密集,黄浦江穿流”,系统在消费级显卡上跑大约 10 分钟,就能输出一个覆盖几平方公里的、可自由漫游的 3D 场景。
这听起来有点像游戏引擎里的 procedural generation(程序化生成),但 ABot-Earth 的特别之处在于它不是靠规则拼贴建筑模型,而是用 AI 模型理解真实世界的三维结构。生成的结果采用 3D 高斯泼溅(3DGS)格式,可以直接导入 Unity 或 Unreal Engine,开发者加点交互逻辑就能用在游戏、仿真或数字孪生项目里。
目前这个功能已经集成到高德地图 App 的“飞行街景 2.0”中。用户可以在手机上进入像北京环球影城、上海迪士尼这类大型景区,用虚拟摇杆在建筑之间穿行,视角可以拉近到看清窗户,也能拉远看到整个区域布局——而且过渡是连续的,没有加载卡顿或模型切换的割裂感。
不靠航拍拼接,而是 AI 补全空间
传统数字地球产品,比如 Google Earth,依赖大量卫星影像、航拍照片和激光点云数据。这些素材需要专业设备采集,处理流程复杂,耗时数月甚至更久。结果就是,只有大城市有高清 3D 模型,偏远地区要么模糊,要么干脆是平面图。

ABot-Earth 走的是另一条路:它用高德过去十年积累的时空数据(比如每天近万亿次的北斗定位轨迹)训练了一个 3D 原生模型。所谓“3D 原生”,意思是模型从一开始就在学习三维空间关系,而不是先看二维图片再猜深度。
技术上,它采用两阶段生成流程。第一阶段先输出一个稀疏的空间占位结构(occupancy layout),相当于搭出城市的骨架——哪里是道路,哪里是建筑群,哪里是绿地。第二阶段在这个骨架基础上,逐级细化几何形状和表面属性,最终生成带纹理和光照效果的 3DGS 场景。
因为不依赖实拍素材,理论上它可以为全球任何地方生成 3D 场景,包括那些从未被航拍过的区域。官方称目前已覆盖 196 个国家和地区,虽然细节精度可能不如一线城市的实拍重建,但胜在“有”且“连贯”。
自由漫游 vs 固定路线:交互体验的根本差异
过去我们用街景服务,比如百度全景或 Google Street View,本质上是在看一条预设好的路径上的照片序列。你只能沿着街道往前走,不能拐进小巷,更不能飞到楼顶俯瞰。这种体验受限于采集车的行驶轨迹。
ABot-Earth 打破了这个限制。因为它生成的是完整的三维空间体,而不是一串图片,所以用户可以任意移动视角——从地面走到室内,从屋顶跳到广场,甚至飞到空中绕建筑一圈。这种“在场感”对某些应用场景特别重要。
比如在智慧出行场景,用户出发前想看看目的地停车场入口在哪、商场有几个出口,现在可以直接“走进去”查看,而不是对着平面图猜。在自动驾驶仿真中,测试车辆可以在 AI 生成的城市场景里随意变道、掉头、闯红灯(当然只是模拟),而不用受限于真实采集路段的长度和路况。
高德在官网开放了一个“地块广场”,里面有不少用户分享的生成案例。有人输入“重庆洪崖洞夜景”,生成了依山而建的吊脚楼群;有人试了“迪拜哈利法塔周边”,得到了沙漠中的摩天楼集群。虽然细节上还有瑕疵(比如某些建筑立面重复、植被不够自然),但整体空间逻辑是通的,漫游起来不会穿模或掉进虚空。
开发者能怎么用?
对普通用户来说,ABot-Earth 主要体现在高德地图里的飞行街景体验。但对开发者,它的价值在于“即插即用”的工作流。
生成的 3DGS 文件可以直接拖进 Unity 或 Unreal Engine。3DGS 是一种新兴的神经渲染表示方法,相比传统网格模型,它在保持高视觉质量的同时,渲染开销更低,特别适合实时应用。游戏团队可以用它快速搭建开放世界的底图,影视团队能拿它做虚拟制片的背景,智慧城市项目则可以在此基础上叠加 IoT 数据做交通流模拟。
不过目前官网只开放了在线体验和结果浏览,还没提供 API 或批量生成接口。这意味着开发者还不能自动化调用服务来生成上千个地块。但高德在介绍中提到“向开发者生态开放”,后续可能会推出 SDK 或云服务。
效率提升千倍,但仍有局限
高德宣称 ABot-Earth 的生成效率比传统重建管线提升约 1000 倍。这个数字听起来夸张,但对比下来其实合理。传统方式要做一个平方公里级的精细 3D 城市模型,通常需要:
- 安排无人机或飞机航拍
- 处理数万张照片做空三解算
- 人工修模填补遮挡区域
- 优化纹理和 LOD(多级细节)
整个流程动辄数周,成本几十万。而 ABot-Earth 在单张消费级 GPU(比如 RTX 4090)上 10 分钟出结果,确实快了几个数量级。
但也要看到它的局限。首先,生成质量依赖输入条件。如果卫星图本身模糊或角度奇怪,生成的建筑可能会变形。文字生成更不稳定——“繁华商业区”这种描述太泛,AI 只能按训练数据里的常见模式套用,可能生成一堆玻璃幕墙写字楼,但未必符合当地实际风格。
其次,目前生成的场景是静态的。没有动态交通、行人、天气变化。高德提到未来会向“动态感知与时空推演”演进,比如根据早晚高峰数据模拟车流,但这还没实现。
最后,虽然覆盖 196 个国家,但非重点区域的细节精度有限。比如非洲某小镇,AI 可能会生成整齐的方格路网和统一高度的平房,而现实中可能是蜿蜒小路和错落土屋。这种“平均化”是当前生成模型的通病。
和 Google Earth 的根本区别
很多人会拿 ABot-Earth 和 Google Earth 对比,但两者目标不同。Google Earth 是一个地理信息平台,核心是“展示真实世界已有的数据”,追求准确性和权威性。它的 3D 模型只覆盖部分城市,且更新慢,但一旦有,就尽量贴近现实。
ABot-Earth 更像是一个“空间生成引擎”,核心是“快速构建可用的三维空间”,哪怕不完全真实。它牺牲了一部分绝对精度,换来了生成速度、覆盖广度和交互自由度。你可以把它看作数字世界的“草图工具”——不是最终成品,但足够用来规划、测试和体验。
战略上,高德显然想把 ABot-Earth 打造成“空间智能”的入口。未来结合实时交通、POI 数据、甚至 AR 眼镜,用户可能不只是看 3D 场景,还能和虚拟信息互动——比如在景区里看到历史人物的全息讲解,或者在商场里收到店铺的促销推送。
实际体验:流畅但细节待打磨
笔者在官网试了几个案例。输入“杭州西湖”,生成了湖面、苏堤、雷峰塔和周边山体。从空中俯瞰,湖岸线和岛屿位置基本正确;降到地面,在白堤上行走时,两侧的柳树和长椅也有呈现。但放大看,部分建筑立面是重复贴图,水面反射也比较简单。
另一个测试是“东京涩谷十字路口”。AI 正确生成了密集的高楼和复杂的道路交汇,但著名的忠犬八公像没出现,周边店铺招牌也全是通用模板。这说明模型对宏观结构把握较好,微观细节仍需人工干预或更高阶的文本引导。
不过漫游体验确实流畅。在 RTX 4080 笔记本上,1080p 分辨率下帧率稳定在 60fps 以上,视角切换无延迟。这得益于 3DGS 的高效渲染特性,也说明高德在工程优化上下了功夫。
下一步会往哪走?
从 0.7 版本看,ABot-Earth 已经解决了“能不能快速生成大范围 3D 空间”的问题。接下来的关键是“如何让生成内容更准、更活、更智能”。
- 准确性:引入更多本地化数据约束,比如结合 OpenStreetMap 的路网、建筑高度数据,减少 AI 的“脑补”偏差。
- 动态性:加入时间维度,比如白天/夜晚切换、季节变化,甚至模拟人流车流。
- 语义理解:让文字生成更可控。用户说“老北京胡同,青砖灰瓦,有四合院”,AI 就不该输出现代公寓。
- 编辑能力:允许用户在生成后手动调整建筑位置、替换材质,形成“AI 生成 + 人工精修”的工作流。
高德背靠阿里生态,在地图数据、云计算和终端分发上有天然优势。如果 ABot-Earth 能持续迭代,它或许真能成为下一代空间计算的基础组件——不只是看地图,而是“进入”地图。