AI 快讯高德发布ABot-Earth 0.7
模型上新

高德发布ABot-Earth 0.7

2026-09-10T11:07:45.882Z
高德发布ABot-Earth 0.7

高德推出 3D 原生城市世界模型 ABot-Earth 0.7,覆盖 196 个国家和地区,可从星球、城市一路生成到街景与地标,并支持在消费级 GPU 上 10 分钟生成公里级 3D 场景。

高德发布 ABot-Earth 0.7:把数字地球从“地图”变成可进入的世界

高德今天(2026 年 9 月 10 日)发布 ABot-Earth 0.7,定位为全球首个 3D 原生城市世界模型。它覆盖超过 196 个国家和地区,支持从星球、城市到街景和地标的一体化生成,目标不是再做一张更清晰的三维地图,而是让用户进入一个能够连续漫游、自由探索并实时交互的数字世界。

**ABot-Earth 0.7 是一种以三维空间为原生表征、能够根据时空数据生成可探索城市环境的世界模型。**与传统数字地球依赖卫星影像、航拍照片和点云拼接不同,它试图让模型直接学习道路、建筑、街区、地形以及空间关系,再输出连续的三维场景。

这也是高德继今年 6 月发布 ABot-Earth 0.5 后的再次升级。0.5 更像是一个能够快速生产 3D 地块的生成工具,0.7 则进一步把生成范围从单个区域扩展到全球尺度,并把城市全貌、街区结构、地标细节组织进同一套空间体系里。高德 CEO 郭宁在发布时表示,大模型理解语言,高德空间智能理解世界。这个判断,基本概括了 ABot-Earth 与通用视频或图像生成模型之间的差异。

ABot-Earth 0.7 从地球、城市到街景的三维连续生成示意图

从“拍下来再贴上去”,转向直接生成三维空间

**传统数字地球是对现实世界进行采集、拼接和渲染的系统,而 3D 原生世界模型则试图直接生成空间结构。**过去二十年,数字地图的基本路径没有发生根本变化:先通过卫星、航拍、街景采集现实世界,再用摄影测量、点云处理、纹理映射和人工修补,把这些素材拼成可浏览的三维地图。

这条路线的优点是与现实对应关系清晰,缺点也很明显。它受制于采集时间、采集路线、设备成本和数据覆盖范围。没有被拍到的地方,系统通常只能留白、拉伸或使用相邻素材补齐;用户能看到的视角,也往往取决于原始采集路径,而不是空间本身是否完整存在。

ABot-Earth 0.7 采用的 3D 原生技术路径,核心变化在于把空间、时间和视觉信息放进同一个时空建模框架。模型不只是记住某一张卫星图或某一帧街景,而是学习城市中的连续关系:道路如何连接,街区如何展开,建筑群如何沿街分布,地标从远景推进到近景时应该如何保持结构一致。

按照高德披露的信息,用户输入一张卫星图像或一段文字描述,ABot-Earth 0.7 可以在一块消费级 GPU 上,用约 10 分钟生成公里级三维城市场景。输出采用 3DGS,即 3D Gaussian Splatting(三维高斯泼溅)格式。与传统网格模型相比,3DGS 不需要先把复杂场景完全转化为规则多边形网格,而是使用大量带有位置、尺度、颜色和透明度信息的三维高斯体来表达场景,能够在视觉质量和实时渲染之间取得更好的平衡。

高德给出的效率指标是,生成效率相较传统模式提升约 1000 倍。这个数字需要放在具体流程里理解:传统 3D 城市制作往往包含数据采集、点云处理、自动拼接、人工修补和多轮质量检查,单个平方公里可能需要数小时甚至数天;ABot-Earth 则把输入压缩为一张卫星图或一段描述,把结果生成时间压缩到分钟级。

| 对比维度 | 传统三维地图生产 | ABot-Earth 0.7 | |---|---|---| | 基础输入 | 卫星影像、航拍、街景、点云等多源采集数据 | 卫星图像或文字描述等输入 | | 生成方式 | 采集、拼接、重建、人工精修 | 3D 原生模型端到端生成 | | 覆盖逻辑 | 受已有采集路线和素材限制 | 可补全并生成连续空间 | | 典型处理周期 | 单个区域通常需要数小时至数天 | 公里级场景约 10 分钟 | | 硬件门槛 | 专业采集设备和高性能处理集群 | 一块消费级 GPU 即可完成示例生成 | | 输出形式 | 点云、网格、纹理等多种资产 | 3DGS 三维场景资产 | | 官方披露效率 | — | 相较传统模式提升约 1000 倍 |

需要强调的是,10 分钟和 1000 倍是高德针对特定生成流程给出的指标,并不等于任何城市、任意输入和任意精度下都能达到同样结果。真实部署仍会受到输入图像质量、建筑密度、地形复杂度、目标细节等级和显存容量等因素影响。对于需要厘米级测绘精度、工程验收或法律取证的场景,生成式三维世界不能简单替代专业测绘数据。

一套模型覆盖从星球到街景的不同尺度

**ABot-Earth 0.7 的关键卖点不是单点生成效果,而是从星球尺度切换到街景尺度时仍能保持空间连续性。**目前不少 3D 生成模型能够生成一个房间、一栋建筑、一段街道,或者为游戏制作一小块可行走场景,但它们通常面向固定尺寸的内容生产,很难同时处理全球、城市、街区、建筑和地标多个层级。

尺度变化是城市世界模型最难处理的部分之一。在星球或国家尺度,模型需要理解地理位置、区域边界和城市分布;放大到城市级别,需要维持主干路网、街区结构和建筑群的整体关系;继续进入街景和地标近景,又要补足建筑的几何轮廓、立面层次、材质纹理以及道路两侧的视觉细节。

如果这些尺度由不同模型分别生成,常见问题是“远看像一座城,近看换了栋楼”:城市全貌、街区布局和单体建筑之间无法对应,用户从远景推进到近景时会出现结构跳变、纹理闪烁或空间断裂。ABot-Earth 0.7 试图通过 3D 原生表征,把不同尺度放入连续的三维空间中,让用户可以从全球视角一路缩放到城市,再进入街区和地标附近。

从产品体验看,这种能力比单纯提高一张渲染图的清晰度更有价值。图像生成解决的是“看起来像什么”,而城市世界模型还要回答“它在哪里”“周围是什么”“从另一条路过去会看到什么”。前者偏向视觉内容生产,后者则更接近空间计算基础设施。

高德官方展示的产品方向包括从地球出发,穿梭到月球、火星以及海内外城市的三维空间;平台还提供城市核心区探索和 1 平方公里地块浏览能力。根据公开页面信息,平台已经展示了数万级别的精选地块,并计划让用户通过文字和参考图生成专属三维区域。不过,用户创作功能目前仍处于内测阶段,开放范围和具体能力可能持续调整。

它真正改变的,可能是三维数据的生产方式

**ABot-Earth 0.7 的产业价值,在于把三维城市生产从重资产项目转成可快速迭代的软件流程。**过去,制作一座可用的三维城市通常需要测绘团队、建模团队、渲染团队和大量后期人工。项目一旦进入新区域,前期采集和资产制作就要重新开始,导致三维数据很难像二维地图那样快速扩张。

高德 6 月发布 ABot-Earth 0.5 时曾表示,模型生成的 3D 制图成本约为传统方式的 1%,效率提升约 1000 倍;0.7 延续了分钟级生成和消费级 GPU 运行的路线,并把覆盖范围扩展到超过 196 个国家和地区。若这一能力能够在精度、稳定性和授权机制上持续提升,三维空间数据的生产门槛确实可能下降一个数量级。

1. 具身智能:从“仿真场景”走向开放环境

具身智能是需要在物理或虚拟环境中感知、规划和行动的人工智能系统。对机器人而言,训练数据不只是图片和视频,还包括可行走区域、障碍物位置、道路连接、视角变化以及动作结果。

现有仿真环境通常需要人工搭建,场景规模和变化类型有限。ABot-Earth 0.7 如果能够根据真实地理信息快速生成连续城市,便可以为机器人导航、路径规划和环境理解提供更多训练场景。机器人可以在同一套空间里反复改变起点、目标和天气条件,而不必每次都重新制作场景。

但这类应用有一个不能回避的前提:视觉上逼真不代表物理上可用。机器人训练需要碰撞几何、地面高度、材质摩擦、动态目标和可通行性标注。3DGS 擅长表达真实感和视角渲染,却不天然等同于可碰撞、可交互的物理世界。因此,ABot-Earth 更可能首先成为视觉和空间理解数据源,后续还需要与网格、语义地图和物理仿真系统结合。

2. 低空经济:给复杂区域快速补一张三维底图

低空经济是围绕无人机、飞行汽车和其他低空飞行器形成的产业体系。无人机航线规划、起降点选择、障碍物识别和应急避障,都需要比二维地图更具体的空间信息。

高德此前提到,ABot-Earth 可以根据卫星影像快速生成对应区域的三维地形,覆盖传统测绘在复杂地形和特殊区域中的部分盲区。对于山区、灾区或尚未完成精细测绘的区域,分钟级生成至少能提供一份用于初步研判的空间底图。

不过,低空飞行对数据时效性和精度的要求很高。高楼施工、临时塔吊、树木生长、通信设施和电力线路都可能影响飞行安全,而这些变化未必会及时反映在卫星图像中。因此,生成式三维地图适合做规划、预演和辅助判断,不能在没有实时传感器校验的情况下单独承担飞行安全决策。

3. 应急救援:在现场数据不完整时先建立可用视图

应急救援是 ABot-Earth 最容易体现“速度价值”的场景之一。地震、洪水、山火和大型事故发生后,现场可能无法立即完成全面航拍,救援指挥需要先判断道路是否连通、建筑物分布、人员进入路径和物资投放区域。

如果系统能够利用已有卫星图、历史地图和现场新增信息,在几分钟内生成一个可漫游的三维场景,指挥人员就能从俯视图进一步进入关键区域,辅助安排救援力量和车辆路线。相比一组静态图片,可连续进入的空间视图更接近现场决策的实际需求。

当然,灾害场景中的“可用”比“好看”重要得多。模型必须标注哪些内容来自实时观测,哪些内容是基于历史数据或模型推断,避免把推测出来的道路和建筑误认为真实状态。对于应急系统来说,生成结果需要带有时间戳、来源说明和不确定性标识。

4. 影视和游戏:减少重复建模,但不会消灭制作团队

在影视、游戏和虚拟现实行业,ABot-Earth 可以把城市建模中最耗时的资产准备环节压缩到分钟级。创作者不必从空白场景开始搭建道路、街区和建筑群,而是先生成一个大范围基础世界,再对关键建筑、角色活动区域和镜头路线进行人工精修。

3DGS 输出也意味着资产可以被进一步用于实时渲染和交互开发。相比只生成一段视频,三维场景更适合调整摄像机、改变视角和设计多条探索路线。不过,3DGS 资产在编辑性、碰撞、灯光重建和跨引擎兼容方面仍有工程要求,不能直接等同于经过完整拓扑整理的游戏模型。

因此,ABot-Earth 更现实的定位是“城市世界的自动草图和基础资产生成器”,而不是完全替代建模师。它会减少重复劳动,把制作团队从大规模铺路、摆楼和贴材质中解放出来,但核心地标设计、叙事空间规划、艺术风格统一和最终质量控制仍然需要专业人员。

0.7 相比 0.5,升级重点在哪里

**ABot-Earth 0.5 证明了公里级三维场景可以被快速生成,0.7 则把重点推进到全球覆盖、全尺寸连续生成和可交互世界组织。**根据公开资料,两代版本的主要差异可以概括如下:

| 能力 | ABot-Earth 0.5 | ABot-Earth 0.7 | |---|---|---| | 发布时间 | 2026 年 6 月 8 日 | 2026 年 9 月 10 日 | | 覆盖范围 | 190 多个国家和地区 | 超过 196 个国家和地区 | | 生成尺度 | 以公里级城市和地块为重点 | 从星球、城市到街景地标的全尺寸连续生成 | | 输入方式 | 卫星图像或文字描述 | 卫星图像或文字描述,并强调全模态时空理解 | | 生成速度 | 约 10 分钟生成公里级场景 | 约 10 分钟生成公里级场景 | | 硬件条件 | 消费级 GPU | 消费级 GPU | | 输出形式 | 可编辑 3DGS 资产 | 可漫游、可交互的 3DGS 城市世界 | | 主要方向 | 快速制图和场景生产 | 全球数字地球与空间智能入口 |

从版本号看,0.7 仍然不是一个宣称完成商业化的终局产品。高德目前公开的信息更多集中在模型能力和展示体验上,关于模型参数规模、训练数据构成、不同区域的真实精度、推理显存要求、并发能力、商用授权和开发者接入方式,尚未披露足够细节。对开发者而言,这些信息比“全球首个”更直接决定产品能否落地。

最大的技术难点:连续性、真实性和可编辑性

**城市世界模型要真正进入生产环境,必须同时解决几何连续性、时间一致性、真实世界准确性和资产编辑能力。**这四个问题决定了它是一个好看的演示,还是可以被开发者和产业系统调用的基础设施。

第一是几何连续性。模型需要让道路、建筑、地形和地标在不同视角下保持一致,不能远景与近景互相矛盾。尤其是从城市级镜头切换到街景级镜头时,模型既要补足细节,又不能改变建筑原有位置和体量。

第二是时间一致性。城市不是静止的,施工、交通、天气、植被和人流会持续变化。如果模型只生成某一时刻看起来合理的场景,却无法表达变化时间,便很难支撑交通仿真、城市规划和长期监测。高德称 ABot-Earth 是“可预测”的城市世界模型,真正的检验标准将是它能否基于历史时空数据推断合理变化,而不是只生成静态画面。

第三是真实世界准确性。生成模型天然会补全缺失信息,但补全也意味着可能产生“看起来正确、实际上不存在”的道路、建筑或设施。对于旅游浏览,这可能只是体验问题;对于导航、救援和低空飞行,则可能变成安全问题。未来产品需要明确区分观测数据、重建数据和生成数据。

第四是可编辑性。3DGS 适合渲染,但产业用户往往还需要修改道路宽度、替换建筑材质、设置碰撞体、加入交通流和导出到 Unity、Unreal Engine 等工具链。高德如果希望 ABot-Earth 成为通用空间底座,就需要继续补齐语义分层、标准格式、场景编辑和实时数据更新能力。

OpenAI Hub 观点:它不是“3D 版文生图”,而是地图公司的模型化转型

ABot-Earth 0.7 最值得关注的地方,不是又一个能生成三维画面的模型,而是高德正在把地图数据、空间计算和生成式 AI 合并成一个产品方向。

图像和视频模型的竞争焦点通常是分辨率、运动一致性、镜头控制和审美质量;城市世界模型的竞争则更像地图、引擎和仿真平台的混合竞争。它既要有地图公司的真实世界数据,也要有生成模型的泛化能力,还要接近游戏引擎的实时交互表现。

高德的优势在于长期积累的道路网络、地理位置、出行轨迹和城市空间数据,这些数据让它比单纯依赖互联网图片的模型更接近真实城市。但优势也带来边界:真实世界数据的授权、隐私、安全和更新成本,会成为模型规模化的重要约束。覆盖 196 个国家和地区是一个很大的数字,但覆盖并不自动意味着每个区域拥有同等精度、同等新鲜度和同等可编辑性。

短期看,ABot-Earth 0.7 最有机会落地在三类任务:一是城市和景区的沉浸式浏览,二是影视、游戏和虚拟空间的基础资产生成,三是应急救援、低空规划和机器人训练中的快速场景构建。长期看,它能否成为真正的空间智能基础设施,取决于是否开放稳定的开发工具链、明确的商用许可、可验证的数据来源以及面向行业的实时更新能力。

对普通用户来说,它让“去一个地方看看”从查看地图和街景,变成直接进入一个可漫游的三维空间;对开发者来说,它提供的不是一张更漂亮的地图,而是一套有机会承载导航、仿真、游戏、机器人和城市服务的世界底座。高德这次发布的 0.7,已经把问题从“能不能生成 3D 场景”推进到了“能不能让生成的世界持续可信地运行”。这才是下一阶段真正的竞争点。

结语

ABot-Earth 0.7 是高德在 3D 原生城市世界模型上的一次重要迭代:覆盖范围扩大到超过 196 个国家和地区,公里级场景生成时间约 10 分钟,输出 3DGS 场景,并尝试把星球、城市、街区和街景放进同一个可连续探索的三维世界。

它目前最强的价值是降低三维空间生产成本和缩短场景构建时间,而不是替代高精度测绘、实时导航或完整物理仿真。对于开发者和深度用户,接下来值得观察的不是演示画面还能有多逼真,而是高德何时公布更细的精度指标、数据时效、资产编辑能力和开发者接入方案。如果这些环节能够补齐,ABot-Earth 才可能从一个令人印象深刻的模型展示,真正变成空间智能时代的基础工具。

参考来源

相关推荐

查看全部