WeatherNext 3来了

Google发布新一代AI天气模型WeatherNext 3,重点强化大气变化建模和更高频预测,但架构、分辨率与基准成绩尚未完整公开。
Google DeepMind与Google Research于9月3日发布WeatherNext 3,新模型的核心变化不是单纯把预报数字再刷高一点,而是让系统更清楚地捕捉持续变化的大气状态,并以更高频率预测其后续演变。
WeatherNext 3是Google最新一代AI天气预测模型,目标是利用深度学习直接建模全球大气状态及其时间演化。 Google表示,新模型能够更清晰地观察正在变化的大气,并更频繁地预测大气行为,相关能力也将逐步进入Google的天气产品与服务体系。

这次发布值得关注,但现阶段也需要克制解读。截至发稿,Google尚未完整披露WeatherNext 3的网络架构、空间分辨率、最长预报时效、单次推理成本,以及相对欧洲中期天气预报中心综合预报系统的详细分项成绩。换句话说,Google已经明确了升级方向,却还没有交出足以复现实验的完整技术报告。
重点不是“算一次更准”,而是更连续地理解大气
大气变化建模是指模型不仅估计某一时刻的天气状态,还要学习温度、气压、湿度、风场和降水等变量如何相互作用并持续演化。 传统数值天气预报会把大气动力学方程离散到网格上,再由超级计算机逐步积分;AI天气模型则从大量历史再分析数据和预报样本中,学习一个近似的大气状态转移函数。
这一区别可以理解为:传统系统在每一步都按照物理方程“解题”,AI模型则通过历史数据学会大气通常会如何“走下一步”。前者计算成本高,但物理约束明确;后者推理速度快,却必须证明自己没有只记住常见天气模式,更没有在极端事件上产生看似合理、实则错误的结果。
WeatherNext 3强调“看清变化中的大气”,说明Google正在把注意力从静态预报精度转向时间演化质量。 对实际用户而言,知道明天下雨当然重要,但知道降雨将在几点开始、持续多久、雨带向哪个方向移动,往往更有价值。航空调度、电网负荷管理、港口作业和城市排水也依赖这种连续变化,而不是一天只有一个最高温和一个降雨概率。
更高频预测是WeatherNext 3最具产品价值的升级方向之一。 高频不一定意味着把同一次预报机械地切成更多时间片,而可能包括更密集地吸收新观测、更频繁地初始化模型,或者输出时间间隔更短的天气状态。三者带来的产品效果不同,但Google目前尚未公布WeatherNext 3具体采用了哪一种组合,也没有给出分钟级或小时级的明确间隔。
这项能力如果能稳定落地,会直接改变天气应用的更新节奏。传统全球中期预报通常围绕固定起报时次运行,用户在两次更新之间看到的天气变化,可能主要来自产品侧插值或短临系统补充;AI模型的推理成本更低,因此有机会把全球预测从“定时发布的一组结果”变成“持续刷新的状态流”。
WeatherNext三代模型,升级路线越来越清楚
WeatherNext是Google将多条AI天气研究路线整合为模型、数据集和产品能力的统一品牌。 这一体系并不等同于单一神经网络,它涵盖确定性预报、生成式集合预报,以及面向Google产品和外部开发者的数据分发能力。
从目前公开材料看,WeatherNext的演进路径可以概括为:第一阶段证明图神经网络能快速完成全球中期预报,第二阶段用生成式方法构建多种可能的未来,第三阶段则进一步强化变化过程与预测频率。
| 模型或数据集 | 核心方法 | 已公开的预测规格 | 主要能力 | 当前状态 | |---|---|---:|---|---| | WeatherNext Graph | 图神经网络天气模型的业务版本 | 0.25度空间分辨率;每6小时初始化;每6小时输出;最长10天 | 全球中期确定性预报,覆盖温度、风、降水、湿度、位势、垂直速度和气压等变量 | 旧实验数据集已要求迁移至WeatherNext 2 | | WeatherNext 2 | 功能网络驱动的生成式天气模型 | 官方提供全球中期集合预报数据;完整配置依具体产品而定 | 同时生成多个合理未来,用概率刻画不确定性,并强化气旋等高影响天气预测 | 已进入WeatherNext数据和产品体系 | | WeatherNext 3 | 新一代AI天气预测模型 | 空间分辨率、预报时效、集合成员数和更新间隔尚未完整披露 | 更清晰地建模变化中的大气,并提高预测频率 | 2026年9月3日发布,正逐步进入产品体系 |
WeatherNext Graph提供了理解Google既有业务基线的参照。 Google Earth Engine此前公开的目录显示,该数据集采用0.25度网格,约相当于赤道附近28公里尺度;每天在00、06、12和18时四次初始化,每6小时给出一个预报步,最长覆盖10天。这个尺度适合全球环流和中期趋势,却不意味着模型能够直接解析一条街道上的局地阵雨。
WeatherNext 2的关键变化是从单一路径转向概率分布。 WeatherNext 2采用生成式方法产生集合预报,也就是针对同一初始大气状态生成多个物理上合理的未来。天气系统具有混沌特征,初始温度或风场中的微小误差,几天后可能放大成完全不同的路径,因此只给出一条预测线,容易制造并不存在的确定感。
WeatherNext 3延续的更可能是“快速生成更多有效预测”的路线,而不是回到单一确定性答案。 如果更高频更新能够与集合预测结合,系统就可以在新观测到来后迅速重估不同天气情景的概率,这比单纯提高一项平均误差指标更接近气象业务真正需要的能力。
为什么“预测更多次”可能比跑分领先更重要
AI天气模型的主要工程优势是把昂贵的数值积分转化为神经网络推理。 传统全球预报依赖大型超级计算机集群,增加分辨率、集合成员或更新频率都会显著增加计算量;训练完成后的AI模型通常能以更低边际成本生成预报,使“多跑几次”从奢侈选项变成可行方案。
这种成本结构对概率预报尤其重要。假设一个业务系统需要比较50种潜在天气路径,传统模式通常要进行50次扰动积分,而生成式AI模型可以共享大量计算,再采样出多个未来。真正的价值不是省下几分钟,而是让原本算不起的高频集合预报进入普通产品。
高频预测还能缩短极端天气发生变化后的信息滞后。 热带气旋路径偏转、强对流快速发展和锋面降水带移动,都可能在两次常规起报之间出现明显变化。如果模型能够更频繁地纳入观测并重新计算,机场、能源企业和应急部门就能更早发现风险概率的变化。
不过,“更频繁”不自动等于“更准确”。如果连续预报高度相关,或者模型只是在相近初始条件上重复输出类似结果,增加运行次数并不会提供同等比例的新信息。评估WeatherNext 3时,应该关注它是否真正吸收了更多新观测、概率分布是否得到重新校准,以及极端事件预警提前量是否增加。
AI天气预报最难的仍然是极端事件
平均误差无法完整代表天气模型的业务价值。 一个模型可以在全球大多数晴朗区域把温度误差降低,却同时错过一次登陆城市的强台风;前者会让总体跑分很好看,后者却可能造成不可接受的实际后果。
WeatherNext 3后续最值得核验的指标至少包括以下五类:
- 确定性精度: 位势高度、温度、风速和降水等变量的均方根误差,以及不同预报时效下的异常相关系数。
- 概率校准: 模型给出30%的暴雨概率时,类似情形是否真的约有30%发生,而不是概率长期偏高或偏低。
- 极端事件表现: 热带气旋路径与强度、极端降水、热浪和寒潮的命中率、漏报率及预警提前量。
- 时间一致性: 相邻两个起报时次是否出现无理由的大幅跳变,连续天气动画是否保持合理的动力学结构。
- 计算与交付成本: 单次全球预报耗时、所需硬件、每天可运行次数,以及数据从生成到抵达用户端的总延迟。
降水仍会是检验WeatherNext 3含金量的关键变量。 气压和高空位势场通常比较平滑,神经网络更容易学习;强对流降水则高度局地化,还受到云微物理、地形和海陆边界影响。全球模型即使在大尺度环流上领先,也不代表它能准确回答“半小时后这条街会不会下暴雨”。
热带气旋则适合检验生成式预报能否覆盖低概率高影响路径。 WeatherNext 2已经把气旋预测列为重点能力,WeatherNext 3若要证明大气变化建模确实提升,就需要展示路径转向、快速增强和登陆时间等关键问题上的概率质量,而不只是展示几张视觉效果流畅的全球风场图。
WeatherNext 3不会立刻取代传统数值模式
AI天气模型短期内更可能成为数值天气预报的加速器和补充,而不是完全替代物理模型。 业务气象机构不仅需要结果准确,还要求系统在数据缺失、卫星故障、罕见气候背景和极端初值下保持稳定,并且能够解释预报变化来自哪里。
纯数据驱动模型还存在分布外风险。训练数据记录的是过去发生过的大气状态,但气候变化正在提高部分极端事件的强度和频率;当未来天气组合超出历史样本范围时,模型是否还能保持物理合理性,需要通过回报实验、实时业务测试和物理约束共同验证。
这里所说的“大气变化”也不能直接等同于“长期气候变化”。 天气预测关注未来数小时到数天的大气演化,气候预测关注数十年尺度上的统计分布变化。WeatherNext 3更擅长理解动态大气,并不意味着它自动成为长期气候模型,更不能据此直接推导几十年后的区域气候结论。
Google本身拥有把模型快速产品化的特殊优势。搜索、地图、Android以及面向企业的云服务都存在天气入口,一旦WeatherNext 3进入这些渠道,模型每天面对的真实查询规模会远超实验室基准。对Google而言,天气模型既是科研成果,也是搜索信息质量、地图出行体验和云端行业解决方案的一部分。
开发者现在更应该关注数据,而不是模型名字
开发者判断WeatherNext 3是否可用,首先要看可访问的数据产品和服务级别,而不是发布演示。 真正影响应用开发的是变量覆盖、网格分辨率、更新时间、历史归档、许可条款、缺测处理和稳定性承诺,这些信息比“新一代模型”五个字更重要。
WeatherNext旧数据集的迁移也说明接口稳定性不可忽视。Google此前已要求WeatherNext Graph用户迁移到WeatherNext 2,旧数据目录记录的可用时间截至2026年7月,意味着依赖固定资产路径和字段结构的生产工作流必须主动升级。WeatherNext 3进入数据体系后,开发者需要特别检查变量命名、集合维度、时间坐标和历史数据兼容性。
面向消费级应用的团队还要避免把全球模型输出直接包装成街区级结论。 0.25度全球网格无法天然支持精确到社区的降雨承诺,即使通过插值把地图绘制得更细,也不会凭空产生新的气象信息。可靠产品通常需要结合雷达、地面站、卫星观测、区域模式和统计降尺度,而不是只依赖一个全球基础模型。
面向能源、物流和保险的团队则应保留多模型交叉验证。 WeatherNext 3可以成为重要输入,但不应在完整业务验证前成为唯一信号源。更稳妥的方法是比较Google模型、传统数值模式和本地观测的分歧,再把分歧本身作为风险指标。
现在能下的结论:方向正确,证据还没完全到位
WeatherNext 3的升级方向比单纯追求榜单第一更有现实意义。 天气预报最终不是一次考试,而是一套持续更新的决策系统;更好地捕捉大气变化、更频繁地生成概率预测,确实能提高预报在出行、能源、农业和灾害响应中的可用性。
WeatherNext 3目前仍缺少足够公开数据来证明领先幅度。 在Google给出同行可复核的论文、分变量基准、极端天气案例、推理成本和概率校准结果之前,不宜把“更清楚”和“更频繁”直接翻译成固定百分比的准确率提升,也不宜假设它在所有地区和天气类型上都优于WeatherNext 2。
我们的判断是,WeatherNext 3真正的竞争力可能不只来自模型本身,而是来自Google把研究模型、全球计算基础设施、实时数据管线和大规模消费产品连在一起的能力。AI天气预报的下一阶段,竞争重点将从“谁在论文里预测得最准”,转向“谁能以足够低的延迟,稳定生成经过校准、可以直接支持决策的天气概率”。
如果WeatherNext 3能够兑现这一点,它带来的变化就不只是提醒用户带伞更及时,而是让天气预报从每天查看几次的静态页面,逐渐成为持续运行的大气数字系统。
参考来源
- Google DeepMind GraphCast GitHub仓库:Google图神经网络全球天气预测模型的官方代码与技术背景,可用于理解WeatherNext早期技术路线。
- Google Research NeuralGCM GitHub仓库:Google将机器学习与大气动力学结合的研究项目,为理解AI天气模型与传统物理方法的融合提供参考。



