翻译:Deep Learning for Day Forecasts from Sparse Observations

Posted by lili on April 16, 2024

本文是论文Deep Learning for Day Forecasts from Sparse Observations的翻译。

目录

Abstract

深度神经网络提供了一种建模天气条件的替代范式。神经模型在数据可用时能够在不到一秒的时间内进行预测,并且具有非常高的时间和空间分辨率,以及直接从大气观测中学习的能力,这些都是这些模型独特的优势之一。使用大气观测数据训练的神经模型,在与最先进的概率数值天气预报模型进行比较时,迄今为止仅在降水这一单一变量上能够在十二小时的领先时间内取得良好的性能。在本文中,我们介绍了MetNet-3,它显著扩展了基于观测的神经模型可以很好地预测的领先时间范围和变量。MetNet-3从密集和稀疏数据传感器中学习,并且能够对降水、风、温度和露点进行最多24小时的预测。MetNet-3引入了一种关键的稠密化技术,隐式捕捉数据同化,并且在网络训练极度稀疏的目标时产生空间密集的预测。MetNet-3具有高时间和空间分辨率,分别可达2分钟和1公里,并且具有低运行延迟。我们发现,MetNet-3能够在CONUS地区的未来24小时内胜过最佳的单一成员和多成员NWPs,例如HRRR和ENS,为基于观测的神经模型设定了一个新的性能里程碑。MetNet-3已经投入运行,并且其预测与其他模型一起在Google搜索中提供。

1 Introduction

物理基础的数值天气预报(NWP)模型目前驱动着全球可用的主要预报。这些系统将大量的稀疏和密集的大气观测数据通过数据同化过程整合和处理成初始的密集大气表示,然后使用物理定律的近似来将其向未来延展。前向模拟是一个昂贵的过程,需要数千个 CPU 小时才能提前数小时或数天进行一次预报。预报的空间和时间分辨率必须保持相对较低,因为它们极大地影响了模拟的计算成本。

基于直接大气观测进行训练的神经网络天气模型提供了一种替代建模范式。一旦观测数据可用,神经模型的预测延迟在几秒钟的数量级上。模型的预报空间分辨率对计算成本影响有限,可以进行一公里或更高分辨率的预报,并且有非常高的时间分辨率,达到几分钟的数量级。神经模型还可以直接从观测数据中学习捕捉到的大气现象。这消除了使用复杂物理描述天气现象的需要,并且可以对理解不明确或超出常规天气领域的现象进行建模。

这些优势特性使得神经模型成为大气建模的一个强有力的替代范式。然而,高分辨率的神经天气模型只能在领先时间范围内展示良好性能,最多只能达到十二小时,并且仅限于降水这一领域。识别、处理和为神经训练打包许多观测数据来源以捕获足够的大气信息,这是一个非常巨大的工程挑战。观测数据来源于许多不同格式的提供商,具有不同的空间和时间分辨率,以及不同程度的稀疏性,从单个点(例如气象站观测)到稠密的地基雷达和轨道卫星观测。这种极大的稀疏程度本身就代表了一个新颖的机器学习挑战,因为模型被期望从稀疏数据中学习,但却要产生密集的预报。

本文介绍了 MetNet-3,这是一种天气预报神经网络,它在其前身 MetNet-1 和 MetNet-2 的基础上有所进步。与前身一样,MetNet-3 保持了每 2 分钟一次的高时间预测频率和高达 1 公里的空间分辨率。但 MetNet-3 将其领先时间范围从 12 小时扩展到完整的 24 小时的一整天范围,这涉及到远远超出外推的动力学。除了降水率,由于其快速变化的特性,特别难以预测,MetNet-3 还预测了另一组核心天气变量,包括地表温度、露点、风速和风向。尽管地基雷达提供了密集的降水测量,MetNet-3 用于其他变量的观测仅来自跨越美国大陆的 942 个点对应的气象站。虽然 NWP 模型在数据同化过程中将稀疏点转换为密集表示,但 MetNet-3 引入了一种称为稠密化的过程来实现这一点,其具有四个主要方面(见图 1)。第一个方面涉及在训练过程中从网络的输入中随机丢弃一部分点观测,同时将这些观测保留作为目标。第二和第三个方面呈现了稠密化的两种评估模式,即在从未在训练过程中出现的一组气象站上进行评估,以衡量网络在空间上的泛化能力和执行隐式同化的能力,并且在仅对特定点进行超局部评估时。最后一个方面是稠密化的推断步骤,网络依靠空间参数共享,将输入中给定的所有稀疏点映射到完全密集的图像上,从而产生密集的预报。

图1:稠密化方面的抽象描述。 (a) 在训练过程中,部分气象站被从输入中屏蔽,但保留在目标中。 (b) 为了评估对未训练位置的泛化能力,一组由方块表示的气象站从未进行训练,仅用于评估。 (c) 为了评估对于可用数据稀疏位置的预测,这些站点也在评估过程中作为输入。 (d) 最终的预测使用完整的训练气象站集作为输入,并通过空间参数共享产生完全密集的预测。

由于整合所有相关的观测数据源的挑战,这些数据源将提供大气近期状况的更完整图景,MetNet-3,就像 MetNet-2 一样,仍然依赖于描述这些条件的同化 NWP 初始状态。这种状态包括了对 MetNet-3 预测的表面变量的密集估计,可以帮助 MetNet-3 在未来为这些变量进行密集化预测。

2. 结果

我们在美国的CONUS区域对MetNet-3进行了评估,评估指标包括瞬时降水率、小时累积降水以及表面变量:2米温度、2米露点、10米风速和10米风向。

瞬时降水率的真实估计来自多雷达/多系统(MRMS)[14]并依赖雷达信号。这些估计具有高达2分钟的时间频率,并设置了MetNet-3的基本先导时间频率。另一方面,1小时累积降水的估计来自雷达信号和地面雨量计,时间频率为60分钟。MRMS通常被认为是一个高保真度的产品[24],根据[8]的方法进行评估,我们仅使用MRMS中雷达保真度最高的区域(见补充资料C)。

表面变量的真实观测来自气象站网络的一分钟观测(OMO)[15](有关气象站的地图,请参阅补充资料C)。气象站包括美国CONUS区域分布的942个位置,每5分钟存储一次观测数据。MetNet-3对这个气象站网络应用稠密化技术。

与使用集合预测模型模拟不确定性的NWP不同,MetNet-3直接输出每个输出变量和每个位置的边缘概率分布,使用全分类Softmax提供丰富的信息,超出了均值(见图3中的样本)。我们将MetNet-3的概率输出与先进的集成NWP模型的输出进行比较,包括来自欧洲中期气象中心(ECMWF)的集成预测(ENS)和来自美国国家海洋和大气管理局(NOAA)的高分辨率集成预测(HREF)。作为参考,我们还包括来自NOAA的高分辨率快速刷新(HRRR)和ECMWF的高分辨率预测(HRES)的单个成员预测。我们选择这些模型是因为它们涵盖了可能的NWP模型范围,前两者是集成模型,而后两者是单个成员NWP模型,其中两者是全球性的,而另外两者则是为CONUS设计的。图4总结了本研究中使用的基线模型和MetNet-3的基本特征。我们基于Continuous Ranked Probability Score(CRPS)、Critical Success Index(CSI)和Mean Absolute Error(MAE)等指标比较模型的性能。CRPS特别适用于与ENS和HREF进行比较,因为它们分别是50个和10个成员的集合,用于测量所有可能速率或数量的全面输出分布的准确性。这个指标是概率预测中主要的指标之一,并且在指导ECMWF的ENS开发过程中发挥着重要作用[3, 7]。有关评估协议和使用的指标的更多详细信息,请参阅补充资料D。

图4:本文中使用的基于物理的基线模型与MetNet-3的基本特征比较。MetNet-3以1公里/2分钟分辨率预测降水,以4公里/5分钟分辨率预测地面变量。由于运行模型几乎是即时的(单个先导时间约为1秒),并且需要比NWP模型更少的计算资源,因此MetNet-3可以比NWP模型更频繁地运行。

2.1 降水

第一个主要结果是MetNet-3在整个先导时间范围内比ENS获得更高的CRPS,表明平均而言,MetNet-3的性能优于ENS(图5a)。当根据分类指标CSI对MetNet-3和ENS的输出概率进行阈值优化时,MetNet-3在轻度(1 mm/h)降水的前15个小时的先导时间内表现优于ENS(图5b),并且在整个24小时的先导时间范围内表现优于ENS对于重度(8 mm/h)降水(图5d)。MetNet-3与ENS之间的技能差距在相对术语中最大,并随着时间的推移逐渐减小。在图7中,我们展示了对整个美国大陆的24小时预报,展示了MetNet-3和ENS概率分布的扩散以及MetNet-3预测新降水形成的能力。

图5:MetNet-3与NWP基线模型在瞬时降水率上的性能比较,使用CRPS(数值越低越好)和分类CSI(数值越高越好)指标进行评估;CRPS包括所有降水率,而CSI图是针对轻度(1 mm/h)、中度(4 mm/h)和重度(8 mm/h)降水。在CRPS图中,基准模型(HRRR和HRES)因表现明显不如概率模型而被省略,以保持清晰度。请注意,将MetNet-3和ENS的概率性预报转化为用于CSI计算的确定性预报的阈值已经在验证集上进行了优化。由于瞬时降水率数据不可用,HREF在所有图中均被省略。有关其他降水率的CSI图、包含确定性基线的CRPS图以及CRPS线非单调的解释,请参阅附录E。

来自MRMS的每小时累积降水估算仅有60分钟的频率,并且在相同时间段内提供的可用于训练MetNet-3的数据帧数量明显较少于用于瞬时降水的数据帧数量。尽管如此,我们发现MetNet-3在CRPS指标上优于ENS和HREF这两个多成员NWP基线模型,在先导时间的前19小时内表现优异(图6a)。根据CSI指标的阈值设定,对于中等(4 mm/h)降水,MetNet-3在先导时间的前18小时内的表现也优于基线模型(图6b)。详细结果可以在附录E中找到。通过这些结果,MetNet-3将基于观测的模型的先导时间优势从MetNet-2实现的12小时扩展到19小时。

图6:MetNet-3与NWP基线模型在小时累积降水上的性能比较,使用概率CRPS(数值越低越好)和分类CSI(数值越高越好)指标进行评估;CRPS包括所有降水率,而CSI图是针对中度(4 mm)降水。

2.2 稀疏表面变量

从气象站观测中学习是具有挑战性的,因为OMO地面真实目标仅在美国大陆的942个气象站点上可用,而气象模型需要在所有位置预测天气变量。在相同的气象站上进行训练和评估可能导致这样一种情况,即模型在训练过的位置上表现良好,但在其他位置上表现不佳。为确保MetNet-3在整个美国大陆表现良好,我们对这些稀疏变量应用了密集化程序,并对20%的随机选择的未在MetNet-3训练中使用的气象站点进行评估,并且在评估过程中也不将其作为输入。在图2中,我们展示了MetNet-3预测表面变量的密集化预测以及在训练和测试气象站点上的误差。

图2:以2022年4月23日UTC时间12:00为例,展示了科罗拉多州洛基山脉的案例研究,显示了ENS和MetNet-3的6小时风速预测的平均值(顶部左侧和中间),以及OMO站点的地面真实情况(顶部右侧)和ENS和MetNet-3在各个气象站点上的误差(底部)。圆圈和正方形分别表示训练站点和测试站点,MAE计算结果包括训练站点和测试站点。这个例子展示了MetNet-3的目标稠密化能力,以及MetNet-3的更高空间分辨率和气象站点的预测精度。

与降水一样,表面值被离散成区间,并且使用具有分类损失的Softmax层来预测它们。MetNet-3在所有先导时间范围内的所有表面变量的CRPS和MAE均优于多成员ENS模型(图8)。在考虑整个预测分布的CRPS方面,MetNet-3显示出了显著的提升。对于所有表面变量,MetNet-3在所有先导时间范围内的CRPS值均优于ENS在最短先导时间(提前1小时)获得的最高CRPS。这也表明了集合NWP在此时间范围内并未特别好地建模预测分布。图9显示了MetNet-3在温度和风速单个位置的预测示例。观察到的大部分数值都落在MetNet-3预测分布的80%置信区间内,而ENS的预测分布非常尖峰且过度分散。在MAE指标方面的结果描绘了类似的情景,MetNet-3的结果比多成员和单成员基线模型要好得多,例如,20小时的MetNet-3温度预报与最佳基线的5小时预报具有相似的MAE。在超局部设置中,其中测试气象站点的值在评估过程中作为输入提供给网络,结果进一步改善,尤其是在早期先导时间内。

3 讨论

MetNet-3将观测数据视为最高保真度的目标,并作为评估和训练的地面真值。另一种选择是使用NWP模型的同化或再分析状态作为目标,其中再分析状态与同化状态不同,它不仅整合了关于大气的过去和现在信息,还包括未来信息。然而,这个选择存在一些限制。首先,我们发现地面真值观测与NWP状态提供的相同变量值存在显著不匹配。图10展示了来自ERA5的NWP再分析状态和经过校正的MRMS的小时累积降水的核心变量的估算值的示例;比较显示了两者之间的显著不匹配。类似地,对于地表温度,我们得到了OMO气象站与HRES和HRRR同化状态之间的MAE分别为1.5摄氏度和0.9摄氏度,有时误差幅度大于MetNet-3本身的预测。请参阅补充资料A,了解与HRES在瞬时降水方面的不匹配示例。针对这些状态进行评估或训练使得难以衡量生成模型的准确性。再分析或同化状态的第二个限制是它们在空间和时间上粗糙。例如,ERA5的空间分辨率约为25公里,频率为6小时。神经模型的优势在于其计算仅随时间频率和空间分辨率线性增长,使用像ERA5这样的粗糙目标限制了神经模型的学习潜力。此外,从点数据进行密集化允许神经模型通过将点数据分配到相应的网格单元来选择任意粗糙的输出分辨率。另一个限制涉及这些目标的实际延迟。像ENS模型的6小时滞后对短期性能有很大影响,如第2节所示。此外,ENS每天只运行4次,因此提供的预测依赖于预报时间前长达12小时的过时大气信息。这对模型的运行性能有很大影响,因此MetNet-3依赖于延迟为几分钟的观测数据以及延迟为55分钟的HRRR状态。然后,MetNet-3需要额外的10分钟来生成所有CONUS地区的所有前瞻性24小时内的预测,每2分钟进行一次。如果考虑到操作延迟,MetNet-3相对于NWP基线的收益将大于第2节中报告的收益。

与MetNet-2相比,MetNet-3在性能上取得了飞跃。补充资料E中的图11显示了MetNet-3的多项创新带来的显著收益。反过来,MetNet-2相对于最初的MetNet获得了类似的改进。这描绘了神经气象模型不断改进的画面,得益于更好的架构和观测源。MetNet-3仍然只使用了所有可用大气数据的一小部分。

4 方法

4.1 数据创建

MetNet-3的数据以输入输出对的形式提供,其中输入包括过去90分钟的雷达(估算的降水率和类型)数据,过去6小时的稀疏OMO气象站报告,GOES卫星的图像,同化的天气状态,纬度和经度信息,海拔信息和当前时间,而输出对应于未来的雷达降水估算(即时雷达仅降水率以及经过校正的小时累积),地面气象站的测量数据(温度、露点、气压和风速和风向)和同化的天气状态(后者仅用于改进模型训练,我们不将其视为地面真值)。有关使用的输入的更多信息,请参阅表1;有关使用的目标的更多信息,请参阅表2。可用的数据跨越了从2017年7月到2022年9月的时期。训练、验证和测试数据集是从连续时期中生成的,没有重叠。连续的19天训练数据时期、1天黑期、2天验证数据时期、1天黑期、2.5天测试数据时期和1天黑期被用来进行抽样。

对于地面变量,我们将OMO(One Minute Observations)站点的测量结果映射到一个4公里×4公里的像素中,该像素包含该站点。如果在给定区域内有多个站点,则取它们的测量值的平均值。对于所有942个气象站,只有12对站点的距离需要对气象站变量进行平均处理。除了时间分割外,我们还将OMO站点分成两组:757个训练站点和185个测试站点(附件C,图3)。测试站点的数据在训练过程中不会以任何方式使用,我们只会报告测试站点的结果。此外,即使在评估过程中,我们通常也不会将测试站点的过去观测数据包含在MetNet-3的输入中,以便模型不会有关于测试站点确切位置的任何信息,并生成代表完整4公里×4公里输出区域的地面预测。包括测试站点的过去观测数据使得MetNet-3可以将预测定制到特定气象站点,并产生超局部的预测结果。

表1: 这是MetNet-3的空间输入表。对于HRRR同化,模型从同化状态获得了617个通道,以及一个包含HRRR状态过期程度信息的通道。除了空间输入外,MetNet-3还获得了预测时间(月份、日期、小时和分钟)和前导时间。

表2:这是MetNet-3的目标表。对于降水,我们使用MRMS的仅雷达瞬时降水估计以及考虑了雨量计的每小时降水累积。对于地面变量,我们使用OMO报告的温度、露点和风速(方向和2个分量)。

4.2 模型架构

MetNet-3神经网络在高层次上由三部分组成:地形(topographical)嵌入、U-Net骨干和MaxVit transformer,用于捕捉长距离相互作用。整个网络具有2.27亿可训练参数。

4.2.1 地形嵌入

常见的做法是将多个与时间无关的变量提供给神经气象模型,其中包含像海陆Mask这样的地形信息[8]。我们采用一种新颖的地形嵌入技术,而不是手动选择和准备这种信息,该技术允许网络自动发现相关的地形信息并将其存储在嵌入中。更具体地说,我们分配一个嵌入网格,步幅为4公里,其中每个点与20个标量参数相关联。对于每个输入示例,我们通过双线性插值从网格中计算每个输入像素中心的地形嵌入。嵌入参数与其他模型参数一起进行训练,类似于NLP中使用的嵌入。

4.2.2 网络架构

图11:MetNet-3网络架构。矩形表示张量,上面/下面的数字表示它们的像素空间大小。

网络架构如图11所示。网络使用两种类型的输入:高分辨率、小背景(2496 km x 2496 km,分辨率为4 km)和低分辨率、大背景(4992 km x 4992 km,分辨率为8 km)。来自不同高分辨率输入的所有时间片段(参见表1)首先沿通道维度连接,然后当前时间也沿通道维度连接,结果是一个624 x 624 x 793的输入图像。

数据然后由U-Net骨干处理,该骨干首先应用两个卷积ResNet块[9],并将数据降采样到8 km分辨率。然后,我们在空间上用零进行填充,使内部表示变成4992 km x 4992 km的方形,并与低分辨率、大背景输入连接。之后,我们再次应用两个卷积ResNet块,并将表示降采样到16 km分辨率。卷积ResNet块只能处理局部相互作用,对于接近24小时的较长前导时间,目标可能取决于整个输入。为了实现这一点,我们使用改进版的MaxVit [22]网络处理16 km分辨率的数据。MaxVit是Vision Transformer(ViT,[6])的一个版本,具有对局部邻域和全局格点的关注。我们通过移除所有MLP子块,添加跳跃连接(到MaxVit输出)在每个MaxVit子块之后,并在注意力中使用标准化的键和查询,修改了MaxVit的架构。

然后,我们取中央裁剪,尺寸为768 km x 768 km,并使用从降采样路径中的跳跃连接逐渐将表示升采样到4 km分辨率,此时我们再次取中央裁剪,尺寸为512 km x 512 km。网络为6个地面气象变量的每个256个区间输出一个分类分布,并对4 km分辨率的表示应用一个具有一个隐藏层的MLP,为617个同化气象状态通道的每个通道输出一个确定性预测。对于降水(即时速率和小时累积),我们将表示升采样到1 km分辨率,并为每个像素输出一个512个区间的分类分布。关于网络架构、优化和使用的超参数的低级细节可以在补充B中找到。