OCELOT: Direct Atmospheric Forecasting from Heterogeneous Earth Observations Using a Graph-Transformer Hybrid Model
大多数 AI 天气模型都从一张规则网格开始。
GraphCast、Pangu-Weather 这类模型读取分析或再分析场,再学习大气状态如何向未来演变。它们把数值模式中最昂贵的预报积分替换成神经网络,却仍然依赖前面的资料同化:卫星辐射、探空、飞机和地面站观测,需要先被整理成一套时空连续、变量统一的网格化大气状态。
OCELOT 把起点往前移了一步。它直接读取异构观测,在隐空间中完成信息融合和时间推进,再预测未来观测值。输入和输出都保留各类仪器原有的位置、时间、通道和扫描几何,不需要把再分析场作为训练标签。
这条路线真正值得关注的地方,在于它重新安排了观测、资料同化与 AI 预报之间的关系。
Summary
OCELOT 是 NOAA 团队开发的全球短时大气预报原型。模型把卫星辐射、散射计、探空、飞机和地面观测映射到一个共享的球面网格,用 Transformer 与图神经网络推进隐状态,再解码到未来观测位置。
当前版本使用 2015—2023 年观测训练,在完整留出的 2025 年上评估到 12 小时。它能够生成空间连贯的多仪器预报,并在较长时效上优于简单持续性预报;地面温度和风的误差仍高于业务 GFS。现有结果支持观测空间预报的可行性,还不足以说明这条路线已经能够替代资料同化和业务数值预报。
文献信息与问题背景
题目:OCELOT: Direct Atmospheric Forecasting from Heterogeneous Earth Observations Using a Graph-Transformer Hybrid Model
中文题目:OCELOT:利用图—Transformer 混合模型从异构地球观测直接预报大气
作者:Azadeh Gholoubi*
机构:NOAA/NWS/NCEP/Environmental Modeling Center 及其合作单位
版本:arXiv v1,2026 年 7 月 15 日;投稿至 Artificial Intelligence for the Earth Systems
链接:arXiv:2607.14196
代码:NOAA-EMC/ocelot,v1.0
传统 AI 天气预报仍需要一张“初始状态图”
真实观测并不整齐。
极轨卫星沿轨道扫描,静止卫星持续凝视固定区域,探空气球一天通常只有少数时次,飞机观测沿航线分布,地面站的空间密度也很不均匀。不同仪器测量的物理量、分辨率、误差和时间频率差别很大。
传统资料同化把这些观测与数值模式背景场结合,估计某一时刻完整的三维大气状态。AI 天气模型再以这张分析场为起点向前预报。
这套流程已经非常成熟,也带来两层依赖:训练数据需要长期再分析,实时预报需要业务分析场。再分析的生成成本很高,其中还包含数值模式、物理参数化和同化系统的结构性假设。
OCELOT 研究的问题是:能否跳过网格化状态重建,直接从过去观测预测未来?
这里需要把“直接”说清楚。论文使用的是来自 NOAA 全球资料同化系统观测资料流的质量控制记录,并非未经处理的原始传感器数据包。它没有读取 GDAS 分析场、再分析场、模式状态或同化增量,也没有把这些网格产品用作训练目标。
它与 GraphDOP、Aardvark 有什么区别
OCELOT 并非第一项端到端观测预报工作。
GraphDOP 已经展示了从地球系统观测学习中期预报的可能性。OCELOT 延续同一范式,换用了更明确的仪器专属图编码器和解码器,以及球面多面体网格上的 Transformer—GNN 混合处理器。论文没有给出两者的直接数值比较,因为训练资料、观测类型、预报时效和检验方法都不一致。
Aardvark Weather 也从观测出发,但它包含学习式分析环节,最终输出全球网格场和站点预报。OCELOT 的主要预测目标始终留在观测空间:模型接收目标位置、有效时间和仪器元数据查询,返回对应的未来测量值。它也可以在共享网格节点上生成诊断场,但这些网格场没有参与训练目标。
OCELOT 如何把不同观测放进同一个模型

OCELOT 采用编码器—处理器—解码器结构。整套流程可以理解成四步。
每类仪器先说自己的“语言”
模型接收七类观测家族,包括:
- ATMS、AMSU-A 等微波温度探测仪
- SSMIS 被动微波成像仪
- AVHRR、SEVIRI 可见光与红外成像仪
- ASCAT 散射计
- 全球探空资料
- AMDAR、AIREP 等飞机报告
- 陆地与海洋地面观测
这些数据不能直接拼成一个普通张量。卫星通道表示亮温或辐射,探空和飞机资料带有气压层信息,散射计还涉及波束与扫描几何。
OCELOT 给每一类仪器设置独立的 GATv2 图注意力编码器。观测值、经纬度、时间、通道和扫描角等元数据先被转换成统一维度的特征,再通过“观测节点—网格节点”二部图传到共享隐空间。
这种设计保留了仪器差异。新观测系统原则上可以通过新增编码器和解码器接入,不需要让所有资料先服从同一种规则网格格式。
共享球面网格负责融合信息
所有观测最终汇入一个经过 6 次细分的二十面体球面网格,共有 40,962 个节点。这个网格不直接表示固定高度上的温度、湿度或风,它承载模型学到的隐状态。
来自卫星、探空、飞机和地面站的信息可以在这里交换。某个区域没有探空观测时,模型仍可能从卫星辐射和周边观测中提取相关结构。
论文采用二维球面隐网格,没有显式建立三维垂直网格。气压层、卫星通道及其垂直敏感性被放进观测特征和解码条件中。这降低了图规模,也意味着垂直关系主要依靠数据学习,缺少明确的三维邻接结构。
Transformer 管时间,GNN 管空间
处理器把时间注意力和空间图传播交替使用。
滑动窗口 Transformer 在每个网格节点上读取最近的隐状态,学习 3 小时时间步之间的变化;空间 GNN 沿球面网格边传播信息,让局地变化和较大尺度结构发生联系。
每个样本包含起报前 12 小时的输入观测,以及随后 12 小时的预测目标。模型连续推进 4 次,每次 3 小时,得到 +3、+6、+9 和 +12 小时预报。每个时效都直接接受真实未来观测监督,中间预测值不会重新作为下一步的观测输入。这减少了短时滚动中的误差反馈,也限制了当前结论:12 小时稳定并不能自动外推到数天预报。
解码时重新找回仪器属性
共享隐状态需要重新变成不同仪器能够测到的量。
OCELOT 为每类仪器设置独立解码器。目标位置周围的网格节点提供大气信息,扫描角、气压层、有效时间和波束几何被投影成查询条件。模型据此输出指定位置、时刻和观测类型的预测值。
这一设计很关键。同一片大气状态经不同通道、扫描角和垂直层次观测后,数值不会相同。论文在开发阶段发现,缺少这些元数据条件时,卫星和探空预测会出现物理上不连贯的结果。
异构样本数量如何平衡
不同资料的样本量相差几个数量级。卫星像元可能远多于探空站,如果把全部误差直接平均,模型很容易优先照顾数据最密集的仪器。
OCELOT 先对无效和质控失败目标做掩膜,再计算各仪器内部误差,最后在仪器之间重新平衡。通道还可以单独设置权重。
这个损失函数解决了一个朴素却实际的问题:共享模型不能只学会预测“数量最多的观测”。不过,论文没有给出系统的权重消融,当前还难以判断各类观测之间的最优平衡方式。
实验结果
模型使用 2015—2023 年资料训练,2024 年用于验证和模型选择,2025 年完整留作测试。测试包含每天 00 UTC 和 12 UTC 两次起报,全年共 730 个初始时次。
这个按年份划分的设计避免了相邻随机样本泄漏,也让四季天气都进入评估。结果仍主要回答一个范围明确的问题:OCELOT v1 能否在 12 小时内,从过去观测生成空间和垂直结构连贯的未来观测。
卫星通道显示出跨仪器一致性

三个微波温度探测通道在 +12 小时的 RMSE 分别为:
- ATMS channel 7:1.87 K
- AMSU-A channel 7:1.24 K
- SSMIS channel 5:1.54 K
它们来自不同平台和扫描方式,却呈现相近的大尺度亮温结构。这个结果与“共享隐状态学到了一部分共同大气信息”的设计目标一致。
AVHRR 红外窗区通道更难,RMSE 为 3.95 K。它对地表温度、云顶辐射和像元内部差异更加敏感,残差也更局地化。当前数值说明不同观测类型都能进入同一框架,同时也显示仪器物理特性仍然决定了任务难度。
垂直廓线连续,但误差并不低

探空温度从地面到 10 hPa 的平均廓线与观测大体一致,RMSE 约为 3.2—5.2 K;飞机温度在 1000—200 hPa 范围内的 RMSE 约为 3.5—4.8 K。
更有信息量的是误差随气压平滑变化,没有出现某些层突然跳变。它说明压力层条件化至少学到了连续的垂直关系。不过,这些误差仍有改进空间,论文也没有检验静力、地转平衡或水分收支等物理一致性。
地面变量优于持续性预报,仍落后于 GFS

2 米气温的全年汇总结果最容易理解:
- OCELOT 从 +3 小时的 3.23 K 增至 +12 小时的 3.64 K
- GFS 从 2.75 K 缓慢增至 2.83 K
- 持续性预报在 +3 小时为 2.51 K,到 +12 小时升至 6.66 K
短时效下,简单持续性预报甚至优于 OCELOT;随着昼夜变化累积,持续性预报迅速失效,OCELOT 才显示出学到大气演变的优势。
在 +12 小时,OCELOT 的 10 米纬向和经向风 RMSE 分别为 2.53 和 2.61 m/s,GFS 为 2.19 和 2.16 m/s,持续性预报为 3.23 和 3.15 m/s。结论很清楚:OCELOT 已经超过无学习基线,业务 GFS 仍然更准。
这种比较对 OCELOT 并不完全公平。GFS 拥有循环资料同化、陆面模式和长期改进的物理参数化。它同时也提醒我们,空间结构看起来合理与达到业务精度是两回事。
这篇论文的价值与边界
价值在于改变训练接口
OCELOT 把 AI 天气预报的训练接口从“规则网格状态”改成了“带元数据的观测集合”。这种接口带来几项实际可能性:
- 避免把长期再分析作为唯一训练标签,扩大可利用的历史观测范围
- 直接预测卫星辐射等原生测量量,减少检索和网格化过程中的信息损失
- 用仪器专属模块接入新的观测系统,同时保留共享大气表示
- 在观测空间分析某类仪器对预报的影响,为 FSOI 等诊断提供新的实现路径
从方法结构看,可以把模型内部的球面隐状态理解为承担了部分“分析场”的作用。这是对架构的解释,并非论文已经验证的物理结论。隐状态没有被强制对应某组气象变量,却需要同时解释多种观测并向未来推进。这让 OCELOT 处在资料同化与预报模型之间,值得继续观察。
“摆脱再分析”需要保留边界
OCELOT 没有用再分析场监督,这一点成立。把它描述成完全摆脱数值天气预报仍然过早。
输入资料来自业务观测流程,已经包含仪器质控和预处理。未来观测位置、时间及仪器元数据还需要作为解码查询给定。模型输出主要是观测值,并不会自动提供天气业务所需的完整三维变量、降水概率和灾害产品。
资料同化的作用也不只在于生成一张规则网格。它处理观测误差、背景误差、动力平衡和缺测区域约束。OCELOT 当前通过数据驱动的共享隐状态吸收其中一部分功能,尚未证明能够覆盖完整业务系统。
当前版本还有缺口
预报时效只有 12 小时。 这个设置适合验证多源融合和短时滚动稳定性,无法支持中期预报结论,也很难完全区分动力学习与短时记忆。
对照基线仍不充分。 论文没有与 GraphDOP 做统一数据上的对比,也没有加入气候态、站点自回归模型等更强的纯观测基线。
地表信息不足。 OCELOT v1 没有把高程、陆海掩膜放进网格,也缺少部分地表敏感微波通道。这与复杂地形、海岸和边界层附近较大的温度、风误差相吻合。
物理一致性尚未系统检验。 大尺度空间结构连贯,不代表模型满足守恒关系、地转平衡或水分收支。极端事件中的位置偏差和强度平滑也没有得到充分评估。
Warning
当前稿件是投稿至 Artificial Intelligence for the Earth Systems 的 arXiv v1 预印本。方法、实验和表述仍可能在同行评审与后续版本中调整。
对大气与空气质量研究的启发
OCELOT 的设计可以迁移到观测形态高度不规则的环境任务。
例如,空气质量研究同时面对地面站、卫星柱浓度、激光雷达、走航和模式输出。可以为不同传感器设置独立编码器,把信息汇入共享时空图,再按站点、卫星像元或垂直廓线分别解码。
这类任务比短时气象预报多出排放和化学反应。共享隐状态需要同时接收排放、土地利用、边界条件和气象驱动,最好再加入质量守恒、化学约束或模式背景。仅靠观测学习,在监测稀疏地区很容易把“没有看见”误当成“没有变化”。
对于 WRF、CMAQ 或资料同化相关研究,更实际的起点有三项:
- 先测试观测原生编码能否减少卫星产品网格化带来的代表性误差
- 比较二维隐网格、分层三维图和模式网格在垂直结构上的差异
- 在同一观测档案和检验协议下,对照持续性、统计模型、资料同化与现有 AI 预报系统
OCELOT 还提供了一个值得深入的问题:如果隐状态能够稳定解释多种仪器,它是否也能帮助判断哪些观测真正改善了未来预报?论文已经把基于预报敏感度的观测影响诊断列为后续方向。对观测系统设计来说,这可能比单纯追求更低的平均 RMSE 更有价值。
总结
OCELOT 尝试直接连接过去观测与未来观测。仪器专属图编码器保留各类资料的几何和元数据,共享球面网格负责跨仪器融合,Transformer 与空间 GNN 推进隐状态,解码器再回到未来观测位置。
在 2025 年完整留出测试中,模型给出了空间连贯的卫星、探空、飞机和地面预报。地面温度与风在较长时效上优于同地点持续性预报,同时仍落后于业务 GFS。这组结果说明观测空间模型已经学到可用的短时大气演变,当前证据覆盖到 12 小时和论文给定的观测体系。
这篇论文适合放在“下一代 AI 天气预报接口”的背景下阅读。重点不在于 OCELOT 是否马上取代现有系统,而在于它证明了一件更基础的事:异构观测可以绕过网格化再分析标签,在共享隐空间中被融合、推进并重新解释。
后续能否延长时效、补足地表与物理约束、公开完整复现资料,并在统一基准上接近成熟业务系统,才决定这条路线能走多远。