Is dat de trainingset van Pangu-Weather in 1979 begint (https://www.nature.com/articles/s41586-023-06185-3). Mijn vermoeden is dan 1 januari 1979. De auteurs van FourCastNet (voor wie het niet kent: een ander AI-weermodel, https://arxiv.org/abs/2202.11214) erkennen dat voor verschillende atmosferische variabelen een decorrelatietijd geldt (bij inference). Met name voor de niet-surface-variabelen is die lang (zie onder, ~9 dagen).
De architectuur van FourCastNet is met uitzondering van een aantal tweaks redelijk gelijkwaardig aan die van Pangu-Weather, zeker de onderliggende Transformer. Kortom, aannemende dat deze decorrelatietijd dus ook van toepassing is in Pangu-Weather, dan is de conclusie te trekken dat het patroon van de jaarwisseling '78-'79 na-ijlde in ongeveer de eerste week van data waarmee Pangu-Weather getraind is.
Wat een onhandig effect is bij Transformers is dat ze gevoelig zijn voor memorisatie: denk bijvoorbeeld aan de rechtszaak van de New York Times tegen OpenAI (het gaat in grote lijnen om dezelfde onderliggende technologie bij ChatGPT!). Door enkel de start van een artikel uit de NYT in te voeren, dreunde ChatGPT 1-op-1 het gehele artikel uit de trainingset op. Bij het beoordelen van de prestaties van een AI-model (het 'generaliseren': hoe goed kan het omgaan met nieuwe situaties) is het dan belangrijk om zeker te weten dat evaluatiedata niet in je trainingset heeft gezeten.
Dat vertaald naar deze context: het is dus goed om je te realiseren dat er een mogelijkheid bestaat dat Pangu-Weather (deels) memoriseert in deze situatie omdat de grootschalige patronen nog deels in de trainingdata zitten, ondanks dat het gaat om een miniem deel (~1 week op ca 39 jaar aan trainingdata) van de dataset. We kunnen overigens momenteel ook niet vaststellen of dat gebeurt of niet.
Dus absoluut eens dat deze ontwikkeling bijzondere aandacht verdient (ook ECMWF is hard aan het lopen met o.a. AIFS), maar goed om dit in het achterhoofd te houden voor iedereen die hier een interesse in heeft 