Wie gerechnet wird
Die meisten Wetterseiten zeigen eine Zahl und verschweigen, woher sie kommt. Diese hier führt 11 Wettermodelle zusammen und legt für jeden Tag offen, welches Modell was gemeldet hat, wie stark es gewogen wurde und was verworfen wurde. Was hier steht, ist keine Werbung für das Verfahren — es ist die Bedienungsanleitung dazu, samt seiner Grenzen.
Der Grundgedanke
Kein Wettermodell ist überall am besten. Das ECMWF-Modell ist in der Mittelfrist stark, ICON und MOSMIX kennen Deutschland genauer, GFS ist frei verfügbar und rechnet oft anders als die europäischen Modelle. Wer nur eins davon anzeigt, übernimmt dessen Schwächen ungefiltert. Wer alle mittelt, verwischt echte Unterschiede und lässt sich von einem kaputten Wert verschieben.
Deshalb: gewichtet zusammenführen, Ausreißer robust erkennen, und die Uneinigkeit als eigene Information mitliefern. Wenn sich die Modelle nicht einig sind, sollst du das sehen — statt einer scheinbar sicheren Zahl, hinter der sich eine Bandbreite von acht Grad versteckt.
Woher die Daten kommen
Alle Vorhersagen werden stündlich abgerufen und im Stundenraster verarbeitet. Fremde Tageswerte werden bewusst nicht verwendet: Anbieter definieren Tagesgrenzen unterschiedlich (UTC-Mitternacht gegen Ortszeit) und „Regenwahrscheinlichkeit des Tages" mal als Maximum, mal als Mittel. Wer solche Tageswerte mischt, misst am Ende die Unterschiede der Definitionen statt der Unterschiede der Modelle — und das Maß für die Einigkeit wäre schlicht falsch. Die Tage werden deshalb hier gebildet, in der Zeitzone des angezeigten Ortes.
| Modell | Betreiber | Auflösung | Basisgewicht | Herkunftsgruppe |
|---|---|---|---|---|
| ECMWF IFS | Europäisches Zentrum für mittelfristige Wettervorhersage | 25 km, global | 1,00 | ecmwf |
| MOSMIX | Deutscher Wetterdienst (über Bright Sky) | Stationsvorhersage (statistisch nachbearbeitet) | 1,00 | mosmix |
| ICON | Deutscher Wetterdienst | 2–7 km (Europa) | 0,95 | icon |
| Locationforecast | MET Norway (Yr) | 1 km (Nordeuropa), sonst global | 0,90 | metno |
| UM | UK Met Office | 2–10 km | 0,90 | ukmo |
| ARPEGE/AROME | Météo-France | 1,3–11 km | 0,85 | mf |
| HARMONIE | KNMI (Niederlande) | 2 km (Benelux/Nordsee) | 0,85 | knmi |
| HARMONIE | DMI (Dänemark) | 2 km (Nordeuropa) | 0,85 | dmi |
| GFS | NOAA (USA) | 13 km, global | 0,80 | gfs |
| GEM | Environment Canada | 15 km, global | 0,75 | gem |
| GSM/MSM | Japan Meteorological Agency | 5–55 km | 0,70 | jma |
| OpenWeather | OpenWeather Ltd. | eigener Blend | 0,60 | owm — nur mit hinterlegtem Schlüssel |
| WeatherAPI | WeatherAPI.com | eigener Blend | 0,60 | wapi — nur mit hinterlegtem Schlüssel |
Die Basisgewichte sind eine redaktionelle Einschätzung — abgeleitet aus veröffentlichten Verifikationsergebnissen der Betreiber und aus der räumlichen Auflösung, aber nicht aus einer eigenen, laufenden Fehlermessung. Das ist ehrlich so zu sagen: Sie sind begründet, aber sie sind kein Beweis. Wer sie ändert, ändert die Vorhersage — und diese Tabelle ändert sich dann automatisch mit, weil sie aus derselben Datei kommt, aus der der Server rechnet.
Warum manche Modelle sich einen Platz teilen
Einige der Reihen stammen aus derselben Quelle: Verschiedene Anbieter verarbeiten dasselbe Grundmodell weiter. Zählte man sie als getrennte Meinungen, stimmte dieses Modell mehrfach ab, die Streuung schrumpfte künstlich — und die Seite behauptete eine Einigkeit, die es nicht gibt.
Deshalb hat jedes Modell eine Herkunftsgruppe, und wenn k Mitglieder einer Gruppe
mitrechnen, bekommt jedes davon den Faktor 1/√k. Und für die Frage „wie viele
unabhängige Meinungen sind das eigentlich?" wird die Kish-Formel über die Gruppen
gerechnet, nicht über die Modelle. Der Unterschied ist erheblich: Bei vier Modellen aus zwei Familien
kommen so rund 1,9 unabhängige Meinungen heraus statt der geschönten 3,7, die eine
Rechnung über die Einzelmodelle liefern würde. Diese Zahl steht im Details-Panel jedes Tages.
Ausreißer: MAD statt Quartile
Bei vier bis acht Werten sind Quartile schlecht definiert — die übliche IQR-Regel taugt hier nicht.
Stattdessen die mittlere absolute Abweichung vom Median: σ̂ = 1,4826 · median(|xᵢ − med|),
und ein Modell fliegt heraus, wenn |xᵢ − med| / σ̂ über der Schwelle liegt.
Drei Sicherungen gehören dazu, und alle drei sind nicht optional:
- Ein Mindestwert für σ̂. Sagen fünf Modelle exakt 12,0 °C, ist die MAD null — und das sechste flöge wegen 12,3 °C mit unendlichem Abstand heraus. Der Mindestwert (1 °C bei Temperatur, 4 km/h bei Wind) verhindert das.
- Erst ab vier Modellen. Bei dreien gibt es keinen belastbaren Median, und nie werden mehr als die Hälfte verworfen.
- Bei zwei Klumpen wird nichts verworfen. Wenn sich das Ensemble in zwei Gruppen teilt, sind das zwei mögliche Wetterlagen — eine echte Aussage, keine Störung. Sie gehört angezeigt, nicht weggerechnet.
Niederschlag rechnet anders
Der Mittelwert von {0, 0, 0, 0, 12 mm} ist 2,4 mm — ein Tag, den niemand erlebt.
Schlimmer noch: Die MAD wäre null, und ausgerechnet das eine Modell mit der interessanten Information
flöge als „Ausreißer" heraus.
Deshalb zweiteilig (Hurdle-Modell): Zuerst der gewichtete Anteil der Modelle, die überhaupt Nässe sehen — das ist die Chance. Dann das gewichtete geometrische Mittel nur über diese nassen Modelle — das ist die Menge, wenn es regnet. Angezeigt wird beides: „40 % Chance, dann 2–7 mm" statt eines erfundenen „0,8 mm".
Das Wettersymbol wird abgestimmt, nicht gemittelt
Ein Mittelwert über Wettercodes ist Unsinn: Der Mittelwert von „klar" und „Gewitter" wäre „Niesel". Abgestimmt wird deshalb zweistufig — erst über die Gruppe (trocken / nass / gefroren / Gewitter, also die Entscheidung, die du wirklich triffst), dann über die genaue Klasse innerhalb der Siegergruppe. Bei Gleichstand gewinnt das schwerere Wetter: Ein zu viel angezeigtes Gewitter kostet weniger als ein verpasstes.
„Modell-Einigkeit" ist keine Trefferquote
Die Prozentzahl auf der Startseite sagt: Wie einig sind sich die Modelle? Sie sagt ausdrücklich nicht: „Mit dieser Wahrscheinlichkeit trifft die Vorhersage zu." Ensemble-Streuung und tatsächliche Trefferquote hängen zusammen, aber die Zahl ist nicht darauf kalibriert — dafür bräuchte es eine jahrelange eigene Verifikation gegen Messwerte.
Sie setzt sich aus vier Teilen zusammen: Temperatur (35 %), Wie das Wetter wird (25 %), Regen oder trocken (20 %) und Wie viele Dienste (20 %). Wieviel Abstand dabei als „weit auseinander" gilt, wächst mit dem Vorhersagehorizont — dass Tag 7 unschärfer ist als Tag 1, ist keine Störung, sondern Physik.
Welcher dieser vier Teile an einem bestimmten Tag die wenigsten Punkte bekommt, muss man hier nicht suchen: Auf der Startseite steht es unter Details an der Einigkeits-Karte, und in der Aufschlüsselung jedes einzelnen Tages ebenso — mit den Zahlen dieses Tages statt mit dem Verfahren im Allgemeinen.
Was tatsächlich eingetroffen ist
Alles bisher Beschriebene ist begründet — die Gewichte, die Ausreißergrenze, die Formel für die Einigkeit. Begründet heißt nicht belegt. Deshalb misst diese Seite sich selbst nach: Jeden Tag wird festgehalten, was jedes Modell für 12:00 UTC des Folgetags gesagt hat, immer mit rund einem Tag Vorlauf. Ist die Stunde vorbei, wird die Vorhersage gegen die echte Stationsmessung des Deutschen Wetterdienstes gehalten.
Wichtig dabei: Es sind Messungen, keine Analysen. Dieselbe Schnittstelle liefert für die Zukunft eine Vorhersage (MOSMIX); würde die mitgezählt, verglichen wir Vorhersagen mit Vorhersagen und nennten das Messung. Das Ergebnis sähe hervorragend aus und wäre wertlos — jede Stunde wird deshalb daraufhin geprüft, aus welcher Quelle sie stammt.
| Modell | Vergleiche | Ø Fehler | nass/trocken richtig |
|---|---|---|---|
| MOSMIX | 32 | 0,93 K | 100 % |
| ICON | 32 | 1,34 K | 100 % |
| ECMWF IFS | 32 | 1,39 K | 97 % |
| GFS | 32 | 1,45 K | 100 % |
| HARMONIE | 32 | 1,46 K | 100 % |
| HARMONIE | 32 | 1,53 K | 100 % |
| Locationforecast | 32 | 1,63 K | 100 % |
| ARPEGE/AROME | 32 | 1,64 K | 100 % |
| GEM | 32 | 1,73 K | 100 % |
| UM | 32 | 1,79 K | 100 % |
| GSM/MSM | 32 | 2,33 K | 100 % |
Ø Fehler ist der mittlere absolute Fehler in Kelvin, nicht der mittlere Fehler: Ein Modell, das abwechselnd zwei Grad zu warm und zwei zu kalt liegt, käme sonst auf null und sähe fehlerfrei aus.
Und was die Seite daraus lernt
Messen allein ändert nichts. Deshalb zieht die Seite aus den gemessenen Abweichungen zwei Konsequenzen — und beide sind ausdrücklich klein und sichtbar:
- Systematischer Versatz wird abgezogen. Liegt ein Modell an einem Ort regelmäßig in dieselbe Richtung daneben — sagen wir anderthalb Grad zu warm —, wird dieser Betrag abgezogen, bevor es in die Zusammenführung geht. Regelmäßig heißt: in dieselbe Richtung. Ein Modell, das abwechselnd zwei Grad zu warm und zwei zu kalt liegt, wird nicht korrigiert; dort gibt es keinen Versatz, nur Streuung, und wer die „korrigiert", verschiebt eine gute Vorhersage nach dem Zufall der letzten Wochen.
- Das Gewicht wird nachjustiert, nach gemessener Genauigkeit — aber höchstens um 25 %. Die Gewichte in der Tabelle oben sind begründet und stehen in der Versionsgeschichte; die Messung darf sie nachschärfen, nicht ersetzen.
Dazu drei Sicherungen, die man kennen sollte: Korrigiert wird erst ab 30 geprüften Vergleichen, nur wenn der Versatz statistisch belastbar ist, und immer gedeckelt. Und gelernt wird ausschließlich aus der rohen Vorhersage — nie aus einer bereits korrigierten. Sonst maße die nächste Runde den Rest ihrer eigenen Korrektur, zöge erneut ab, und die Vorhersage liefe sich selbst hinterher.
Nichts davon geschieht still. Was gerade abgezogen wird und warum, steht in der Antwort des Servers und im Verwaltungsbereich — und es lässt sich mit einem Schalter abstellen. Eine Vorhersage, die sich heimlich nachjustiert, wäre das Gegenteil dessen, wofür es diese Seite gibt.
Zwei Einschränkungen, die dazugehören:
- Das gilt nur für Deutschland. Belastbare Stationswerte gibt es hier über das DWD-Netz. Außerhalb wird gar nichts erst gespeichert — eine Zeile, die nie geprüft werden kann, ist kein Datensatz, sondern Müll mit Zeitstempel.
- Die Gewichte oben ändern sich davon nicht. Das ist Absicht. Gewichte, die sich still nachjustieren, wären das Gegenteil einer offengelegten Rechnung: Die Tabelle, die du hier liest, beschriebe dann nicht mehr, was der Server rechnet. Wenn aus diesen Messungen einmal eine Anpassung folgt, steht sie in der Versionsgeschichte — und hier.
Wenn Modelle ausfallen — oder du selbst weniger auswählst
Wettermodelle sind manchmal nicht erreichbar. Dann rechnet die Seite mit dem, was da ist — und sagt es. Bei zwei bis drei Modellen wird die angezeigte Einigkeit gedeckelt, bei einem einzigen ist sie auf 30 % begrenzt und die Quelle wird benannt. Eine einzelne Quelle darf hier nie stillschweigend maßgeblich sein. Und Tage ganz ohne Daten stehen sichtbar als solche da — die Woche wird nie klammheimlich auf fünf Tage verkürzt, damit es voll aussieht.
Dasselbe gilt, wenn du dir selbst zusammenstellst, welche Modelle mitrechnen sollen: Der Deckel richtet sich danach, wie viele Reihen tatsächlich abstimmen, nicht danach, ob das ein Ausfall oder deine Entscheidung war. Damit die Zahl dann nicht im Widerspruch zu ihrer eigenen Aufschlüsselung steht, nennt diese in so einem Fall beide Werte — die Summe der vier Teile und den angezeigten, gedeckelten Wert — samt Grund. Eine Rechnung offenzulegen und ihr Ergebnis stillschweigend zu korrigieren wäre das Gegenteil dessen, wofür es diese Seite gibt.
Was diese Seite nicht kann
- Sie ist keine Unwetterwarnung. Amtliche Warnungen kommen vom Deutschen Wetterdienst und gelten unabhängig davon, was hier steht. Bei Unwetterlage gilt die amtliche Warnung.
- Sie ist nicht kalibriert. Es gibt zwar seit Neuestem eine laufende Messung gegen DWD-Stationswerte (siehe oben) — daraus folgt aber weder eine kalibrierte Wahrscheinlichkeit noch eine Anpassung der Gewichte. Gewichte und Einigkeitsmaß sind begründet und werden überprüft, aber sie sind nicht statistisch hergeleitet.
- Sie kennt keine lokalen Besonderheiten. Föhn, Seewind, Kaltluftseen im Tal — kein globales Modellraster löst das auf, und ein Mittelwert daraus auch nicht.
- Sie ist nur so gut wie ihre Quellen. Liegen alle Modelle daneben, liegt auch die Zusammenführung daneben. Ein Ensemble ist kein besseres Modell, sondern ein ehrlicheres.
Daten und Datenschutz
Die Wettermodelle werden über den Server dieser Seite abgefragt, nicht aus deinem Browser heraus. Deine Koordinate geht damit an einen Server statt an sechs Fremdanbieter. Die Antworten liegen auf ein Raster von etwa fünf Kilometern gerundet im Zwischenspeicher — zwei Menschen in derselben Stadt teilen sich also einen Abruf, und die gespeicherte Position ist bewusst ungenau.
Deine gemerkten Orte und der Verlauf liegen ausschließlich in deinem Browser (localStorage). Sie gehen nie an den Server, es gibt kein Konto und keine Kennung. Nach deinem Standort fragt die Seite genau einmal — beim ersten Besuch — und danach nur noch, wenn du den Knopf drückst. Mehr dazu in der Datenschutzerklärung.
Quellenangaben
- Open-Meteo.com — Wetterdaten unter CC BY 4.0; liefert die Modelle ECMWF, ICON, GFS, ARPEGE, GEM, JMA, UKMO, KNMI und DMI.
- MET Norway — Locationforecast, Norwegisches Meteorologisches Institut, NLOD / CC BY 4.0.
- Bright Sky — offene Schnittstelle zu den Daten des Deutschen Wetterdienstes (MOSMIX-Stationsvorhersage).
- Ortssuche nach Namen über das Geocoding von Open-Meteo; Suche nach Postleitzahl über Nominatim — Daten © OpenStreetMap-Mitwirkende, ODbL. Rückwärtssuche (Koordinate → Ortsname) über BigDataCloud.
Zwei Dienste für die Ortssuche sind kein Zufall: Open-Meteos Geocoding sucht ausschließlich nach Namen und antwortet auf „93047" mit einem leeren Ergebnis. Rein numerische Eingaben gehen deshalb an Nominatim, das Postleitzahlen kennt. Da eine Postleitzahl weltweit mehrdeutig ist — „80331" gibt es in München und in der Ukraine — wird das Land deiner Browsersprache in der Trefferliste nach vorn sortiert. Es entscheidet nur die Reihenfolge, nie was gefunden wird.