Wie gut das Orakel trifft — und wie viele es lesen. Fachbegriffe erklärt →
Bots und Scanner herausgefiltert; IPv6-Adressen pro Haushalt (/64) zusammengefasst.
Was heute im Einsatz ist, bewertet über die gesamte Saison-Historie (Apr–Okt, ~10 Jahre): die Regel und das destillierte logistische Modell. Beide auf demselben Tage-Set.
Peirce-Score (Sensitivität + Spezifität − 1). 0 = nicht besser als Raten, 1 = perfekt. Positiv = nützlich. (68 Gewittertage, nach Thermik gewertet (LI entkoppelt).)
Anteil der Tage, an denen die Vorhersage genau die richtige Kategorie (Session / marginal / kein Wind) getroffen hat.
Was ein stumpfer „immer dasselbe"-Tipp (die häufigste Kategorie) träfe. Die Vorhersage muss das schlagen, um nützlich zu sein.
| Vorhersage ↓ Tatsächlich → | LÄUFT | VIELLEICHT | FLAUTE |
|---|---|---|---|
| LÄUFT | 352 | 336 | 378 |
| VIELLEICHT | 145 | 155 | 260 |
| FLAUTE | 42 | 73 | 239 |
Zeilen = was vorhergesagt wurde, Spalten = was tatsächlich am See passiert ist. Auf der Diagonalen liegen die Treffer.
Sensitivität und Spezifität sind binäre Maße. Dafür werden die drei Kategorien zu „Wind-Tag ja/nein“ zusammengefasst: LÄUFT und VIELLEICHT zählen als Wind-Tag, FLAUTE als kein Wind — sowohl bei der Vorhersage als auch beim tatsächlichen Ausgang.
Dasselbe Tages-Set wie oben, aber Vorhersage = der experimentelle logistische ML-Klassifikator. Treibt nie die offizielle Vorhersage — nur Vergleich. (68 Gewittertage, nach Thermik gewertet (LI entkoppelt).)
Anteil der Tage, an denen die Vorhersage genau die richtige Kategorie (Session / marginal / kein Wind) getroffen hat.
Was ein stumpfer „immer dasselbe"-Tipp (die häufigste Kategorie) träfe. Die Vorhersage muss das schlagen, um nützlich zu sein.
| Vorhersage ↓ Tatsächlich → | LÄUFT | VIELLEICHT | FLAUTE |
|---|---|---|---|
| LÄUFT | 265 | 165 | 251 |
| VIELLEICHT | 158 | 252 | 164 |
| FLAUTE | 116 | 147 | 462 |
Zeilen = was vorhergesagt wurde, Spalten = was tatsächlich am See passiert ist. Auf der Diagonalen liegen die Treffer.
Sensitivität und Spezifität sind binäre Maße. Dafür werden die drei Kategorien zu „Wind-Tag ja/nein“ zusammengefasst: LÄUFT und VIELLEICHT zählen als Wind-Tag, FLAUTE als kein Wind — sowohl bei der Vorhersage als auch beim tatsächlichen Ausgang.
Alle drei Modelle auf demselben Tage-Set bewertet — aber nur auf den Jahren ab 2023, die zum Testen zurückgehalten und in keinem Modell mittrainiert wurden. Sonst würde das HGB-Modell auf genau den Tagen geprüft, aus denen es gelernt hat, und künstlich gut aussehen. Hier laufen die Regel sowie die bis 2022 trainierten Logistik- und HGB-Modelle gegeneinander.
Peirce-Score (Sensitivität + Spezifität − 1). 0 = nicht besser als Raten, 1 = perfekt. Positiv = nützlich.
Anteil der Tage, an denen die Vorhersage genau die richtige Kategorie (Session / marginal / kein Wind) getroffen hat.
Was ein stumpfer „immer dasselbe"-Tipp (die häufigste Kategorie) träfe. Die Vorhersage muss das schlagen, um nützlich zu sein.
| Vorhersage ↓ Tatsächlich → | LÄUFT | VIELLEICHT | FLAUTE |
|---|---|---|---|
| LÄUFT | 125 | 125 | 151 |
| VIELLEICHT | 63 | 52 | 88 |
| FLAUTE | 14 | 22 | 75 |
Zeilen = was vorhergesagt wurde, Spalten = was tatsächlich am See passiert ist. Auf der Diagonalen liegen die Treffer.
Sensitivität und Spezifität sind binäre Maße. Dafür werden die drei Kategorien zu „Wind-Tag ja/nein“ zusammengefasst: LÄUFT und VIELLEICHT zählen als Wind-Tag, FLAUTE als kein Wind — sowohl bei der Vorhersage als auch beim tatsächlichen Ausgang.
Dasselbe Tages-Set wie oben, aber Vorhersage = der experimentelle logistische ML-Klassifikator. Treibt nie die offizielle Vorhersage — nur Vergleich.
Anteil der Tage, an denen die Vorhersage genau die richtige Kategorie (Session / marginal / kein Wind) getroffen hat.
Was ein stumpfer „immer dasselbe"-Tipp (die häufigste Kategorie) träfe. Die Vorhersage muss das schlagen, um nützlich zu sein.
| Vorhersage ↓ Tatsächlich → | LÄUFT | VIELLEICHT | FLAUTE |
|---|---|---|---|
| LÄUFT | 75 | 63 | 74 |
| VIELLEICHT | 65 | 77 | 72 |
| FLAUTE | 62 | 59 | 168 |
Zeilen = was vorhergesagt wurde, Spalten = was tatsächlich am See passiert ist. Auf der Diagonalen liegen die Treffer.
Sensitivität und Spezifität sind binäre Maße. Dafür werden die drei Kategorien zu „Wind-Tag ja/nein“ zusammengefasst: LÄUFT und VIELLEICHT zählen als Wind-Tag, FLAUTE als kein Wind — sowohl bei der Vorhersage als auch beim tatsächlichen Ausgang.
Vorhersage = HistGradientBoosting. Trainiert auf den Jahren bis 2022, deshalb hier nur auf den Testjahren ab 2023 bewertet (anderes, kleineres Tages-Set als oben). Das stärkste Modell im Vergleich — läuft als Blackbox-Parallelmodell live mit, treibt die offizielle Vorhersage aber nie.
Anteil der Tage, an denen die Vorhersage genau die richtige Kategorie (Session / marginal / kein Wind) getroffen hat.
Was ein stumpfer „immer dasselbe"-Tipp (die häufigste Kategorie) träfe. Die Vorhersage muss das schlagen, um nützlich zu sein.
| Vorhersage ↓ Tatsächlich → | LÄUFT | VIELLEICHT | FLAUTE |
|---|---|---|---|
| LÄUFT | 76 | 58 | 61 |
| VIELLEICHT | 51 | 81 | 61 |
| FLAUTE | 75 | 60 | 192 |
Zeilen = was vorhergesagt wurde, Spalten = was tatsächlich am See passiert ist. Auf der Diagonalen liegen die Treffer.
Sensitivität und Spezifität sind binäre Maße. Dafür werden die drei Kategorien zu „Wind-Tag ja/nein“ zusammengefasst: LÄUFT und VIELLEICHT zählen als Wind-Tag, FLAUTE als kein Wind — sowohl bei der Vorhersage als auch beim tatsächlichen Ausgang.