Każda drużyna ma siłę ataku i obrony
Model hierarchiczny szacuje dla każdego klubu dwie liczby: ile goli potrafi strzelić i ile zwykle traci. Szacunki dla klubów w jednej lidze „pożyczają” sobie nawzajem informację, więc drużyna po czterech kolejkach nie dostaje skrajnej oceny na podstawie jednego wysokiego zwycięstwa. W modelu siedzą też: poziom rozgrywek (III liga, IV liga, okręgówka, A i B klasa), sezony oraz przewaga gospodarza. Mecze pucharowe między poziomami są dla modelu szczególnie cenne — to one kalibrują różnicę między ligami.
Gole to proces losowy
Z siły ataku jednej drużyny i obrony drugiej wychodzi oczekiwana liczba goli dla obu stron (to prognoza modelu, nie „xG” liczone ze strzałów w rozegranym meczu). Same gole model traktuje jako proces Poissona: przy oczekiwanych 1,8 gola czasem padnie jeden, czasem cztery. Z rozkładu wszystkich możliwych wyników bierze się i prawdopodobieństwo 1 / X / 2, i szansa na konkretny rezultat (te „najbardziej prawdopodobne wyniki” na stronach meczów), i macierz wyników.
2000 symulacji reszty sezonu
Każdy nierozegrany mecz jest losowany z rozkładu z kroku 2 — i tak 2000 razy dla całego sezonu. Za każdym razem powstaje inna końcowa tabela. Licząc, jak często drużyna kończy na danym miejscu, dostajemy prognozę punktów z przedziałem, prawdopodobieństwo mistrzostwa i spadku oraz heatmapę pozycji.
Czego model nie wie
- Kontuzji i zawieszeń — brak najlepszego napastnika nie zmienia prognozy.
- Składów — model nie widzi wyjściowej jedenastki ani rotacji przed pucharem.
- Pogody i boiska — ulewa, wiatr i grząska murawa obniżają liczbę goli, model tego nie uwzględnia.
- Motywacji — meczów o wszystko, meczów o nic i spraw pozaboiskowych.
- Transferów w trakcie okienka — nowy zespół widzi dopiero po wynikach.
Dlatego prawdopodobieństwo 80% nie znaczy „pewne”. Znaczy, że na dłuższą metę mniej więcej co piąty taki mecz kończy się inaczej — i tak też należy czytać każdą liczbę na tej stronie.
Uczciwość
Nie ukrywamy pomyłek. Na stronie każdej kolejki widać, ile typów model trafił, a ile spudłował; na stronie drużyny — jakie prawdopodobieństwo dawał temu, co faktycznie się wydarzyło, mecz po meczu. Na start strony historia trafień pochodzi z modelu douczonego już na tych wynikach (zawyża skuteczność); od teraz prognozy są zapisywane przed każdą kolejką i tylko takie będą liczone.
Stan danych: 30 sierpnia. Model wytrenowany 31 sierpnia na 4065 meczach.
Nie jesteśmy stroną bukmacherską
Strona nie jest związana z PZPN, wojewódzkimi związkami piłki nożnej ani żadnym bukmacherem. Nie publikujemy kursów, nie odsyłamy do operatorów zakładów i nie doradzamy typowania. To projekt statystyczny: interesuje nas, jak dobrze model opisuje regionalną piłkę i gdzie się myli. Liczby traktuj jak prognozę pogody — jako opis niepewności, nie jako zapowiedź wyniku.