MathPredictions

Hogyan működnek előrejelzéseink?

Az oldalon szereplő minden szám egyetlen folyamat kimenete, amely minden mérkőzésre ugyanúgy fut le. Nem szerkesztő válogatja a meccseket, ember nem ír felül valószínűséget, és semmit nem vonunk vissza csendben azután, hogy nem jött be.

Röviden: a mérkőzések frissessége szerint súlyozott támadó- és védőértékeket több szezon eredményéből becsüljük, azokat a lehetséges végeredmények teljes eloszlásává alakítjuk, összevetjük azzal, amit a fogadási piac beáraz, végül nyilvánosan elszámoljuk a tényleges eredménnyel szemben. Az alábbi szakaszok mindegyik lépést végigveszik.

A mögöttes adatok

A motort több szezonnyi lejátszott mérkőzésen illesztjük az itt lefedett összes sorozatból: végeredmények és félidei állások, megszerzett és elszenvedett szögletek, valamint az adatforrás által szállított lövés- és labdabirtoklási adatok, amelyek az oldalak kontextuspaneljeit és a szögletmodell tartalék láncát táplálják. Emellett ott van a fogadóirodai oddsok pillanatképe, amelyet az előrejelzés készítésekor rögzítünk, és amíg a mérkőzés még nyitva van, frissítünk. Az e-sportot, valamint a virtuális és szimulált sorozatokat kézzel karbantartott nyilvántartás alapján zárjuk ki, nem névegyezés alapján, így azok eredményei soha nem szennyezhetik egy valódi csapat értékét.

Időben súlyozott támadó- és védőértékek

Minden csapat visel egy támadó- és egy védőértéket: mennyit teremt és mennyit enged a saját közegéhez képest. A kettőt együtt becsüljük iteratív arányos illesztéssel, egy zárt alakú megoldóval, amely felváltva frissíti a támadást és a védekezést, amíg az egész halmaz vissza nem adja a benne ténylegesen megfigyelt gólmennyiséget, miközben minden múltbeli mérkőzést exponenciális frissességi mag diszkontál. A közelmúlt formája dominál, a régebbi szezonok pedig folyamatosan halványulnak el, ahelyett hogy egy önkényes szezonhatáron levágnánk őket. A becslés országonkénti halmazokon belül történik, amelyek egy ország osztályait és hazai kupasorozatait együtt tartják: így a kupapárosítások hidat képeznek az osztályok között, és egy feljutó csapat valódi ellenfelek ellen szerzett értékkel érkezik, nem üres lappal.

Amikor kevés az adat

A nyers értékek túlreagálják a kis mintákat, ezért mindegyiket a mögötte álló bizonyíték arányában húzzuk a halmaza referenciaértéke felé — ez az empirikus bayesi lépés akadályozza meg, hogy egy maroknyi rögzített mérkőzéssel rendelkező klub verhetetlennek tűnjön csak azért, mert kettő közülük 4-0-ra végződött. A bajnokságok alapszintjei ugyanezt a kezelést kapják a halmaz átlaga felé, ami megakadályozza, hogy egy kis sorozat egy nagy halmazon belül a zajra sodródjon. A húzás erejét az effektív mintaméret adja, nem a mérkőzések száma, így az erősen diszkontált régi meccsek joggal számítanak kevesebbet.

Az értékektől az eredmények eloszlásáig

Minden mérkőzésnél a két csapat értékei és a sorozat hazai, illetve idegenbeli alapszintjei mindkét oldalra várható gólszámot adnak. Ezeket a várható értékeket teljes eredmény-valószínűségi mátrixszá bontjuk ki — a 0-0-tól felfelé minden hihető végeredményre —, benne a Dixon-Coles korrekcióval a két gólszám közötti, jól dokumentált összefüggésre az alacsony gólszámú meccseken, vagyis pontosan ott, ahol a független Poisson-modellek tévednek és ahol a futball valójában zajlik. A mérkőzés kimenetele, a pontos végeredmény, a gólszám alatt/felett, a mindkét csapat szerez gólt, a kettős esély és az ázsiai hendikep mind ugyanabból a normalizált mátrixból olvasható ki. Két általunk közölt piac ezért nem mondhat ellent egymásnak: az alatt/felett ára és a pontos végeredmény ára ugyanaz az eloszlás, kétszer nézve.

A piac helyes olvasása

Ahol fogadóirodai oddsok vannak, azokat nem vesszük készpénznek. A közzétett oddsok tartalmazzák az iroda árrését, ezért ezt először eltávolítjuk, és az oddsokat tisztességes valószínűségekké alakítjuk. A hendikep- és gólszámvonalakat ezután egyenletrendszerként oldjuk meg arra a két mennyiségre, amelyet a piac valójában kifejez — a csapatok közötti erőkülönbségre és a várható összgólszámra —, ami sokkal stabilabb jelzés bármely egyedi ársornál. A negyedes vonalakat osztott tétes maggal árazzuk, amely pontosan kezeli a fél nyereség és fél veszteség eseteit, ahelyett hogy a legközelebbi egész vonalra kerekítenénk, ahogyan a közzétett modellek többsége csendben teszi.

Külön szögletmodell

A szögleteket nem a gólokból vezetjük le. Saját támadó- és védőértékük van — megszerzett és elszenvedett szögletek, ugyanazzal az időben súlyozott megoldóval becsülve —, oldalanként előrejelezzük őket, majd a mérkőzés pontos szögletvonalára árazzuk egy diszkretizált folytonos eloszlással, nem kikeresőtáblával. Ha egy csapat szögletmúltja túl szegényes ahhoz, hogy megbízzunk benne, a modell meghatározott láncon lép vissza: előbb az értékek, aztán az élő mérkőzésstatisztika, aztán már csak a piac. Ha ezek közül egyik sem éri el a küszöböt, a modell azt jelzi, hogy nincs adat, ahelyett hogy kitalálna egy számot.

Pontosság szerint súlyozott ötvözés

A modellt és a piacot az effektív mintaméreten alapuló pontosságsúlyozással ötvözzük: szegényes múltú csapatoknál a súly nagyobb részét a piac viszi, mélyen lefedett bajnokságokban a modell, az átmenet pedig folytonos, nem kapcsoló. Ha az ötvözés után is megmarad 5% vagy nagyobb értékkülönbség, a tipp value jelölést kap — a modell olyan előnyt állít, amelyet az odds nem tükröz, és ezt nyilvánosan, a kezdés előtt mondja ki, ahol utólag ellenőrizhető.

Kalibráció és mintán kívüli tesztelés

Semmi nem megy élesbe azért, mert egy visszateszt jól fest. A motort nagyjából félmillió múltbeli mérkőzésen validáljuk szigorú mintán kívüli szétválasztással: az értékeket kizárólag abból becsüljük, ami az adott kezdés előtt tudható volt, az eredményeket pedig log-loss és Brier-pontszám alapján értékeljük — valódi pontozási szabályok, amelyek büntetik a magabiztos tévedést ahelyett, hogy jutalmaznák —, mellettük a vonallal szembeni találati aránnyal és sávos kalibrációs görbékkel, amelyek ellenőrzik, hogy egy 60%-os tipp valóban körülbelül 60%-ban jön-e be. Az a verzió, amely nem éri el az elfogadási küszöböket, nem megy élesbe.

Nincs kézi válogatás

Minden alkalmas valódi labdarúgó-mérkőzés kap előrejelzést — nincs könnyű esetek kiválogatása. Az előrejelzések a kezdés előtt 30 perccel befagynak, és minden befagyasztott tippet elszámolunk a végeredménnyel szemben, majd beszámítunk a nyilvános találati mérlegbe, nyerőket és vesztőket egyaránt.