Come funzionano i nostri pronostici
Ogni numero presente su questo sito è il risultato di un'unica catena di elaborazione, identica per ogni partita. Nessun redattore sceglie gli incontri, nessuna persona corregge una probabilità e nulla viene ritirato in silenzio dopo aver perso.
In sintesi: le valutazioni di attacco e difesa, pesate in base a quanto è recente ogni partita, vengono stimate su più stagioni di risultati, trasformate in una distribuzione completa dei possibili risultati, confrontate con ciò che il mercato delle scommesse sta prezzando e infine regolate pubblicamente rispetto al risultato reale. Le sezioni seguenti descrivono ciascuno di questi passaggi.
I dati alla base
Il motore è stimato su più stagioni di partite concluse in tutte le competizioni coperte qui: risultati finali e del primo tempo, calci d'angolo ottenuti e concessi, oltre a tiri e possesso palla forniti dal feed, che alimentano i pannelli di contesto delle pagine e la catena di ripiego del modello sui corner. A questi si aggiunge un'istantanea delle quote dei bookmaker, rilevata quando il pronostico viene generato e aggiornata finché la partita resta aperta. Esports e competizioni virtuali o simulate vengono esclusi tramite un registro mantenuto manualmente e non per corrispondenza di nomi, così i loro risultati non possono mai contaminare la valutazione di una squadra reale.
Valutazioni di attacco e difesa pesate nel tempo
Ogni squadra porta con sé una valutazione di attacco e una di difesa: quanto crea e quanto concede rispetto al proprio contesto. Le due vengono stimate insieme tramite adattamento proporzionale iterativo, un risolutore in forma chiusa che alterna attacco e difesa finché l'intero gruppo non riproduce il volume di gol effettivamente osservato al suo interno, scontando ogni partita passata con un nucleo esponenziale di recenza. La forma recente domina e le stagioni più vecchie svaniscono gradualmente, invece di essere tagliate a un confine di stagione arbitrario. La stima avviene all'interno di gruppi per Paese che tengono insieme le divisioni di una nazione e le sue coppe nazionali: così le sfide di coppa fanno da ponte tra le categorie e una neopromossa arriva con una valutazione conquistata contro avversari reali anziché da foglio bianco.
Quando i dati sono pochi
Le valutazioni grezze reagiscono troppo ai campioni piccoli, perciò ciascuna viene attirata verso il valore di riferimento del proprio gruppo in proporzione all'evidenza che la sostiene: un passaggio bayesiano empirico che impedisce a un club con una manciata di partite registrate di sembrare imbattibile perché due di esse sono finite 4-0. I tassi di base dei campionati ricevono lo stesso trattamento verso la media del gruppo, il che evita che una piccola competizione dentro un gruppo grande vada alla deriva sul rumore. L'intensità di questa attrazione dipende dalla dimensione efficace del campione e non dal numero di partite, così le partite vecchie e fortemente scontate pesano giustamente meno.
Dalle valutazioni alla distribuzione dei risultati
Per ogni incontro le valutazioni delle due squadre e i tassi di base casalinghi e in trasferta della competizione producono un numero atteso di gol per parte. Queste attese vengono espanse in una matrice completa di probabilità dei risultati — ogni esito plausibile a partire dallo 0-0 — con la correzione di Dixon-Coles per la dipendenza ben documentata tra i due punteggi nelle partite a basso punteggio, proprio ciò che i modelli di Poisson indipendenti sbagliano esattamente dove il calcio vive davvero. Esito finale, risultato esatto, over/under, entrambe le squadre segnano, doppia chance e handicap asiatico si leggono tutti da quell'unica matrice normalizzata. Due mercati che pubblichiamo non possono quindi contraddirsi: la quota dell'over/under e quella del risultato esatto sono la stessa distribuzione, vista due volte.
Leggere il mercato nel modo giusto
Dove esistono quote dei bookmaker, non vengono prese per buone. Le quote pubblicate contengono il margine del bookmaker, quindi vengono prima ripulite da quel margine e convertite in probabilità eque. Le linee di handicap e di totale vengono poi risolte come sistema per le due grandezze che il mercato esprime davvero — il divario di forza tra le squadre e il totale di gol atteso —, un segnale molto più stabile di qualsiasi singola quota. Le linee a quarto sono prezzate tramite un nucleo a puntata divisa che tratta con esattezza i casi di mezza vincita e mezza perdita, invece di arrotondarle alla linea intera più vicina come fa silenziosamente la maggior parte dei modelli pubblicati.
Un modello dedicato ai calci d'angolo
I calci d'angolo non vengono dedotti dai gol. Hanno valutazioni proprie di attacco e difesa — corner ottenuti e concessi, stimati con lo stesso risolutore pesato nel tempo —, vengono proiettati per ciascuna squadra e poi prezzati sulla linea corner esatta della partita tramite una distribuzione continua discretizzata, non con una tabella di consultazione. Quando lo storico dei corner di una squadra è troppo scarso per essere affidabile, il modello ripiega lungo una catena definita: prima le valutazioni, poi le statistiche live della partita, poi il solo mercato. Se nessuno di questi livelli supera la soglia, il modello dichiara che non ci sono dati invece di inventare un numero.
Combinazione pesata sulla precisione
Modello e mercato vengono combinati con una ponderazione per precisione basata sulla dimensione efficace del campione: il mercato porta gran parte del peso per le squadre con storico scarso, il modello prevale nei campionati con copertura profonda e il passaggio tra i due è continuo, non un interruttore. Quando dopo questa combinazione sopravvive uno scarto di valore del 5% o più, il pronostico viene segnalato come value: il modello sostiene di avere un vantaggio che la quota non riflette, e lo dice pubblicamente prima del fischio d'inizio, dove chiunque può verificarlo in seguito.
Calibrazione e test fuori campione
Nulla va online perché un backtest sembra bello. Il motore è validato su circa mezzo milione di partite storiche con una separazione rigorosa fuori campione: le valutazioni vengono stimate solo su ciò che era conoscibile prima di ogni fischio d'inizio e gli esiti sono valutati con log-loss e punteggio di Brier — regole di punteggio proprie che puniscono l'errore sicuro di sé invece di premiarlo — insieme al tasso di successo contro la linea e a curve di calibrazione per fasce, che verificano se un pronostico al 60% vince davvero circa il 60% delle volte. Una versione che manca le soglie di accettazione non entra in produzione.
Nessuna selezione manuale
Ogni partita di calcio reale idonea riceve un pronostico: nessuna scelta dei casi facili. I pronostici vengono congelati 30 minuti prima del fischio d'inizio, e ogni pronostico congelato viene regolato sul risultato finale e conteggiato nello storico pubblico di precisione, vittorie e sconfitte allo stesso modo.