MathPredictions

預測如何產生

本站的每一個數字,都來自同一條對所有比賽一視同仁的流程。沒有編輯挑選場次,沒有人工修改機率,也沒有哪條預測在輸了之後被悄悄撤下。

概括來說:模型以近期比賽權重較高的方式,從多個賽季的賽果中擬合攻防評分,將其展開為所有可能比數的完整機率分布,再結合博弈市場的定價進行檢驗,最後依真實賽果公開結算。以下各節逐一說明這些步驟。

底層資料

模型使用本站所涵蓋賽事中多個賽季的已完賽資料進行擬合,包括全場與半場比數、球隊角球得失數,以及資料來源提供的射門和控球資料;後兩項用於頁面上的比賽背景資訊,並在角球資料不足時作為備用依據。同時,系統會在產生預測時記錄一份博弈業者賠率快照,並在開賽前持續更新。電競、虛擬賽事和模擬賽事透過人工維護的名錄排除,而非僅靠名稱比對,因此這些賽果不會混入真實球隊的評分。

帶時間衰減的攻防評分

每支球隊都有進攻評分和防守評分,用來衡量它相對於自身所處環境能夠攻進多少球、又會失掉多少球。兩項評分透過迭代比例擬合聯合求解:每輪分別對進攻和防守參數進行閉式更新,反覆迭代,直到整個樣本池能夠重現實際觀察到的進球水準。每場歷史比賽還會透過指數時間衰減函數降低權重,因此近期狀態占主導,而更早的賽季會平順淡出,不會在某個人為劃定的賽季邊界上突然被捨棄。擬合在按國家劃分的樣本池內進行,同一國家的各級聯賽與國內盃賽位於同一個池中。如此一來,盃賽對陣便能連結不同級別的聯賽,升班馬也會帶著從真實對手身上累積的評分進入新賽季,而不是從零開始。

樣本稀薄時的處理

原始評分容易對小樣本反應過度,因此每項評分都會根據其證據量向所在樣本池的先驗基準收縮。這一步經驗貝氏處理,可以避免一支只有寥寥數場紀錄的俱樂部僅因其中兩場以 4-0 獲勝,就被判斷得過於強大。各聯賽的基準水準也會以同樣方式向樣本池平均值收縮,防止大型樣本池中的小型賽事受隨機雜訊影響而偏離。收縮強度取決於有效樣本量,而不是單純的比賽場數,因此權重已大幅衰減的久遠比賽影響更小。

從評分到比數機率分布

對每場比賽,雙方的攻防評分與該賽事的主客場基準水準共同得出兩隊各自的預期進球數。這些期望值會展開為完整的比數機率矩陣,涵蓋從 0-0 開始的所有合理結果,並透過 Dixon-Coles 修正刻畫低比數比賽中兩隊進球數之間已有充分研究的相關性;這正是獨立卜瓦松模型容易產生偏差的區間。勝平負、正確比數、進球大小球、雙方均進球、雙重機會和亞洲讓球盤的機率,全部取自同一張正規化矩陣。因此本站發布的不同盤口不會互相矛盾:大小球和正確比數的定價,只是從不同角度讀取同一個機率分布。

正確解讀市場

對於有博弈業者賠率的場次,模型不會直接照單全收。公開賠率包含莊家利潤,因此會先剔除利潤率,還原為公平機率。接著,系統將讓球盤與大小球盤聯立求解,推導出市場真正表達的兩個量:雙方的實力差和預期總進球數。這比依賴任何單一賠率都更穩定。四分之一盤則依分注規則定價,準確處理半贏與半輸,而不是像許多公開模型那樣將其簡單取整。

獨立的角球模型

角球預測並不是從進球數推導出來的。模型會用同一套時間加權方法,依據球隊獲得和被對手獲得的角球數,分別擬合獨立的角球進攻與防守評分,並預測雙方角球數。接著,模型透過離散化的連續分布為該場比賽的實際角球盤口定價,而不是依賴查表。當一支球隊的角球紀錄不足以採信時,模型會依序採用球隊評分、即時比賽統計和純市場資訊作為備用依據。若所有來源都未達要求,模型會顯示「無資料」,而不是編造一個數字。

按精度加權的融合

模型與市場會根據有效樣本量進行精度加權融合:對於歷史資料較少的球隊,市場占有較高權重;在資料涵蓋充分的聯賽中,模型占有較高權重。兩者之間平順過渡,而不是直接切換。若融合後仍存在 5% 或以上的價值差,該預測會被標記為「價值推薦」,表示模型認為賠率尚未反映這項優勢。該判斷會在開賽前公開,任何人都可以在賽後驗證。

校準與樣本外檢驗

任何版本都不會只憑一份表現漂亮的回測就上線。引擎會在約五十萬場歷史比賽上,依照嚴格的時間順序進行樣本外驗證:每場比賽的評分只能使用開賽前已經可知的資訊擬合。預測結果透過對數損失和 Brier 分數等適當評分規則進行評估,這些指標會懲罰過度自信的錯誤;系統也會同時檢查盤口命中率和分組校準曲線,確認標示機率為 60% 的預測是否確實約有 60% 命中。未達驗收標準的版本不會上線。

不人工挑選比賽

每一場符合條件的真實足球比賽都會有預測,絕不只挑容易的場次。預測會在開賽前 30 分鐘鎖定;每筆鎖定後的預測都會依最終賽果結算,並計入公開成績紀錄,無論勝負都不會遺漏。