MathPredictions

预测如何生成

本站的每一个数字,都来自同一条对所有比赛一视同仁的流程。没有编辑挑选场次,没有人工修改概率,也没有哪条预测在输了之后被悄悄撤下。

概括来说:模型以近期比赛权重更高的方式,从多个赛季的赛果中拟合攻防评分,将其展开为所有可能比分的完整概率分布,再结合博彩市场的定价进行校验,最后按真实赛果公开结算。以下各节逐一说明这些步骤。

底层数据

模型使用本站所覆盖赛事中多个赛季的已完赛数据进行拟合,包括全场与半场比分、球队角球得失数,以及数据源提供的射门和控球数据;后两项用于页面上的比赛背景信息,并在角球数据不足时作为备用依据。同时,系统会在生成预测时记录一份博彩公司赔率快照,并在开赛前持续更新。电竞、虚拟赛事和模拟赛事通过人工维护的名录剔除,而非仅靠名称匹配,因此这些赛果不会混入真实球队的评分。

带时间衰减的攻防评分

每支球队都有进攻评分和防守评分,用来衡量它相对于自身所处环境能够打进多少球、又会失掉多少球。两项评分通过迭代比例拟合联合求解:每轮分别对进攻和防守参数进行闭式更新,反复迭代,直到整个样本池能够重现实际观察到的进球水平。每场历史比赛还会通过指数时间衰减函数降低权重,因此近期状态占主导,而更早的赛季会平滑淡出,不会在某个人为划定的赛季边界上突然被舍弃。拟合在按国家划分的样本池内进行,同一国家的各级联赛与国内杯赛处于同一个池中。这样,杯赛对阵便能连接不同级别的联赛,升班马也会带着从真实对手身上获得的评分进入新赛季,而不是从零开始。

样本稀薄时的处理

原始评分容易对小样本反应过度,因此每项评分都会根据其证据量向所在样本池的先验基准收缩。这一步经验贝叶斯处理,可以避免一支只有寥寥数场记录的俱乐部仅因其中两场以 4-0 获胜,就被判断得过于强大。各联赛的基准水平也会以同样方式向样本池均值收缩,防止大型样本池中的小型赛事受随机噪声影响而偏离。收缩强度取决于有效样本量,而不是简单的比赛场数,因此权重已大幅衰减的久远比赛影响更小。

从评分到比分概率分布

对每场比赛,双方的攻防评分与该赛事的主客场基准水平共同给出两队各自的期望进球数。这些期望值会被展开为完整的比分概率矩阵,涵盖从 0-0 开始的所有合理结果,并通过 Dixon-Coles 修正刻画低比分比赛中两队进球数之间已有充分研究的相关性;这正是独立泊松模型容易出现偏差的区间。胜平负、准确比分、进球大小球、双方均进球、双重机会和亚洲让球盘的概率,全部取自同一张归一化矩阵。因此本站发布的不同盘口不会自相矛盾:大小球和准确比分的定价,只是从不同角度读取同一个概率分布。

正确解读市场

对于有博彩公司赔率的场次,模型不会直接照单全收。公开赔率包含庄家利润,因此会先剔除利润率,还原为公平概率。随后,系统将让球盘与大小球盘联立求解,推导出市场真正表达的两个量:双方的实力差和期望总进球数。这比依赖任何单一赔率都更稳定。四分之一盘口则按分注规则定价,准确处理半赢与半输,而不是像许多公开模型那样将其简单取整。

独立的角球模型

角球预测并不是从进球数推导出来的。模型会用同一套时间加权方法,根据球队获得和被对手获得的角球数,分别拟合独立的角球进攻与防守评分,并预测双方角球数。随后,模型通过离散化的连续分布为该场比赛的实际角球盘口定价,而不是依赖查表。当一支球队的角球历史不足以采信时,模型会依次采用球队评分、实时比赛统计和纯市场信息作为备用依据。若所有来源都达不到要求,模型会显示「无数据」,而不是编造一个数字。

按精度加权的融合

模型与市场会根据有效样本量进行精度加权融合:对于历史数据较少的球队,市场占据更高权重;在数据覆盖充分的联赛中,模型占据更高权重。两者之间平滑过渡,而不是直接切换。若融合后仍存在 5% 或以上的价值差,该预测会被标记为「价值推荐」,表示模型认为赔率尚未反映这一优势。该判断会在开赛前公开,任何人都可以在赛后核验。

校准与样本外检验

任何版本都不会仅凭一份表现漂亮的回测就上线。引擎会在约五十万场历史比赛上,按照严格的时间顺序进行样本外验证:每场比赛的评分只能使用开赛前已经可知的信息拟合。预测结果通过对数损失和 Brier 分数等适当评分规则进行评价,这些指标会惩罚过度自信的错误;系统还会同时检查盘口命中率和分组校准曲线,确认标称概率为 60% 的预测是否确实约有 60% 命中。未达到验收标准的版本不会上线。

不人工挑选比赛

每一场符合条件的真实足球比赛都会有预测,绝不只挑容易的场次。预测会在开赛前 30 分钟锁定;每条锁定后的预测都会按最终赛果结算,并计入公开成绩记录,无论胜负都不会遗漏。