全部指南
发布于 2026年9月14日8 分钟阅读

英超预测怎么做?AI 到底在看哪些数据

premier-leaguedata方法论

英超为什么比看起来难预测

英超是全世界数据覆盖最厚的足球赛事。每场比赛有多路转播信号、好几家 xG 供应商、逐分钟的事件数据,还有一个深到会因为首发名单泄露而移动的盘口。照理说,这么厚的覆盖应该让预测变容易。

至少在一个具体意义上,它起的是反作用。公开数据越充分,显而易见的那些输入就越早被定进价格里。一个读着“场均进球、场均失球”的模型,读的是这项运动里最公开的两个数字,而一个同样读过它们的市场,跟它没有任何可分歧的余地。真正剩下价值的地方,在那些不容易快速组装、不容易正确加权、或者只在开赛前六十分钟才存在的输入上。

这一篇讲的就是这些输入在英超具体是什么、模型强在哪、人强在哪,以及怎么核对一条英超预测是不是真的赛前发布的。

赛程密度是变量,不是脚注

38 轮联赛之外还有两项国内杯赛,头部球队再加一个欧战赛季——而欧战的场次比过去更多。十二月把这一切进一步压缩:英超是主要联赛里唯一不放冬歇的,节日期间一支球队可能七天里踢三场。

它对预测的意义不是“疲劳的球队踢得差”,这句话太粗糙,没有可操作性。真正的意义是:密度抬高了轮换的概率,而轮换会改变站在场上的那支球队是谁。一个把俱乐部当成固定强度评分来处理的模型,恰恰在这个评分最不适用的那些场次上定错了价。赛程表几个月前就公开,所以密度是少数能提前拿到的强信号之一,也是少数模型比普通观众算得更好的输入之一——因为它要求你同时盯住所有赛事。

主场优势不是很多人以为的那个常数

英格兰足球的主场优势是真实存在的,同时它已经连续二十年在缩小。前几个赛季的空场时期给了这项运动一个异常干净的自然实验:观众被拿走之后,这个效应显著变窄。这说明它有相当一部分是通过“观众对判罚和节奏的影响”起作用的,而不只是旅途和场地熟悉度。

对模型来说更有用的一点是:主场优势在各家俱乐部之间并不均匀。有些球场的效应远大于另一些,而它们彼此之间的差距,比“平均主场表现”和“平均客场表现”之间的差距还要大。用一个全联赛统一的主场系数,是一种会在“人们最期待模型有观点”的那些场次上直接损失精度的简化。

xG 好用在哪、不好用在哪

预期进球是足球里最有用的公开指标,也是被误用得最频繁的一个。

它作为中期的球队质量估计很好用。放到十场、十五场的尺度上,累计的 xG 与被创造的 xG,比比赛结果本身更能说明一支球队实际踢成什么样——因为结果噪声大,而射门质量噪声小。

它在单场上很不好用。英超球队一场大概十到十五脚射门,所以单场 xG 是一个建立在极少事件数上的估计,它的误差范围宽到足以吞掉大多数人引用它想证明的那些差距。

它在不同供应商之间也不能直接搬。各家 xG 模型对点球算不算、要不要吃进射门后信息、位置语境纳入多少,做的选择都不一样。同一场比赛的两个公开 xG 数字,常常根本不在衡量同一件事——所以拿这家的数字去比那家的数字,首先是一个分类错误,其次才是分析错误。

模型在英超上实际看什么

输入更新节奏模型拿它做什么主要局限
赔率变动秒级反推市场的共识概率只说市场怎么想,不说谁对
xG 与射门质量每场赛后中期强弱估计单场样本极小,各家口径不一
首发与伤停赛前约一小时重估双方的结构窗口极短,公告本身也不完美
赛程密度几个月前已知预判轮换与负荷是倾向,不是首发名单
裁判与判罚分布整个赛季累积调整与判罚相关的分布按裁判拆开后样本很薄
定位球套路整个赛季累积调整进球来源分布教练更替后反应很慢

这张表里最值得注意的是“首发”那一行。英超赛前最有价值的单项信息,在开赛前一小时左右才公开,也就是说可用窗口以分钟计。这是偏好自动化流水线而不是人肉流程的一个结构性理由,跟模型聪不聪明无关。

人和模型各自的盲区

模型对“新东西”是盲的。 一名在这个联赛还没有出场时间的新援、一位上任三场的主教练、一种从没被观察过的战术变化——这些都是数据稀薄的处境,一个训练在历史上的模型没有可以泛化的依据。而它照样会给出一个看起来很自信的数字,这比什么都不给更糟。

人对“价格”是盲的。 人类分析最常见的失败不是把比赛读错了,而是把比赛读对了、却完全不关心市场是不是早就得出了同一个结论。“对一支球队的判断正确”和“对一个价格的判断正确”是两种成就,而只有后一种是稀缺的。

人会过度加权上一场。 近因偏差是足球讨论里最强的偏差。上周末输 0 比 4 的球队,会被当成一支散架的队伍讨论两个星期,不管十场尺度上的底层数字说了什么。

模型会过度相信自己的校准。 一个概率的好坏,取决于它被对照过的那份记录——这正是《AI 足球预测准吗》那篇在讲的事。

怎么核对一条英超预测是不是赛前发布的

英超的开球时间是固定且公开的,这让它成为最容易核验的赛事之一。

  1. 1.找到发布时间戳——频道消息时间、页面更新时间,或者一次公开提交。
  2. 2.拿它去比对既定开球时间,而不是比对终场哨。
  3. 3.确认这条判断里引用的赔率也锚定在同一时刻;一条不带价格的判断,在唯一重要的那个维度上是不可证伪的。
  4. 4.确认未命中的那些条目,和命中的在同一个页面上。

我们自己的条目在事件之前打时间戳、事后按一条写明的规则结算,并且一起公开在公开预测记录上,计数规则在《我们的胜率是怎么算出来的》里。而同样这几道检验会明显变难的那项赛事——跨联赛、两回合、交手历史稀薄——写在《欧冠预测怎么做》里。

常见问题

模型在英超上能赢过一个懂球的老球迷吗? 单论读一场比赛,经常赢不过。但论“在六十分钟的窗口里,把一场比赛读给一个价格听,同时处理十场,长期稳定,而且不会觉得烦”——能,而在操作层面,只有后面这个比较是有意义的。

数据越多,英超预测就越准吗? 不是。英超同时拥有最多的公开数据和最有效率的市场,这两件事是同一回事的两面。多出来的数据只有在“还没被定进价格里”的地方才有帮助。

英超哪些场次最难建模? 可用历史最少的那些:新帅上任头几周的球队、紧挨着杯赛因而大幅轮换的那一场,以及赛季前几个月里任何一支刚升上来的球队参与的比赛。