一个名字底下的两项赛事
欧冠通常被当成一件事来讨论。从建模的角度看它是两件事,而且两者的行为差异大到:为其中一种调好的方法,用在另一种上会主动把你带偏。
第一件是联赛阶段——36 支来自全欧洲的球队,各自和八个不同对手打八场单回合比赛,排进同一张积分表。第二件是淘汰赛,这里的分析单位不是一场比赛,而是一轮对决:两回合、看总比分,打平进加时和点球,因为客场进球规则在几个赛季前已经取消了。
如果你读过姐妹篇《英超预测怎么做》,对照着看最有用。国内联赛给模型的是密集、重复、彼此可比的场次;欧冠给它的是稀疏、跨国、结构上不寻常的场次。
先把赛制搞清楚
有相当数量的欧冠分析,到今天仍然是按旧的“四队一组、六场小组赛”写的,而这个差别对预测是有影响的。
现在每支球队面对八个不同对手,四主四客,从分档中抽出;联赛阶段没有任何两队交手两次。积分表前八直接进 16 强,第 9 到 24 名进两回合附加赛,其余直接出局。这意味着一支球队争夺的名次是连续的,不是二元的——第八和第九之间隔着整整一轮淘汰赛,这让末段轮次的动机结构,对远比旧赛制更多的球队产生作用。
跨联赛对比才是难点
在国内联赛里,模型的每一项输入都校准在一个共同的池子上。两支英超球队面对过高度重叠的对手,处在同一套判罚尺度、同一份赛程表、大体相同的风格分布之下。建立在这个池子上的强度评分,内部是自洽的。
欧冠把这件事打破了。一支葡萄牙球队对上一支德国球队,两边的评分是在互不相交的样本上估出来的,唯一把它们连起来的,是这两个联赛的俱乐部之间数量有限的历史跨国交手。在联赛强度之间做换算,是一个叠在另一个估计之上的估计——它是任何欧冠模型里最大的单一误差来源。
由此衍生出三个具体陷阱:
- 联赛系数是滞后的。 它由好几个赛季的成绩累积而成,描述的是这个联赛曾经在哪,而不是现在在哪;而且它常常被少数几家俱乐部主导,那几家并不能代表被记在账上的那个联赛。
- 风格错配没有历史可查。 一支整个赛季面对同一种战术分布的球队,突然撞上完全不同的一种,而它自己的记录里找不到可比的场次去学习。
- 判罚尺度与节奏不同。 各项赛事之间,出牌率和允许的身体对抗程度有可测量的差异,而与这些东西挂钩的分布是不能直接搬运的。
一轮淘汰赛不是两场比赛
在淘汰赛里,次回合不是一场全新的比赛,而是一场“条件已经被首回合设定好”的比赛。
手握两球领先的球队,踢法是不一样的,而且这个差别不是模型可以扔进误差项里的细节:它改变射门数量、控球比例,以及进球在九十分钟里的分布。用打首回合的那套参数去打次回合,是这项赛事里最常见、也最容易避免的错误之一。
客场进球规则的取消,在一个方向上让事情变干净,在另一个方向上让事情变难。干净在于:总比分现在就只是总比分。难在于:打平的对决进入加时的频率比过去高得多,而加时是一个有自己进球率、自己换人规则、并且历史样本极薄的时段。
轮换、动机,以及“没有意义的一场”
欧冠里的动机,在结构上不稳定,这是国内联赛很少出现的情况。
在联赛阶段末段,一支已经锁定前八的球队和一支还在抢第 24 名的球队,是在同一块草皮上踢两种不同的运动。与此同时,绝大多数参赛队还在争国内冠军或者保级,也就是说一场周中的欧战,经常被摆在周末联赛之后。这里的轮换不只由体能驱动,它由“这家俱乐部如何给自己的几项赛事排序”驱动——而这个判断,没有任何历史数据集会直接编码。
联赛阶段与淘汰赛,并排看
| 维度 | 联赛阶段 | 淘汰赛 |
|---|---|---|
| 分析单位 | 单场比赛 | 两回合构成的一轮 |
| 独立性 | 大体独立 | 次回合被首回合限定 |
| 动机稳定性 | 末段随名次落定而衰减 | 高,但随首回合比分改变 |
| 轮换概率 | 高,尤其末轮 | 低 |
| 可比样本 | 八个不同对手 | 同一个对手连打两场 |
| 主要误差来源 | 跨联赛强度换算 | 总比分带来的战术转向 |
底层问题是样本稀疏
上面所有内容归结到一件事:这项赛事的场次本来就不多。一支球队一个赛季踢八场联赛阶段比赛;而分属不同国家的两家具体俱乐部,可能从未交手,或者五年前交手过一次,双方阵容如今几乎没有重叠。
这就是为什么欧冠预测的不确定性区间天生比国内联赛宽,哪怕分析质量更高;也是为什么一个模型如果对欧冠比赛报出和国内联赛一样的信心,它告诉你的是它自己的校准问题,而不是这场比赛的信息。诚实地读懂这种不确定性所需要的词汇——隐含概率、估计与价格之间的差、以及为什么差距特别大往往是征兆而不是机会——在《期望值(EV)是什么》里;而赔率到概率的换算本身在《足球赔率怎么看》里。
怎么核对一条欧冠预测
核验方法和别处一样,另加两条这项赛事特有的。
- 1.发布时间戳早于既定开球时间,而且要拿频道时间或公开提交去验,不是拿它出现的那篇文章去验。
- 2.同一时刻的价格要在。没有价格的判断没法评估。
- 3.淘汰赛要看清这条判断说的是“这一回合”还是“整轮对决”。两者的结算方式不同,把它们混起来正是含糊记录的生成方式。
- 4.未命中的条目和命中的在同一个页面上,按同一条写明的结算规则。
我们的条目——赢的和输的一样——都在公开预测记录上,在各自的事件之前打好时间戳,并镜像到一个公开的 git 仓库:github.com/oddsflowai-team/clawsportbot-protocol/tree/main/record。
常见问题
欧冠比国内联赛更难预测吗? 在一个具体意义上更难:数据更稀疏,加上跨国对比多叠了一层估计,所以误差区间更宽。但它不是“因为市场更锋利”而更难——市场面对的是同一份稀疏。
新赛制让联赛阶段更好预测了吗? 每队场次变多意味着数据略微增加,但每一场的对手都不一样,所以样本是变宽了而不是变深了。更明确的变化在末段动机上:现在有意义的名次分层比过去多得多。
模型该把一轮对决的两回合当成一场还是两场? 当成两场,其中第二场以第一场的结果为条件。完全独立地处理会漏掉战术转向;当成一场连续比赛处理,则会漏掉中间两周的间隔、阵容变化和主客场的切换。