先把问题问对
“AI 足球预测准吗”每天都被搜很多次,而它几乎不可能有一个负责任的答案——不是因为诚实的答案难听,而是因为“准”这个字被问出来的时候,通常没有定义。
一个没有定义的形容词,配上一个没有样本量的百分比,就是这个行业里绝大多数“准确率 87%”的来源。所以这篇不打算给你一个数字,它给你的是一套动作:读完之后,你应该能自己去核验任何一家预测方——包括我们——而且全程不需要看懂任何一个模型。
“准”至少是三件不同的事
命中率。 发出的判断里,事后被证明对的占多少。它最直观,也最容易被做高:专挑低赔率的大热门发,命中率自然好看,而这种“准”几乎不携带信息,因为市场早就把那个结果定得很贵了——那件事不需要模型也知道。
概率校准。 一个预测方说“这件事有七成可能”,那么在它所有说过七成的事情里,应该大约有七成真的发生。校准衡量的不是某一天猜没猜中,而是它对自己的把握有多诚实。一个校准良好、命中率平平的模型,通常比一个命中率漂亮、却从不肯把概率说出口的服务有用得多。
长期一致性。 同一套方法,换联赛、换赛季、换赛程密度之后还稳不稳。运气好的三周和一套真的成立的方法,从外面看长得一模一样,唯一能把它们分开的是观察窗口的长度。
这三件事互不蕴含。一家服务可以命中率很高而校准很糟,也可以校准很好而命中率看着平庸。任何只报一个数字的说法,都默认你不会追问它报的到底是哪一种。
| 口径 | 衡量什么 | 最容易怎么做高 | 需要多大样本 |
|---|---|---|---|
| 命中率 | 已发布判断里对的比例 | 只发低赔率热门 | 大 |
| 概率校准 | 报出的概率诚不诚实 | 干脆不报概率 | 中等,但要分档统计 |
| 长期一致性 | 跨联赛、跨赛季稳不稳 | 只展示最好的那一段 | 很大,而且必须连续 |
一条命中,什么也证明不了
在一个大致五五开的问题上连续猜对五次,概率约为三十二分之一。也就是说,如果有一百个频道同时在猜,这一周平均会有三个连对五次。它们的截图里每一个字都是真的,但那不构成证据——你看到的是一场你没看见的筛选过程留下的幸存者。
这就是为什么“战绩截图”几乎没有信息量。截图展示的是一个窗口,而挑选窗口的人正是被评估的对象。真正有信息量的,是一份你没法挑选的记录:全量、连续、并且发布在结果揭晓之前。
同样的逻辑反过来也成立,这一半常被忘掉:一串未命中同样不能证明方法坏了。短序列在两个方向上都不是证据;而一家服务在状态差的那个月里悄悄不发了,它告诉你的是它的编辑手法,不是它的分析能力。
审计任何一家预测方的四个动作
- 1.先看时间戳,再看内容。 一条判断如果不能被证明发布于开赛之前,它的对错就无从谈起。频道消息的发送时间、页面的更新时间、公开仓库的提交记录都可以用——三者里至少要有一个能把这条主张钉在某个时刻上。
- 2.要全量,不要摘要。 未命中的部分在不在里面?如果你只能看到最近十条,或者只能看到赢的,那你衡量的是一个编辑,不是一个模型。
- 3.问清结算口径。 走盘怎么算、半赢半输怎么算、比赛延期怎么算。这些定义不写下来,任何比例数字里都藏着一个事后可以随手调整的自由参数。我们自己那一行版本写在《我们的胜率是怎么算出来的》里。
- 4.向前跟,不要向后翻。 挑今天发布的三条,自己抄下来,终场之后自己核。向后翻永远会美化一份记录,向前跟不会。
按架构给预测方分类——规则脚本、单一模型、大模型生成的散文、闭环智能体,各自会怎么坏——是另一件事,写在《AI 足球预测靠谱吗》里。这一篇讲的是记录本身怎么审,而记录的审法跟它由什么产生无关。
为什么我们不公布任何准确率数字
这个站的任何一个页面上,都没有出现过我们自己的命中率或收益数字。这是刻意的,原因值得摊开讲,因为从外面看,“不公布数字”和“数字不好看”长得一样。
第一,任何写进文章的比例,下一条结算完就过期了。第二,也是更要紧的:小样本上的比例会误导人。在几十条的样本上,真实水平完全相同的两套方法,仅靠方差就能差出十几个百分点,而读者没有任何办法从一个孤立的百分比里反推出它背后的样本量和时间窗口。第三,一个由我们自己挑出来的数字,恰恰是这篇文章在教你打折扣对待的那种东西——那等于要求你对所有人保持怀疑,唯独对我们例外。
数字的替代物是:把整份记录摆在你能自己去数的地方。
具体怎么核对我们
每一条已发布的信号,都在它所指的事件发生之前打上时间戳,事后按同一套写明的口径结算,赢的、输的、走盘的排在同一个地方:公开预测记录。底层记录还镜像到一个公开的 git 仓库——github.com/oddsflowai-team/clawsportbot-protocol/tree/main/record——提交历史是公开的,我们这边没有人能事后改动某一条而不在历史里留痕。
要读懂那份台账里每一行到底在说什么,先看《期望值(EV)是什么》。EV 是整份记录里最容易被误读的一列,而误读它是从一份正确的台账里得出错误结论的最快路径。
常见问题
那你们到底准不准? 在这个概括程度上,这个问题没有答案,任何直接给你一个答案的文章都在卖东西。可以回答的是更窄的版本:我们发布的每一条都能被独立核验“发布于事件之前”,未命中的和命中的在同一个页面上,计数规则写在明面上。剩下的判断该由你做,而不是由我们的摘要替你做完。
样本要多大才算够? 没有万能门槛,但有一个方向:样本越小,运气的贡献越大。几十条只能看出有没有明显的系统性问题,看不出方法优劣;几百条才开始撑得起关于校准的讨论;一致性则需要跨赛季的连续记录。与其记住某个具体门槛,不如记住这条单调关系。
命中率高,是不是就一定在发热门? 不一定,但这是最该先排除的解释。看一眼它发出的判断落在什么赔率区间。如果长期密集地集中在很低的区段,那么高命中率就是这个选择的算术结果,而不是洞察力的证据——在你看价格之前,这两件事是分不开的。