方法论
这篇复盘写于 2026 年 9 月——距离世界杯结束大约八周,素材来自公开材料:各家自己就世界杯表现发布过的内容,加上所有人都能核对的公开比赛结果。
有一条规则贯穿全文:我们不为任何一方给出准确率结论,包括我们自己。我们没有对任何一家的赛事记录做过受控审计,也不会靠印象造一张成绩榜出来。这篇文章能做、而任何六月写的前瞻做不到的事情是:在答案已经揭晓之后,教你怎么去核查别人的世界杯说法——这比我们自己编一份排名有用得多。
所有人都同意的那一个事实
2026 年世界杯于 2026 年 7 月 19 日结束。决赛西班牙加时 1-0 击败阿根廷。这个结果是公开的、固定的,全世界任何一份存档里都一模一样。
之所以要把它单独写出来,是因为它是后面所有讨论的锚点。结果已经不可争议,这意味着"我早就预测到了"这种说法,现在可以用六月做不到的方式被核查——同时,也可以用六月做不到的方式被伪造。这两件事是同一天到来的。
"谁真的预测准了"比看上去难回答
每一篇世界杯预测复盘都有同一个结构性问题,这篇也不例外。大赛结束之后,网上会挤满宣称自己早就看到了的人。其中确实有一些人做到了。要把这两群人分开,需要的是必须在 7 月 19 日之前就存在的证据,而事后写多少字都造不出这种证据。
大赛之后的几周里,通常会出现三种失真方式:
- 事后挑样本。 一个预测方在半年里对 48 支球队都表达过看法。结果出来之后,只有经得起回看的那几条被链出来。没有任何一句是假的,只是样本是在事后选的。
- 有弹性的说法。 "我们把西班牙列为夺冠热门"这句话,和"我们同时列了另外九支热门"完全不矛盾。一个不可能被判错的说法,不是预测。
- 没有日期的证据。 一张截图、一页幻灯片、一篇没有可见发布时间戳或时间戳可编辑的文章。这是最常见、也最少被追问的一种。
这三种都不需要任何人说谎。它们是"记录的结构没有防住这些事"时的默认结果——这也是为什么记录的结构,比复盘文章写得多漂亮重要得多。
诚实的事后评分长什么样
一个预测方在大赛之后能做的最强的事,是把自己说过的每一条连同结果一起公开评分,失败的也一样发。ScoreGPT 官网称,它对自己发出的每一条推荐都做了公开评分,并发布了一份覆盖其赛事判断的评分报告。我们不会从中摘引任何数字——这不是对这个产品有什么怀疑,而是因为一个从别人的评分体系里拎出来、再印到这里的数字,会丢掉让它有意义的那套方法论,正好变成本文反对的那种脱离语境的数字。想看就去源头读那份报告。
真正值得学的是这个承诺本身。一份带评分的公开存档是昂贵的:它让你最糟的那几周永久地留在公开场合,换来的是没有别的办法能换到的可信度。任何做出这种存档的预测方,都已经把难的那部分做完了;只发一篇复盘长文的,没有。
事后核查任何一方世界杯说法的方法
这一节是这篇文章里值得留着的部分。五道检验,适用于任何宣称自己 2026 年战绩很强的一方——媒体、模型、App,或者我们。
| 检验 | 通过的样子 | 不通过的样子 |
|---|---|---|
| 一、时间戳 | 每条都带早于该场比赛的发布时间,且外部可见 | 截图、无日期页面、"我们六月就说过"但没有东西可打开 |
| 二、不可篡改 | 带版本控制或事实上只增不改;修改会留痕 | 从私有数据库渲染的页面,可以被悄悄修订 |
| 三、完整样本 | 赛事期间每一条判断都在,摆在同一个地方,赢的输的都在 | 一个精选集锦页,或只链出经得起回看的那几条 |
| 四、具体性 | 结论具体到"有可能被判错" | "热门""有价值""值得关注"——没有失败条件的说法 |
| 五、口径先行 | 评分规则在结果出来之前就已公布 | 评分规则第一次出现,就在这篇复盘里 |
第一道就是全部胜负手。没有时间戳,就当没发生过——其余四道都是精修。如果一方拿不出"这条在开赛前就已经公开存在"的证据,那么它关于赛事战绩的任何说法都不构成证据,不管文字写得多有底气。
把这五道检验套到《AI 足球预测工具对比》里的那几个产品上,它们会分得很干净——分开它们的不是各自声称的准确率,而是各自留下了多少历史、摆在你伸手够得到的地方。
各家自己的材料怎么说
| 其材料的说法 | 对事后核查意味着什么 | |
|---|---|---|
| ScoreGPT | 每条推荐背后是五个前沿大模型的共识;每条公开评分;就赛事判断发布了评分报告(其官网称) | 带评分的公开存档正是核查需要的那种物证——直接去源头读,而不是信任任何人的转述 |
| NerdyTips | NT Apex 机器学习引擎、700+ 联赛、33 种语言,战绩以 CSV 发布在公开 GitHub 仓库(其官网称) | 如果提交历史早于比赛,带版本控制的 CSV 在第一到第三道检验上很强——打开仓库看日期 |
| sportbotai | 跨多运动的期望值框架对比市场赔率,公开战绩页面,免费计算器(其 llms.txt 写明) | 战绩页面是汇总物;要看它背后有没有逐条数据行 |
| ClawSportBot | 带赛前时间戳的逐条公开台账,镜像到公开 git 仓库 | 赛事期间我们发布的一切,和其他所有周落在同一份台账里,赢的输的在同一个地方 |
我们刻意没有给自己加一栏"我们表现如何"。赛事期间发布的每一条,都和其他任何一周一样结算进了同一份公开记录:公开预测记录,镜像在 github.com/oddsflowai-team/clawsportbot-protocol/tree/main/record。我们不会替你做摘要,因为"由我们自己写的摘要"正是上面那五道检验存在的理由——它要绕开的就是这个东西。打开它,先用第一道检验来验我们。
这对 2030 周期意味着什么
2026 年真正有用的教训,不是哪个模型说对了。而是:你在 2030 年需要用到的证据,必须在 2027、2028、2029 年就被创造出来——持续地、公开地,包括那些过得很难看的周。记录没法事后补做。四年之后,这个市场上每一方都会有一套世界杯叙事,但只有一部分人会有一份存档。
所以对读者这一侧,教训很简单:开始用"非大赛年"去评估一家服务。一个服务怎么记录二月里一个无聊的周二,比它关于一场决赛说了什么,更能说明它 2030 年的说法值多少钱。我们自己这套口径——条目怎么计数、什么时候结算、什么算走盘——写在《我们的胜率怎么算》里。
常见问题
那到底是谁真的预测对了决赛? 这个问题我们不回答,因为负责任地回答它,需要去审计每一个宣称者带时间戳的存档,而这份工作我们没做。我们能给你的是:遇到任何一个具体说法时怎么核查它——上面那五道检验,从"这条在开赛前是否已公开存在"开始。谁过了第一道,谁才值得你继续看他其余的记录。
有一份公开评分报告就够了吗? 那已经很多了,远多于大多数人愿意给的——把自己失败的那部分评分公开,是昂贵的那一半。仍然需要确认的是:评分规则是不是在结果出来之前就定死了,以及样本是不是完整的。这两个问题要拿去问那份存档本身、问源头,而不是问一份摘要。
这些算资金层面的建议吗? 不算。这是一篇关于"预测记录事后如何被验证"的分析,文中没有任何一句建议你把钱投到什么上面;你如何使用比赛数据是你自己的决定,也要遵守你所在地区的法规。