全部指南
發布於 2026年9月14日8 分鐘閱讀

英超預測怎麼做?AI 到底在看哪些資料

premier-leaguedata方法論

英超為什麼比看起來難預測

英超是全世界資料覆蓋最厚的足球賽事。每場比賽有多路轉播訊號、好幾家 xG 供應商、逐分鐘的事件資料,還有一個深到會因為先發名單外洩而移動的盤口。照理說,這麼厚的覆蓋應該讓預測變容易。

至少在一個具體的意義上,它起的是反作用。公開資料越充分,顯而易見的那些輸入就越早被定進價格裡。一個讀著「場均進球、場均失球」的模型,讀的是這項運動裡最公開的兩個數字,而一個同樣讀過它們的市場,跟它沒有任何可分歧的餘地。真正還剩價值的地方,在那些不容易快速組裝、不容易正確加權、或者只在開賽前六十分鐘才存在的輸入上。

這一篇講的就是這些輸入在英超具體是什麼、模型強在哪、人強在哪,以及怎麼核對一條英超預測是不是真的賽前發布的。

賽程密度是變數,不是註腳

38 輪聯賽之外還有兩項國內盃賽,頂尖球隊再加一個歐戰球季——而歐戰的場次比過去更多。十二月把這一切進一步壓縮:英超是主要聯賽裡唯一不放冬歇的,節慶期間一支球隊可能七天內踢三場。

它對預測的意義不是「疲勞的球隊踢得差」,這句話太粗糙,沒有可操作性。真正的意義是:密度抬高了輪換的機率,而輪換會改變站在場上的那支球隊是誰。一個把俱樂部當成固定強度評分來處理的模型,恰恰在這個評分最不適用的那些場次上定錯了價。賽程表幾個月前就公開,所以密度是少數能提前拿到的強訊號之一,也是少數模型比一般觀眾算得更好的輸入之一——因為它要求您同時盯住所有賽事。

主場優勢不是很多人以為的那個常數

英格蘭足球的主場優勢是真實存在的,同時它已經連續二十年在縮小。前幾個球季的空場時期給了這項運動一個異常乾淨的自然實驗:觀眾被拿走之後,這個效應顯著變窄。這說明它有相當一部分是透過「觀眾對判罰與節奏的影響」起作用的,而不只是舟車勞頓與場地熟悉度。

對模型來說更有用的一點是:主場優勢在各家俱樂部之間並不均勻。有些球場的效應遠大於另一些,而它們彼此之間的差距,比「平均主場表現」和「平均客場表現」之間的差距還要大。用一個全聯賽統一的主場係數,是一種會在「人們最期待模型有觀點」的那些場次上直接損失精度的簡化。

xG 好用在哪、不好用在哪

預期進球是足球裡最有用的公開指標,也是被誤用得最頻繁的一個。

它作為中期的球隊品質估計很好用。放到十場、十五場的尺度上,累積的 xG 與被創造的 xG,比比賽結果本身更能說明一支球隊實際踢成什麼樣——因為結果雜訊大,而射門品質雜訊小。

它在單場上很不好用。英超球隊一場大概十到十五腳射門,所以單場 xG 是一個建立在極少事件數上的估計,它的誤差範圍寬到足以吞掉大多數人引用它想證明的那些差距。

它在不同供應商之間也不能直接搬。各家 xG 模型對十二碼算不算、要不要吃進射門後資訊、位置脈絡納入多少,做的選擇都不一樣。同一場比賽的兩個公開 xG 數字,常常根本不在衡量同一件事——所以拿這家的數字去比那家的數字,首先是一個分類錯誤,其次才是分析錯誤。

模型在英超上實際看什麼

輸入更新節奏模型拿它做什麼主要限制
賠率變動秒級反推市場的共識機率只說市場怎麼想,不說誰對
xG 與射門品質每場賽後中期強弱估計單場樣本極小,各家口徑不一
先發與傷停賽前約一小時重估雙方的結構窗口極短,公告本身也不完美
賽程密度幾個月前已知預判輪換與負荷是傾向,不是先發名單
裁判與判罰分布整個球季累積調整與判罰相關的分布按裁判拆開後樣本很薄
定位球套路整個球季累積調整進球來源分布教練更替後反應很慢

這張表裡最值得注意的是「先發」那一列。英超賽前最有價值的單項資訊,在開賽前一小時左右才公開,也就是說可用窗口以分鐘計。這是偏好自動化流水線而不是人力流程的一個結構性理由,跟模型聰不聰明無關。

人和模型各自的盲區

模型對「新東西」是盲的。 一名在這個聯賽還沒有出場時間的新援、一位上任三場的總教練、一種從沒被觀察過的戰術變化——這些都是資料稀薄的處境,一個訓練在歷史上的模型沒有可以推廣的依據。而它照樣會給出一個看起來很有自信的數字,這比什麼都不給更糟。

人對「價格」是盲的。 人類分析最常見的失敗不是把比賽讀錯了,而是把比賽讀對了、卻完全不關心市場是不是早就得出同一個結論。「對一支球隊的判斷正確」和「對一個價格的判斷正確」是兩種成就,而只有後一種是稀缺的。

人會過度加權上一場。 近因偏誤是足球討論裡最強的偏誤。上週末輸 0 比 4 的球隊,會被當成一支散掉的隊伍討論兩個星期,不管十場尺度上的底層數字說了什麼。

模型會過度相信自己的校準。 一個機率的好壞,取決於它被對照過的那份紀錄——這正是《AI 足球預測準嗎》那篇在講的事。

怎麼核對一條英超預測是不是賽前發布的

英超的開球時間是固定且公開的,這讓它成為最容易核驗的賽事之一。

  1. 1.找到發布時間戳記——頻道訊息時間、頁面更新時間,或者一次公開提交。
  2. 2.拿它去比對既定開球時間,而不是比對終場哨。
  3. 3.確認這條判斷裡引用的賠率也錨定在同一時刻;一條不帶價格的判斷,在唯一重要的那個維度上是不可證偽的。
  4. 4.確認未命中的那些條目,和命中的在同一個頁面上。

我們自己的條目在事件之前打上時間戳記、事後按一條寫明的規則結算,並且一起公開在公開預測紀錄上,計數規則在《我們的勝率是怎麼算出來的》裡。而同樣這幾道檢驗會明顯變難的那項賽事——跨聯賽、兩回合、交手歷史稀薄——寫在《歐冠預測怎麼做》裡。

常見問題

模型在英超上能贏過一個懂球的老球迷嗎? 單論讀一場比賽,經常贏不過。但論「在六十分鐘的窗口裡,把一場比賽讀給一個價格聽,同時處理十場,長期穩定,而且不會覺得煩」——能,而在操作層面,只有後面這個比較是有意義的。

資料越多,英超預測就越準嗎? 不是。英超同時擁有最多的公開資料和最有效率的市場,這兩件事是同一回事的兩面。多出來的資料只有在「還沒被定進價格裡」的地方才有幫助。

英超哪些場次最難建模? 可用歷史最少的那些:新教練上任頭幾週的球隊、緊接著盃賽因而大幅輪換的那一場,以及球季前幾個月裡任何一支剛升上來的球隊參與的比賽。