用大模型给世界杯定价:121 笔投注如何跑赢市场
作者用 Claude 对世界杯比赛生成胜率与期望进球,结合 Dixon-Coles 修正构建比分分布,在 Kalshi…
一位独立研究者把大模型搬上了预测市场:在对 2026 年世界杯的比赛进行系统化分析后,他用 LLM 输出概率与期望进球,再借助 Dixon-Coles 修正的 Poisson 模型构建完整比分分布,最后依据模型概率与 Kalshi 盘口的差距筛选并执行真实投注。在 121 笔投注中,他起始资金 255 美元,最终增长至 771 美元,期间将近一半的投注亏损,但整体仍实现约三倍收益。作者把每场比赛的分析档案(dossier)和下注记录全部公开在 GitHub 上,方法由其与 Claude 协作开发,整个流程自动化执行。
实验背景:从 Euro 2024 到 World Cup 2026
两年前,作者曾让 GPT-4o 基于 SportMonks 数据猜测 Euro 2024 的全部 51 场比赛结果,最终准确命中 28 场胜者(55%),但仅 8 场(16%)的净胜球完全正确。此次他提出一个更尖锐的问题:模型能否不只是预测比分,而是推理出一个能击败市场价格的概率,并据此盈利?为此,他在分析中刻意对模型屏蔽了盘口价格,让 LLM 仅依据比赛档案(阵容、近期状态、首发名单、赛事背景)独立判断。
方法:档案—概率—期望进球—比分网格
每场比赛前,作者确定性地产出一份不含盘口信息的 dossier D,LLM 据此生成 (p, xG¹, xG²):p = (p₁, p_d, p₂) 为胜平负概率,xG¹ 和 xG² 为双方的期望进球。比赛真实比分 S = (S¹, S²) 被视为随机变量,由两个独立 Poisson 分布(λ₁ = xG¹,λ₂ = xG²)生成,并叠加 Dixon-Coles 1997 的低分修正 τ(ρ = -0.10),最后把矩阵截断到每方 10 球并归一化。胜平负直接读取 p;淘汰赛中 p₁ + ½p_d 视为球队 1 晋级概率;其他市场(大小球、让球、双方进球、单队进球、零封等)则通过对 S 网格按规则 r_m(S¹, S²) ∈ {0,1} 求加权和得到 q_m。由于 r_m 是二值函数,其期望正好就是对应合约命中的概率,因此"一次推理、两个点估计"即可同时为约二十个 Kalshi 二元合约定价。
下注逻辑:edge、锚定与凯利比例
当 LLM 给出的合约概率 q_m 高于 Kalshi 上同一合约的卖出价 c_m 时,二者之差 e_m = q_m − c_m 即为模型认为的"优势"。作者按 e_m 排序挑选最大优势合约,并通过分数凯利公式(f* = (bp − q)/b,其中 b = (1/c_m) − 1)按比例分配仓位,同时为每个市场设定一个最大单笔下注额作为上限。这一组合将模型概率与市价波动、流动性都纳入了决策,使原本只看胜率的策略具备仓位管理能力。
结果与局限
在 121 笔真实投注中,资金从 255 美元增至 771 美元,几乎一半的投注亏损,但少数高 e_m 合约的命中弥补了损失。作者把这一阶段的完整 dossier、概率表和投注日志都放在 GitHub 上,供他人复现。需注意的是,样本规模有限,盘口选择也限于 Kalshi 的特定合约种类,且 xG 估计完全依赖 LLM 对文本档案的解读,未与历史 xG 模型做对照,因此结论仍属个案实验,而非对"LLM 是否普遍战胜博彩市场"的统计证明。
