双色球科学分析工具

用概率模型与真实历史开奖数据,把「号码能不能被预测」算个明白

00数据概览

页面中所有结论均由真实历史开奖数据实时算出,未使用任何模拟数据。

01一注号码有多稀有超几何分布 · 信息熵

红球从 33 个里选 6 个,蓝球从 16 个里选 1 个,一共有 C(33,6)×16 = 17,721,088 种组合。每一注号码中一等奖的机会完全相同。

02返奖率与期望收益真实销量数据

每注 2 元。用真实销售额换算出总投注注数,再统计每期实际派出的一、二等奖金额,加上三~六等奖的固定奖,看看长期返奖率落在哪里。

逐期返奖率(实际派出奖金 ÷ 当期销售额)
细灰线为逐期值,红线为 100 期移动平均。浮动奖用真实注数和单注奖金计算,固定奖按概率折算。

03随机性检验卡方 · 游程

如果开奖是随机的,每个号码出现的次数应该接近均匀,奇偶序列也不该有「记忆」。下面是三项标准统计检验,全部用真实数据完成。

红球 01–33 出现次数
蓝球 01–16 出现次数

04和值分布精确理论分布

6 个红球之和最小是 21,最大是 183。下面把真实和值分布,与「所有组合等概率」推导出的精确理论分布做对比——理论分布是用动态规划精确算出来的,不是正态近似。

红球和值分布:真实 vs 理论
灰柱为真实频次,红线为精确理论分布(按总期数缩放)。
边缘发现:历史红球存在轻微的低号偏多

05贝叶斯:历史改变不了概率大数定律

挑一个号码,看它在历史上的「累计出现频率」。如果历史真的携带信息,这条线应该会持续偏离理论值;而随机序列只会绕着理论值波动,并且越来越贴近。

06中出注数模型唯一有效的预测

号码本身算不出来,但「这一期会有多少注中一等奖」是可以建模的:总投注注数 × 单注中奖概率。总投注注数由真实销售额 ÷ 2 得到。

三个年代:每期一等奖中出注数(实测均值 vs 模型预测)
模型 = 平均总投注注数 × 1/17,721,088。

07泊松假设不成立过离散

如果每注号码都是独立随机选出来的、总注数又稳定,那么每期中出一等奖的注数应该近似服从泊松分布。真实数据并不服从——波动比泊松大得多。

每期一等奖中出注数分布:真实 vs 泊松
红柱为真实占比,蓝线为同等均值下的泊松分布理论占比。

08极端期集中选号

历史上出现过很多远超平均的极端期。销量暴涨叠加「人多的地方号码多」——生日号、连号、对称号被大量重复投注,就会制造出这种极端值。

一等奖中出注数最高的 12 期

09凯利准则:最优投注比例为负交互计算

凯利准则给出「长期增长率最大化」的投注比例。当期望为负时,算出来的最优比例会是负数——意思是这个游戏不该参与。可以自己改参数试试。

长期增长率 g(f) 随投注比例变化
g(f) = p·ln(1+f·b) + (1−p)·ln(1−f),b 为净赔率。曲线整体在 0 之下,说明任何比例的长期增长率都是负的。
「必中方案」算总账:把全部组合买下来

10预测能力回测:能算注数,算不出号码walk-forward 滚动回测

前面几节证明了「号码是随机的」。这一节把它直接放到赌桌上验证:让各种流传的选号法站在每一期开奖之前选号,再跟真实开奖比命中。forward 滚动回测是唯一诚实的验证方式——如果允许模型看到未来数据,任何方法都能跑赢。

7 种选号法的平均命中个数(最近 期)
灰色带是 ±2σ 的随机噪声区。所有方法都落在带内 —— 没有任何一种能跑出去。注意「固定 01-06」这种毫无逻辑的选法也排在前面,这正是噪声的特征。
按前期热度分四组,看下一期的实际出现率
33 个红球按前 100 期出现次数排名分成四组。如果「热号真的更容易出」,第一组应明显高于随机基准 18.18%;如果「冷号该回补了」,第四组应明显更高。两条都没发生。

11模型检验总表 & 结论

12最近 30 期开奖明细