aigu · ← 首页 · 诚实记分牌 · 博客 · EN

AI 委员会的信念,校准吗?

委员会每次开仓都会给出一个 0 到 1 的信念值(conviction)。如果把它读作「这笔会赢的概率」,就能画出可靠性曲线。下面是 17 只公开蛊、1050 笔已平仓交易的结果。

最后更新: 2026-08-25 21:55 UTC

信念区间笔数平均信念实际胜率偏差
[0.00, 0.35)3320.1910.452-0.261信心不足
[0.35, 0.55)1330.4110.444-0.033基本校准
[0.55, 0.68)4990.5930.487+0.107过度自信
[0.68, 1.00)860.7020.453+0.248过度自信

聚合数字是个谎

平均信念 0.452,实际胜率 0.468,聚合偏差 -0.016 —— 一个看起来几乎完美校准的模型。它不是。分桶之后,两端的误差方向相反、互相抵消:委员会在犹豫时信心不足,在笃定时过度自信。任何单一的聚合校准分,都能把这件事藏得严严实实。

它几乎没有判别力

从最低桶到最高桶,信念移动了 0.511,而实际胜率只移动了 0.001。委员会信念的离散度现实的 511.0 倍。用信念回归胜率,斜率是 0.048 —— 完美校准是 1.0,毫无判别力是 0。

而且这一切在统计上并不显著

信念与盈亏的 Spearman 相关:ρ = -0.009,p = 0.763(5,000 次置换检验)。信念与「是否盈利」:ρ = +0.014,p = 0.660。在这个样本上,信念不携带任何可检测到的、关于结果的信息

我差点掉进去的陷阱

有一只蛊(唯一样本像样的那只)单独算出 ρ = +0.276、p = 0.041,很诱人。但候选一共有 17 只,而我之所以盯着它看,正是因为它数据最多。Bonferroni 校正:0.041 × 17 = 0.7。什么都没有。把它当成一个发现写出来,会是这个网站上最不诚实的一件事。

方法

每笔开仓的信念值,与其后最近一次平仓的实际盈亏配对。只统计公开蛊。少于 3 笔的桶直接丢弃。p 值来自置换检验(打乱结果重算,数一数随机能有多少次超过观测到的相关性)。所有决策无未来函数、走查评估;全部为纸面交易。

这页不能说明什么

n = 1050,很小。其中约一半来自同一只蛊。信念只是 LLM 吐出的一个数,它并没有被训练去校准这个数——把它读作 P(赢) 是我们的选择,不是它的主张。另外,方向性加密交易的胜率本来就在 50% 附近,所以「在 0.5 附近校准」是一个很低的门槛,一句诚实的「我不知道」就能免费通过。

研究与纸面交易,不构成投资建议。