Featured image of post 39笔交易、10个假设,最像的策略只靠3笔数据撑着

39笔交易、10个假设,最像的策略只靠3笔数据撑着

用自建量化平台分析39笔链上交易,10个策略假设互相PK,排名第一的funding_oi_signal只靠3笔有效数据撑起来、解释力却是垫底——它赢只是因为它最简单。本文拆解小样本陷阱、过拟合与多重检验,记录一次诚实的量化分析。

一句话概括

我用自建的量化分析平台 AlphaTrace,把 39 笔链上交易丢给 10 个策略假设互相 PK,想找出「这些交易最可能在用什么方法」。结果排第一的策略,只靠 3 笔有效数据撑起来,而且它的「解释力」是 10 个假设里最低的——它能拿冠军,纯粹因为它最简单。

这不是程序坏了。这是一次诚实的量化分析该有的样子:最像的解释,不等于最真的解释。

平台在做什么

AlphaTrace 干的事一句话能说清:把链上一个公开地址的历史交易搬进来,还原每次买入那一刻的市场长什么样,然后让一批经典策略(动量、突破、均值回归……)互相竞争,看哪个最能解释这些交易为什么在这些时刻发生。

它给我的永远是「最可能的假设」,不是「确定的真相」,更不是「稳赚保证」。这次的数据是:39 笔交易,覆盖 23 个币种,时间从 2024 年 6 月跨到 2026 年 9 月。

第一名的故事

跑完假设竞赛,10 个假设按总分排好。排第一的叫 funding_oi_signal,中文是「资金费率/持仓量信号」,总分 0.563,只有 1 个参数。看名字挺唬人——「用资金费率和持仓量信号来解释交易时机」。但点开它的证据栏,第一句话就泄了底:

3/39 fingerprints carry real funding/OI data(39 笔交易里,只有 3 笔真的带资金费率和持仓量数据)

39 笔交易,只有 3 笔有这个策略需要的关键数据。 这个「第一名」是靠 3 笔交易撑起来的。

更扎心的是它那 6 项小分。平台给每个假设打 6 个维度的分:

  • 解释力 0.38 —— 能不能解释他过去的操作。这是 10 个假设里最低的。
  • 预测力 0.58 —— 能不能猜中之后的操作。一般。
  • 稳定性 0.49 —— 换个时间段还灵不灵。一般。
  • 稳健性 0.90 —— 参数改一改结论还成立吗。很高,后面验证页确认是「高原」。
  • 样本外 0.62 —— 用没见过的数据测还准吗。一般。
  • 简约性 1.0 —— 参数越少越可信。满分。

看出来了吗?它总分能排第一,靠的是简约性满分 + 稳健性高分,而不是靠「解释得对」。它的解释力是垫底的。一个解释力垫底的假设拿了冠军,因为这个评分体系会奖励「简单」——参数越少,简约性越高,越不容易是巧合调出来的。

10个假设的总分,冠军 funding_oi_signal 的解释力却垫底
10个假设总分 vs 冠军的解释力 | 数据:AlphaTrace 假设竞赛

但这不等于它解释得对。

两个不能混为一谈的分数

这件事让我重新认识了「打分」:

总分高 ≠ 解释力强。 funding_oi_signal 总分 0.563 排第一,但它的解释力 0.38 是垫底的。如果只看排行榜的总分,会以为「这些交易就是在用资金费率信号」,但其实这个假设对数据的解释能力是最差的。

简约性是把双刃剑。 参数少确实更可信(不容易过拟合),但「简单」和「正确」是两回事。一个只有一个参数的假设,可以又简单又错。

平台的证据栏也老实写着:这是一个「可证伪的解释,不是已验证的策略」(falsifiable explanation, not a validated strategy)。还有一句更关键的警告——当资金费率和持仓量数据缺失时,这个假设会退化成一个现货市场的替代指标(正收益 + 高成交量排名),而这跟第二名 volume_momentum(量能动量)高度重叠。也就是说,它所谓的「解释」,在大多数没有衍生品数据的交易上,其实和量能动量是一回事。

验证:高原和尖峰

光有排行榜不够,还要看这个策略是不是「调出来的巧合」。验证页干的就是这件事。

它把假设的参数在一片范围里挨个取值重新打分,画成一张图。看这张图只看一件事:

  • 高原(一片范围里成绩都差不多)= 好事。参数不依赖某个幸运值,规律可能是真的。funding_oi_signal 在这里被判为「高原——稳健」。
  • 尖峰(只有一个点特别高,旁边全趴着)= 危险。这个成绩是碰运气调出来的,换个参数就崩。这叫过拟合——把历史里的噪音当成了规律。

funding_oi_signal 通过了这关(高原,稳健性 0.90)。但这只说明「它不是过拟合」,不说明「它是对的」。一个假设可以既不过拟合、又解释得不对——就是简单而稳定地错着。

事件研究:一次全军覆没

平台还有个事件研究模块,测的是「某类消息出来后,价格会不会有规律地走」。我灌了 23 条真实历史事件(产品发布、财报、监管、合作、高管变动、上币),按「币 + 事件类型」分组,算事后涨跌,再做统计检验。

这里有个统计上的大坑必须说清楚。假设同时检验 20 组「消息和涨跌的关系」,就算这些消息全是废话、和涨跌毫无关系,纯靠运气也大概会有 1 组看起来「显著相关」。检验做得越多,越容易撞出假规律。这叫多重检验问题

平台用 FDR(错误发现率控制)来修正——根据一共检验了多少组,把「显著」的标准相应提高。通过 FDR 校正的,才算真有信号。

这次的结果是:11 个分组、9 组进了检验,没有任何一组通过 FDR(q 值大约 0.79,离通过差很远)。

这同样不是程序坏了,这是诚实的结果。每组样本量只有个位数(比如某个币的监管事件只有 3 次),这种样本量下,看起来再漂亮的规律都过不了检验。正确的读法是:「数据不足,还看不出可靠规律。」

关联 ≠ 因果

最后说一个贯穿全程的提醒。就算真发现「某类消息出来后价格总涨」,那也只是「同时出现」,不代表「消息导致了涨」。可能背后还有别的原因,只是恰好和消息撞上了。

所以平台在每个统计结果旁边都挂着「关联 ≠ 因果、历史 ≠ 未来」。事件研究的回测曲线再好看,也只是「在这个样本里、这段时间内,按这个规则会赚」,换一段就未必。

我从这次分析里学到的方法论

  1. 样本太少,就别下结论。 39 笔交易、3 笔有效数据,任何「显著」都站不住。FDR 校正后全军覆没,是数据在诚实地告诉你「还不够」。
  2. 别只看总分,要看小分。 总分第一的假设,解释力可能是垫底的。知道它「靠什么赢的」比知道它「排第几」重要得多。
  3. 简单和正确是两回事。 简约性高是好事(防过拟合),但一个假设可以又简单又错。
  4. 高原不是真相,只是「不像碰运气」。 通过验证只说明不是过拟合,不说明是对的。
  5. 关联 ≠ 因果。 最像的解释,是「可证伪的解释」,不是「已验证的策略」。

AlphaTrace 给我的是有证据的假设,不是稳赚的答案。它能让我从「瞎跟风」升级成「明白自己在跟什么、以及这靠不靠谱」。但真正的盈亏,永远取决于我自己的纪律。