目录

市场状态识别下的多轴交易信号

我的一句话总结:策略要适配市场形态(Market Regime)!

文章来源


我们先来看一组反常的结果:

十条 BNB 技术信号触发了 3884 笔交易,扣除交易成本后,平均每笔只赚 0.18bp。加入状态门控以后,信号本身没有变化,交易数量降至 2286 笔,每笔收益却升到 17.12bp。铜期货上的技术信号也出现了类似变化:每笔收益从 0.46bp提高到 17.40bp,执行次数由 3759 次减少到 1140 次。

在 Tensor 的 Jimmy Hu 分享给我们的最新论文中,把研究重点放在已有信号的执行时机上。作者在原始信号和订单之间加入一层 meta-layer:它识别市场状态,查询信号在相似状态下的历史结果,估计当前条件期望收益,再把估计交给门控、信号合成或仓位模块。

论文的核心结论是:一条信号的无条件收益接近于零,并不意味着它在所有环境下都没有价值。部分信号的收益可能高度集中于少数状态,平均数只是把有利和有害的交易混在了一起。

论文:Regime-Aware Multiaxial Signal Meta-Layer
作者:Jimmy Hu(Tensor Systems)
原文:https://alphanet.global/Regime-Aware_Multiaxial_Signal_Meta-Layer.pdf

一、元层位于信号与执行之间

作者设计了一套六层架构。

第一层接收市场数据,并为不同状态轴计算各自的特征。第二层分别识别趋势、市场效率、波动等状态,输出的不是单一标签,而是每个状态的归属概率。第三层是 Signal EV Ledger,用带有时间衰减的账簿记录信号在各状态下的历史结果。第四层根据不同状态轴近期的解释能力调整权重,将它们汇总为一个多轴 EV 分数。第五层负责执行,可以拒绝入场、修正原始信号,也可以改变仓位。最后一层使用统一的开发期、冻结检验期和顺序回放规则比较不同执行模式。

这个顺序体现了论文最重要的工程选择:估计与执行被明确分开。同一个条件收益估计器可以接入不同执行方式,研究者也可以在不重建状态模型的情况下比较门控和仓位调整。对于需要归因、风控和版本管理的实盘系统,这种模块化通常比端到端输出订单更容易审计。

二、状态轴怎样设计

作者没有把市场压缩成“牛市、熊市、震荡市”这样的单一标签,而是沿多条轴分别描述。一个时点可以处于价格上涨、波动收缩和市场效率下降的组合状态。若只保留一个总标签,这些性质会被捆在一起,信号究竟受哪一种变化影响也难以解释。

论文认为,一条有用的状态轴至少要满足三个条件。首先,不同状态下的信号结果分布应当能够分开;如果每个状态里的条件收益都差不多,这条轴没有提供新的筛选信息。状态还需要有可以核查的经济含义,例如趋势延续、市场无序或波动扩张,而不能只是样本内恰好分开的编号。多条轴之间则应尽量减少冗余,否则状态格子的数量增加了,独立信息并没有增加。

实证采用了三条轴。快速趋势轴分为上涨、平稳和下跌三个状态,特征包括半衰期为 3 小时的收益 EMA、12 小时动量和 48 小时 R/S Hurst 指标。效率与熵轴使用 10 小时 Kaufman Efficiency Ratio、14 小时一阶自相关和 16 小时排列熵,分为有序与无序。波动轴由 Rogers—Satchell 波动率比值、Parkinson 比值和 ATR 百分比构成,分为收缩与扩张。

所有特征只能使用当时已经得到的数据。论文把这一点称为 trailing-only computation。特征窗口还要与状态切换速度匹配:过长的窗口会给出过时标签,过短则容易跟随噪声。在本次实验里,各轴使用 3 至 48 根一小时行情柱,服务于四小时左右的交易结果。检验期中的趋势状态平均每天切换约四次,效率状态约两次,波动状态约 1.1 至 1.2 次。这里的 regime 是日内状态,不是持续数月的宏观周期。

三条轴组合后共有 12 个市场环境。作者没有直接训练一个 12 分类黑箱,而是先分别估计各轴的条件收益,再进行汇总。这一设计也与样本量有关。开发期若有 3000 个候选交易,12 个格子在较理想的占用率下平均还能分到约 250 个样本;若再增加一条三状态轴,格子数会升至 36 个,许多估计只能更多依靠收缩。论文建议每个单元至少保留约 20 至 50 个有效观察,状态数量不能脱离这个预算。

三、用 Wasserstein 距离识别结果分布

普通 K-Means 根据特征空间里的欧氏距离聚类。Hu 认为,当研究目标是区分信号结果时,单纯比较市场特征只是间接方法。两段行情的动量或波动率可能接近,信号在其中产生的收益分布却未必相似。

假设两组交易具有相同的平均收益和方差。第一组大多集中在均值附近;第二组由较大盈利和较大亏损混合而成。低阶矩可能把它们视为同类,实际交易中的尾部暴露却不同。论文采用二阶 Wasserstein 距离 (W_2),同时反映分布的位置、离散程度与形状。每个训练观察都对应一张结果直方图,算法按照 (W_2) 距离分配状态,并用簇内直方图的 Wasserstein 重心作为状态原型。

训练过程与普通 K-Means 相似,只是距离和质心都换到了概率分布空间。算法先把每张直方图分配给最近的重心,再重新计算各簇的 Wasserstein 重心,如此迭代直至分配不再变化、簇内成本改善低于阈值,或达到最大迭代次数。一维直方图的重心可以通过分位数函数的平均高效计算。论文建议采用 Wasserstein 版本的 K-Means++ 初始化,以降低局部最优对初始中心的敏感性。

聚类收敛后,模型不会把新观察硬分到唯一状态。它把观察到各重心的平方 () 距离代入温度缩放的 softmax,得到软后验概率。处在状态中心的观察可能获得接近 1 的归属概率,边界上的观察则可能在两个状态之间各占约一半。温度参数 () 默认取簇内平方距离的中位数;温度太小会退化成硬分类,太大又会让各状态接近均匀。作者建议检查后验熵的分布,以判断状态中心和边界是否仍有区分。

软后验解决了硬标签常见的跳变问题。一根行情柱稍微跨过边界,不会让条件收益从一个格子瞬间切到另一个格子。每笔结果也能按概率同时进入相邻状态,稀疏单元因此获得更多有效样本。论文估计,在两状态且平均胜出后验约为 0.8 的情况下,软分配的有效样本数约为硬分配的 1.6 倍。

四、为什么还要设置核方法比较器

论文没有只与硬状态模型比较,还构造了一个 Nadaraya—Watson 高斯核条件估计器。这个比较器使用较慢的效率、波动和熵特征,在当前特征附近寻找历史交易,并按空间距离和时间距离加权结果。特征先转换为开发期百分位,减少不同量纲和水平漂移的影响。

核方法能够拟合平滑而连续的条件收益面,理论上比离散状态更灵活。它的不足在于很难用简洁语言解释某次 EV 为什么较高,也容易在当前环境远离训练样本时依赖遥远邻居进行外推。多轴模型保留了上涨、有序、波动扩张等具名状态,软后验又缓和了离散格子的生硬边界。

作者据此提出两类方法的适用差异:如果信号优势随特征平滑变化,核估计可能更合适;如果优势集中在若干明显状态,离散结构更接近数据生成过程。这是论文设置比较器的理论理由,后面的 BNB 技术信号实验则给出了一次样本外对照。

五、Signal EV Ledger 如何形成多轴评分

状态识别完成后,每条轴、每个状态都会维护一份 Signal EV Ledger。交易在时点 () 入场时,系统保存当时的软后验;四小时结果 () 得到确认后,再按照这些概率把结果写入相应状态。较旧观察以指数方式衰减,半衰期为 ()。趋势和方向类状态为多头、空头分别建账,波动与效率这类对称状态则合并两个方向。

账簿同时保存有效样本数和加权平均收益。一个状态的记录较少时,原始均值很容易被几笔极端交易扭曲,因此论文引入全局先验 ()。状态估计在样本稀少时向信号的无条件平均收益收缩;随着有效样本超过虚拟先验样本数 (N_0),状态自身的记录逐渐占据主导。文中给出的常用 () 范围是 20 至 50。

半衰期并非越长越好。状态每天切换数次时,过久的记忆会让旧环境的收益继续影响当前判断。参数扰动中,BNB 技术信号把账簿半衰期延长一倍后,开发期结果从正转负。作者据此建议,记忆半衰期通常不应超过平均状态转换间隔的 3 至 5 倍。

每条轴在当前状态下都能给出一项条件 EV。论文再以动态归因权重 () 对它们求和,形成多轴评分。这个评分是各轴条件收益的加法组合,不包含轴之间的交互。如果真正的优势只在“趋势上涨且波动扩张”同时发生时出现,加法结构可能无法完整表达。直接维护联合状态账簿可以捕捉交互,但单元数量会按各轴状态数的乘积增长。

六、动态归因与三种执行方式

等权是最简单的轴权重,论文希望权重能随近期区分能力变化。系统在滚动窗口内计算某条轴给出的 EV 与实际交易结果之间的 Spearman 相关系数,再对相关系数平方进行上下限截断、EMA 平滑和归一化。示例中的单轴权重被限制在 0.15 至 0.60 之间,以免某一条轴完全支配评分或被彻底关闭。

论文把这套方法称为 ANOVA-style variance decomposition,但实际公式更接近相关性驱动的动态加权。若各轴彼此相关,平方相关并不能像严格的方差分解那样识别独立贡献。作者也承认轴的独立性只能近似满足,建议监控不同轴后验向量的相关程度。

归因还需遵守三项时间纪律。计算权重时只能使用已经结束的交易;用于检验相关性的 EV 必须冻结在当时的入场值,不能被后来的账簿信息改写。滚动窗口相对于轴的数量也要足够长,论文对三条轴给出的经验下限约为 50 至 100 个观察。此外,账簿和归因若在同一段数据上反复调优,会出现 double-dipping;更严格的做法是把账簿建立期与归因估计期进一步分开。

得到统一的多轴 EV 后,执行层提供三种接口。

Composite 模式把 EV 与原始信号强度相加,组合分数超过阈值才交易,因此会同时改变入场决策和信号排序。Gate 模式不修改信号强度,只在 EV 低于阈值时拒绝入场;阈值在开发期按总净收益选择,而不是按每笔收益选择,以防模型只保留极少数交易获得虚高均值。Sizing 模式保留所有候选,再按开发期 EV 的三个分位档使用 0.5、1.0 和 1.5 倍头寸。

三种模式共享同一个评估框架:使用相同的开发期和一次冻结检验期,按小时顺序回放,并在每条信号轨道上执行 busy-blocking,即同一时刻只允许一个未结束头寸。这样比较执行方式时,不会因为数据区间或交易重叠规则不同而获得额外优势。

七、实验设置

实验使用铜期货和 BNB 期货的一小时数据,每个品种包含 2023 年 1 月至 2026 年 6 月的 30648 个小时。铜受宏观周期、库存和工业需求影响,BNB 则具有趋势行情、均值回复盘整和清算冲击之间的快速切换。作者有意选择了两种难以维持稳定无条件优势的市场,用来检验状态层能否从弱基线中分离条件收益。

2023 年用于状态模型和账簿的 jumpstart;2024 年 1 月至 2025 年 6 月为开发期;2025 年 7 月至 2026 年 6 月为一次性冻结的 holdout。所有特征、阈值和模型都只使用历史数据,开发期结束时统一重拟合一次,随后冻结。铜和 BNB 的往返成本分别设为 2 个基点和 5 个基点。

TECH 组由十条标准动量信号构成,包括两组 EMA 交叉、24 小时和 48 小时 Donchian 突破、24 小时 ROC、MACD、RSI 动量、布林带、三重 EMA 排列和 6/36 小时均线交叉。技术信号在一段运行开始时入场,24 小时内遇到第一个反向候选则退出。

DL 组同样有十条信号,由五条多头和五条空头 LSTM—Transformer 信号组成。底层模型使用分钟数据预测未来四小时有符号收益,预测值超过开发期第 85 百分位时,汇总成小时级入场,持有期固定为四小时。也就是说,状态层工作在一小时粒度,DL 信号本身利用了更细的分钟级信息。

核比较器使用 72 小时 Kaufman ER、72 小时 Rogers—Satchell 波动率和 72 小时排列熵的开发期百分位;带宽在 0.10、0.15、0.20 中选择,时间衰减半衰期在 168 和 336 小时中选择,收缩参数 () 固定为 35。

八、结果

开发期为每组信号选出最佳执行模式后,论文在 holdout 中得到以下结果:

实验 基线交易数 基线每笔收益 入选模式 模式交易数 模式每笔收益
铜 × TECH 3759 0.46 bpsGate 1140 17.40 bps
铜 × DL 3666 2.75 bpsSizing 3666 4.40 bps
BNB × TECH 3884 0.18 bpsGate 2286 17.12 bps
BNB × DL 3667 13.19 bpsSizing 3667 20.55 bps

两组技术信号的基线接近盈亏平衡,Gate 在减少交易后明显改善每笔收益。两组 DL 信号本身已经有较宽的正收益,开发期则选中 Sizing,通过重新分配风险取得更高的组内累计结果。论文据此认为,适合哪种执行方式取决于原始信号的条件收益分布:优势集中于少数状态时,门控更直接;多数状态都盈利但幅度不同,仓位调整保留了更多机会。

被 Gate 拒绝的候选没有从统计中消失。作者建立 ghost stream,假定这些交易仍按原策略成交和退出。铜 TECH 被拒的 2619 个候选平均每笔 -5.16 个基点,累计 -181%;BNB TECH 被拒的 1598 个候选平均每笔 -22.35 个基点,累计 -384.5%。铜 DL 和 BNB DL 的 ghost 累计结果也为负。这项检验说明,门控在当前 holdout 中确实集中排除了一批不利交易,而不是随机缩小样本。

EV 排序与未来四小时结果的 Spearman IC 位于 0.121 至 0.181 之间,四个实验的最高 EV 十分位平均收益都高于最低十分位。多轴模型相对核比较器的优势并非每组都同样大:铜 TECH 上核方法的 IC 为 0.201,高于多轴模型的 0.144;其余三组则由多轴模型领先。按组内累计收益计算,多轴方案在四个 holdout 中都更高。

BNB TECH 是作者重点讨论的案例。核门控在开发期累计 +329%,高于多轴门控的 +273%;进入 holdout 后,核门控转为 -39%,多轴门控为 +391%。这次反转与作者关于连续核估计在分布漂移中可能过度外推的解释一致。不过,单个品种的一段路径尚不足以证明离散状态结构具有普遍的样本外优势。

成本压力测试把往返成本提高到基准值的 1.5 倍和 2 倍。四个入选方案在两倍成本下仍保持正的组内累计结果,而铜 TECH 与 BNB TECH 的未过滤基线已经分别降至 -58% 和 -187%。参数盆地大体平稳,最明显的例外仍是 BNB TECH 的账簿半衰期:记忆延长一倍后,开发期结果显著恶化,与其快速状态切换相吻合。

九、结论

论文最终将自身贡献归纳为三个方面。

第一,状态轴设计应被视为模型的核心问题,而不是预先给定的外部标签。有效的状态轴需要同时满足结果分布可分、经济含义清晰以及轴间尽量正交,并在特征窗口、状态切换速度和单元样本量之间取得平衡。

第二,作者以二阶 Wasserstein 距离对信号结果分布进行聚类,用分布重心表示状态原型,再由距离生成软后验概率。这一处理既保留了具名状态的可解释性,也缓和了硬分类在状态边界处产生的不连续。

第三,论文把 Signal EV Ledger 所承担的条件收益估计,与 Gate、Composite 和 Sizing 三种执行方式明确分开,使同一套估计结果能够在统一评估框架下对应不同的交易用途。

作者同时承认,当前模型仍采用轴间加法,无法直接表达状态交互;动态归因在轴相关时也只是对真实方差贡献的近似。实证仅包含两个品种、两类信号和每个品种一段 12 个月的 holdout,因此还需要跨资产、跨信号、跨市场状态的进一步检验。论文提出的后续方向包括:利用带有层级收缩的联合状态估计捕捉轴间交互,引入在线轴学习以适应结构变化,把软后验扩展为 Wasserstein 空间中的连续状态估计,以及在多条信号轨道之上加入考虑相关性的组合配置层。按照原文的定位,这项工作的主要成果是一套状态条件化的信号元层架构,而不是已经完成验证的交易系统。

— THE END —