【报告导读】
1. 基于深度学习预测+强化学习优化的指数增强策略框架,从K线到权重一键生成决策结果
2. 强化学习模型应用于组合优化问题,静态配置转化为动态决策
3. PPO模型逐年滚动训练,双窗口+双门槛质量诊断筛选训练结果
4. Banach自融资投影保障组合价值
5. 深度学习预测+强化学习优化框架在沪深300、科创50等主流宽基指数表现较优
基于深度学习预测+强化学习优化的指数增强策略框架,从K线到权重一键生成决策结果:本文将指数增强问题拆分为连续衔接的八个环节:原始数据输入、统一清洗与标签构造、K线衍生特征工程、时序编码、截面关系聚合、多标签预测、强化学习组合优化以及执行与回测评估。本框架的核心优势在于以最基础的K线数据作为输入值,可一键实现收益风险信号预测和个股权重决策,为投资实践提供有效参考。
l 强化学习模型应用于组合优化问题,静态配置转化为动态决策:承接前序报告中深度学习模型预测的收益风险信号,我们将预测信号、基准权重、已有持仓、换手成本与跟踪误差约束共同纳入状态空间;动作空间定义为连续权重调整信号,经裁剪与Softmax映射为可执行的主动配置权重;奖励函数综合考量超额收益、因子暴露收益、跟踪误差惩罚、换手惩罚与集中度约束,使模型在追求长期超额收益的同时控制风险与交易成本,最大化组合综合表现。
PPO模型逐年滚动训练,双窗口+双门槛质量诊断筛选训练结果:PPO模型采用Actor-Critic架构,Actor输出连续动作分布、Critic估计状态长期价值,其核心优势在于通过裁剪替代目标函数限制新旧策略偏离幅度,提升训练稳定性。训练PPO模型时采用逐年滚动方式,沪深300以最近2-4年数据为纯训练集、最近一年为验证集,在验证集上划分双窗口、通过平均奖励与累计超额收益双门槛进行模型质量诊断,并对多个候选模型按验证集表现进行Softmax加权集成,以增强策略泛化能力。
Banach自融资投影保障组合价值:在 PPO模型输出目标权重后,我们引入Banach不动点选代求解调仓后组合规模,使组合价值、目标权重与交易成本相互一致,避免资金不自洽问题。PPO模型训练阶段默认交易成本为0,避免交易成本重复扣除;在回测阶段统一扣除真实交易成本。
深度学习预测+强化学习优化框架在沪深300、科创50等主流宽基指数表现较优:将以上指数增强框架分别应用于沪深300、科创50指数成分股,每年滚动训练深度学习与强化学习模型并预测下一年信号结果,在2020年7月31日至2026年5月29日回测区间内,沪深300指数增强策略实现年化收益率5.11%、年化超额收益4.26%;在2021年7月30日至2026年5月29日回测区间内,科创50指数增强策略实现年化收益率15.09%、年化超额收益12.52%。两个策略均在获得超额收益的同时降低了最大回撤幅度,且科创50增强结果相比凸优化显著改善,验证了深度学习预测+强化学习优化框架的有效性。
报告结论基于历史价格信息和统计规律,但二级市场受各种即时性政策影响易出现统计规律之外的走势,所以报告结论有可能无法正确预测市场发展,报告阅读者需审慎参考报告结论。历史收益不能形成投资依据,文中观点仅供参考,不构成投资建议。
一、基于深度学习预测+强化学习优化的策略框架
(一)指数增强框架:从静态因子到动态决策
传统因子选股与指数增强方法一般遵循因子挖掘、因子打分、组合优化的框架,其优势在于逻辑清晰、可解释性较强,但在权益市场中,当面临风格切换、因子交易拥挤等情况时,仅采用静态因子可能面临因子失效问题,甚至可能导致更大幅度的回撤。在前篇报告《时序截面三层深度学习模型预测收益风险信号》中,我们构建了TimeEncoder-GraphSAGE-MLP三重特征提取模型,对Sharpe比率、最大回撤等多个收益风险指标进行了预测,形成未来收益风险的预测信号,并通过回测验证了信号在投资实践中的有效性。
本报告将在深度学习预测收益风险信号的基础上,进一步将静态决策转化为动态决策问题,将前篇报告中“信号预测+组合优化”指数增强框架拓展为“深度学习预测+强化学习优化”两层决策体系。其中,第二层由PPO模型承担,目标是在给定约束条件、当前仓位、市场状态等条件下,将预测信号转化为可执行的动态权重,并通过Banach不动点迭代对输出权重进行微调,以平滑交易成本对组合规模的影响。本框架的核心优势在于以最基础的K线数据作为输入值,可一键实现收益风险信号预测和个股权重决策,为投资实践提供有效参考。
(二)总体策略框架与流程图
从整体逻辑看,本文将指数增强问题拆分为连续衔接的八个环节:原始数据输入、数据清洗与标签构造、K线衍生特征工程、时序编码、截面图网络聚合、多标签预测、强化学习组合优化、回测执行与评估。
其中,深度学习部分以K线数据通过滑动窗口构建特征工程,输入TimeEncoder-GraphSAGE-MLP三重特征提取模型,在时间维度上通过TimeEncoder提取趋势和波动模式,在截面维度上通过GraphSAGE模型识别股票间的联动关系,并最终通过MLP模型对超额收益、Sharpe比率、最大回撤等多个收益风险指标进行了预测,形成未来收益风险的预测信号。训练完成后,系统进一步根据验证集RankIC进行质量筛选,避免低质量预测直接进入后续组合优化。
强化学习部分则把组合管理视为一个序列决策问题,将预测信号、约束条件、已有持仓以及交易成本共同纳入状态空间,使组合权重的调整不再是单次静态求解,而是面向长期路径表现的连续决策;而在定义奖励函数时,我们采用了包含预测信号、超额收益、换手与跟踪误差惩罚等多项在内的综合惩罚。在PPO模型给出个股配置权重预测结果后,我们加入了Banach不动点迭代模块,以更真实地刻画交易成本,并尽量降低交易成本对组合规模的损耗。
二、强化学习优化:动态决策资产配置权重
指数增强策略的组合构建是一个多约束的优化问题。对于成分股数量较多、基准权重动态变化、调仓成本与跟踪误差约束同时存在的指数增强产品而言,组合权重具有明显的路径依赖特征:上一期持仓会影响本期换手率,本期主动偏离会影响下一期跟踪误差,而交易成本会直接影响净值结果。因此,本报告将组合优化表述为一个带有基准约束的序列决策问题,并采用近端策略优化算法(PPO,Proximal Policy Optimization)与Banach自融资投影相结合的方式生成组合目标权重。
强化学习的引入,使得组合权重的生成方式由“单期求解”提升为“动态策略学习”。组合优化问题天然具备状态、动作、转移与奖励四个核心要素,这为强化学习提供了较为完整的应用场景。我们用离散时间动态指数跟踪框架,将指数跟踪与再平衡问题表述为多期优化问题,并通过PPO与Banach不动点迭代实现对高维状态和非线性交易成本的统一处理。
(一)强化学习优化:从静态配权到动态决策
传统单期优化通常以当期预测值或因子得分为核心输入,在给定基准权重的基础上,对主动权重进行一次性调整。该类方法的优点是结构清晰、求解快速,但其隐含前提是:当期最优即能够代表跨期最优,且调仓成本可以通过简化惩罚项加以近似处理。对于现实中的指数增强组合,这一隐含假设并不完全成立。首先,达到收益风险最优不仅与当期横截面排序有关,还受到历史持仓路径影响。其次,实际交易成本与成交金额、成交股数等不是简单的线性关系,假设固定的交易费率并不符合现实。最后,跟踪误差控制具有跨期属性,单期优化难以识别这种路径依赖,例如,若组合在某一期为了追逐短期信号大幅偏离基准,下一期可能面临较高的换手和跟踪误差回归成本;若过度压制换手率,组合又可能无法及时利用新信号。
基于以上问题,我们引入强化学习模型动态配置个股权重。强化学习的优势在于,它不局限于“某一时点的最优权重”,而是学习一个策略函数:在给定信号、持仓、基准和风险状态下,应如何调整组合权重。用公式可表达为
强化学习的输入值来自于前序深度学习预测模块的输出值。报告《时序截面三层深度学习模型预测收益风险信号》中,我们已经验证了深度学习模型输出的Sharpe比率和最大回撤信号预测效果可观,且在指数增强策略中能有效获取超额收益、控制回撤,因此我们将此作为强化学习模型的输入值,这样强化学习的输入值更具有前瞻性,使模型在训练过程中较少受到历史数据的噪声影响。将预测值作为状态核心变量,相当于先用前序模型完成“信息提纯”,再由强化学习完成“权重映射”,从而形成“预测—决策”两层分工。
(二)指数增强问题的马尔科夫过程表述
在强化学习框架下,指数增强组合优化可表达为马尔可夫决策过程(Markov Decision Process, MDP):
测与组合约束”,动作描述“主动权重调整方向与幅度”,奖励描述“调仓是否大幅偏离约束限制、是否实现更高的超额收益与风险收益平衡”。这样,一方面组合管理目标能够通过奖励函数显式表达,另一方面,强化学习优化器作为“预测—组合”的连接层,可避免把预测误差直接放大为组合偏离。
1.状态空间:收益风险、持仓位置、交易约束与市场环境
状态空间包括当前收益信号、当前风险信号、当前基准权重、当前主动偏离,叠加回溯窗口(lookback window)内收益信号均值、风险信号均值、个股收益均值与波动,以及部分组合特征与市场环境特征。
2.动作空间:从连续动作到可执行目标权重
PPO模型是一种结合策略网络决策(Actor)和价值函数评估(Critic)的强化学习架构,其中Actor负责输出动作分布,Critic负责估计状态价值。但与凸优化结果不同,PPO的Actor网络输出结果并不是组合权重,而是每只股票的连续动作打分。代码中Actor网络采用多层MLP结构,输入值为前文定义的状态空间,隐藏层维度为(256,256,128),每层包含线性变换、层归一
(三)PPO模型:稳定更新连续权重策略
1.Actor网络和Critic网络
PPO的核心优势在于通过裁剪替代目标函数(Clipped Surrogate Objective)限制新旧策略的偏离幅度,从而避免策略更新幅度过大导致训练震荡。下文中我们将从损失函数的定义详细解释PPO的优势所在。
2.损失函数
PPO模型的整体损失函数由策略损失(Actor Loss)、价值函数损失(Critic Loss)和熵正则项(Entropy Loss)组成:
3.损失计算与反向传播
PPO模型从获取状态、计算价值到反向传播更新参数的流程如下图所示。
(四)PPO模型:训练与筛选
与前篇报告中深度学习模型的训练一致,本报告的PPO模型同样采用逐年滚动训练的方法,每年年初采用最近4年的数据重新进行模型训练,并使用训练好的模型预测当年的个股配置权重。具体训练参数设置如下:
1.训练集与测试集
对于沪深300,我们采用最近4年的数据为训练集,其中最近2-4年的数据用于纯训练,最近1年的数据为验证集;未来1年的数据为测试集。例如,如果我们需要训练预测2026年权重的模型,则2022-2024年数据为训练集,2025年数据为验证集;2026年数据为测试集,用于生成回测配置权重。
对于科创50,我们采用最近3年的数据为训练集,其中最近2-3年的数据用于纯训练,最近1年的数据为验证集;未来1年的数据为测试集。
2.模型质量诊断
采用双窗口+双门槛机制,具体而言:
·首先,将1年的验证集平均划分为两个窗口,分别在两个窗口内计算平均奖励和回测累计超额收益率。
·其次,在每个窗口内判断平均奖励是否大于0.02、累计超额收益是否大于8%。在代码中,我们设置平均奖励大于0.02得1分、累计超额收益大于8%得1分,单窗口综合得分最高为2分,验证集累计综合得分最高为4分。
·最后,如果整个验证集综合得分大于等于2分,则模型通过质量诊断。
3.重试机制与权重预测
对于一个模型的训练,目前我们设置5个随机数种子区间、每个种子区间内最多重训练3次,并对候选模型生成的权重结果进行加权集成,平滑预测结果。具体步骤如下:
1)随机数种子区间内重试:我们设置5个随机数种子区间之间的间隔较大、同一区间内产生的种子间隔较小,这样可以实现“粗粒度探索+细粒度搜索”效果。在同一随机数种子区间内,我们最多用不同的种子尝试3次,如果在一次训练中模型综合得分达到2分,则提前结束该轮训练并保存模型结果;如果已达到最大尝试次数3次仍没有模型综合得分达到2分,则进入下一区间的训练,该轮不保存模型结果。在重试过程中,最多产生5个候选模型及对应权重。
2)候选模型权重加权集成:对重试过程产生的N个候选模型(N≤5),我们采用Softmax加权集成计算最终回测权重。首先根据验证集累计超额收益(即两个窗口的累计超额收益之和)计算Softmax权重,用公式可表达为
3)回退机制:如果15次训练没有任何一个模型综合得分达到2分,导致没有可用的模型结果,权重计算将回退到Alpha因子值加权。与报告《时序截面三层深度学习模型预测收益风险信号》一致,这里的Alpha因子即为深度学习模型预测的标准化后的Sharpe比率信号。在剔除因子负值后,按照因子值正比计算个股权重。
(五)Banach不动点迭代:让目标权重与组合价值自洽
Banach迭代的主要目的是平滑调仓过程中组合总规模的变化。当PPO模型生成目标权重后,还需要将其转化为调仓后的持仓价值。若不考虑自融资约束,直接令新持仓价值等于目标权重乘以旧组合价值,加入交易成本后可能产生资金不自洽问题。因此我们引入Banach不动点思想,将“调仓后组合规模”视为未知量,通过迭代求解使组合价值、目标权重与成本函数相互一致。
当前代码中,Banach模块的核心方程为:
(六)一个生活化例子:每周买菜预算与组合调仓
我们可以用“每周买菜”理解强化学习组合优化。假设一个家庭每周都有固定预算,需要决定蔬菜、肉类、水果和主食各买多少。状态包括冰箱剩余库存、近期菜价、家人偏好和上周是否有浪费;动作是本周各类食材买多少;约束是总花费不能超过预算;奖励则来自营养均衡、花费合理和浪费较少。
对应到指数增强策略,冰箱库存相当于上一期持仓,菜价和家人偏好相当于市场状态与预测信号,预算约束相当于组合权重和为100%的自融资约束,营养与浪费则对应超额收益、风险和换手成本。强化学习的目标不仅仅是学会“这周买最便宜的菜”,还应通过多周经验逐渐学会什么时候多买、什么时候少买,什么时候虽然某种食材看起来便宜但不宜过度集中,等等。
三、强化学习有效性检验
本章以科创50为样本,对强化学习组合优化环节进行示例性消融实验。实验保持深度学习预测信号、基准权重与价格数据输入一致,仅对强化学习奖励函数中的关键约束项进行移除或保留,对比不同设定下的累计调仓期超额收益、平均奖励、跟踪误差、换手率、主动持股比例及权重集中度等指标。
消融组共包括6组:完整奖励函数、去Alpha信号、去风险惩罚、去实际超额收益、去跟踪误差/换手约束,并额外保留pipeline筛选结果模型作为最终策略表现的参照。其中,完整奖励函数组和pipeline筛选结果的奖励函数是一致的,但为了节约训练时间,二者在参数设置上存在差异,例如完整奖励函数组只训练30轮,而pipeline筛选模型训练120轮;但轻量化的参数设置不影响消融实验的结论。
此外,本章中pipeline筛选模型与下一章中科创50增强策略所采用的PPO模型也并不完全相同。下一章中采用的PPO模型与前文的训练方法一致,是每年滚动训练、根据验证集表现筛选与加权集合的结果;本章中的pipeline筛选模型并未进行滚动训练等处理,但相比其他轻量化参数的消融组而言,仍具有更精细的参数设置,包括训练轮次更多等等。
消融实验的目的是验证以下两点:一是通过强化学习配置个股是否改善了组合的长期表现,二是奖励函数中的各项约束是否具有不可替代的作用。
(一)Pipeline筛选结果模型:回测结果分析
首先,对于pipeline最终筛选结果,我们从各期奖励、超额收益、换手率、跟踪误差等角度详细拆解策略的表现。
在奖励方面,由图5可见单期奖励存在一定波动,部分调仓期奖励为负,说明强化学习优化并不是每一期都获得正向奖励,而是在多期序列中追求累计收益—风险约束下的整体最优。同时,对比奖励与单期收益,奖励为负时并不一定导致单期超额收益也为负,同样说明强化学习的目标是整体最优权重,长期来看pipeline筛选结果相对科创50获得累计超额收益72.41%,表明组合层面的超额收益具有较强的累积性。
从散点图也可以得到相同的结论。从图7可见,单期奖励与单期超额收益之间整体呈现正相关,但奖励与超额收益正负相反的情况也并不罕见;但图8从长期来看,累计奖励与累计超额收益率呈现显著正相关关系,表明强化学习的目标是长期的组合表现。
我们在强化学习中主要通过奖励函数对跟踪误差和换手率进行软约束,从结果来看,每一期跟踪误差均高于10%,平均跟踪误差为17.60%;每一期换手率均高于20%,平均换手率为35.24%。换手率周期性地在每年1月底调仓日出现最高点,说明我们每年重新训练一次深度学习模型确实影响了配置结果。
从主动权重与信号的散点关系看,无论是收益信号还是风险信号与主动权重的线性相关系均不显著。这一结果说明,有别于传统选股因子按排序打分结果线性配置权重,强化学习优化结果综合考虑了Alpha机会、风险暴露、仓位限制和交易约束等因素的影响,因此映射关系非线性恰恰表明强化学习是一个统一的多因素动态决策框架。
进一步观察组合权重配置情况,由图13可见,策略的主动持股比例整体保持在较高水平,说明组合相对于科创 50基准具有明确的主动管理特征。同时,前5大重仓股权重和第一大重仓股权重整体仍分别处于50%、20%上下的区间,与报告《时序截面三层深度学习模型预测收益风险信号》中凸优化的硬约束条件一致,说明强化学习优化结果处于正常可控范围,未出现长期极端集中于少数股票的情形。
从每一期收益/风险信号与主动权重的相关性来看,相关性具有明显时变特征,部分调仓期相关性为负,同样说明强化学习会根据不同调仓期的信号结构和约束条件动态调整配置逻辑,这也是前面图11和图12中在整个回测区间计算相关系数不显著的原因。此外,相对而言收益信号与主动权重的相关性波动更剧烈,相邻两期相关性正负号改变的情况更多;风险信号与主动权重的相关性更稳定,连续多期相关性正负号一致的情况更多。
更进一步,由图15可见,当奖励与主动偏离的幅度相匹配时,更容易产生正向超额收益。图16列出了科创50在2026-05-29一期超配权重前10与低配权重前10的股票。
(二)消融组结果对比
消融实验结果显示,在回测期内,pipeline筛选结果的累计超额收益并不是最高的,其超额收益达到72.41%;而完整reward组的累计超额收益达到83.76%。但从后文跟踪误差、换手率等指标的结果对比,我们仍可发现pipeline筛选结果在经过更多轮训练后,是一个相对更优的模型。
相比之下,其他4个消融组的累计超额收益表现均出现不同程度的下降,其中去除实际超额收益项后回测期内累计超额收益最低,仅为5.85%,说明实际超额收益是奖励函数中的关键组成部分。去除alpha信号、去除风险惩罚与去除TE/换手约束三个组的累计超额收益分别为24.36%、26.45%和27.18%,均显著低于完整reward组的表现,说明这三项也对组合优化具有正向贡献。
从核心指标对比可以看到,pipeline筛选结果虽然在累计超额收益上略低于完整reward组,但平均奖励显著高于其他5组。其中,pipeline筛选结果的平均换手率显著低于其他5组、主动权重显著高于其他5组,跟踪误差与完整reward组相当;6个消融组的前5大重仓股集中度均在40-50%区间,整体相差不大。这说明pipeline筛选结果的决策更偏主动管理,且能把权重集中于未来表现较好的个股,在提高主动权重的同时降低换手对组合资产的损耗。
相比之下,完整reward组的主动程度略低,但平均奖励仍显著高于其他4组,且最终超额收益高于pipeline筛选结果,体现出基础奖励函数本身具备有效性。值得注意的是,去实际超额收益组虽然平均reward排在第三位,但累计超额收益最低,说明在本策略框架下,不能仅以训练过程中的平均reward作为模型优劣判断标准,这也是我们在验证集筛选模型时采用平均奖励与累计超额收益双门槛的原因。
由如下散点图可见,pipeline筛选结果位于右上方,说明其在承担较高主动偏离时,有效将主动权重配置在具有超额收益的个股上,因此表现出较高的跟踪误差,同时获得较高的累计超额收益。完整reward组的跟踪误差也较高,但主动偏离相对较低、集中度较高,说明其超额更多来自于超配个别股票,因而换手率高于pipeline筛选结果。但去TE/换手约束组虽然具有同样的跟踪误差与主动偏离特征,其累计超额收益却远低于完整reward组,说明以纯粹的收益风险特征作为奖励函数并不能使组合配置结果达到最优,这也证明了本报告奖励函数设计的完备性。
相对而言,去Alpha信号组和去风险惩罚组超额表现较弱更多来自于主动偏离的不足;去实际超额收益组在主动权重上与其他四组相近,但跟踪误差相对偏高,且最终累计超额收益最低,可能源于模型将主动权重错配给表现较弱的个股,表明缺失关键奖励项后,模型容易在错误方向上放大主动风险。
四、模型应用实例:指数增强策略
在报告《时序截面三层深度学习模型预测收益风险信号》中,我们将深度学习预测的收益风险信号应用于指数增强策略,通过凸优化叠加硬约束和软惩罚项进行个股权重计算,验证了深度学习预测信号可以在获得超额收益的同时有效实现回撤控制。后文中,我们将再次将深度学习预测信号应用于指数增强策略,但个股权重计算由本文的强化学习模型完成,把“深度学习预测+强化学习配置”的框架再次应用于沪深300、科创50等主流宽基指数,检验强化学习模型相比传统凸优化方法是否具有优势。
(一)指数增强组合优化框架
本报告中沪深300和科创50指数增强策略均遵循统一的框架进行信号预测、组合优化与回测。具体而言,以指数成分股为基础股票池,获取股票与指数的日线/小时线数据输入深度学习模型,逐年进行模型训练,并预测未来一年的Sharpe比率、最大回撤信号;在组合构建时,采用滚动训练PPO模型预测个股配置权重,并用Banach不动点迭代方法微调权重结果、平滑交易成本,并按照下一交易日收盘价将目标权重换算为持仓股数、生成买卖订单,最终进行回测净值计算与业绩评价。以沪深300为例,指数增强策略流程图如下。
(二)沪深300指数增强策略
沪深300增强策略的原始数据取值区间为2019年1月1日至2026年5月29日,采用小时线数据,每年重新训练一次模型。其中深度学习共训练2020-2025年6个模型,除2020年模型由于数据不足仅采用2019-2020两年数据进行训练以外,其他模型均为滚动最近三年数据训练;强化学习除2020、2021年模型由于数据不足缩减训练集规模以外,其他模型均为滚动最近四年数据训练。回测区间为2020年7月31日至2026年5月29日,每月最后一个交易日调仓,股票单边交易成本0.05%。
2020年7月31日至2026年5月29日,沪深300指数增强策略回测累计收益率为32.20%,年化收益率为5.11%,相比沪深300指数实现年化超额收益4.26%;策略Sharpe比率和Calmar比率分别为0.3691、0.1691,最大回撤为-30.23%;策略超额收益的Sharpe比率和Calmar比率分别1.1228、0.5094,最大回撤为-8.36%。同时,从策略与沪深300指数的最大回撤对比来看,在回测区间内增强策略的最大回撤始终没有超过指数本身。
从分年度业绩表现来看,策略在2025年以来表现略弱于指数,可能源于近两年市场风格、牛熊趋势变化较大,强化学习模型在前一年验证集上表现较优反而在测试集上泛化能力不足;2020-2024年间均跑赢沪深300,且在整个回测区间内最大回撤均小于指数,表明“深度学习预测+强化学习优化”的框架能够实现增强的效果。
(三)科创50指数增强策略
科创50增强策略的原始数据取值区间为2019年12月31日至2026年5月29日,采用小时线数据,每年重新训练一次模型。其中,深度学习模型共训练2021-2025年5个模型,强化学习模型共训练2021-2025年5个模型,除2021年模型由于数据不足仅采用2020-2021两年数据进行训练以外,其他模型均为滚动最近三年数据训练。回测区间为2021年7月30日至2026年5月29日,每月最后一个交易日调仓,股票单边交易成本0.05%。
2021年7月30日至2026年5月29日,科创50指数增强策略回测累计收益率为91.85%,年化收益率为15.09%,相比科创50指数实现年化超额收益12.52%;策略Sharpe比率和Calmar比率分别为0.6055、0.2806,最大回撤为-53.80%;策略超额收益的Sharpe比率和Calmar比率分别为1.3430、1.3565,最大回撤为-9.23%。同时,在回测区间增强策略的最大回撤均低于指数本身,表明“深度学习预测+强化学习优化”框架对科创50指数可有效实现捕捉超额收益、同时控制风险的效果。
从分年度业绩表现来看,除2022年科创50增强策略相对指数无显著超额外,其他年份均跑赢指数,尤其2024年以来超额收益明显。一方面可能源于数据量增加后模型训练效果改善,另一方面2024年以来模型的验证集与测试集总体趋势一致,或对回测效果也有影响。
(四)回测结果对比:强化学习VS凸优化
为进一步检验强化学习模型的效果,我们将前文两个指数增强的回测结果与报告《时序截面三层深度学习模型预测收益风险信号》中凸优化回测结果进行对比。
1.沪深300指数增强策略
下图为沪深300指数增强策略分别采用强化学习、凸优化方法计算权重的回测结果,红线为强化学习结果相对凸优化结果的超额收益。由图可知,直至2023年上半年,强化学习方法回测结果优于凸优化;而2023年下半年以来强化学习方法跑输,尤其在2025年6-9月跑输幅度较大。但从回撤表现来看,强化学习方法在整个回测区间内相较于凸优化更进一步缩减了组合回撤的幅度。
2.科创50指数增强策略
下图为科创50指数增强策略分别采用强化学习、凸优化方法计算权重的回测结果,红线为强化学习结果相对凸优化结果的超额收益。由图可知,2022年强化学习结果表现弱于凸优化,2025年强化学习结果没有显著跑赢凸优化,其他年份强化学习结果均显著跑赢。从回撤表现来看,强化学习结果在2024年之前回撤幅度没有表现出显著优势,自2024年以来组合回撤幅度较凸优化有明显缩减。
3.强化学习结果超额来源
对于科创50增强策略,强化学习结果相对凸优化的超额收益一定程度来源于重配未来表现较优的个股。由下图可见,强化学习预测的权重结果呈现显著的右偏长尾分布,极个别个股可获得很高的权重。例如,科创50增强策略如果采用凸优化方法,个股最高配置权重为16%;而采用强化学习方法最高权重可超过30%。
与此同时,获得超配的个股在未来一个月内确实表现较优。下图列出了整个回测区间内,强化学习相对凸优化超配幅度最高的前20只个股,可以发现强化学习相对凸优化的超配权重可达到20%以上,且重配在寒武纪、固德威等表现突出的个股;其他个股即使在未来一个月没有跑赢科创50,也没有出现大幅跑输的情况,这一方面也从侧面验证了深度学习预测信号确实能有效筛选未来具备超额潜力的个股,但同时也是强化学习对这些个股的重配使增强策略的表现更上一层楼。
反之,沪深300增强策略采用强化学习时表现较弱,或与强化学习结果的集中度偏低有关。计算各调仓期权重结果的HHI指数,可发现沪深300与科创50增强策略权重的集中度表现是相反的:沪深300增强策略采用凸优化时集中度更高,而科创50增强策略采用强化学习时集中度更高。沪深300增强采用强化学习时表现较弱,或与其成分股较多、权重可调整空间较小也有关系;此外,在模型诊断中,我们统一采用累计超额收益超过8%为诊断标准,这一标准或对沪深300有些严苛。因此,沪深300增强策略的强化学习结果表现差强人意并非说明强化学习模型没有意义,未来我们可调整参数设置,进一步优化策略表现。
五、风险提示
报告结论基于历史价格信息和统计规律,但二级市场受各种即时性政策影响易出现统计规律之外的走势,所以报告结论有可能无法正确预测市场发展,报告阅读者需审慎参考报告结论。基金历史收益不代表未来业绩表现,文中观点仅供参考,不构成投资建议。
六、附录
(一)可调参数列表
(二)状态空间变量列表
PPO模型中状态向量中包含的具体变量及释义如下表所示。假设股票数量为N,回看窗口期长度为L。
本文摘自:中国银河证券2026年7月7日发布的研究报告《【银河金工】基于深度学习预测与强化学习优化的指数增强策略——银河金工组合优化系列报告》
分析师:马普凡、刘璐
评级标准:
评级标准为报告发布日后的6到12个月行业指数(或公司股价)相对市场表现,其中:A股市场以沪深300指数为基准,新三板市场以三板成指(针对协议转让标的)或三板做市指数(针对做市转让标的)为基准,北交所市场以北证50指数为基准,香港市场以恒生指数为基准。
行业评级
推荐:相对基准指数涨幅10%以上。
中性:相对基准指数涨幅在-5%~10%之间。
回避:相对基准指数跌幅5%以上。
公司评级
推荐:相对基准指数涨幅20%以上。
谨慎推荐:相对基准指数涨幅在5%~20%之间。
中性:相对基准指数涨幅在-5%~5%之间。
回避:相对基准指数跌幅5%以上。
法律申明:
本公众订阅号为中国银河证券股份有限公司(以下简称“银河证券”)研究院依法设立、运营的研究官方订阅号(“中国银河证券研究”“中国银河宏观”“中国银河策略”“中国银河固收”“中国银河科技”“中国银河先进制造”“中国银河消费”“中国银河能源周期”“中国银河证券新发展研究院”)。其他机构或个人在微信平台以中国银河证券股份有限公司研究院名义注册的,或含有“银河研究”,或含有与银河研究品牌名称等相关信息的其他订阅号均不是银河研究官方订阅号。
本订阅号不是银河证券研究报告的发布平台,本订阅号所载内容均来自于银河证券研究院已正式发布的研究报告,本订阅号所摘录的研究报告内容经相关流程及微信信息发布审核等环节后在本订阅号内转载,本订阅号不承诺在第一时间转载相关内容,如需了解详细、完整的证券研究信息,请参见银河证券研究院发布的完整报告,任何研究观点以银河证券发布的完整报告为准。
本订阅号旨在交流证券研究经验。本订阅号所载的全部内容只提供给订阅人做参考之用,订阅人须自行确认自己具备理解证券研究报告的专业能力,保持自身的独立判断,不应认为本订阅号的内容可以取代自己的独立判断。在任何情况下本订阅号并不构成对订阅人的投资建议,并非作为买卖、认购证券或其它金融工具的邀请或保证,银河证券不对任何人因使用本订阅号发布的任何内容所产生的任何直接或间接损失或与此有关的其他损失承担任何责任,订阅号所提及的任何证券均可能含有重大的风险,订阅人需自行承担依据订阅号发布的任何内容进行投资决策可能产生的一切风险。
本订阅号所载内容仅代表银河证券研究院在相关证券研究报告发布当日的判断,相关的分析结果及预测结论,会根据银河证券研究院后续发布的证券研究报告,在不发出预先通知的情况下做出更改,敬请订阅者密切关注后续研究报告的最新相关结论。
本订阅号所转发的研究报告,均只代表银河证券研究院的观点。本订阅号不保证银河证券其他业务部门或附属机构给出与本微信公众号所发布研报结论不同甚至相反的投资意见,敬请订阅者留意。
《证券期货投资者适当性管理办法》于2017年7月1日起正式实施,通过微信订阅号发布的本图文消息仅面向银河证券客户中的机构专业投资者,请勿对本图文消息进行任何形式的转发。若您并非银河证券客户中的机构专业投资者,为保证服务质量、控制投资风险,请取消关注,请勿订阅、接收或使用本订阅号中的任何信息。
本订阅号所载内容的版权归银河证券所有,银河证券对本订阅号保留一切法律权利。订阅人对本订阅号发布的所有内容(包括文字、影像等)的复制、转载,均需注明银河研究的出处,且不得对本订阅号所在内容进行任何有悖原意的引用、删节和修改。
投资有风险,入市请谨慎。