深度学习模型在指数增强策略中的具体架构与训练机制是什么?

请详细阐述报告中提出的时序截面三层深度学习模型的具体架构,包括时序编码层、截面图网络层及多任务预测头的设计原理。同时,说明模型在训练过程中采用的损失函数、优化策略及防止过拟合的机制。
最佳答案 匿名用户编辑于2026/06/10 07:55
报告提出的深度学习预测模型是一个多任务时序图网络,整体架构分为三层。第一层是时序编码层(TimeEncoder),基于Transformer模型,通过自注意力机制捕捉个股在时间序列上的长距离依赖,利用注意力池化将时间维度压缩为紧凑的时序表示。第二层是截面图网络层(GraphSAGE),用于识别股票间的联动结构。该层基于市场统计驱动构建图网络,通过滚动窗口内的收益率相关系数筛选邻居节点,并采用均值聚合函数结合门控机制与残差连接,动态融合自身特征与邻居信息,以平滑异常波动并缓解过平滑问题。第三层是多任务预测头(MLP),通过三个独立的MLP头分别输出超额收益、Sharpe比率和最大回撤的预测值。 在训练机制方面,模型采用有监督学习,损失函数为横截面Spearman相关性损失(RankIC)与MSE的加权组合,权重分别为0.85和0.15,旨在优先优化横截面排序能力同时约束预测尺度。为防止过拟合,训练过程设置了梯度裁剪上限、学习率调整器(基于验证集损失停滞自动衰减)、早停机制(验证集损失连续多步未改善则停止)以及滚动训练窗口(每年重新训练,使用最近三年数据)。此外,模型通过验证集RankIC保存最优模型,确保预测信号的质量。
参考报告REPORT

银河金工组合优化系列报告:时序截面三层深度学习模型预测收益风险信号.pdf

本报告构建了一种基于深度学习的指数增强策略框架,旨在解决传统静态因子在风格切换时失效的问题。框架将指数增强问题拆分为信号预测与组合优化两大环节。在信号预测端,报告构建了包含K线形态、动量趋势、风险波动及量价资金等多维特征的体系,并对不同特征组采用差异化预处理(G1组保留原始方向,G2/G3组进行Z-score标准化)。预测模型采用TimeEncoder-GraphSAGE-MLP三重特征提取架构:TimeEncoder通过Transformer捕捉时序长距离依赖;GraphSAGE通过市场统计驱动的图网络聚合邻居节点信息,识别截面联动;MLP输出超额收益、Sharpe比率和最大回撤三个多任务预...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至