GFlowNet相比传统强化学习与遗传规划在因子挖掘中的具体优势体现在哪些方面?

在量化因子挖掘领域,传统的强化学习(RL)和遗传规划(GP)方法存在哪些局限性?GFlowNet作为一种新型生成模型,其核心原理是什么?请详细阐述GFlowNet在探索机制、因子多样性、搜索效率及历史信息利用等方面,相较于RL和GP的具体优势,并结合模型结构说明其如何实现低相关性因子的挖掘。

最佳答案 匿名用户编辑于2026/07/10 15:20

GFlowNet由深度学习先驱Yoshua Bengio团队提出,其核心思想是将对象的生成过程建模为图网络中的“水流”过程。与强化学习旨在寻找单一最优解不同,GFlowNet旨在挖掘“一群优秀的多元化公式”,这极其契合多因子选股模型对低相关性、高多样性Alpha池子的需求。

相较于强化学习,GFlowNet在探索机制上具有显著优势。强化学习容易陷入模式崩溃,一旦找到几个极高收益的因子,策略就会收敛,反复生成相似公式,导致因子高度同质化、特征重叠严重。而GFlowNet天生具备极强的多样性保证,能够广泛探索整个公式空间,挖掘出的因子结构多样、相关性低,非常适合直接构建多因子组合。在batch内相关性水平上,强化学习的新生成因子对之间相关性中位数急速上升,而GFlowNet则保持稳定。

相较于遗传规划,GFlowNet在底层驱动力和搜索效率上更具优势。遗传规划基于随机变异和交叉,缺乏对公式空间规律的理解,往往在局部试错,效率极低且易陷入局部最优。GFlowNet则利用神经网络的泛化能力,能够“学习”到哪些公式子结构更容易产生高收益。它通过观察走过的轨迹构建全局概率图,具有明确的方向感和泛化性。此外,神经网络权重记录了所有见过的结构化信息,能够更聪明地在有希望的子空间进行探索,而遗传规划在优秀公式被淘汰后需长时间才能再次演化。

在模型结构上,GFlowNet的训练目标是使网络中的流量分布满足守恒定律,即中间状态的流入流量等于流出流量,终止状态的流入流量等于奖励。实际训练中采用Trajectory Balance目标,通过前向策略采样轨迹,计算奖励并更新网络。状态表示结合Transformer编码动作历史序列与手工特征,奖励函数综合IC、多头IR及Barra相关性惩罚,从而确保挖掘出的因子既具备预测能力,又保持低相关性。

参考报告REPORT

Alpha掘金系列之二十四:基于GFlowNet和AlphaEval的分钟频因子挖掘筛选框架.pdf

本文提出了一种基于GFlowNet和AlphaEval的分钟频因子挖掘筛选框架。首先回顾了GFlowNet原理,指出其通过建模图网络中的“水流”过程,旨在挖掘多元化、低相关性的Alpha因子池,克服了强化学习的模式崩溃和遗传规划的搜索效率低下问题。在日频数据挖掘中,基于原始K线、衍生特征及分钟聚合特征挖掘出大量因子,IC均值中位数较高,且因子相关性低、复杂度可控。针对分钟频数据内存瓶颈,引入MemMap机制和分块并行计算框架,实现了高效计算,并验证了分钟频信号对日频信号的增量价值。在因子筛选阶段,采用AlphaEval框架从多样性、预测能力、秩稳定性等维度进行筛选,通过DPP方法筛选出低冗余因...

我来回答
分享至