2025年深度学习揭秘系列专题报告:AI能否终结人工基本面与高频因子挖掘

  • 来源:信达证券
  • 发布时间:2025/08/20
  • 浏览次数:366
  • 举报
相关深度报告REPORTS

深度学习揭秘系列专题报告:AI能否终结人工基本面与高频因子挖掘.pdf

深度学习揭秘系列专题报告:AI能否终结人工基本面与高频因子挖掘。本报告为《深度学习揭秘》系列的第五篇。在前期报告《深度学习揭秘系列之三:用DeepSeek优化价量因子》的基础上,本报告旨在系统性地探究AI在基本面与高频两大核心领域的因子挖掘潜力,并评估其在多大程度上能够实现对传统人工研究范式的自动化乃至超越。面对日益复杂的市场环境与海量的另类数据,本研究将探索的边界从前序报告中的日频价量数据,进一步拓展至蕴含长期价值的财务数据与包含精细交易行为的分钟级行情数据。为实现这一目标,我们设计并实施了两套独立的自动化因子生成与验证框架。在基本面因子的探索中,我们为AI构建了一个包含标准化财务数据字段与...

一、AI 基本面因子挖掘:构建自动化研究框架

1.1、实验设计:基础数据与处理算子

为实现人工智能(AI)模型在选股因子挖掘领域的自动化应用,首要步骤是构建一个结构化且逻辑严谨的实 验环境。该环境由两个核心部分构成:标准化的基础数据集与一系列预定义的因子处理算子。本节将详细阐述这 些基础设定,它们是整个 AI 基本面因子生成流程的基石。 本研究的基础数据层涵盖了财务数据与行情数据两大类别。在财务数据方面,我们从上市公司的利润表、资 产负债表与现金流量表中,筛选出字段覆盖率高于 75%的核心财务项目,以确保因子的有效性和覆盖广度。此 外,为将公司的基本面状况与市场估值相联系,我们引入了日度频率的总市值(mv)与滚动十二个月(TTM)的 分红总额(dividend_ttm)数据。这些经过筛选和整理的数据共同构成了可供 AI 调用的原始数据池。

在原始数据池的基础上,我们为 AI 提供了一套标准化的处理算子库。这些算子封装了量化研究中常用的数 据处理逻辑,例如,ttm 算子可将累计财务数据转换为滚动四个季度的口径,而 yoy 算子则用于计算同比增长率。 通过提供这些预定义函数,AI 能够直接调用高级运算,从而专注于探索数据间的深层财务逻辑,而非基础的数 据处理与计算。

根据本系列前期报告《深度学习揭秘系列之三:用 DeepSeek 优化价量因子》的研究结论,为 AI 提供有效的 因子范例(即先验知识),能够显著提升其生成新因子的效率与质量。因此,本研究延续此方法,将一批经典的 基本面因子及其历史回测表现作为“样例”输入给 AI 模型作为参考。 为确保所有因子(无论是作为样例的因子还是 AI 新生成的因子)均在统一、可比的基准下进行评估,我们 设定了如下标准化的回测框架: 回测区间:2013 年 12 月 31 日至 2025 年 6 月 30 日。 样本空间:剔除上市不满 365 个自然日的新股,剔除 ST 股。 中性化处理:对因子进行市值行业中性化。 测试方式:周频调仓,以下周第一个交易日的 VWAP 价格成交,计算 VWAP 收益率的 RankIC 均值与 ICIR。 方向调整:根据 RankIC 均值的正负,对因子方向进行调整,使得 RankIC 为正,便于比较。 通过上述数据与算子体系,AI 能够在标准化、结构化的环境下生成新的基本面因子。这为后续的因子生成 流程奠定了坚实基础。在下一小节,我们将详细介绍 AI 生成基本面因子的操作流程,并结合具体案例分析其有 效性。

1.2、人机交互框架:AI 因子生成流程详解

为将前述的基础数据与算子转化为有效的选股因子,我们设计了一套人机协同的自动化工作流。此流程旨在 系统性地引导 AI 模型进行因子挖掘与创新,其核心是基于精心设计的提示工程(Prompt Engineering)构建的迭 代循环机制。

整个因子生成流程是一个结构化的闭环系统,主要包含以下几个关键步骤: 1) 初始化: 研究员首先定义实验的元规则,包括设定 AI 的角色、提供可用的财务数据与处理算子列表,并输 入一组经过验证的“样例因子”及其历史表现作为 AI 的初始参考知识库。 2) AI 生成: 在接收到包含上述所有信息的指令后,AI 模型开始进行创造性工作,生成一个全新的因子,并以 标准化的 JSON 格式输出其名称、逻辑释义及表达式。 3) 验证与评估: 研究员获取 AI 生成的因子表达式,并利用 1.1 节中定义的标准化回测框架,对新因子的历史 选股效果(如 RankIC、ICIR、超额收益等)进行量化评估。 4) 反馈与迭代:经过评估后,添加至“已生成成功因子列表”中。该列表会作为动态更新的知识库,在下一轮交 互中反馈给 AI,并明确要求其生成与所有已知样例及已成功因子均不重复的新因子。 通过这一“初始化 → 生成 → 评估 → 反馈”的迭代循环,AI 的学习过程被有效引导。它不仅能从最初的样例中学习,还能从自身每一轮的成功创造中汲取经验,从而持续地向更深、更广的因子空间进行探索。

该流程的具体实现,依赖于系统提示(System Prompt)与用户提示(User Prompt)的协同作用。 系统提示为 AI 设定了恒定的角色、知识边界与行为准则,是整个流程的稳定基石。其设计的核心思想在于: 角色设定:“假如你是一位资深的量化选股因子专家”,这一指令旨在激活模型在特定专业领域的知识储备与 推理能力。 知识边界定义:通过明确提供可用的数据字段(available_data)和算子库(process_code_prompt),我们为 AI 圈定了其可以操作的“工具箱”,确保了生成表达式的可执行性,并防止了模型凭空捏造不存在的数据或函数。 提供范例:样例因子(sample_factor)及其评价指标的展示,为 AI 提供了具体的“成功案例”,使其直观地理 解何为有效的因子,并学习其结构与逻辑表达方式。 硬性规则约束: 诸如“因子名称与表达式不能相同”、“进行正确的去量纲操作”等规则,旨在保证生成因子 的新颖性、可比性和逻辑严谨性。特别是要求 AI“从逻辑出发进行挖掘,不需要计算因子的 RankIC”,这实 现了人机分工,让 AI 专注逻辑创新,将计算验证交由外部系统,提高了整体效率。

与静态的系统提示不同,用户提示是驱动流程迭代的关键。它在每一轮交互中动态变化,其核心作用是提供 即时反馈,构建 AI 的“记忆”。 传递新知:将上一轮 AI 生成并被验证有效的因子及其完整的绩效指标反馈给 AI。这相当于一个动态更新的 “经验库”,让 AI 知道“已经做过什么”以及“做得怎么样”。 驱动创新:在反馈了最新成果后,给出“继续寻找...”的指令。结合系统提示中“不能相同”的规则,AI 被激励 去探索与所有已知因子(包括原始样例和自身已生成的)逻辑和表达均不相同的全新方向,避免了在已有成 果附近的重复探索。

综上,这一人机协同的闭环框架将 AI 的计算创造力与人类研究员的专业验证能力有机结合,构建了一个可 扩展、高效率的因子发现引擎,为后续大规模、系统性的因子生成实验奠定了坚实的方法论基础。

1.3、AI 价值因子挖掘:经典框架的有效拓展与创新

为启动 AI 的因子挖掘流程,我们首先需要为其提供一套高质量的“先验知识”。在价值投资领域,我们选取 了市场上广泛认可的经典价值因子,如市盈率倒数(EP)、市净率倒数(BP)、市销率倒数(SP)、市现率倒数(CFP) 以及股息率(DP)等,作为 AI 学习和模仿的基准。这些“样例因子”及其历史回测表现构成了 AI 进行价值因子 探索的初始知识库,旨在引导其理解价值投资的核心逻辑——寻找被市场低估的优质资产。

接收到初始指令和样例后,AI 开始自主探索。在我们的实验中,模型成功生成了一个包含 20 个全新因子的 多样化组合。这些由 AI 创造的因子不仅局限于对样例的简单模仿,而是展现出对财务数据更深层次的理解和创 造性的组合。它们广泛地从股权自由现金流(FCFEP)、企业自由现金流(FCFFP)、息税折旧摊销前利润(EBITDA)、 留存收益(Retained Earnings)等多个维度,对企业的内在价值进行了更为精细和立体的刻画。

从整体回测表现来看,AI 生成的价值因子组合展现出不错的选股能力。综合统计显示,这 20 个 AI 因子的 RankIC 均值稳定在 3%以上,ICIR 均值超过 0.35,表明其预测能力具备显著的有效性与持续性。同时,多头组合 的年化超额收益波动比均值达到 0.71,而多空对冲组合的收益波动比均值为 1.56,印证了这些因子在区分未来优 胜股与劣势股方面的能力。

深入分析 AI 的创造过程,我们发现其贡献主要体现在两大方面:因子创新与因子增强。一方面,AI 能够生成与所有样例因子相关性均较低的新颖因子,开拓了传统价值投资的边界;另一方面,AI 也能在经典因子的逻 辑基础上进行优化,生成相关性虽高但选股效果更为出色的增强型因子。下方的相关性矩阵清晰地揭示了 AI 生 成因子与样例因子之间的关系,为我们进一步筛选和理解这些新因子提供了实证依据。

REP_LF 因子(留存收益/总市值)是 AI 因子创新的典型代表。该因子与所有样例因子的相关性均未超过 70%, 展现了其独特的逻辑视角。留存收益是公司自创立以来所有净利润的累积,扣除已派发股利后的部分,它直接反 映了公司内源性资本的积累和再投资能力。REP_LF 因子将这一历史盈利的“存量”与公司当前的“市值”进行比较, 旨在衡量市场对公司长期价值创造能力的定价是否充分。高比率通常意味着公司历史盈利丰厚,安全边际较高, 但当前可能被市场低估。 从回测结果来看,REP_LF 因子的表现十分稳健。经市值与行业中性化后,该因子在整个回测区间的周频 RankIC 均值达到 3.97%,ICIR 为 0.43。其多头组合实现了 5.38%的年化超额收益,而多空对冲组合的年化超额 收益更是达到了 11.48%,对应的收益波动比为 1.22,展示了其在全市场范围内的优异选股能力。

除了创造全新因子,AI 同样擅长对现有因子逻辑进行深度优化,CGP_TTM 因子便是例证。该因子的构建方 式为“(销售商品、提供劳务收到的现金 TTM - 购买商品、接受劳务支付的现金 TTM)/ 总市值”,本质上是衡 量公司核心购销活动产生的“现金毛利”。 相较于样例因子中基于权责发生制的经营活动现金流(OCFP_TTM),CGP_TTM 剔除了更多非核心经营活 动现金流的干扰,也规避了应收、应付、存货等会计科目的影响,从而更纯粹、更真实地反映了企业主营业务的 “造血”能力。在因子相关性上,它与 OCFP_TTM 的相关性达到 70.5%,但在大部分回测指标上实现了超越,可 视作对 OCFP_TTM 的一次成功“增强”。 经过标准化的回测,CGP_TTM 因子全区间的 RankIC 均值为 3.44%,ICIR 为 0.39。其多头组合年化超额收 益为 6.50%,而多空组合表现尤为亮眼,年化超额收益为 17.97%,收益波动比为 2.51,充分说明该因子在识别估 值合理的公司方面具有强大的判别力。

1.4、AI 质量因子挖掘:从盈利能力到运营效率的多维度探索

质量因子旨在识别那些具有稳健的盈利能力、健康的财务状况和高效的运营管理能力的公司。为引导 AI 在 这一领域进行探索,我们向其提供了涵盖盈利能力(如每股收益 EPS、净资产收益率 ROE)、资产质量(如每股 净资产 BPS)和现金流质量(如每股经营现金流 OCFPS)等维度的经典质量因子作为样例。

基于这些样例,AI 系统性地生成了 60 个新的质量因子。通过分析这些因子的逻辑表达式,我们观察到 AI 的探索覆盖了多个维度,不仅包括对传统盈利指标的深化,还延伸至资本结构、资产周转效率以及现金流转换等 多个层面。

对这批 AI 生成因子的回测结果显示,其中一部分因子具备了有效的选股潜力。具体来看,在 60 个因子中, 有 5 个因子的年化多头超额收益超过了 3.55%,7 个因子的多头组合收益波动比大于 0.7。在多空对冲组合中,有 3 个因子的年化超额收益超过 14.5%,10 个因子的收益波动比大于 1.73。这些数据表明,AI 生成的因子库中包 含了一批值得进一步研究的信号。

在 AI 生成的因子中,我们发现模型能够基于经典盈利能力指标进行逻辑上的延伸。以 GPS_QR(单季度毛 利/最新总股本)和 COPPS_QR((单季度毛利 - 销售费用 - 管理费用)/最新总股本)为例,这两个因子体现了对 盈利能力的不同层次的刻画。 GPS_QR 关注的是企业产品或服务的直接盈利空间,而 COPPS_QR 则在毛利的基础上,进一步扣除了为实 现销售和维持公司运营所必需的费用。理论上,后者旨在更聚焦于核心经营环节的盈利结果,能够过滤掉部分毛 利高但运营效率不佳的公司。从因子相关性数据看,这两个新因子与作为样例的 EPS_QR 因子有较高的关联度。

在选股效果上,COPPS_QR 与 EPS_QR 的 ICIR 及多头超额收益表现相近。值得注意的是,COPPS_QR 在多 空超额收益波动比这一指标上表现出一定优势。这可能表明,相较于 EPS_QR,COPPS_QR 因子在识别潜在表现 较差的股票方面具备更强的区分能力。

除了对传统盈利指标的优化,AI 也展现出构建新型运营效率指标的能力。在生成的因子中,我们注意到模 型不再局限于以股本、股东权益或总资产作为分母进行标准化,而是开始探索使用其他财务项目。 ART_QR 因子(单季度营业总收入 / 平均应收账款),即应收账款周转率,便是一个很好的例子。该因子衡 量企业在一个季度内收回应收账款的效率。较高的周转率通常意味着企业信用政策得当、回款速度快,从而资产 流动性较强、潜在的坏账风险较低。它从资产管理的角度评估了公司的运营质量。

从回测绩效上看,ART_QR 的多空组合表现较为突出,其收益波动比为 1.98。更重要的是,该因子与所有样 例质量因子的相关性都处于较低水平,说明它提供了一个相对独立的选股视角,这对于构建多元化的因子模型具 有积极意义。

1.5、AI 成长因子挖掘:探索盈利增长的多维定义

成长性是驱动股价长期上行的关键因素之一。在传统因子体系中,成长因子通常通过计算企业关键财务指标 的同比增长率来构建。为引导 AI 在这一方向上进行探索,我们提供了以各口令径下的利润和收入单季度同比增 速为代表的一组样例因子。这些基础成长因子代表了市场对企业增长情况的常规度量方式。

在接收了样例因子后,AI 系统生成了超过 20 个新的成长因子。分析这些因子的构造逻辑可以发现,AI 的探 索并不仅限于对样例的模仿,而是展现出对“成长”这一概念多维度的理解。其尝试方向涵盖了从利润定义的扩展 (如 EBITDA、综合收益等),到盈利质量的调整(如考虑费用、折旧、现金流等),再到部分创新性成长概念的 提出。

综合来看,AI 在生成成长因子的过程中体现出几种清晰的思路: 扩展基础指标:模型将同比增长(YOY)的计算逻辑,从样例中的净利润和营业收入,推广到了更广泛的盈 利指标上,如息税折旧摊销前利润(EBITDA_QR_YOY)、毛利润(GROSSPROFIT_QR_YOY)以及综合收益 (CI_QR_YOY)等,旨在从不同角度捕捉企业的增长动态。

构建复合指标: AI 尝试通过组合不同财务细分项来构建更精细的利润指标,并计算其同比增长。例如,通 过在利润中扣除资本性支出( OWNER_EARNINGS_QR_YOY ) 或 加 上 财 务 费 用 (FINANCING_NEUTRAL_PROFIT_QR_YOY),模型试图剥离特定经营或财务决策的影响,以探寻更核心的增 长来源。 探索创新范式: 模型还生成了少数非同比增速定义的成长因子,例如 SGR_LF(可持续增长率)和 CASH_ADJ_OP_QR_YOY(现金流调整后的营业利润增长)。这类因子跳出了传统的同比增长框架,尝试从内生 增长潜力和盈利增长质量等新维度来评估成长性。 从回测效果来看,一个值得关注的现象是,许多经过复杂调整的成长因子(例如,在毛利基础上扣除销售和 管理费用后计算的增速),其各项选股评价指标并未系统性地优于结构更简单的基础成长因子。尽管选股效果未 见显著提升,但 AI 的这些尝试本身也反映出其具备较强的财务逻辑理解与创新组合能力,能够自主探索更为精 细化的盈利增长定义。 这一现象或许表明,在成长性评估方面,更为复杂的因子构造未必总能带来选股效果的 线性提升。市场对增长的认知可能更偏向于核心的、未经深度调整的盈利或收入指标,或者说,增加的复杂度可 能引入了额外的噪声,从而在一定程度上影响了信号的稳定性。这提示我们在因子构建中,需要在逻辑深度与信 号有效性之间进行审慎的权衡。

1.6、基本面因子衍生计算与合成

在前述章节中,AI 的主要任务是基于上市公司的原始财务数据,通过不同算子的组合来挖掘具有新颖经济 逻辑的价值、质量与成长类因子。这一过程可以视作因子挖掘的“第一阶段”,即从 0 到 1 的创造。在此基础上, 我们可以引入“第二阶段”的处理,即对已生成的因子进行二次衍生计算,旨在从时间序列维度强化因子的信息含 量。 为此,我们设计了一系列衍生算子,用于捕捉因子值的动态变化特征,如偏离度(sud、sud2)和相对波动 (svr)等。

我们将这些衍生算子应用于前文 AI 生成的原始因子库。例如,对于价值类因子,我们可应用 sud2 算子,分 析其当前值相对于过去一年均值的偏离程度,以捕捉价值修复或价值陷阱的信号。对于质量和成长因子,应用 sud 或 svr 算子,可以衡量其相对于历史季度的改善趋势或稳定性。

经过衍生计算后,因子库的整体有效性得到了改善。通过对比衍生前后因子池的 RankIC 均值和年化多头超 额收益的分布,可以观察到,经过衍生计算的因子池,其两个核心指标的分布均出现了向右平移的趋势。具体来 说,衍生后因子的 RankIC 均值上限从约 4%提升至接近 5%,而年化多头超额收益的均值也从 2.64%提升至 3.51%, 说明衍生计算这一步骤对提升因子信号质量具有普遍性的积极作用。

最后,为了将这些丰富的因子信息整合成一个强有力的选股信号,我们构建了一个包含全部原始因子和衍生 因子的特征池。基于此,我们采用带 L1 正则化的 Lasso 回归模型进行因子合成。Lasso 模型能够在拟合数据的同 时,将部分无效或冗余因子的系数压缩至零,从而实现特征筛选和降维,有助于提升模型的泛化能力。 具体的合成流程是:我们以过去 5 个自然年的数据作为训练集,滚动训练 Lasso 模型,用于预测接下来一年 的周度收益率(以未来 5 个交易日的 VWAP 均价收益率为目标)。每年年初重新训练模型,以适应变化的市场环 境。

经过 Lasso 模型合成后的单一因子,其选股能力得到了显著增强。回测结果显示,合成因子的全区间周度 RankIC 均值达到了 6.85%,ICIR 为 0.79。在组合表现上,其多头组合的年化超额收益为 12.30%,收益波动比为 2.34;多空对冲组合的年化超额收益达到 46.97%,收益波动比为 4.43。这些结果表明,通过“AI 生成 + 衍生计 算 + 线性合成”这一流程,我们能够构建出效果稳健且强大的基本面选股因子。

二、AI 驱动的高频因子挖掘:从分钟数据到选股信号

2.1、方法论构建:高频因子自动生成的工作流

与基本面因子生成所采用的“变量+算子”组合模式不同,在高频因子挖掘中,我们采用了更为直接和灵活的 方法。考虑到分钟级数据的结构相对固定且计算逻辑复杂多变,我们赋予 AI 直接生成基于 numpy 和 pandas 的 Python 代码的能力。这种方式给予了 AI 更大的创造自由度,使其能够实现更为复杂的时序和截面计算。对于输 入的高频数据,则将其格式固定化,统一为横表 DataFrame,index 为 timestamp 格式,日期为 A 股交易日,时点 为 A 股交易时点,columns 为股票代码,数据均为 1 分钟频率,且将该信息通过 Prompt 的方式告知 AI。 为了有效引导 AI 的探索,降低其任务复杂度,我们借鉴了人类研究员的经验,预先封装了一系列“分域函 数”。这些函数旨在识别特定的市场状态或数据区间,例如,标记出当前分钟的数据在其当日横截面或历史时间 序列中所处的高位、中位或低位区域。

这些预置函数如同高级的“积木块”,将人类的先验知识和领域经验固化下来,使 AI 能够聚焦于如何创造性 地组合这些“状态”和基础数据,而非纠结于底层的实现细节。 在 AI 生成日度频率的高频因子后,为匹配我们周度调仓的回测体系,我们统一将其计算为过去 5 个交易日 的移动平均值。本次高频因子的回测区间为 2020 年 1 月 1 日至 2025 年 6 月 30 日,其余回测参数(如样本空间、 中性化处理等)均与前文基本面因子部分保持一致。 与基本面因子挖掘类似,我们为 AI 提供了一批已被证实较为有效的样例高频因子作为初始学习材料,以帮 助其理解有效高频信号的特征。

高频因子生成流程相较于基本面因子的生成流程,添加了相关性筛选机制,用于筛选相对于样例高频因子和 AI 已生成的高频因子,相关性较低(小于 0.75),且 ICIR 表现更好的因子,使得最后得到的 AI 高频因子集,两 两之间的秩相关性在 0.75 以下。

该流程的顺利运转,高度依赖于精心设计的提示工程(Prompt Engineering)。我们通过系统提示(System Prompt)和用户提示(User Prompt)的组合,来精确地引导和控制 AI 的行为。

系统提示扮演着为 AI 设定“世界观”和“方法论”的角色,它在整个对话过程中保持不变,是 AI 行为的根本准 则。我们的设计主要遵循以下原则:  角色扮演:开宗明义地要求 AI 扮演“资深的量化选股因子专家”,以激发其在该领域内的知识和推理能力。 明确边界:清晰地列出可用的数据字段和已封装的函数库。这既是赋能,也是约束,确保 AI 生成的代码是 可执行且符合我们预设框架的。 提供范例:展示完整的样例因子,包括代码、逻辑和关键回测指标。这是最直接的“教学”,让 AI 直观地理 解“好因子”的样子。 设定规则与约束:提出一系列硬性要求,如“因子逻辑不能重复”、“进行正确的去量纲操作”、“返回纯 JSON 格式”等。这些规则旨在规范 AI 的输出,提高自动化处理的效率,并引导其生成更具创新性和实用性的因 子。特别地,我们强调“从逻辑出发进行挖掘,不需要计算指标”,这是为了让 AI 专注于创造性的因子构建, 而将计算和验证环节交由我们的回测系统完成,实现人机分工。 内存优化:因为高频数据占用内存空间较大,且因子计算过程中可能产生较多的临时计算变量,因此我们在 Prompt 中要求 AI 在编写高频因子代码时,实时删除后续不再使用的变量,且将浮点数类型从 float64 转为 float32 以进一步节省内存空间。

与静态的系统提示不同,用户提示是驱动流程向前迭代的关键,其核心是“动态反馈”。 传递新知:每一轮的用户提示都会包含一个最新的“AI 已生成的因子”列表,其中包含了因子从名称到所有 回测绩效的完整信息。这相当于一个动态更新的“经验库”或“记忆”,让 AI 知道自己“已经做过什么”以及“做 得怎么样”。 驱动创新:在提供了最新的反馈后,指令非常简洁——“继续寻找选股能力出色的高频因子”。结合系统提 示中“逻辑不能相同”的要求,AI 被激励去探索与已知所有因子(包括原始样例和自己已生成的)都不同的 新方向。

综上,通过这一套结构化、自动化的工作流和精心设计的 Prompt,我们将大语言模型从一个通用的对话工 具,成功地改造为一个专注、高效的高频因子挖掘引擎,为后续的系统性实验奠定了坚实的方法论基础。

2.2、AI 高频因子库:整体表现与分类解析

通过第 2.1 节所述的自动化生成流程,我们获得了一共包含 70 个高频因子的多样化因子库。为了便于分析 和理解,我们根据这些 AI 生成信号的经济内涵,将其归纳为四大类别:波动、动量反转、量价相关与流动性。 从整体的回测结果来看,AI 在高频领域展现出较强的挖掘潜力。尤其是在波动类与量价相关类因子上,生 成了多个选股效果较为突出的新因子。下表详细列出了部分 AI 生成因子的核心评价指标,直观地展示了 AI 的 挖掘成果,并为后续的深入案例分析提供了数据支持。

2.3、案例剖析之一:投机波动因子(speculative_frenzy_instability)

在 AI 生成的众多波动类因子中,speculative_frenzy_instability 因子的回测表现值得我们进行深入剖析。该因 子旨在识别并量化个股在陷入一种我们定义为“投机狂热”(Speculative Frenzy)的状态时,其自身风险所呈现出 的不稳定性。 该因子的构建逻辑颇为精巧。首先,它定义了触发“投机狂热”的分钟级时点,需同时满足三个历史性异常 条件: 1) 成交量异常:当前分钟的成交量显著高于其历史滚动周期内的同期均值。 2) 振幅异常:当前分钟的振幅((最高价-最低价)/均价)显著高于历史同期水平。 3) 价格偏离异常:当前分钟的收盘价与均价的偏离度显著高于历史同期水平。 然后,因子计算的核心步骤是:仅在上述极端的“三重压力”时段内,去计算个股特质性波动(以特质收益 率的绝对值作为代理)的标准差。因此,一个高的因子值,意味着该股票在市场交投最狂热、价格波动最剧烈时, 其独立于市场的内在风险本身也变得极不稳定。这种“不稳定中的不稳定”特性,是识别具有高度投机属性或所 谓“彩票”属性股票的一个有效信号。

分析上述代码实现细节,可以看到 AI 较好地完成了整个因子的计算流程,且变量命名规范,并按照 Prompt 中的要求删除了后续不再被使用的变量与浮点数类型地转换。另外还可以看到 AI 在代码实现过程中的一些细节 处理较好,例如在“amp_norm = (high - low) / vwap_safe”得到 amp_norm 变量后,使用“amp_norm.replace([np.inf, -np.inf], np.nan, inplace=True)”的方式将正负无穷转换为 nan,从而避免分母 vwap_safe 可能为 0 导致的后续计算 错误。 在回测中,该因子的多头组合单边年化换手率为 42.02 倍,截至回测期末,共有 4368 只股票具有有效的因 子值,表明其具有较好的覆盖度。 从回测结果看,该因子展现出持续且较强的预测能力,全区间均值为-9.03%,ICIR 为-0.98。这表明,因子值 越高的股票,其未来一周的表现存在相对更差的倾向。

在进行组合绩效分析时,我们首先对因子进行方向性调整(即取负值),使得因子值越高的股票预期收益越 高。调整方向后,因子多头组合表现出稳健的超额收益,其全区间年化超额收益为 9.71%,对应的收益波动比为 1.87。

而在多空对冲组合中,该因子的选股能力体现得更为充分。组合的年化收益为 61.95%,收益波动比为 4.57, 显示出该因子在区分两端股票方面具备较强的效力。

2.4、案例剖析之二:极端加速度方差占比因子(extreme_gamma_burst_ratio)

extreme_gamma_burst_ratio 因子是 AI 在探索价格二阶导数信息时生成的另一个代表性信号。该因子旨在通 过分析价格“加速度”(Gamma)的分布特征,来捕捉股价变动的爆发性与不稳定性。 其核心构造逻辑可分解为以下几个步骤: 1) 计算价格加速度(Gamma):首先,因子计算分钟级收益率的一阶差分(ret.diff()),得到价格加速度序列。 这一指标反映了价格动量的变化速度。 2) 识别“加速爆发”时点:接着,因子利用预置的历史分域函数,识别出每日中价格加速度的绝对值显著高于 其历史滚动均值的时点。我们将这些时点定义为“加速爆发”事件。3) 计算方差占比:最后,因子计算在这些“加速爆发”时点内,价格加速度的方差,并将其除以当日全体价格 加速度的总方差。 该因子的经济学含义在于,一个高的比率值表示该股票当日的价格加速行为主要由少数几个极端剧烈的“爆 发”事件所贡献,而非平稳、持续的动量变化。这种模式通常与高度不确定性和投机性交易相关联,因此该因子 同样被预期为是一个负向选股指标。

该因子的多头组合单边年化换手率为 35.43 倍。从回测绩效来看,extreme_gamma_burst_ratio 因子同样呈现 出稳定的负向预测能力。其全区间 RankIC 均值为-4.82%,ICIR 为-0.83,证实了其作为负向指标的有效性。

在组合回测中,经过方向调整后,该因子的多头组合实现了 7.92%的年化超额收益,收益波动比为 1.44。

在多空对冲组合中,其表现则更为突出。组合的年化超额收益为 46.49%,收益波动比为 6.18,显示出该因 子在多空两端均有较强的区分能力,能够有效识别出未来潜在表现差异显著的股票对。

2.5、案例剖析之三:动量与加速度相关性因子(momentum_acceleration_corr)

与前述两个侧重于“不稳定”和“爆发性”的负向因子不同,momentum_acceleration_corr 因子代表了 AI 在 探索“趋势稳定性”方面的尝试。该因子旨在通过衡量动量与其自身变化速度之间的一致性,来识别股价运动的内 在强度与持续性。 该因子的构建逻辑如下: 1) 定义动量与加速度:因子首先定义了两个关键变量。其一为“动量”,以滞后一期的分钟收益率(ret.shift(1)) 作为代理;其二为“加速度”,以分钟收益率的一阶差分(ret.diff(1))作为代理,它反映了动量的变化情 况。 2) 计算相关性:随后,因子计算在日内交易时段中,上述“动量”序列与“加速度”序列的相关系数。 一个高的正相关系数,其经济学含义是:当股票处于正向动量(前期上涨)时,其收益率倾向于进一步加速 (涨得更快);而当其处于负向动量(前期下跌)时,收益率则倾向于减速(跌得更慢或开始反弹)。这种动量与 加速度的同向变化,描绘了一种稳定且自我强化的趋势特征。因此,我们预期该因子是一个正向选股指标,即高 相关性预示着未来股价有更大概率延续当前趋势。

动量加速度相关因子多头组合单边年化换手率为 16.44 倍,显著低于投机波动因子与极端加速度方差占比因 子。momentum_acceleration_corr 因子在回测区间内表现为一个有效的正向指标,其全区间 RankIC 均值为 3.61%, ICIR 为 0.39。

在组合绩效层面,其多头组合(买入因子值最高分组)的年化超额收益为 3.40%,收益波动比为 0.43。

而在多空对冲组合中,其区分能力得到了更好的体现。组合的年化超额收益为 21.34%,收益波动比为 2.35, 表明该因子能够有效地识别出具备稳定趋势特征的股票,并将其与趋势不明确或不稳定的股票区分开来。

2.6、案例剖析之四:收益与价格偏离的交互效应因子

dual_stress_rolling_idio_ret_dev_product 因子是 AI 在“量价相关”类别中生成的、一个逻辑较为复杂的交互项 因子。它并非直接衡量单一的量价关系,而是通过构建收益与价格偏离的乘积,来捕捉股价在特定压力环境下的 “脱锚”程度。 该因子的核心构造逻辑可以分解如下: 1) 计算核心变量:因子需要两个特质化(idiosyncratic)的分钟级变量:特质收益率(Idio Ret):股票的分钟收益率扣除市场整体收益后的部分,代表其自身的涨跌。 特质价格偏离度(Idio Price Dev):股票收盘价相对于其分钟均价(VWAP)的偏离程度,同样经过 市场中性化处理,代表其价格在分钟内的相对位置。 2) 构建交互项:因子计算上述两个特质变量的乘积(Product)。一个大的正向乘积值,通常发生在两种情 况:(a) 股价在分钟内实现大幅特质上涨,且收盘价远高于该分钟的均价;或 (b) 股价在分钟内经历大 幅特质下跌,且收盘价远低于该分钟的均价。 3) 施加压力条件:因子的计算被限制在“双重压力”(Dual Stress)的条件下进行,这些条件可能是在历史 滚动窗口(Rolling)中识别出的高波动或高成交量时段。这相当于一个过滤器,使得因子只在市场最不 稳定、信息含量最丰富的时刻发挥作用。 该因子的经济学直觉基于“均值回归”理论。一个大的正向因子值,无论是由极端上涨还是极端下跌驱动, 都描绘了一种股价“过度反应”或“价格脱锚”的状态。这类由短期情绪或流动性冲击导致的极端走势,在未来 有较大概率出现修正。因此,我们预期该因子是一个负向选股指标。

回测结果有力地支持了这一判断。dual_stress_rolling_idio_ret_dev_product 因子表现出很强的负向预测性,其 全区间 RankIC 均值为-8.23%,ICIR 为-0.89。

在组合绩效层面,经过方向调整后,该因子的多头组合实现了 11.63%的年化超额收益,收益波动比为 2.14。

在多空对冲组合中,其区分能力也较为显著。组合的年化超额收益为 51.12%,收益波动比达到 4.39,说明 该因子能够有效识别出未来潜在表现差异较大的股票,尤其在捕捉短期过度反应后的反转机会方面具备潜力。

2.7、AI 高频因子的增量提升

在前面的章节中,我们通过案例剖析验证了部分由 AI 生成的单个高频因子具备选股能力。然而,一个更具 实际意义的问题是:这些 AI 因子能否为现有的因子库带来真正的增量价值?为此,本节将通过组合测试,来评 估将 AI 因子与传统的样例因子相结合后,整体策略的绩效是否能得到提升。 为了进行公平的比较,我们构建了两个合成因子: 1) 基准组合:由本报告最初提供给 AI 的“样例高频因子”等权重合成。 2) 增强组合:由“样例高频因子”与“AI 生成的高频因子”共同等权重合成。 具体的合成方法为,我们将每个因子中性化后,再进行缩尾与标准化处理,然后将属于各自组合的因子值进 行简单等权平均。通过对比这两个合成因子的回测表现,我们可以清晰地判断 AI 因子的加入是否带来了积极的 增量贡献。 从回测结果来看,在加入 AI 生成的新因子后,组合因子的整体预测能力得到了有效提升。合成因子的周频 RankIC 均值从 8.48%提升至 9.43%,ICIR 也从 0.76 提升至 0.88,且每年均有稳定的正向提升。

在多头组合层面,这种增量贡献同样有所体现。组合的年化多头超额收益从 5.58 上升至 11.19%,相应的收 益波动比也有接近翻倍的改善。

而在更能体现纯粹 Alpha 能力的多空组合中,加入 AI 因子后,多空组合的年化超额收益从 50.21%提升至 66.81%,年化收益波动比也从 3.37 提升至 4.75。

综上所述,这些结果共同表明,通过本研究框架生成的 AI 高频因子,不仅自身具备选股能力,更重要的是, 它们为现有的因子库提供了有效的补充,带来了可量化的增量价值。这证明了 AI 在挖掘新颖且有效的 Alpha 来 源方面具备的潜力。

三、研究结论与展望

本报告系统性地探索了人工智能在自动化因子挖掘领域的应用潜力,通过分别针对低频基本面数据和高频分 钟数据的实证研究,我们得出以下核心结论:

1. AI 能够有效实现自动化基本面因子挖掘与创新。 我们构建的“标准化数据 + 预定义算子”框架,成功引导 AI 在价值、质量与成长三大经典投资维度上进行 了深度探索。研究证明,AI 不仅能够复现并优化传统的财务比例因子,更能基于对财务报表内在逻辑的理解, 创造出如“留存收益市值比(REP_LF)”这类具备新颖经济内涵的创新因子。我们进一步展示了“AI 生成 → 衍生 计算 → Lasso 合成”的多阶段优化流程,最终得到的复合因子在各项回测指标上均表现出强大的选股能力(周频 RankIC 均值 6.85%,多空组合收益波动比 4.43),充分验证了该自动化研究框架的系统性有效性。

2. AI 在高频领域展现出挖掘独特 Alpha 来源的强大潜力。 针对分钟级行情数据,我们采用了更灵活的“代码生成 + 预置分域函数”模式,赋予 AI 更大的创造空间。 该方法成功挖掘出一批与经典因子相关性低且结构复杂的新信号,例如旨在捕捉价格极端波动的“投机波动因子”, 其周频 RankIC 均值高达 9.03%。更为关键的发现是,这些 AI 因子提供了显著的增量价值。将 AI 生成的新因子 库与一组经典的样例高频因子融合后,组合的整体选股能力得到显著提升,证明 AI 能够有效捕捉到传统因子库 未能覆盖的、独特的 Alpha 来源。

3. 人机协同将成为量化研究的新范式。 本报告的研究表明,AI 能够作为一种强大的赋能工具,将研究人员从繁重、重复的因子挖掘工作中解放出 来。AI 在广度搜索和复杂计算组合方面的优势,可以和人类研究员在经济逻辑洞察、异常检验和策略思想构建 方面的优势形成互补。未来的量化研究,其核心竞争力可能不仅在于拥有更先进的算法模型,更在于如何提出更 深刻的投资问题、设计更高效的人机协同框架,从而在海量信息中持续地发掘具备可解释性、可重复性的投资价 值。 综上所述,人工智能正为量化投资领域的因子发现带来深刻变革。无论是基于深度价值的长期基本面分析, 还是捕捉瞬时交易行为的高频策略,AI 均已展现出成为新一代 Alpha 引擎的巨大潜力。

编辑:火腿肠
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至