另类数据量化投资图景:从数据丰度到范式革命

  • 来源:兴业证券
  • 发布时间:2026/07/24
  • 浏览次数:23
  • 举报
相关深度报告REPORTS

另类数据的量化投资图景:从数据丰度到范式革命——海外文献推荐系列之一百九十二.pdf

研究背景与目的传统量化投资依赖财报及宏观统计数据,但随着机构策略趋同,标准化数据的Alpha红利显著衰减。另类数据凭借差异化的信息维度和更快的更新频率,正从边缘探索走向投研核心。本文通过梳理近年海外代表性文献,厘清另类数据在因子挖掘中的应用逻辑,为A股量化实践提供参考。核心内容与框架报告首先提出"数据丰度"宏观概念,指出计算能力跃迁、机器学习渗透与非传统数据源扩张共同推动量化投资进入新阶段。Dugast和Foucault(2025)的理论研究论证了数据丰度在扩大信息搜索池、拉大人业绩分化、提升价格信息含量三方面的独立价值。报告系统梳理了另类数据九大核心类别及其代表性研究:地理空间类(卫星停车场...

数据丰度时代与另类数据的战略崛起

传统量化投资体系长期依赖财报、行情与宏观统计等标准化数据源,但随着机构策略趋同,这类数据的信息红利正被快速稀释。近十年来,计算能力跃迁、机器学习渗透与非传统数据源扩张,共同推动量化投资进入"数据丰度"时代。海量多源异构的另类数据以规模化方式进入投研视野,与之配套的数据处理工具同步迭代。Green and Zhang (2024) 指出,另类数据正在实质性地改变投资策略,推动资产管理范式转移,从少数对冲基金的"实验性武器"演变为全球资管机构的标准配置。

Dugast 和 Foucault(2025)发表于《Journal of Finance》的理论研究为数据丰度的价值提供了严谨框架。该文区分了数据处理成本下降与数据丰度增加两种机制,论证后者具有独立且深远的价值:其一,扩大量化基金可供搜索的信息池规模,提高发现高精度预测信号的概率,形成"隐藏金矿效应";其二,拉大管理人之间的业绩分化,数据获取渠道、清洗能力与算法模型差异在丰富信息环境中被显著放大;其三,持续提升资产价格的信息含量,更多高质量信号被挖掘并用于交易,市场价格发现功能增强。

九大核心类别另类数据的实证价值

经过十余年积累,学术界与业界针对另类数据的实证研究已覆盖九大核心类别。地理空间类数据中,Katona 等(2024)利用卫星停车场填充率数据验证了对零售企业季度业绩的增量预测价值,其负增长对业绩恶化的预测强度显著大于正增长对业绩改善的预测;Xue 等(2025)基于热红外辐射开发企业经营活动实时度量方法,发现热红外指标较高的企业在下一季度获得更高股票收益。舆情情绪类方面,Cookson 等(2024)系统考察了 Twitter、StockTwits 和 Seeking Alpha 三大平台信号,发现共同情绪成分正向预测次日收益,而共同关注度成分负向预测次日收益,反映情绪与关注度的信息结构差异。

消费行为类研究中,Gupta 等(2022)利用信用卡和借记卡交易数据构造实时销售信号,发现该信号可持续预测未来三个季度的盈余惊喜,基于销售变化的多空策略产生显著年化净收益。供应链贸易类方面,Lieberman 等(2025)利用 B2B 支付及时性数据,提出信息缓慢扩散与垂直议价能力两大机制,付款突然延迟预示现金流恶化,而持续适度延迟付款则反映供应链议价能力。人力资本类研究中,Green 等(2017)基于 Glassdoor 员工评价数据,发现评价改善的企业显著跑赢评价恶化企业,预测能力主要来源于职业发展机会和高级管理层评价变化。

ESG 与责任投资类方面,Avramov 等(2022)从评级分歧视角研究 ESG 信息摩擦,发现 ESG 不确定性较低时评级与未来表现呈显著负相关,不确定性较高时该关系被削弱。物联网与传感器类中,Da 等(2017)利用工业用电增长率预测长达一年的股票未来回报,其表现优于股息率、盈利收益率等传统金融预测变量。网页爬取类研究中,Cavallo 等(2023)基于每日在线价格数据构造高频通胀指数,构建动态 TIPS/名义国债轮动策略。专家网络与调研类方面,Han 等(2018)利用中国 A 股分析师实地调研数据,证实进行实地调研的分析师盈利预测准确度显著高于未调研者。

生成式 AI 驱动的范式革命

生成式人工智能的崛起从根本上突破了非结构化数据的处理瓶颈,重构了另类数据的价值实现路径。Sheng 等(2025)发表于《Review of Financial Studies》的研究将 ChatGPT 推出视为自然实验,发现积极采用生成式 AI 的对冲基金年化超额回报率比未使用者高出显著幅度,且利用服务中断事件验证该业绩提升确实来自 AI 应用。

生成式 AI 对另类数据的赋能可按数据类型分为三个层次。第一层次为文本类数据的语义级理解,大语言模型通过上下文感知建模,能够准确识别复杂表达中的多重信号,将文本类因子信噪比提升一个数量级,实现从原始文本中端到端提取预测信号。第二层次为非文本数据的结构化解析,多模态能力使得从卫星图像直接生成量化描述成为可能,序列建模能力在处理传感器时序信号方面具有显著优势。第三层次为多源异构数据的融合分析,AI 可同时分析社交媒体情绪、卫星图像、信用卡交易趋势与员工评价,生成综合性基本面前瞻评分,实现从"单一信号"走向"全景认知"。

期期效应与长期预测能力的系统性侵蚀

短期高频另类数据的规模化滥用正引发深层结构性问题。Dessaint、Foucault 和 Fresard(2024)发表于《Journal of Finance》的研究揭示了"期期效应":短期另类数据因其获取成本更低、更新频率更高、超额收益兑现更快,诱导市场主体的有限认知资源持续向短期经营脉冲倾斜,主动缩减对企业长期竞争力的研究投入,导致一年期以上长期盈利预测精度系统性下滑。该效应在社交媒体、刷卡交易、卫星影像等多类主流另类数据中均得到验证,具有普适性约束力。

当前另类数据体系还面临三重现实约束:数据噪声与行业覆盖不均衡,消费类数据仅适配可选消费行业,卫星数据主要适用于高耗能实体制造业;数据采购成本与隐私合规红线抬高使用门槛,头部机构形成信息垄断;传统模型在处理多模态数据时效率低下,难以有效分离短期扰动与长期经营信号。三重约束相互叠加,形成"数据越丰富、竞争越不平等"的结构性矛盾。

长短期融合的未来推进路径

面对上述挑战,未来量化研究需着力构建长短期融合的新型投研体系。第一,深化生成式 AI 在复合因子构建中的应用,通过多模态一体化降噪解析、长期基本面信息挖掘与长短期复合因子体系构建,破解期期效应带来的信息失衡。第二,拓展长短期分层的数据源建设,短期维度上拓展直播电商订单、快递物流、门店客流等本土高频数据,长期维度上挖掘专利存续、招投标长期订单、ESG 持续投入等具备长期价值属性的数据,缓解行业覆盖偏差。第三,将另类数据应用边界从收益率预测延伸至公司治理与风控合规领域,包括财务造假识别、ESG 长效评估与公司长期治理监控,引导市场从短期价格博弈转向长期价值研判。

在数据丰度不断深化的未来,真正的竞争壁垒不在于数据获取量,而在于融合短期信号与长期价值的能力、理解数据背后经济含义的深度,以及将另类数据转化为可持续决策框架的系统化水平。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至