来源:市场资讯

(来源:兴证金工团队XYQuantResearch)

投资要点

  • 西学东渐,是指从明朝末年到近代,西方学术思想向中国传播的历史过程。在今天,西学东渐仍有其重要意义。由于AI的发展,单篇文献翻译的价值和难度已经大幅降低。为此,我们转化呈现形式,通过文献综述的方式为大家呈现海外资产定价与量化投资领域的最新研究成果,进而最大化地提供研究增量。本篇聚焦的主题是另类数据。

  • 传统量化投资高度依赖财报及宏观统计数据,但随着机构策略趋同,这类标准化数据的Alpha红利已显著衰减。 相比之下,另类数据凭借差异化的信息维度和更快的更新频率,正从边缘探索走向投研核心。本文试图通过梳理近年来的海外代表性文献,厘清另类数据在因子挖掘中的应用逻辑。

  • 近十年来,机器学习算法的广泛渗透,共同推动了非传统数据源的爆发式增长,正式宣告了“数据丰度”时代的到来。在这一宏观背景下,数据不再稀缺,稀缺的是对数据的处理能力。另类数据已彻底摆脱了对冲基金“小众武器”的标签,迅速演变为全球资管机构的标配基础设施。海量多源异构数据的涌入,不仅改变了信息处理的速度,更在深层次上重塑了整个资产管理行业的投研流程与决策生态。

  • 经过十余年的积累,学术界与业界针对另类数据的实证研究已覆盖九大核心类别,构建了扎实的证据链条。本文逐一梳理了地理空间、舆情情绪、消费行为、供应链贸易、人力资本、ESG、物联网传感器、网页爬取及专家网络等类别数据的代表性研究,为在A股的量化实践提供参考。

  • 生成式AI(GenAI)的崛起,从根本上突破了非结构化数据的处理瓶颈,彻底重构了另类数据的价值。针对文本、图像、音频等传统计量手段难以量化的信息,GenAI通过深层的语义理解与跨模态融合技术,能够精准捕捉其中蕴含的市场预期与情绪变化,将其转化为系统性、可交易的高频量化信号。多项基于海外市场的实证研究显示,系统性应用生成式AI的对冲基金,其年化超额回报率相比未使用者普遍高出3至5个百分点。

  • 然而,硬币的另一面是,短期高频数据的规模化滥用正引发短期高频数据“周期效应”,导致市场长期预测能力出现系统性下滑。 实证表明,市场对短期另类数据的过度追逐,正诱发显著的“注意力挤出”效应:资金扎堆博弈短期景气脉冲,导致一年期以上长期盈利预测精度系统性下滑。尽管短期信号可增厚阶段性收益,但其增益远不足以抵消长期研判能力缺失带来的估值偏差,为另类数据应用划定了“不可仅唯短期论”的认知红线。

  • 面对上述挑战,未来的量化研究需跳出单纯的数据堆砌,着力构建长短周期融合的新型投研体系。具体的推进路径包括:一是深化生成式AI在复合因子构建中的应用,平衡短期Alpha与长期风险;二是拓展长短周期分层的数据源建设,缓解特定行业的覆盖偏差;三是将另类数据的应用边界从单纯的收益率预测延伸至公司治理与风控合规领域。

风险提示:文献结论外推至A股存在市场制度与数据口径差异;因子历史表现不代表未来;机器学习模型存在过拟合、样本外失效和解释性不足风险;交易成本、流动性和容量约束可能侵蚀策略收益。

一、引言

传统量化投资体系长期以标准化、结构化数据为根基,其资产定价逻辑、因子挖掘路径以及策略构建流程,几乎完全依附于上市公司定期财务报告、二级市场量价记录和宏观统计公报等公开、规整的信息源。这类数据因统计口径一致、披露流程规范、便于数学建模,在过去数十年间构成了量化行业超额收益最为核心的“数据护城河”。然而,伴随机构投资者数量持续攀升,量化模型趋同现象日益严重,既有结构化数据所蕴含的信息红利正被快速稀释——依托传统财报和行情指标所生成的因子,其收益衰减趋势已愈发明显。在此背景下,市场参与者亟需向陌生信息维度拓展,以重新建立认知差与决策优势,另类数据因而逐步从边缘探索走向量化投资的前沿主战场,成为当前具备突破性的研究方向与实践热点。

所谓另类因子,是指那些不同于传统财报与行情数据之外的非标信息渠道,经由系统化提炼与量化处理所形成的可测度指标,其核心功能在于能够对资产收益的截面差异进行具有统计显著性的解释,或对未来价格变动方向提供前瞻性预测。Sun et al. (2024) 在Alternative data in finance and business: emerging applications and theory analysis中对 2015-2023 年间 100 余篇相关文献进行了系统回顾,明确指出另类数据相比传统数据具有来源多样、异构性、灵活性、客观性和可演化性等优势,能够在企业经营状态刻画中提供"更深入、更全面、更及时"的评估。从具体外延来看,另类因子广泛覆盖地理空间类、舆情与情绪类、消费行为类等九余个细分领域。采用另类因子的深层逻辑在于,伴随传统数据源所承载的信号被市场反复消化,其边际定价能力已趋于饱和,Alpha的获取难度持续加大;相比之下,另类数据凭借其独有的信息优势与时效优势,通常领先于财务报告的披露周期,且具备更强的先行指向性。能够为投资决策者开辟出捕捉尚未融入资产价格的增量信息的窗口,从而在日益拥挤的量化竞争中构筑差异化的胜率基础。

打开网易新闻 查看精彩图片

本文围绕近年来另类数据相关的代表性文献展开梳理,从数据丰度的宏观视角出发,系统梳理另类数据的主要类别、前沿应用及其对量化投资方法论的影响。文章结构如下:第一章论述数据丰度作为另类数据兴起的宏观图景;第二章分类讨论各类另类数据的挖掘与应用。第三章探讨生成式人工智能对另类数据处理的范式革命;第四章总结另类数据的挑战与未来方向。

二、数据丰度:另类数据兴起的宏观图景

近十年来,计算能力的跃迁、机器学习方法的广泛渗透,以及非传统数据源的高速扩张,共同推动量化投资在全球资管行业中从边缘走向主流。全球数据存储规模、算力供给与人工智能技术呈现指数级增长态势,催生了前所未有的“数据丰度”时代:海量多源异构的另类数据以规模化、持续化的方式进入投研视野,与之配套的数据清洗、特征提取与建模工具亦同步迭代升级。Green and Zhang (2024) 在 Journal of Portfolio Management 的综述中指出,另类数据正在实质性地改变投资策略,推动资产管理的范式转移。这一进程的终端效应是,另类数据不再只是少数头部对冲基金的"实验性武器",而正在迅速演化为全球资管机构投研基础设施中的标准配置。

数据丰度究竟“好”在哪里?Dugast和Foucault(2025)发表于《Journal of Finance》的论文《Equilibrium Data Mining and Data Abundance》,从理论层面为这一问题提供了严谨的回答。该文突破了既有研究将信息技术进步简单等同于“信息获取成本下降”的单一框架,将大数据扩张区分为数据处理成本下降与数据丰度增加两种机制,并论证了后者对资产管理行业具有独立且深远的价值。具体而言,数据丰度的“好”体现在三个层面

数据丰度的首要价值在于扩大了量化基金可供搜索的信息池规模。在传统数据环境下,所有参与者面对的是同一套财报和行情数据,信息的同质化决定了预测信号的边际增量十分有限。而数据丰度时代的到来,意味着社交媒体情绪、卫星遥感影像、信用卡交易记录、供应链物流数据等异构信息源进入投研视野,量化基金作为“数据挖掘者”,在更大的数据空间中搜索,其捕获统计显著且经济意义重大的预测变量的概率显著提升。Dugast和Foucault(2025)将这一正向机制称为“隐藏金矿效应”,更庞大的异构数据池提高了量化基金发现高精度预测信号的可能性。这是另类数据能够开辟新Alpha来源的理论根基。在传统因子收益持续衰减的当下,数据丰度为量化投资提供了新的“勘探前沿”。

数据丰度的第二个优点在于拉大了管理人之间的业绩分化,为具备技术和数据优势的机构创造了更宽的护城河。论文的结论指出,在数据丰度时代,不同量化基金的业绩表现变得更加分散。原因在于,数据获取渠道、清洗处理能力、特征工程方法和算法模型的差异,在丰富的信息环境中被显著放大——领先者因率先整合高质量另类数据而持续强化优势,落后者则因数据基础设施薄弱而面临更大的跑输风险。这一分化的经济学含义在于:数据丰度并非普惠式的“雨露均沾”,而是对机构的认知深度、技术积累和资源投入提出了更高要求。对有能力驾驭另类数据的机构而言,数据丰度提供了将技术优势转化为持续超额收益的战略窗口。Massa、Mensah、Tang 和 Asamoah(2024)基于社交媒体客户评分的外生变化,使用断点回归识别了另类数据的"先发优势":共同基金在另类数据评分外生上调 1 个百分点时,对相关股票的持仓增加 0.7%–3%,且这种超额收益效应在另类数据公开后逐渐衰减。这一发现印证了数据丰度时代"抢跑"的战略价值,也提示我们另类数据的竞争优势具有时效性。

从宏观层面看,数据丰度的第三个优点在于持续提升资产价格的信息含量。Dugast和Foucault(2025)证明,数据丰度总是能够提高价格信息含量(price informativeness)。其传导机制在于:更多高质量的另类数据信号被挖掘并用于交易,资产价格将更迅速、更全面地反映基本面信息,市场的价格发现功能因而增强。这一结论具有重要的行业含义,即另类数据的广泛使用不仅是微观基金个体的策略选择,也是推动资本市场定价效率提升的系统性力量。当价格能够更准确地反映资产的内在价值时,资本在市场中的配置效率也随之改善。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

三、另类数据的关键类别与代表性研究

3.1

地理空间类:卫星图像数据

另类数据的一大分支源自地理空间信息,其中卫星图像因其覆盖范围广、更新频率高、可追溯性强而受到学术界与业界的共同关注。Katona、Painter、Patatoukas和Zeng(2024)发表于《Journal of Financial and Quantitative Analysis》的研究《On the Capital Market Consequences of Big Data: Evidence from Outer Space》,利用主要零售商引入卫星覆盖这一外生事件,验证了卫星停车场数据的基本面预测能力。结果表明,停车场填充率的同比增长对零售企业季度业绩具有显著的增量预测价值,且这种预测关系呈现明显的非对称特征。具体而言,停车场利用率的负增长是季度基本面恶化的一个尤为强劲的领先指标,其预测强度显著大于正增长对业绩改善的预测,意味着卫星停车场数据在捕捉零售企业下行风险方面具有独特优势,对识别业绩暴雷风险尤为重要。

打开网易新闻 查看精彩图片

从交易策略的角度来看,Grossman和Stiglitz(1980)的信息效率悖论指出,当信息获取需要成本时,价格不会立即反映全部信息,从而为知情投资者提供了与信息获取成本相匹配的超额回报空间。Pedersen(2015)将此概括为“高效地低效”的市场状态,即在给定数据成本的约束下,部分投资者仍可通过获取高难度信息获取超额收益。在这一逻辑框架下,能够负担卫星数据获取与处理成本的投资者,理论上可以在零售企业财报发布前利用停车场填充率的变化构建有利可图的交易策略。

因此,文章基于上述逻辑构建了一个量化交易策略:在每个季度内,根据停车场填充率的异常变化,以偏离历史均值的程度作为判定标准,将零售企业分为多头组合(填充率异常上升)和空头组合(填充率异常下降),并在财报公告前后持有相应头寸。实证结果显示,该策略在公告日前后3天的窗口内产生了显著的超额收益,其中多头组合跑赢市场约1.6%,空头组合跑输市场约3%,多空组合的异常收益约为4.76%。值得关注的是,空头侧的收益规模几乎是多头侧的两倍,这一非对称性与前文基本面预测的非对称性高度一致。这表明停车场利用率下降对业绩恶化的预测精度更高,因此卫星数据对于做空当季业绩可能不及预期的零售企业具有更强的参考价值。上述发现表明,卫星图像不仅可以作为企业经营状况的外部观测工具,还可被加工为停车场填充率等结构化量化因子,用于预测公司销售表现、财报公告方向及短期股票收益。

Xue、Zhang和Zhao(2025)发表于《Journal of Financial and Quantitative Analysis》的论文《Nowcasting Firms‘ Operating Activities from Satellite Data on Thermal Infrared Radiation》,基于“现实世界的实际活动消耗能源并发射热红外辐射(TIR)”这一物理事实,开发了一种直接、实时度量企业经营活动的方法。具体而言,研究利用卫星数据识别企业工厂在生产过程中释放的热红外辐射,并检验企业TIR是否能够提供关于其未来业绩的信息。

在数据构造方面,作者利用NASA Landsat 8/9和MODIS卫星数据,识别中国A股制造业上市公司的工厂边界,并计算工厂区域的热红外辐射。为了排除季节、地理和自然气候因素的干扰,作者将工厂区域的TIR减去周边5公里缓冲区裸地的TIR,得到调整后的生产相关热红外指标。文中以合肥同大江淮汽车有限公司为例,展示了工厂定位、厂区边界识别和热红外热力图构造过程:厂区和工业区呈现更强的红色热辐射,而非工业区域热辐射较弱。这种图像处理过程说明卫星原始图像可以被转化为企业层面的结构化经营指标。

在股票收益预测方面,该文发现TIR也具有资产定价意义。Fama-MacBeth回归结果显示,TIR较高的企业在下一季度获得更高股票收益;基于TIR构造的多空组合,即买入TIR最高分位企业、卖空TIR最低分位企业,可以获得显著超额收益(该策略年化超额收益约为5.2%)。

打开网易新闻 查看精彩图片

3.2

舆情与情绪类:社交媒体情绪数据

社交媒体情绪是舆情情绪因子的重要组成部分。Cookson、Lu、Mullins和Niessner(2024)发表于《Journal of Financial Economics》的论文《The Social Signal》,系统考察了来自Twitter、StockTwits和Seeking Alpha三大平台的社交媒体关注度与情绪信号。

随着Twitter、StockTwits、Seeking Alpha等平台的普及,投资者越来越多地在社交媒体上讨论股票、发布观点、表达情绪,企业也通过这些平台披露信息和与投资者互动。尤其是2021年GameStop事件之后,社交媒体对交易行为和市场价格的影响受到广泛关注。该文的核心问题是:不同社交媒体平台产生的投资信号是否相同?社交媒体中的“情绪”和“关注度”是否具有不同的收益预测含义?

已有社会金融和行为金融研究通常仅使用单一平台数据,但该文指出,不同平台在用户群体、发帖长度、内容形式、互动方式、推荐机制和专业化程度上存在显著差异,不能简单将某个平台的情绪指标等同于整体的社交媒体信号。图展示了同一只股票在StockTwits、Twitter和Seeking Alpha上的帖子示例:StockTwits更像短消息和投资社区,内容简洁直观;Twitter更开放、内容更碎片化;Seeking Alpha则以较长篇幅的深度投资文章为主。这表明社交媒体数据并非同质化的数据源,不同平台承载着不同类型的信息。

打开网易新闻 查看精彩图片

该文使用了2012至2021年间来自StockTwits、Twitter和Seeking Alpha的公司—日层面数据,分别构造了两个核心变量:关注度和情绪。关注度衡量某只股票在某个平台上被讨论的强度,情绪则衡量相关内容的正面或负面倾向。作者进一步使用主成分分析(PCA)分解不同平台之间的共同成分和平台特有成分。结果显示,关注度在不同平台之间高度相关,第一主成分可解释约67%的平台间变化;但情绪的一致性较弱,第一主成分仅能解释约39%的变化,仅略高于三组完全独立信号时的理论水平。这一结果具有重要含义:投资者在不同平台上通常会同时关注同一批股票,但他们对这些股票的态度并不一致,即“大家都在讨论某家公司”这一关注度信号跨平台较为统一,而“大家怎么看这家公司”这一情绪信号则更受平台用户结构、表达方式和社区文化的影响。该文通过控制传统新闻、公司公告、历史收益、波动率和公司固定效应后重新进行PCA,上述结论依然成立,说明社交媒体关注度并非传统新闻报道的简单复制,而是具有独立的信息结构。

在收益预测方面,该文发现社交媒体情绪和关注度具有相反的市场含义。共同情绪成分能够正向预测次日异常收益,即社交媒体情绪越积极,股票次日收益越高;而共同关注度成分则负向预测次日异常收益,即关注度异常升高后,股票次日更可能出现回落。作者进一步分析了20日内的收益动态,发现积极情绪对应更高的当日和次日收益,且之后没有明显反转;而高关注度通常伴随当日上涨,但随后10至20日出现部分反转。这表明情绪更可能包含与价值相关的信息,而关注度更可能反映短期散户追逐和过度反应。

整体来看,社交媒体数据不仅可以反映散户关注度和投资者情绪,还可以在一定程度上预测短期收益。但这种预测能力具有显著的复杂性:情绪信号可能代表信息,关注度信号可能反映过度反应;专业用户与新用户的信号质量不同;平台机制的变化也会改变数据的信息含量。

3.3

消费行为类:消费者交易数据

消费行为因子是另类数据中与基本面关联最为直接的类别之一。Gupta、Leung和Roscovan(2022)发表于《Journal of Portfolio Management》的论文《Consumer Spending and the Cross-Section of Stock Returns》,利用个体信用卡和借记卡交易数据,系统考察了消费者支出在解释股票横截面收益中的信息价值。

该文的核心逻辑在于,消费者需求最终会影响企业收入、现金流和盈利能力,如果投资者能够提前观测消费端变化,就有可能在财报披露之前识别企业基本面的边际变化。与传统财务报表、分析师预测和市场价格数据相比,信用卡和借记卡交易数据具有更高频、更及时、更接近真实销售活动的特点,因此构成一种典型的另类数据来源。

在数据方面,文章使用了2013年至2019年美国面向消费者企业的日度信用卡和借记卡交易数据,包含销售金额、消费者数量、交易次数等指标,并由数据供应商对消费者样本变化进行调整,以提高公司层面消费趋势的代表性。作者将交易数据映射到上市公司,并主要聚焦于消费者可选消费行业,因为该行业在样本中的数据覆盖率最高、代表性最强,图中展示了不同行业的数据覆盖情况,其中消费者可选消费行业明显高于金融、医疗、公用事业等其他行业。

在变量构造上,作者将日度交易数据聚合为月度公司层面的销售指数,并计算同比销售变化,作为“实时销售信号”。这一信号并非财报中披露的会计销售收入,而是基于消费者实际刷卡消费形成的销售变化指标。由于财务报表通常按季度披露且存在一至两个月的滞后,而交易数据可以在消费发生后一周左右获取,因此该信号能够在财报披露之前提供企业销售趋势的早期线索,从而有效缓解财报披露滞后带来的信息不对称问题。

该文首先检验了消费者交易数据对企业未来盈余惊喜的预测能力。作者构造了两类盈余惊喜指标:一类是基于历史每股收益变化的历史盈余惊喜,另一类是基于实际EPS与分析师预测EPS差异的共识盈余惊喜。Fama-MacBeth回归结果显示,基于信用卡和借记卡交易数据构造的销售变化信号能够显著正向预测企业未来的盈余惊喜,预测能力可持续至未来三个季度,并在1%的置信水平上解释了盈利惊喜约17%的变异。该结果在大盘股和小盘股样本中均成立,但在小盘股中的预测力度更强,这与小盘股信息不对称程度更高、分析师覆盖水平更低的特征相一致,在这类企业中,投资者对非传统数据源的依赖度更高,因此交易数据所蕴含的增量信息价值更为突出。

在收益预测方面,文章进一步构造了基于实时销售信号的多空投资组合,即Improving-minus-Worsening(IMW)组合。具体做法是:每月根据销售变化信号对股票排序,买入销售改善最明显的股票,卖空销售恶化最明显的股票。实证结果显示,该策略在扣除交易成本并控制常见系统性因子后,仍能产生约16%的年化净收益,说明消费者交易数据不仅能够预测企业基本面,也可以转化为可交易的量化投资信号。

打开网易新闻 查看精彩图片

3.4

供应链与贸易类:B2B支付及时性

供应链因子是另类数据中直接刻画企业间关系与行业传导机制的重要类别。Lieberman、Mihov、Naranjo和Velikov(2025)发表于《Journal of Financial Economics》的论文《Show Me the Receipts: B2B Payment Timeliness and Expected Returns》,利用Dun & Bradstreet的企业信用支付数据,研究了B2B支付及时性对股票收益的预测能力。

贸易信用是供应商向客户提供的短期融资形式,例如30天、60天或90天账期。传统财务报表通常只披露应付账款余额,难以直接反映企业究竟是按时付款、提前付款还是拖延付款。该文的核心贡献在于,利用商业信用信息数据库中的企业付款及时性数据,证明企业向供应商付款的速度包含重要的基本面和资产定价信息。已有贸易信用研究主要关注贸易信用作为企业融资来源的作用,例如企业融资约束、银行信贷替代、供应商信息优势和贸易信用条款差异等问题,但大多衡量的是“贸易信用规模”或“应付账款水平”,较少直接观察企业的实际付款行为。该文指出,付款及时性比应付账款余额包含更细致的信息,两家企业可能有相似的应付账款规模,但一家按期付款,另一家持续拖欠供应商,二者反映的现金流状况和供应链关系完全不同。

在数据方面,文章使用Dun & Bradstreet的企业信用支付数据,核心变量是PAYDEX分数。PAYDEX根据供应商向D&B报告的付款经验计算,衡量企业相对于约定账期的付款及时程度:分数越高说明付款越及时,80表示按时付款,高于80代表提前付款,低于80代表延迟付款。例如,70代表比账期晚约15天,60代表晚约22天,50代表晚约30天。这一指标并非普通财报信息,而是来自供应商—客户交易关系中的实际付款记录,因此具有典型的另类数据特征。

打开网易新闻 查看精彩图片

该文提出了两个核心机制。第一个机制是信息缓慢扩散。如果一家企业突然延迟向供应商付款,可能意味着其现金流恶化、融资压力上升或陷入潜在财务困境。由于这类付款信息首先仅掌握在供应商和信用数据机构手中,普通股票投资者难以及时观察,因此股票价格不会立即反映该负面信息。随着后续财报、公告或市场信息逐渐披露,负面基本面才会逐步被价格吸收,从而导致未来股票收益下降。以Liquid Holdings Group(股票代码LIQD)为例加以说明,2013年12月初,Liquid公司由于核心用户出现经营问题导致现金流严重断裂,无力向自身供应商付款,PAYDEX在此时暴跌,而其股价直至年末甚至次年初才大幅下降。如果投资者依据PAYDEX评分包含的信息进行交易,即可在2013年11月末做空该股票。

打开网易新闻 查看精彩图片

第二个机制是垂直议价能力与供应链风险。文章指出,并非所有延迟付款都代表企业困境。若企业长期、稳定、适度地延迟付款,反而可能说明其在供应链中拥有较强议价能力,能够将部分融资压力转嫁给供应商。这类企业通过延后付款改善营运现金流、降低短期外部融资需求,但同时也可能形成黏性的供应商关系,使企业在供应链压力上升时缺乏灵活调整的能力,因此承担更高的供应链压力风险,要求更高的预期收益。为了检验该机制,作者构造了Late Payment Consistency(LPC)指标,用以衡量企业是否持续、稳定、适度地晚付款。实证结果显示,高LPC企业具有更强的市场力量和供应链议价能力特征,如财务约束更低、困境概率更低、市场份额更高、盈利能力更强。基于LPC的多空策略表现显著:买入高LPC企业、卖空低LPC企业可获得较高的月度超额收益。进一步的宏观定价检验发现,全球供应链压力指数(GSCPI)能够解释LPC组合收益差异,说明该收益溢价与供应链压力风险相关,而非普通规模、价值、盈利或动量因子所能解释的异常收益。

打开网易新闻 查看精彩图片

该文将另类数据研究扩展至企业间真实商业付款行为,为供应链因子提供了新的数据维度和实证证据。从量化投资的角度来看,B2B支付及时性数据可被构造为两类因子:一类是短期负面预警因子,用于识别突然延迟付款、现金流恶化和潜在困境企业;另一类是供应链议价能力因子,用于识别持续适度晚付款但承担供应链压力风险的企业,从而获取相应的风险溢价。

3.5

人力资本类:员工评价相关数据

人力资本类另类数据是近年来资产定价研究中快速发展的方向。Green、Huang、Wen和Zhou(2017)发表于《Journal of Financial Economics》的论文《Wisdom of the Employee Crowd: Employer Reviews and Stock Returns》,利用Glassdoor平台上员工对雇主的 crowdsourced 评价数据,研究了员工满意度变化对股票收益的预测能力。

该文的核心逻辑在于:员工是企业运营的亲历者,其对职业发展机会、管理层能力、企业文化等方面的主观评价,可能包含尚未被市场充分吸收的企业基本面信息。与传统财务报表相比,Glassdoor等平台上的员工评价具有实时性高、覆盖面广、难以被管理层直接操纵的特点,因此构成一种典型的人力资本类另类数据源。

在数据方面,文章使用了Glassdoor平台上大量雇主评价数据,核心变量为员工对雇主的1至5星总体评分,以及针对职业发展机会、高级管理层、工作与生活平衡等子维度的分项评分。作者进一步构造了文本型评价指标,通过比较员工在“优点”与“缺点”两栏的文本长度差异来推断员工满意度的变化。

文章发现,员工评价改善的企业显著跑赢员工评价恶化的企业。这一收益效应主要集中在当前员工的评价中,且在企业早期评价和员工位于总部所在州时更为显著。进一步的分解显示,预测能力主要来源于员工对职业发展机会和高级管理层的评价变化,而与工作与生活平衡的评价无关。在基本面层面,员工评价的变化能够预测企业销售和盈利能力的同期增长,并帮助预测未来一个季度的盈余惊喜。该文的证据表明,员工评价揭示了关于企业基本面的增量信息,且这一信息尚未被市场充分定价。

从量化投资的角度来看,该文说明员工评价数据可以构造为人力资本情绪因子,员工满意度改善的企业可能存在未被市场认知的基本面上行趋势,而员工满意度恶化的企业则可能面临经营压力。与传统舆情情绪因子不同,员工评价来源于企业内部人士的切身体验,其信息质量可能优于普通社交媒体上的散户情绪。此外,该文也提示研究者在使用此类数据时需要注意区分不同员工群体(当前员工 vs 前员工)、不同评价维度(职业发展 vs 工作生活平衡)以及不同企业生命周期阶段(早期评价 vs 成熟期评价)的信号差异。

打开网易新闻 查看精彩图片

3.6

ESG与责任投资类:ESG评级分歧指标

ESG与责任投资类另类数据是近年来资产定价研究中备受关注的领域。Avramov、Cheng、Lioui和Tarelli(2022)发表于《Journal of Financial Economics》的论文《Investment and Asset Pricing with ESG Disagreement》,从ESG评级分歧这一独特视角出发,研究了不同ESG评级机构之间评级不一致所产生的信息摩擦如何影响资产定价。

该文的核心逻辑在于:随着ESG投资理念日趋主流化,市场上涌现出MSCI、Sustainalytics、Refinitiv、Bloomberg等多套ESG评级体系。然而,这些评级机构在方法论、指标权重和数据来源上存在显著差异,导致同一家企业可能在不同评级机构那里获得截然不同的ESG评分,即所谓的“ESG评级分歧”(ESG disagreement)。

打开网易新闻 查看精彩图片

这种分歧本质上是一种信息摩擦:当投资者面对相互矛盾的ESG信号时,他们对企业真实ESG表现形成异质信念,这种异质信念进而被定价于资产价格之中。文中构建了一个ESG评分分歧指标,具体构造方式如下:

第一步:百分位排名转换。 对于每一家评级机构与每一家股票的组合,将原始ESG评级分数转换为百分位排名(归一化至0到1之间)。

第二步:计算两两配对的标准差。 对于每一只股票,计算任意两家评级机构百分位排名之间的标准差,作为该配对的不确定性度量。

第三步:取平均值。 将该股票所有两两配对的标准差取平均值,得到公司层面的ESG评级不确定性指标。同理,将两两配对的百分位排名平均值再取平均,得到公司层面的ESG综合评级。

进一步采用了双重分组方法:先根据ESG不确定性将股票分成五组,在每个不确定性组内再根据ESG评级将股票分为五组。最终发现,在ESG不确定性较低的组中,ESG评级与股票未来表现呈显著负相关;而在ESG不确定性较高的组中,这一负相关关系被显著削弱。

3.7

物联网与传感器类:能耗数据

物联网与传感器因子是另类因子中最依赖硬件基础设施的类别。其核心逻辑在于:通过在物理世界中部署传感器网络,实时监测经济活动的状态和变化。能耗数据作为电网传感器网络采集的实时物理指标,由电力系统自动记录,不受企业会计政策或管理层判断的影响,能够真实反映经济活动的实时变化。

Da、Huang和Yun(2017)发表于《Journal of Financial and Quantitative Analysis》的论文《Industrial Electricity Usage and Stock Returns》,是该领域的奠基性研究。文章利用美国各州层面的月度工业用电数据,系统考察了工业用电增长率对股票市场未来回报的预测能力。

该研究发现,工业用电增长率能够预测长达一年的股票未来回报,回归R²达到9% 。具体而言,当前的高工业用电量预示着未来的低股票回报,这一结论与反周期风险溢价(countercyclical risk premium) 的逻辑高度一致——经济繁荣期用电量高企,投资者风险厌恶程度降低,要求的风险补偿下降,预期未来回报走低;经济衰退期用电量萎缩,投资者风险厌恶程度上升,要求的风险补偿升高,预期未来回报走高。工业用电量之所以能够预测股票回报,根本原因在于它能够实时跟踪经济周期中最具周期性部门的产出。当企业预期销售增长时,会开动机器扩大生产,这一行为必然伴随着用电量的上升。由于工业用电数据通常以月为单位高频发布,远早于季度财报的披露时间,投资者可以据此提前判断经济走势和企业生产节奏。

文章进一步将工业用电增长率与股息率、盈利收益率、账面市值比等10种传统金融预测变量进行了对比。结果显示,工业用电增长率优于传统的金融变量。在10种传统预测变量中,仅有产出缺口(即实际产出与潜在产出之差)的表现优于工业用电指标。但产出缺口数据的发布存在明显滞后,而工业用电数据几乎实时可得,这使得后者在实际投资应用中具有更强的可操作性。这一比较说明,工业用电数据并非简单重复已有变量所包含的信息,而是提供了一种更直接、更实时的经济周期度量方式。

打开网易新闻 查看精彩图片

3.8

网页爬取与公开信息类:在线价格数据

网页爬取与公开信息类另类数据是近年来增长最快、覆盖面最广的另类数据类别之一。其核心逻辑在于:通过自动化程序从互联网公开页面中批量提取产品定价、库存水平、促销信息、企业公告等信息,将非结构化的网页内容转化为结构化的量化指标,从而捕捉企业经营策略和市场竞争态势的实时变化。

Cavallo、Czasonis、Kinlaw和Turkington(2023)发表于《Journal of Portfolio Management》的论文《Inflation Hedging: A Dynamic Approach Using Online Prices》,正是这一领域在资产配置方向上的代表性研究。该文利用PriceStats提供的来自21个国家多渠道零售商网站的数百万种产品价格的每日在线价格数据,构造了高频通胀指数,并在此基础上构建了一个动态通胀对冲策略。

过去四十余年来,学术界和投资界对通胀与资产价格之间的关系进行了大量研究,但结论并不令人乐观——能够提供可靠通胀对冲的资产并不多。美国于1997年推出的通胀保护国债(TIPS),是唯一一种收益与通胀明确挂钩的资产类别。然而,TIPS存在一个显著的缺陷:在大多数通胀温和的时期,其收益率低于名义国债。投资者面临的困境是:持有TIPS虽然获得了通胀保护,却牺牲了名义国债在低通胀环境下的更高票息收益。已有的通胀对冲文献大多从静态的“买入并持有”视角出发,研究股票、债券或大宗商品在长期投资组合中的通胀对冲属性。很少有研究考虑主动管理的策略来动态对冲通胀风险。理想状态下,投资者应当在通胀温和时持有名义国债以获取更高的票息收益,而在通胀预期上升时转向TIPS以捕捉其价格升值。但要实现这一目标,投资者需要一个能够提前预示市场集体通胀预期变化的领先指标。该研究正是利用网页爬取的在线价格数据来填补这一空白。

该文使用的在线价格数据来自PriceStats,这是由Cavallo与MIT教授Roberto Rigobon共同创立的私人公司,其方法论源于著名的“十亿价格项目”(Billion Prices Project)。PriceStats每日从全球多渠道零售商网站上抓取数百万种产品的价格信息,这些产品覆盖了广泛的消费品类别,数据以日度频率更新,远快于各国官方统计机构按月或按季度发布的消费者价格指数(CPI)。PriceStats在线通胀指数的核心优势在于时效性和细颗粒度。官方CPI数据通常存在数周甚至更长的发布滞后。例如,美国劳工统计局通常在每个月第二周发布上个月的CPI数据,这意味着投资者在交易时面对的是一个月前的通胀信息。相比之下,在线价格数据几乎可以在消费发生的同时被采集和汇总,为投资者提供了近乎实时的通胀信号。

基于通胀信号,构建了动态TIPS/名义国债轮动策略。当在线价格指数显示通胀正在快速上升时,从名义国债转向TIPS;当在线通胀趋于稳定或下降时,从TIPS转回名义国债。这一动态策略的潜在收益来源有两个方向:当实际通胀低于市场预期时,名义国债价格上升、TIPS价格相对承压,动态策略通过持有名义国债捕捉其价格升值;当实际通胀高于市场预期时,TIPS价格上升、名义国债价格相对承压,动态策略通过持有TIPS获得通胀保护。

打开网易新闻 查看精彩图片

3.9

专家网络与调研类:分析师调研信息

专家网络与调研类是另类数据中最接近“一手信息”的类别。其核心逻辑在于:通过行业专家深度访谈、定制化渠道调研、管理层非公开接触、经销商及终端客户反馈等方式,获取传统财务报表和公开披露无法覆盖的“软信息”,从而形成对行业格局、技术走向和企业基本面的差异化洞见。

Han、Kong和Liu(2018)的论文《Do Analysts Gain an Informational Advantage by Visiting Listed Companies?》,利用中国A股市场上市公司分析师实地调研的独特数据集,系统考察了实地调研是否以及如何为分析师提供了信息优势。

分析师在资本市场中扮演着重要的信息中介角色,其研究报告和盈利预测是投资者决策的重要参考。然而,分析师的信息优势从何而来?一个直观但缺乏系统证据的渠道是实地调研,通过与管理层的面对面交流,分析师可以获得财务报表和公开电话会议无法传递的增量信息。该研究正是利用中国深交所自2009年起要求上市公司披露分析师和机构投资者实地调研信息的制度安排,首次大规模实证检验了实地调研对分析师预测准确性的因果影响。该文指出,实地调研不仅是信息收集的物理行为,更是分析师拼凑信息图景的关键环节,通过与公司管理层的私人互动,分析师能够将公开信息与现场观察到的“软信息”整合为更完整的公司画像。研究将分析师分为“实地调研分析师”(进行过实地调研)和“非实地调研分析师”(未进行过实地调研)两组,比较两类分析师在调研前后的盈利预测准确度变化。

研究结论表明,进行实地调研的分析师,其盈利预测准确度显著高于未进行实地调研的分析师。这表明,与管理层的面对面交流能够为分析师提供公开信息渠道无法覆盖的增量信息,从而提升其预测质量。

打开网易新闻 查看精彩图片

四、生成式人工智能:另类数据的范式革命

如今,人工智能正在迅猛发展。生成式人工智能(Generative AI)的崛起正在从根本上改变对冲基金处理另类数据的方式。生成式AI的核心价值在于其处理非结构化另类数据的能力。前文从地理空间到专家调研,梳理了九大类另类数据及其在量化投资中的实证价值。然而,这些数据的共同瓶颈并不在于“采集”,而在于“理解”。例如社交媒体帖文不会自动标注情绪标签,专家调研纪要更不会自动转化为买卖信号,传统方法依赖大量人工规则、词典匹配和特征工程,处理成本高昂、可扩展性有限,且难以捕捉文本中微妙的语义、语气和上下文关系。生成式人工智能的崛起,正在从方法论层面重新定义另类数据的价值。它不再回答“数据从哪里来”,而是回答“数据意味着什么”。

打开网易新闻 查看精彩图片

Sheng、Sun、Yang和Zhang(2025)发表于《Review of Financial Studies》的论文《Generative AI and Asset Management》,正是对这一范式变革的系统性实证检验。该研究巧妙地将ChatGPT的推出看作一场“自然实验”,2022年11月之前,市场还没有生成式AI;之后,AI突然变得人人可用。通过对比“用AI的基金”和“不用AI的基金”在ChatGPT推出前后的业绩变化,研究发现,那些积极采用生成式AI的对冲基金,年化超额回报率比不用AI的基金高出3至5个百分点,而且这个优势在那些早已储备AI人才的基金中更为明显。为了进一步确认这种业绩提升确实来自AI而非其他因素,该文还利用了ChatGPT偶尔服务中断的事件作为验证——当AI突然不可用时,那些依赖AI的基金业绩确实受到了影响。从本质上讲,资产管理行业的竞争就是“谁先获取信息、谁更会处理信息”的竞争,而生成式AI的出现,让过去只有顶尖机构才能完成的复杂信息处理工作变得触手可及,而这正是前文九大类另类数据从“原始的原材料”变成“可交易的信号”所缺失的关键一环。

打开网易新闻 查看精彩图片

进一步,我们探讨生成式AI如何赋能另类数据,从文本解析到多源融合,生成式AI对前文九大类另类数据的赋能,可按数据类型分为三个层次:

第一层次,文本类数据的语义级理解。 舆情情绪类(社交媒体帖文、新闻报道)、专家网络与调研类(调研纪要、访谈记录)、网页爬取与公开信息类(产品描述、用户评论、企业公告)以及人力资本类(Glassdoor员工评价)——这些数据源的核心信息载体是自然语言文本。传统量化模型处理此类数据时,高度依赖预定义情感词典和词频统计,不仅无法处理反讽、否定和语境依赖等复杂语言现象,更无法理解文本背后的逻辑关系。以“这家公司亏损了,但我非常看好它的转型前景”为例,传统词典法会将其误判为正面,而实际上前一句表达的是基本面负面信号。近期研究表明,大语言模型在金融文本情感分析任务上显著优于传统的 Loughran-McDonald 词典。Kirtac and Germano (2024) 基于 2010-2023 年 96.5 万篇美股新闻的实证显示,GPT-3 基础的 OPT 模型预测股市方向的准确率达到 74.4%,对应的多空策略夏普比率高达 3.05,全面超越 BERT、FinBERT 与词典基准。大语言模型通过上下文感知的语义建模,能够准确识别此类复杂表达中的多重信号,将文本类因子的信噪比提升一个数量级。更关键的是,生成式AI可以直接从原始文本中端到端地提取预测信号,无需人工定义特征,大幅降低了从数据到因子的转化成本。

打开网易新闻 查看精彩图片

第二层次:非文本数据的结构化解析。 地理空间类数据(卫星图像、热红外辐射)本质上属于视觉信息,需要通过图像识别技术转化为结构化经营指标。生成式AI的多模态能力,即同时处理文本、图像和数值数据的能力。使得从卫星图像中直接生成量化描述成为可能。物联网与传感器类数据产生的大量时序信号,也可以通过AI模型进行异常检测和模式识别,从而更精准地捕捉生产活动的边际变化。这类数据虽然不涉及自然语言,但生成式AI的序列建模能力在处理其时空依赖结构方面具有显著优势。

第三层次:多源异构数据的融合分析。 这是生成式AI最具变革性的应用场景。传统量化模型通常针对单一数据源设计因子,而生成式AI具备同时处理文本、图像、数值和时序数据的能力。例如,在评估一家零售企业的基本面时,AI可以同时分析其社交媒体情绪(舆情类)、停车场卫星图像(地理空间类)、信用卡交易趋势(消费行为类)以及员工评价(人力资本类),生成一个综合性的基本面前瞻评分。这种跨数据源的信息融合,正是另类数据从“单一信号”走向“全景认知”的终极形态,也是生成式AI在资产管理中最具战略价值的功能。

打开网易新闻 查看精彩图片

五、另类数据的挑战与未来方向

大数据浪潮推动卫星数据、舆情数据等海量另类数据持续商业化,另类数据供应商规模亦随之迅速扩张,资本市场已全面进入Dugast和Foucault(2025)所定义的“数据丰度”时代,传统财报主导的信息生产格局正被彻底重构。然而,伴随各类短期高频另类数据的大规模普及,市场信息预测行为出现了显著的结构性扭曲,Dessaint、Foucault和Fresard(2024)发表于《Journal of Finance》的论文《Does Alternative Data Improve Financial Forecasting? The Horizon Effect》,系统揭示了短期导向另类数据对市场预测行为的“注意力挤出”效应,即“周期效应(Horizon Effect)”,为量化投资与另类数据研究划定了核心边界。

打开网易新闻 查看精彩图片

周期效应揭示了短期另类数据对市场长期预测能力的系统性侵蚀,其根源在于注意力稀缺约束下市场主体对短期信号的过度追逐。该理论的核心逻辑建立在注意力稀缺理论之上:短期另类数据(消费交易、月度舆情、厂区短期开工数据等)因其获取成本更低、更新频率更高、短期超额收益兑现更快,会诱导分析师、量化研究者、机构投资者有限的认知资源持续向短期经营脉冲倾斜,从而主动缩减对企业长期竞争力、研发投入、行业长期格局、可持续现金流等长期基本面的研究投入,最终形成不可逆的信息失衡结果。如图20所示,短期盈利、营收等预测的信息含量显著提升,但一年以上长期盈利及企业价值预测精度持续下滑,短期信息增益无法对冲长期研判能力的损耗。这一结论并非某一类数据的局部现象,研究中统一检验了社交媒体、刷卡交易、卫星影像等多类主流另类数据后证实,所有短期高频另类数据均存在这一内在缺陷,具有普适性的约束力。结合前文Gupta等(2022)消费交易因子及卫星数据的实证可以看出,现有多数量化策略仅依托1至3季度的短期另类信号构建多空组合,天然受周期效应制约。若机构长期单一依赖短期另类数据,将逐步丧失对企业长期估值中枢的判断能力;从全市场维度来看,全行业资金扎堆短期景气套利,会放大市场短期波动、弱化价值发现功能,加剧市场短期投机倾向。

打开网易新闻 查看精彩图片

除周期效应这一底层矛盾外,当前另类数据体系还面临三重现实约束,共同抬高了另类数据的应用门槛。

其一,数据噪声与行业覆盖不均衡并存——消费类数据仅适配可选消费行业,卫星数据主要适用于高耗能实体制造业,数据覆盖存在天然的行业偏误。

其二,数据采购成本与隐私合规红线抬高使用门槛,头部机构凭借独家数据形成信息垄断,进一步加剧市场信息分层(Dugast & Foucault,2025)。

其三,传统文本模型与时序模型在处理多模态另类数据时效率低下,难以有效分离短期扰动与长期经营信号。

三重约束相互叠加,使得另类数据从“可获取”到“可有效使用”之间仍存在显著鸿沟。值得特别指出的是,三重约束之间存在相互强化的关系:行业覆盖不均衡导致数据供给集中在少数热门赛道,进一步加剧了机构在这些赛道上的同质化竞争;信息垄断与处理效率低下的叠加,使得中小机构即使获取了数据也难以有效利用,从而加速了行业的马太效应。这种“数据越丰富、竞争越不平等”的悖论,构成了数据丰度时代最深刻的结构性矛盾。

立足周期效应所揭示的核心矛盾及行业现存的多重桎梏,结合技术迭代、产业拓展与资本市场治理需求,另类数据领域未来的研究与实践可从三大方向推进。

方向一:生成式AI与另类数据深度融合,破解长短期信息失衡难题。 生成式AI与另类数据的深度融合,有望从根本上破解周期效应带来的长短期信息失衡难题,其价值体现在三个层面。第一,大模型可实现多模态另类数据的一体化降噪解析。针对社交媒体水军、卫星停工干扰、一次性大额支付等噪声,依托长上下文能力自动清洗原始另类数据,提升信号信噪比,减少短期虚假经营脉冲对预测的干扰。第二,大模型可突破短期数据局限,挖掘长期基本面信息。通过整合企业十年以上年报、电话会议纪要、行业研报,提取研发投入轨迹、产能规划、管理层长期战略等低频可持续指标,弥补短期另类数据在长期信息维度的缺失,缓解周期效应下长期预测失效的问题。第三,可构建长短周期复合因子体系,通过AI区分短期景气扰动与长期价值变量,将短期另类增强信号与长期基本面指标进行加权融合,弱化单一短期因子策略的回撤风险。Sheng等(2025)已验证生成式AI可显著提升另类数据的超额收益,但现有实证主要集中于美股文本数据。未来可结合国内电商、物流、工业用电等本土另类数据,搭建适配A股市场的AI长短周期融合因子框架,将生成式AI的技术红利从理论验证推向本土实践。在这一融合过程中,还需要关注生成式AI自身的技术局限性对另类数据处理效果的影响。大语言模型的“幻觉”问题,即模型可能生成逻辑自洽但事实错误的推断——在金融决策中可能产生误导性后果;模型训练数据的时效性和代表性偏差,也可能导致对特定类型企业或行业的系统性误判;此外,黑箱决策特性使得AI驱动的信号难以追溯和解释,在风险控制和合规审查中面临额外障碍。因此,未来实践中需要建立人机协同的验证机制,将AI生成的信号与传统基本面分析进行交叉检验,而非简单替代人工判断。

方向二:拓展新型另类数据源,丰富长短周期分层数据体系。 拓展新型另类数据源、丰富长短周期分层数据体系,是从供给侧缓解周期效应的基础性工程。当前学界实证多聚焦于海外刷卡、卫星、社交媒体等成熟数据源,类型同质化严重,且大多仅捕捉短期经营波动,缺少能够刻画企业长期发展的另类指标。未来研究可从两个维度双向拓展:在短期维度上,拓展国内直播电商订单、快递物流、门店客流、工业实时用电、产业链票据等本土高频短期另类数据,完善国内消费与制造行业的短期景气观测指标,适配中短期策略增强;在长期维度上,挖掘专利存续数据、招投标长期订单、ESG持续投入、员工长期薪酬等具备长期价值属性的另类数据,弥补周期效应下长期观测指标稀缺的短板,从数据源头平衡市场的长短期信息供给。与此同时,针对新能源、生物医药、数字经济等新兴赛道开发专属另类观测维度,打破当前数据行业覆盖不均衡的局限,逐步降低市场对短期数据的过度依赖。从方法论层面来看,数据源的拓展还应当伴随数据融合理论的创新。不同另类数据源在频率、精度、覆盖范围和经济含义上存在显著差异,如何设计科学的数据融合框架以最大化多源数据的协同效应,是未来研究的重要方向。例如,高频消费数据与低频企业专利数据之间如何建立映射关系?短期景气信号与长期价值信号在因子权重上应遵循何种分配原则?这些方法论问题尚缺乏系统的理论指导。未来研究可借鉴多模态学习、迁移学习等AI领域的成熟框架,构建面向资产定价的专用数据融合架构,从方法论层面提升多源异构另类数据的综合使用效率。

方向三:拓展另类数据在公司治理与风险防控领域的应用。 拓展另类数据在公司治理与风险防控领域的应用,跳出以收益预测为核心的单一框架,是从需求侧引导市场回归长期价值的重要路径。现有另类数据研究绝大多数局限于股票收益与盈利预测维度,在周期效应的作用下研究视野日益短期化。未来应在三个方向上实现突破:第一,在财务造假识别方面,依托多年B2B支付、物流、产销另类数据进行交叉验证,识别财报营收与存货的真实性,利用长时序另类数据发现单季度数据无法捕捉的持续性舞弊行为;第二,在ESG长效评估方面,摒弃短期舆情驱动的ESG打分模式,整合厂区长期卫星排放监测、历年供应链合规记录、员工长期流动趋势等长周期另类数据,构建更具可持续性的ESG评价体系,规避短期舆情波动带来的ESG评级失真;第三,在公司长期治理监控方面,通过分析管理层多年发言文本、上下游长期合作数据,持续跟踪股权质押、关联交易、长期投融资行为,实现企业长期经营风险的前置预警。三个方向的共同目标,是引导市场从短期价格博弈逐步转向长期价值研判,从市场层面缓解周期效应所带来的短期化倾向。进一步地,另类数据在监管科技领域的潜在应用值得前瞻性关注。随着市场对短期另类数据的过度依赖日益加深,监管机构同样可以利用另类数据来监测市场整体的短期化倾向和系统性风险积累。例如,通过监测全市场短期另类数据驱动的交易规模占比变化,可以量化市场短期投机热度的实时水平;通过追踪各行业另类数据使用强度的分化程度,可以识别潜在的泡沫积聚领域。这种“用另类数据监管另类数据”的双向互动,将构成数据丰度时代资本市场治理的新范式。

打开网易新闻 查看精彩图片

综上所述,另类数据为量化投资开辟了全新的信息维度,但其长期价值取决于市场参与者能否超越短期信号追逐、构建长短周期平衡的信息处理体系。在数据丰度不断深化的未来,真正的竞争壁垒不在于谁能获取更多数据,而在于谁能更有效地融合短期信号与长期价值、更深刻地理解数据背后的经济含义、更系统地将另类数据转化为可持续的决策框架。

六、参考文献

[1] Dugast, J., & Foucault, T. (2025). Equilibrium data mining and data abundance. Journal of Finance, 80(1), 211-258.

[2] Katona, Z., Painter, M. O., Patatoukas, P. N., & Zeng, J. (2024). On the capital market consequences of big data: Evidence from outer space. Journal of Financial and Quantitative Analysis, 59(3), 551-579.

[3] Xue, Y., Zhang, B., & Zhao, X. (2025). Nowcasting Firms‘ Operating Activities from Satellite Data on Thermal Infrared Radiation. Journal of Financial and Quantitative Analysis, 61(3), forthcoming.

[4] Cookson, J. A., Lu, R., Mullins, W., & Niessner, M. (2024). The social signal. Journal of Financial Economics, 158, 103870.

[5] Gupta, T., Leung, E., & Roscovan, V. (2022). Consumer spending and the cross-section of stock returns. Journal of Portfolio Management, 48(7), 117-137.

[6] Lieberman, P., Mihov, A., Naranjo, A., & Velikov, M. (2025). Show me the receipts: B2B payment timeliness and expected returns. Journal of Financial Economics, 172, 104108.

[7] Sheng, J., Sun, Z., Yang, B., & Zhang, A. L. (2026). Generative AI and asset management. Review of Financial Studies, hhag050.

[8] Dessaint, O., Foucault, T., & Fresard, L. (2024). Does Alternative Data Improve Financial Forecasting? The Horizon Effect. Journal of Finance, 79(3), 2237–2287.

[9] Green, T. C., Huang, R., Wen, Q., & Zhou, D. (2019). Crowdsourced employer reviews and stock returns. Journal of Financial Economics, 134(1), 236-251.

[10] Avramov, D., Cheng, S., Lioui, A., & Tarelli, A. (2022). Investment and asset pricing with ESG disagreement. Journal of Financial Economics, 145(2), 642-664.

[11] Da, Z., Huang, D., & Yun, H. (2017). Industrial electricity usage and stock returns. Journal of Financial and Quantitative Analysis, 52(1), 37-69.

[12] Cavallo, A., Czasonis, M., Kinlaw, W., & Turkington, D. (2023). Inflation hedging: A dynamic approach using online prices. The Journal of Portfolio Management, 50(1), 58-71.

[13] Han, B., Kong, D., & Liu, S. (2018). Do analysts gain an informational advantage by visiting listed companies? Contemporary Accounting Research, 35(4), 1843-1867.

[14] Sun, Y., Liu, L., Xu, Y., et al. (2024). Alternative data in finance and business: emerging applications and theory analysis. Financial Innovation, 10, 127.

[15] Green, T. C., & Zhang, S. (2024). Alternative Data in Active Asset Management. Journal of Portfolio Management, 51(2).

[16] Kirtac, K., & Germano, G. (2024). Sentiment trading with large language models. Finance Research Letters, 62(Part B), 105227.

[17] Massa, M., Mensah, A., Tang, V. W., & Asamoah, P. E. (2024). The Early Bird Catches the Worm: How Lasting is the Value of New, Alternative Data? HEC Paris Research Papers Series No. 1518.

注:文中报告节选自兴业证券经济与金融研究院已公开发布研究报告,具体报告内容及相关风险提示等详见完整版报告。

证券研究报告:《另类数据的量化投资图景:从数据丰度到范式革命——海外文献推荐系列之一百九十二》

对外发布时间:2026年7月23日

报告发布机构:兴业证券股份有限公司(已获中国证监会许可的证券投资咨询业务资格)

分析师:郑兆磊

SAC执业证书编号:S0190520080006

分析师:林沁莹

SAC执业证书编号:S0190526060007

打开网易新闻 查看精彩图片