来源:市场资讯

(来源:FOF老码头)

在上一篇量化指数增强策略专题中,我们对策略的整体构建框架做了一个详细的拆解。而作为量化指数增强策略最核心的超额收益来源,多头端Alpha策略在研发人员不断的开发中也有着持续的演进与发展。我们基于过往的策略构建模式迭代过程结合实地私募基金尽调获取到的信息,将量化指数增强的多头选股构建模式划分为几个主要阶段,详细展开介绍策略开发从少量强因子,到大量公式化Alpha,再到非线性模型、特征工程和端到端学习的持续演进过程。

我们把这条演进路径概括为三个大阶段:第一阶段更偏向“因子驱动”,核心是找到、生产和组合有效 Alpha 因子;第二阶段更偏向“模型驱动”,核心是让模型学习因子之间更复杂的非线性关系,并通过特征工程提升数据表达;第三阶段是可以理解为“纯模型或端到端探索”,尝试让模型从更原始、更高维的数据中直接学习投资结构。

希望我们的梳理能帮助各位投资者更好的理解量化指增多头端的策略演进,同时也一定程度上解答量化策略究竟是如何构建组合并获取Alpha收益的问题。

图1:指数增强多头端策略演进路径

打开网易新闻 查看精彩图片

第一阶段:

因子驱动——从少量强因子到因子工厂

在第一阶段,策略的核心驱动力仍然是因子。模型更多承担打分、加权、筛选和组合的辅助角色,真正决定组合收益绩效的,是研究人员挖掘出来的因子质量。

1.0模式:少量强因子,简单线性组合

早期的指数增强多头端,往往建立在少数经典因子之上。这些因子通常有比较清楚的经济含义与构建逻辑,例如估值、盈利质量、成长、动量、反转、波动率、流动性、市值、股息率等。策略的基本流程也比较直观:先计算每只股票在不同因子上的得分,再进行标准化、去极值、行业或市值中性化,之后按照预设权重合成为一个综合分数。分数较高的股票相对超配,分数较低的股票相对低配或剔除,最后再通过组合优化满足跟踪误差、行业偏离、个股权重和换手率等约束。

这一阶段最大的优点是可解释性强。因子的开发人员可以比较清楚地说明,每个因子希望表征的是股票的什么特征,以及这一特征为何能够反映到最终的市场定价上。这类型的因子往往需要研究人员具备较好的金融经济基础,并通过对市场的观察总结,提炼出扎实的因子逻辑,并且强调逻辑的独特性。对于这类因子,越是不够有效或机构化程度不高的早期市场越容易获取股票无法充分定价的收益。

而1.0模式也有明显局限性。第一,少数强因子容易被发现、复制和拥挤。当越来越多资金使用相似逻辑,股票的定价偏离将越来越少,因子的边际收益会明显下降。第二,简单的线性因子组合,容易忽略因子之间的互相影响关系。但真实市场往往不是这样,在不同的市场环境中同一个因子表现也会有较大的波动。低估值股票是否有吸引力,可能取决于盈利趋势、资产质量、行业景气度和风险偏好;动量信号是否有效,也可能取决于流动性和市场波动状态。第三,强因子逻辑需要较长的时间验证,因而也不便于快速调整。随着因子逻辑的逐步挖掘,策略边际提升的空间较为有限。所以,1.0模式解决了“如何系统化选股”的问题,但还没有很好解决“如何持续生产和更新超额收益来源”的问题。

1.5模式:以量取胜的因子工厂

随着数据积累、算力提升和研究流程平台化,量化机构开始从“少数强因子”转向“大量因子组合”。常常被大家提到的是世坤(WorldQuant)式的Alpha Factory思路。其相关公开研究中有一篇常被引用的论文《101 Formulaic Alphas》,展示了通过公式化表达式,从价格、成交量、成交额、排序、相关性、时序变化等基础数据中批量构造Alpha信号的思路。它代表了一种重要转变:策略不再只依赖少数具备完整经济叙事的强因子,而是接受大量单独看较弱、但组合后可能有效的统计信号。

在因子工厂模式中,研究体系更像一条“Alpha生产线”。研究员或平台不断生成候选信号,对其进行样本内、样本外、分层、衰减、相关性的检验。通过检验的信号进入候选库,再根据相关性、稳定性和容量进行组合。单个信号可能并不惊艳,但如果数量足够多、逻辑足够分散、相关性足够低,整体组合可能获得更平滑的超额收益。这类似于球队从依赖几名明星球员,升级为一整套轮换阵容。单个因子的胜率未必很高,但系统的韧性更强。

1.5模式在1.0的基础上有了一定改进,一是超额来源更加分散,降低对少数因子的依赖;二是研究流程更加工业化,可以批量生成、检验、淘汰和更新信号。但这一模式也带来了新的风险:大量因子挖掘很容易产生数据挖掘和过拟合:历史上有效的表达式,可能只是偶然适配了过去样本。很多表面上不同的因子,实质上可能暴露于同一种风格或交易逻辑。一旦市场结构变化,信号可能同步失效。

第二阶段:

模型驱动——从非线性学习到深度特征工程

进入第二阶段后,策略的主驱动力逐渐从“因子本身”转向“模型如何理解因子”。因子仍然重要,但它们不再只是被简单线性相加,而是成为模型学习未来收益、股票排序和复杂交互关系的输入。

2.0模式:大量弱因子 + 非线性模型

随着机器学习技术的发展,模型开始在指数增强多头端中扮演更重要角色。在传统线性框架里,不同因子分别被赋予权重,再加总成综合分数。但在真实市场里,因子之间经常存在复杂的条件关系。树模型、随机森林、梯度提升树、神经网络等非线性模型,可以尝试捕捉这些复杂交互。策略的核心也从“人为设定因子权重”,逐渐转向“让模型学习因子与未来收益之间的映射关系”。输入仍然可能是大量弱因子,但模型成为更重要的驱动器。

2.0模式的优势在于,通过处理因子间非线性关系,识别因子之间的交互作用,在高维数据中寻找细微但可重复的统计规律。当具备大量弱因子的条件后,这种非线性的模型框架对于风格轮动较快、个股数量较多、交易结构复杂的市场,能够进一步提升因子组合的绩效,充分挖掘因子的潜力。

不过,模型复杂度提高并不天然等于收益提高。机器学习模型高度依赖数据质量、训练方式和样本外验证。模型很容易在回测中表现漂亮,在实盘中表现普通。对投资者而言,真正重要的不是管理人有没有使用机器学习,而是机器学习是否能够提供助力管理人稳健的超额提升。

2.5模式:特征工程 + 多样模型

当模型的应用达到一定深度后,投研人员发现喂给模型的数据质量在策略表现上的影响越来越突出。2.5模式相对2.0模式最重要的提升就是在大量弱因子的基础上开始叠加深度特征工程。所谓特征工程,可以理解为:不是直接把原始数据扔给模型,而是先根据金融市场的结构特征,对数据进行清洗、转换、组合和表达,让模型更容易识别有效信息,提高输入数据的信噪比。常见的特征工程包括:对极端值进行缩尾处理;对不同量纲的数据标准化;构造滚动窗口指标;以及构造因子之间的交叉特征等。

对于这一模式的管理人来说,能否找到足够精细刻画特征的指标比挖掘一个弱Alpha的因子来说更具意义。而管理人在各类机器学习模型的范式上不断设计和优化模型来形成有效的预测,让模型本身成为策略的子单元。2.5模式的策略不再迷信某一个复杂模型,而是把数据、特征、模型、组合优化和交易执行视为一条完整链条。一个好的指数增强系统,需要在每一环都减少噪声、降低偏差、控制成本。

当然,特征工程越复杂,研究自由度也越高,过拟合风险随之上升。此外特征本身不具备显著的预测能力,而复杂的机器学习模型其内部具有一定的黑盒特征,当模型表现不及预期时,研究人员可能无法准确的判断究竟是什么因素导致了策略效果的波动。归因难度的上升一定程度上也会影响策略模型的迭代效率,进而更考验管理人对模型本身的理解能力。

第三阶段:

纯模型探索——端到端学习

第三阶段可以理解为纯模型或端到端的架构形式。这里的“纯模型”并不是说完全不需要金融理解、风险控制和组合优化,而是说Alpha生成过程尽量减少人工定义因子的中间环节,让模型承担更多从数据到预测、甚至从预测到组合目标的学习任务。

3.0模式:端到端模型

和前几个阶段相比,3.0模式下的端到端模型最大的变化不是“用了更复杂的神经网络”,而是研究范式发生了变化:策略不再主要依赖研究员先定义因子、再让模型给因子加权,而是希望模型从更原始、更高维的数据中,直接学习与投资目标相关的结构。

图2:传统量化框架与端到端框架

打开网易新闻 查看精彩图片

传统量化框架通常是“原始数据—人工因子—模型打分—组合优化—交易执行”。端到端思路则尝试把中间的人工因子定义压缩,让模型直接处理更接近原始形态的数据,例如高频量价序列、订单簿变化、公告文本、新闻资讯、资金流结构、产业链关系、公司之间的图网络,甚至多种数据模态的组合。

端到端的模型看似十分理想,它既能够大幅压缩整个策略的开发流程,又能够借助模型挖掘很多隐藏在原始数据中的各种预测信息,但从实际操作层面它也是最难落地的一类方法。首先,它需要大量高质量数据,对于管理人来说获取并高效的存储利用这些数据本身就是一种工程上的挑战。其次,它需要强大的模型能力和算力支持,在如今模型飞速迭代,算力极为紧缺的环境下,管理人也需要承担更高的开发成本。再次,它的可解释性更低,对风控、模型监控和异常处理提出更高要求,模型迭代优化需要的时间成本与理解难度较其他的模式都更高。因而端到端模式仍是量化管理人在不断的探索与尝试的新范式,最终是否能够有效落地仍需要时间的检验。

从单点能力到系统能力

回顾这几代模式演进,可以看到随着量化管理人的不断探索,对于Alpha的挖掘从单一的突出能力逐步向系统化复合化的系统能力发展。当前主流的量化指增私募管理人,也基本都在采用第二阶段的范式进行策略的开发与落地。

但不可忽视的一点在于数据越丰富,越需要关注数据的质量和独特性;因子越多,越需要管理相关性和拥挤度;模型越复杂,越需要严谨的样本外检验;系统复合度越高,越需要考验多个功能模块之间的耦合能力。不同的模式之间并不存在绝对的全面占优,在不同的市场环境以及不同的研究禀赋内选择最适合的策略架构才是一个优秀管理人应该考虑的方向。而真正成熟的量化策略,不是把模型做得越来越神秘,而是能把复杂技术转化为稳定、可监控、可归因、可迭代的投资流程。这也是投资者面对指数增强策略时最应该关注的地方。

风险提示:本材料中所述内容仅供参考,不代表东方红资产管理的任何意见或建议,东方红资产管理不对任何依赖于本材料任何内容而采取的行为所导致的任何后果承担责任。本材料知识产权归东方红资产管理所有,未经允许请勿转发、转载、截取或完整使用本材料所载内容。