这项由香港科技大学(广州)、浙江大学、中山大学及独立研究员联合开展的研究,以预印本形式于2026年7月30日发布在arXiv平台,编号为arXiv:2607.28410。研究聚焦于一个金融交易领域长期悬而未决的问题:大型语言模型(也就是我们熟悉的ChatGPT这类AI)能否用来执行大额股票交易?
每天股市开盘,无数基金经理面对着一个看似简单却暗藏凶险的问题:手里有一张大额订单,比如要买入或卖出一百万股某支股票,该怎么办?如果一口气全部扔进市场,就像往平静的水塘里扔下一块巨石,价格会立刻剧烈波动,自己的交易反而会造成损失。这种因为自己的买卖行为导致价格变差的现象,在金融界被称为"市场冲击"。
聪明的解法是把大订单拆成一个个小订单,慢慢地、分批地在一段时间内完成交易。但问题随之而来:什么时候多买一点?什么时候少买一点?怎么判断接下来五分钟价格会涨还是跌?这个把大订单拆小、并聪明地安排每笔小交易时机和数量的过程,就是"母单执行"(Parent Order Execution)——它是算法交易领域最核心的问题之一。
现有的解决方案大致分两类。一类是"按规则办事"型,比如最简单的TWAP策略,就是把总量平均分配到每一分钟,不管市场怎么变,雷打不动地均匀交易。还有更复杂的数学模型,比如学界著名的Almgren-Chriss框架,它假设市场冲击遵循某种固定的数学规律。但真实市场并不总是按照数学家的设想运转,规则一旦失效就束手无策。另一类是"让机器学习"型,通过强化学习等技术训练AI来做交易决策,但这类方法需要大量的特定市场数据来训练,换个市场环境或者换个任务设定,整套系统往往要重新来过。
研究团队提出了一个新思路:既然大型语言模型在语言理解、逻辑推理方面展现出强大能力,并且已经被训练了海量的金融、经济相关知识,那么能不能直接让它来做这件事?不需要预设任何市场规律假设,也不需要针对特定任务重新训练,直接在推断时生成决策。这套系统被命名为PACE,中文可以理解为"有计划地控制执行"。
一、大额交易的本质难题:为什么不能一次性全买完
要真正理解这项研究在做什么,需要先在脑海中构建一个具体的场景。假设你是一家基金公司的交易员,今天需要帮客户买入价值五亿元的某支股票,而且要在上午九点半到十一点半这两个小时内完成。
如果你在九点三十分整把这五亿的买单全部挂出去,市场上所有卖家都知道有人要大量购买,他们会立刻把价格抬高。你越急着买,价格就被你自己推得越高,最终你可能花了五亿五千万才买完,凭空多支出了一千万。
这就是为什么大额交易必须"化整为零"。但仅仅"均匀拆分"还不够聪明。假设市场在九点四十分左右会有一波上涨行情,精明的交易员应该在此之前多买一些,在涨价之后少买一些,这样平均下来的成本会更低。问题在于,没有人能准确预测未来,但可以根据当前的价格走势、成交量变化等信号做出比随机猜测更好的判断。
研究团队注意到一个有趣的自然现象:股票价格的波动可以分解成两个层次,就像地球上有洋流(缓慢移动的大趋势)也有海浪(短暂的局部起伏)。从更长的时间维度看,价格在一两个小时内会形成一个相对清晰的涨跌方向;但在每一两分钟这样的短时间尺度上,价格的波动则显得混乱而难以捉摸。
这个洞察成了PACE框架的设计核心。
二、PACE的运作原理:一位"战略家"搭档一位"战术家"
PACE的设计理念可以用一场军事行动来理解。执行一次大型作战任务,需要两个层面的角色协作:负责整体战略部署的参谋长,以及在战场一线随机应变的前线指挥官。
PACE中的"规划者"(Planner)扮演参谋长的角色。在整个交易任务开始之前,它会接收两类信息:一是"母单"的基本信息,包括要买还是卖、买卖多少股、从什么时候开始到什么时候结束;二是过去一段时间(比如过去一小时)的市场历史数据,包括每分钟的股价和成交量。同时,系统还会提供一条TWAP参考曲线,也就是"如果均匀分配应该怎么交易"的基准方案。
规划者要做的事情是:基于这些输入,对整个交易窗口期做出整体的战略判断。具体来说,它把整个交易时间段平均切分成若干个5分钟的"时间槽",然后为每个时间槽打一个分数,分数越高表示这个时间段越值得多交易。同时,规划者还会输出一个"置信度"分数,表示它对这次判断有多大把握。
这个置信度的设计非常精巧:如果规划者觉得市场信号清晰、趋势明确,置信度高,那么最终的交易计划就会较多地偏离均匀分配,向AI认为更好的时机倾斜;如果规划者觉得信号模糊、难以判断,置信度低,那么交易计划就会更接近均匀分配的TWAP基准,稳健地完成任务而不冒险。
规划完成后,整个交易窗口被分成若干个"子计划",每个子计划规定了某5分钟内要完成多少交易量。
"执行者"(Executor)则像是前线指挥官。在每一个具体的交易时刻(每隔一分钟决策一次),执行者同时接收三类信息:最近几分钟的实时市场数据(短期价格和成交量变化),规划者在开始时给出的整体趋势判断,以及当前这个子计划的TWAP基准量(也就是"平均应该交易多少")。
执行者的任务是在TWAP基准量的基础上做微调:如果当前价格对交易有利(比如卖出时价格涨到了一个高点),就多交易一些;如果不利(价格正在下跌),就少交易一些,等待更好的时机。调整的幅度由一个参数控制,确保不会偏离TWAP基准太远。
三、实验设计:如何公平地测试这套系统
研究团队使用了深圳证券交易所的Level-1快照数据,覆盖2026年4月份所有交易日。Level-1数据能提供每个时刻市场上最优的买价(Bid1,愿意出最高价的买家报价)和最优的卖价(Ask1,愿意出最低价的卖家报价),这两个价格的平均值被用作股票的参考价格(中间价)。
每个交易日随机生成10张"母单"进行测试。每张母单的开始时间固定在上午10:30,结束时间则随机选取,可能是10:40、10:50、11:00、11:10、11:20或11:30,因此执行窗口在10分钟到60分钟之间变化。订单方向(买或卖)随机确定,最终51%是买单,49%是卖单。订单数量在100股到10000股之间随机生成,且必须是100的整倍数,平均约5000股。
实验测试了两种下单方式。"激进"模式下,买单直接以市场上卖家的最低价报价,卖单直接以买家的最高价报价,这样可以立即成交,但价格不是最优的。"被动"模式下,买单以买家最高价报价(相当于挂限价单等别人来成交),卖单以卖家最低价报价,这样如果能成交,价格会更好,但存在成交不了的风险。在被动模式中,如果时间快到最后一分钟还有未成交的量,系统会切换成激进模式强制完成交易,这个操作叫"扫单"(sweep)。
为了减少AI随机性带来的干扰,每张母单都会重复运行8次,取平均结果。
参与比较的对手策略包括:最简单的TWAP均匀分配策略;经典的Almgren-Chriss(AC)数学优化策略,通过搜索最优参数κ=0.5来确定前置交易的程度;两种机器学习方法,分别是XGBoost和LSTM,它们被训练用来预测下一分钟价格涨跌方向,然后据此调整交易量。
测试用到的主要指标叫做"价格表现"(bp,单位是基点,1基点等于万分之一)。对于买单,这个指标衡量策略的平均成交价比同期TWAP均价低了多少;对于卖单,衡量高了多少。数值越大越好,正数意味着相比均匀交易节省了成本,负数意味着付出了更高代价。最终汇报的是按交易金额加权的综合指标wbp。
四、实验结果:AI到底赢了多少
在激进模式下,TWAP均匀策略的wbp是-3.28,意思是相比理论最优价格,均匀交易会损失约3.28个基点。AC策略做到了-2.93,比TWAP改善了0.35个基点。XGBoost达到-3.10(改善0.18),LSTM达到-2.91(改善0.37)。
PACE搭载ChatGPT-5.4模型达到了-2.76,改善0.52个基点;搭载DeepSeek-v4-flash模型则达到了-2.26,改善整整1.02个基点,比次优的LSTM还要好0.65个基点。
在被动模式下,各策略绝对值都更大(因为被动策略有成交风险),但相对排名和改善幅度基本一致:PACE(DeepSeek-v4-flash)达到-3.92,改善1.07个基点,比最强基准好0.71个基点。
这0.65到1个基点的提升,放到现实里意味着什么?研究团队做了一个换算:对于一个每年交易规模达到1000亿美元的基金,比TWAP每年多节省约1个基点,折算成真金白银就是大约1亿美元(约7亿人民币)的执行成本节省。即便对小一些的基金,这个数字也是实实在在的。
所有策略都实现了100%的母单完成率,这意味着PACE不是靠"挑容易做的单子"来刷数据,而是在所有情况下都完整执行了任务。
研究团队用5000次自举重采样(bootstrap)检验了这个结论的统计可靠性。DeepSeek-v4-flash在激进模式下的改善幅度,95%置信区间是[0.15, 2.12],p值为0.002,统计上非常显著,不是侥幸。
五、哪些情况下AI优势更大,哪些情况下优势缩小
实验进一步把所有母单按三个维度拆分,分别看PACE对比TWAP的改善幅度。
按交易方向分,买单的改善约为0.35个基点(激进)和0.50个基点(被动),而卖单的改善则高达1.43个基点(激进)和1.42个基点(被动)。卖单表现更好的原因与中国特有的市场制度有关:由于中国市场对卖空(即借入股票做空)存在较严格的限制,负面消息反映在股价里的速度更慢,这意味着卖出订单有更多操作空间,AI的判断也更容易产生价值。
按执行窗口长短分,执行窗口在30分钟以内的短期订单,改善幅度约为1.45到1.57个基点;而执行窗口在30到60分钟的长期订单,改善幅度仅约0.62个基点。道理很直觉:越往远处看,价格走势越难以预测,AI的判断也就越不可靠,贡献自然就小。
按订单量大小分,两个区间(0-5000股和5000-10000股)的改善幅度相差不大,约在0.77到1.16个基点之间。
在市场波动性测试中,研究团队把所有母单按执行窗口内的价格波动率分成高低两组。对比机器学习方法(XGBoost和LSTM),PACE在两组中都表现更好。这说明PACE对价格噪声有更强的抵抗力,把长期规划和短期执行分开来做,确实有助于减少局部价格噪声的干扰。
六、拆解PACE的每一块零件,看看哪个最重要
为了验证PACE各个模块的贡献,研究团队做了消融实验,也就是"拆掉某个部件,看性能如何变化"。
完整的PACE(DeepSeek-v4-flash,激进模式)wbp为-2.26。去掉规划者,只保留执行者后,wbp变为-2.88,性能下降了0.62个基点。去掉执行者,只保留规划者,wbp变为-2.62,性能下降0.36个基点。两者都去掉就等于TWAP,wbp为-3.28,是最差的。
换句话说,规划者和执行者都有独立价值,不可或缺,去掉任何一个都会造成明显性能损失。规划者的贡献在这个设定下更大,但执行者也提供了不可忽视的额外增益。
研究团队还测试了两种提示词变体:一种去掉了"方向性指导"(例如"买单希望价格更低"这类说明),另一种去掉了名词解释(例如Ask1、Bid1、TWAP的含义)。两种变体仍然比TWAP好,说明AI的基础交易知识本身已经足够有用,但完整的提示词仍能进一步提升表现。
七、AI会思考多远的未来?规划复盘实验
默认设置中,规划者在整个母单开始时只做一次规划,之后不再更新。研究团队测试了一种"动态复盘"变体:每完成一个子计划,规划者就根据最新市场数据重新规划剩余部分,相当于每5分钟更新一次战略。
结果出乎意料地呈现出两极分化:对于执行窗口在10-40分钟之间的短期母单,动态复盘使wbp从-1.99变差到-2.50;对于执行窗口在50-60分钟的长期母单,动态复盘则使wbp从-2.78改善到-2.48。
这个结论很有启发性:对于短期订单,一次性规划就足够了,频繁修改反而会打乱节奏、引入噪声;对于长期订单,由于未来太远、一次性规划难以准确,动态更新反而能更好地随市场变化调整。
八、推断成本:性价比如何
这项研究还核算了使用AI的经济账。在整个测试数据集中,共有1680张母单,总交易额约合3560万美元。DeepSeek-v4-flash方案的总API调用费用仅约30美元,换来的是约1个基点的改善,对应约3560美元的执行成本节省。也就是说,每投入1美元的AI计算成本,节省了超过100美元的交易成本,性价比相当高。
九、AI的行为心理学:它和人类交易员有何不同
这项研究最有趣的部分之一,是对AI决策行为的深入分析,揭示出若干与人类投资者截然相反的特征。
首先,研究考察了规划者每次输出是否稳定。对同一张母单反复调用8次,每次的价格走势评分是否会差异很大?用KL散度这个"衡量两个分布差异程度"的指标来看,三种模型设定(ChatGPT-5.4、DeepSeek-v4-flash低推理、DeepSeek-v4-flash高推理)的跨次散度都很低,说明规划者对同一份市场数据的判断相当稳定,不会随机乱飘。
其次,研究考察了置信度与分配集中度的关系。对同一张母单,当某次调用输出的置信度高于平均水平时,其对应的交易量分配是否也更集中在少数几个时间槽上?答案是肯定的,三种模型都呈现出正相关,高置信度意味着更集中的下注。这与人类投资者的过度自信现象有相似之处——人类越有信心,往往越把钱集中押在少数资产上。
然而,关键差异在于置信度与实际表现的关系。对人类投资者,大量研究表明过度自信往往导致更差的投资回报(1999年Terrence Odean的经典研究就记录了这一现象)。但PACE的分析显示,AI的高置信度与更好的实际交易表现呈现出统计上显著的正相关,无论是否加入控制变量都成立。这意味着,当AI"觉得自己看准了",它确实更有可能是对的,而不是盲目自信。
在执行者的行为分析上,研究团队考察了时间压力如何影响AI的决策。当子计划快到结束时间(时间压力高),执行者倾向于减少当前的交易量;当时间还很充裕(时间压力低),执行者反而会多交易一些。这与人类的"拖延"心理恰恰相反——人类往往在截止日期临近时才加速,但AI提前布局、避免在最后时刻被迫以不利价格完成任务。
还有一个有趣的发现:两款AI模型的决策机制有所不同。ChatGPT-5.4的执行决策部分遵循了"近期趋势延续"逻辑,比如价格最近涨了就多买、跌了就少买。但DeepSeek-v4-flash的决策则无法用简单的趋势追踪或均值回归来解释,它有某种更复杂的市场推理在起作用。由于去掉规划者的DeepSeek-v4-flash版本仍然优于TWAP,说明这些"无法用简单规律解释"的决策确实带来了真实的性能增益,而不是噪声。
十、一张订单的完整旅程:具体案例解读
论文中展示了一个直观的案例。有一张卖单,需要在10:30到11:20之间卖出9000股某支股票。规划者看完9:40到10:30的历史数据后,判断下行趋势将持续,因此给前面几个时间槽打了更高的分数(1, 0.5, 0.5, 0, 0, -0.5, -0.5, -1, -1, -1),也就是说前期多卖、后期少卖,整体方案前置了大量交易量。从事后复盘看,股价在母单执行期间确实持续下跌,前置交易的策略帮助以更高的价格卖出了更多股票。
在具体执行层面,有一段10:50到10:54的子计划,TWAP基准是每分钟200股。执行者在价格相对高点(10:51、10:52)把交易量增加到了300股,在价格开始下跌后(10:53、10:54)把交易量减少到了100股。结果是以高于TWAP基准的平均价格完成了这段子计划。
说到底,这项由香港科技大学(广州)等机构开展的研究,用严谨的实验证明了一件事:大型语言模型不仅能做那种"你要不要买这支股票"的宏观判断,也能在微秒与分钟之间的执行层面发挥真实价值。更令人回味的是那几个行为分析发现——AI不会因为自信而失控,不会因为时间紧迫而慌乱,不会被最近一两分钟的价格波动牵着鼻子走。这些与人类投资者的系统性偏差恰好互补,或许真的意味着AI不是要替代交易员,而是弥补他们最容易犯错的那几个地方。感兴趣的读者可通过arXiv编号2607.28410查阅原始论文。
Q&A
Q1:PACE框架的核心创新点是什么?
A:PACE的核心创新在于把母单执行拆分为两个层次:规划者负责分析整体趋势并分配长周期的交易量,执行者则在每分钟根据实时行情微调具体数量。整个系统不需要预设任何市场运作假设,也不需要针对特定任务重新训练模型,直接调用大型语言模型的已有知识在推理时生成决策,兼顾了传统策略的稳健性和AI的适应性。
Q2:PACE比TWAP好多少,实际上能省多少钱?
A:在深圳证券交易所的测试数据中,PACE(DeepSeek-v4-flash)在激进下单模式下比TWAP均匀策略好约1.02个基点,在被动模式下好约1.07个基点。对一个每年交易规模达1000亿美元的基金,这意味着每年可以节省约1亿美元的执行成本。测试期间,整个实验的AI调用费用仅约30美元,性价比极高。
Q3:AI置信度高的时候交易表现真的更好吗?
A:是的,研究通过回归分析发现,规划者的置信度与实际价格表现呈统计上显著的正相关关系,在加入订单方向、数量、执行窗口和波动率等控制变量后仍然成立。这与人类投资者的过度自信现象不同,人类越自信往往结果越差,但AI的高置信度确实对应了更准确的市场判断,是"有凭据的自信"而非盲目乐观。
热门跟贴