Py学习  »  机器学习算法

HRT AI 负责人:深度学习如何扩展到整个市场

狄奥尼索斯之歌 • 1 周前 • 86 次点击  

 

演讲来源:ICML 2026 Expo Talk
演讲者:Iain Dunning,Hudson River Trading AI 负责人
原视频:https://icml.cc/virtual/2026/75721

Iain Dunning 是 Hudson River Trading(HRT)的 AI 负责人,负责由研究员与工程师组成的 HRT AI Labs。HRT 是全球大型自动化自营交易与做市机构之一,其深度学习系统已在生产环境运行十余年。Iain 在这场 ICML 演讲中把公司的核心研究方向概括为:为市场数据这一独特模态建立“基础模型”,让模型从原始报价、撤单和成交事件中学习市场结构。

这场演讲主要讨论 HRT 如何将 Scaling 和 Foundation Model 的方法应用到金融市场:市场事件能否像语言 Token 一样被建模,金融数据的规模是否足以支撑大型模型,超长上下文和跨资产依赖为什么难以处理,以及交易中速度与模型智能应如何权衡。Iain 还进一步讨论了合成市场数据、跨市场联合建模和 LLM 融合等研究方向,试图回答一个更基础的问题:如果把市场本身视为一种可学习的数据模态,金融模型究竟可以扩展到多大规模。

TL;DR:Iain Dunning 的核心观点

  1. 1. HRT 已经在生产中构建市场基础模型。团队减少对传统手工特征的依赖,把报价、撤单、成交和精细时间等原始市场事件直接交给深度学习;这套路线已经在真实交易中运行十余年。
  2. 2. 市场基础模型的核心约束是预测期限。 韩国市场近期每天约产生 3 亿条事件,全球数据可能达到 10 万亿—100 万亿事件;但预测期限越长,真正独立的训练标签越少,因此短周期可以使用复杂深度模型,30 天级别任务仍可能更适合线性回归。
  3. 3. 市场模型的核心难题在于长上下文与跨资产共同演化。 预测 Nvidia 不能只看 Nvidia,还要同步处理 Nasdaq 期货、Broadcom、Micron 等相关资产的实时事件流。它们持续变化、彼此影响,因此静态 RAG 无法自然解决这个问题。
  4. 4. 交易的核心约束是“速度—智能”帕累托前沿。 并非所有策略都必须达到纳秒级;关键是在不同延迟层级上获得足够强的判断能力。这要求模型与硬件协同设计,并探索异构推理系统。
  5. 5. 合成数据和 LLM 融合仍是两个开放问题。 合成市场必须同时保持跨资产一致性、厚尾事件和长 Rollout 稳定性;而通用 LLM 又存在严重的 Point-in-time 污染,不能直接拿最新模型回测过去。
  6. 6. LLM 已经能显著加速量化研究,但还不能自主完成真正的新研究。 HRT 已经尝试自动研究流程,目前模型写代码很好,却仍无法稳定提出新颖想法并通过严格的样本外验证。与此同时,深度学习正在从最短预测期限逐步向更长周期扩张,但传统模型短期内不会消失。

演讲精编

HRT 正在构建市场基础模型

今天的演讲题目是“扩展金融市场中的深度学习”。我是 Iain Dunning,在 Hudson River Trading 负责 AI。今天我想让大家稍微看看我们的世界和我们面对的问题,也希望你们听完以后继续提问。

“Hudson River Trading 是什么?”这些年我的答案一直在变。到了 2026 年,显而易见的回答是:它是一家“NeoLab”——先把 AI 用到市场,再把 AI 用到其他一切事情上。

认真地说,我们是一家 AI 交易公司。这里的意思是,我们相信人工智能在交易这个特定领域可以比人聪明得多,并用这种能力全天候运行遍布全球的交易业务。HRT 已经存在很多年,员工数量也不算少。一个可能超出很多人预期的事实是:粗略估计,全球 10%—20% 的交易都由我们的 AI 系统完成。

HRT 的业务规模与全球交易覆盖
HRT 的业务规模与全球交易覆盖

我常常和美国西海岸的人谈交易 AI。他们会说:“如果有人把 AI 用到市场,不是很有意思吗?”我的回答是:“那确实会很有意思。”

我带领的团队叫 HRT AI Labs,由研究员和工程师组成。我们对自身工作的描述这些年也在变化,尽管工作本身未必变了那么多。现在我喜欢把它表述为:我们正在构建市场的基础模型。

每一种模态都有人想做基础模型,市场数据也只是一种模态。如果我们能把基础模型、大数据和大算力的理念真正结合起来,得到一个理解市场的基础模型,会是一件非常了不起的事。这不是某个未来才能实现的抽象基础研究项目;我们现在已经有了某种版本,而且每天都在继续推进。我们已经让深度学习在生产中运行了十年。说我们 2014 年就在做基础模型也许有些夸张,但谁知道呢?

HRT AI Labs 与市场基础模型
HRT AI Labs 与市场基础模型

今天我想从较高层次说明我们在做什么:让大家熟悉“市场数据是一种模态”的想法,解释为什么交易市场是一个可以使用类似 LLM 思路的环境,同时指出这种模态特有的困难。这只是开启讨论,因为四十分钟不可能讲完所有内容。

演讲内容:市场数据、模型规模与独特挑战
演讲内容:市场数据、模型规模与独特挑战

从手工特征到原始市场事件

谈到市场时,我经常感到人们连“市场是什么”都存在误解。有人把市场想成一个零和、敌对的游戏,每个人都只想智胜对手。看到会场里穿 Jump Trading T 恤的人,我确实也会产生一点这种感觉。但真实市场其实很酷:它只是一个把买方和卖方聚集起来的地方。

在古代——也就是几百年前的纽约——人们在 Buttonwood Tree 下见面,纽约证券交易所由此起步。没有手机即时联系所有人的年代,想买卖股票,就得约定工作日上午十点集合;所有想交易的人来到同一地点,寻找对手方并完成交易。现代电子市场当然做得更好,但其中的细节很重要。

市场连接买方与卖方并完成价格发现
市场连接买方与卖方并完成价格发现

人们进入市场,是因为有某个经济目标要完成。他们并非只是为了狙击别人、证明自己在价格判断上更聪明。我自己会买 ETF——准确说,我从来不卖,只买,因为我很无聊,也不喜欢在个人账户里交易。我只是想用货币换取宽基股票敞口,价格合理、滑点和价差尽量小。既然现在身处韩国,这可能有点逆叙事:我并不打算三倍做多 SK Hynix。当然,也有人正是想做这件事,或想买标普 500。不同参与者来到市场,有不同目的。

每天只在上午十点于树下见面很受限制。还可以怎么改进?我可以提前宣布:某个价格愿意买多少股,另一个价格愿意买多少股;价格合适时,我也愿意卖。这样就解锁了一个重要功能:如果我上午十点想买、你下午三点想卖,我们本来会错过几个小时;但做市商可以分别站在两笔交易的另一边,跨时间完成中介,并赚取不到一美分的价差。

市场还有价格发现功能。假如我真的想三倍做多 SK Hynix,我需要一个可信的参考价格。市场通过参与者不断交易,逐渐发现资产的公允价格。人们可以据此完成对冲等有经济用途的事情,也可以做一些更“堕落”的事情。

往下看一层,市场常被描述成限价订单簿。概念很简单:在任何时点,都可以看到当天尚未成交的买单和卖单。举一个简化例子,订单簿里有四笔卖单和四笔买单,每笔都有价格和数量。最佳卖价是 102 美元,最佳买价是 100 美元;如果两边重叠,订单就已经成交了。

限价订单簿示意图
限价订单簿示意图

顶层买盘可能是 100 美元买 10 股,顶层卖盘可能是 102 美元卖 20 股。十年前的传统量化研究会仔细看这个订单簿,然后手工构造特征。比如:最佳档位上愿意卖的数量多于愿意买的数量,这是否意味着价格应更靠近 102 美元,还是反而应该离它更远?研究员会继续考虑其他档位,再设计出某种特征。

但这不太符合深度学习的精神。多年前计算机视觉给我们的教训是:别再迷恋那些小小的手工特征,把整批数据交给卷积网络,让它自己学会所有特征以及更多东西。既然如此,为什么市场不能这样做?既然能用真实数据,为什么还要依赖人工特征?

为了延续与 LLM 的类比,我喜欢把市场看成事件流。市场是多智能体环境,数据流里的每一条事件都是某个参与者的动作。我们不知道这些智能体共有多少,也不了解其中大多数是谁。一个可能是 Jump,一个可能是 HRT,一个可能是 Citadel;其余许多只是普通散户、加州教师退休基金,或像我这样买宽基 ETF 的人。大家都在这场游戏里,并通过有限的动作集合表达自己的观点。

想象时间从上往下流动:有人说,愿意以 100 美元买 20 股;另一个人说,愿意以 102 美元卖 10 股;第三个人愿意以 103 美元卖 20 股。随后有人来到市场,对第一位买家说:“我接受你的报价。”他卖出 10 股,双方在 100 美元成交。

市场的基本动作空间就是这些:向订单簿增加委托、删除委托、修改委托,或主动与静态委托成交。真实市场当然复杂得多,各市场也非常多样。有些开盘时举行集合竞价,有些收盘时举行,还有些盘中也有集合竞价。加密市场有资金费率,数据流会广播市场净头寸、与标的价格的偏离,以及保证金需要支付的费用。另一些市场有涨跌停机制,限制某段时间内价格变化幅度,并向市场发布价格带。所有这些丰富信息,都是我们构建大型市场模型的原料。

原始市场事件流与基本动作
原始市场事件流与基本动作

接下来继续折磨这个类比:把市场事件看成一种类似语言的模态。一条市场事件究竟比一个词或 Token 更丰富,还是更贫乏?

先看一句话的 Token 化。通常一个词和一个标点各占一个 Token,像 LLM 这样的缩写可能被切成多个 Token。我相信幻灯片用的是 GPT-5 tokenizer。现在考虑一条市场事件需要多少 Token 才能编码。

支持“市场事件更丰富”的论点是,一条简单的新增委托其实像一个动词,后面跟着许多名词和形容词。首先,它是“新增”;然后要说明方向,是买入;再说明价格,比如 100.02 美元;还要说明数量和订单应在簿上保留多久。一条市场事件可能至少相当于五个文本 Token。照这种算法,1 万亿条市场事件就等于 5 万亿 Token,可以继续计算 Chinchilla 最优模型应有多大。

市场事件与文本 Token 的信息量比较
市场事件与文本 Token 的信息量比较

但这个论证也可能站不住脚。很多市场事件在字节层面包含多个字段,却未必有多少真正的信息增量。自然语言句子中的多数词都有相当强的语义,而市场里充满噪声和反复变动。不能说某些事件绝对没有信息,但它们的信息含量可能非常低。

一种刻板印象是,散户交易者近似随机游走:一只股票某天的买卖人数大致相当,因此一笔散户交易也许完全不能告诉你这个标的未来如何变化。一个简单做市策略同时在当前价格附近挂双边报价,也可能没有泄露任何方向性信号;它只是重复已经存在的信息。

我个人仍然偏向认为,市场事件比普通 Token 丰富,当然我承认自己对这个模态有偏爱。另一个必须纳入思想实验的因素是时间。

文本 Token 通常有位置编码,但并不存在一个与 Token embedding 正交、连续而精确的物理时间轴。文档中的位置只是不断增加的索引,用 RoPE——或者 NoPE,真没想到这也能成为一种方法——处理就能完成很多任务。市场却有很强的时间性和时效性。事件时间精度很高、到达过程高度非泊松:很多事情会在同一瞬间爆发,随后又出现大片空白。如果模型没有在表征阶段处理时间,只想以后像位置编码一样补上,可能已经漏掉了重要信息。若把时间本身视为事件的一部分,每条市场事件就更丰富了。

低信息量市场事件与时间维度的重要性
低信息量市场事件与时间维度的重要性

从数据规模到模型规模

既然我们在韩国,我用韩国市场做一个具体例子。我发现很多韩语词会被罗马字母转写,反过来也一样。幻灯片上的“시장 데이터”应该就是“市场数据”。KRX 大约有 2,500 家上市公司;Claude 看过我们的代码库后告诉我,可交易标的大约有 7,000 多个。尤其在最近几个月,韩国市场每天大约产生 3 亿条数据流事件。

再具体一点,6 月 23 日这一天,Samsung 和 SK Hynix 各自产生了约 400 万条事件,而连续交易时间只有大约六小时。按 LLM 预训练语料的标准,这已经是一篇极长的“文档”;很少有预训练文档能达到这种长度。即使你不同意“一条事件等于多少 Token”的计算,单个标的一天 400 万事件也要求系统能处理超长序列。

韩国股票市场每天约产生 3 亿条事件
韩国股票市场每天约产生 3 亿条事件

韩国数据流主要有两类事件。第一类是订单簿状态更新,表示簿上的一个或多个委托发生了变化,可以进一步拆成单笔更新;第二类是成交事件。平均每条事件大约包含 10 字节信息。值得注意的是,大多数事件并不是成交,而是参与者改变买卖报价或静态委托。

韩国市场事件的类型与数据构成
韩国市场事件的类型与数据构成

非交易人士想到市场,往往先想到“成交”,因为他们自己进入市场时就是去交易。但真实市场更像一场参与者不断前后移动的舞蹈:每个人通过更新订单簿上的报价表达自己对价格的看法。报价更新事实上主导了数据流。

事件到达又具有很强的突发性。Samsung 在某个交易日开盘后的前 60 秒,产生了约 4.4 万条事件。设计模型时,必须思考什么样的体系才能跟上这种瞬时洪峰。幻灯片上的图是 Opus 4.8 生成的漂亮可视化。我假定它是真的,不过在 AI 时代谁又说得准?至少底层来源确实是真实市场数据。

Samsung 开盘一分钟内的市场事件突发分布
Samsung 开盘一分钟内的市场事件突发分布

再做一次信封背面的计算:每天 3 亿条事件,乘以每年约 250 个交易日,等于每年 750 亿条。考虑活动量随时间增长,十年历史轻松得到约 5,000 亿条事件。这已经与 GPT-3 的约 5,000 亿 Token 语料相当——而 GPT-3 实际训练只走完了其中前约 3,000 亿 Token。Llama 3 后来使用约 15 万亿 Token。

韩国股票市场十年约积累 5000 亿条事件
韩国股票市场十年约积累 5000 亿条事件

这里只计算韩国股票。如果加上韩国期货、期权以及其他交易所,再乘上你认为合理的“每事件 Token 数”,最后扩展到全球市场,规模会迅速增加。Nvidia 每天产生的事件大约是 Samsung 的十倍。由此会发现,我们拥有一个非常可观的数据集。

全球市场事件规模与 LLM 训练数据比较
全球市场事件规模与 LLM 训练数据比较

暂时换一个方向,谈谈 HRT 最终要用这些数据做什么。把复杂性全部略去,一个很简单的描述是:我们判断股票会上涨还是下跌;认为会上涨就买,认为会下跌就卖。这在实践中相当有效。

更细一点,可以分成两类。第一类是 Taker、移除流动性,或者用更漂亮的说法叫参与价格发现:如果大型市场模型判断股票价格将上涨,就买入;判断将下跌,就卖出。第二类是 Maker、增加流动性或做市:如果你对某个标的的公允价格有良好估计,就可以在它两边报价,声明愿意在什么价格买、什么价格卖。

价格预测、流动性移除与做市
价格预测、流动性移除与做市

提到这些,是因为我们的目标终究是预测未来,而不只是做出一大团关于市场的神经网络。

我年轻时学过一条拟合线性模型的经验法则:线性回归每增加一个参数,最好有十个数据点支持。后来一段时间,这种说法看起来很古老;进入 LLM 时代,我们又开始讨论每个参数对应多少 Token。Chinchilla 最优大约是每个参数二十个 Token,所以“十个数据点对应一个参数”又不算太离谱。

但市场预测还多了一个维度:期限。假设要预测一分钟后的股价,这属于偏高频的交易期限。模型能有多大,应与这个一分钟任务中独立数据点的数量相称。

一年大约有  个一分钟区间。再乘以标的数量、训练历史年份等因素,就会得到  到  个一分钟预测区间。如果用线性回归,数据量也许足以支撑约  个参数;既然如此,也可以考虑深度学习。

预测期限与独立样本数量
预测期限与独立样本数量

从事件—Token 类比出发,我们拥有的数据可能达到 10 万亿至 100 万亿条事件。按照常见 Scaling Law,每家量化公司似乎都应该竞相构建终极的万亿参数大型市场模型。如果你坚持线性回归,也会从“每个参数需要若干独立预测期限”的逻辑得到类似结论:这批数据也许能够支持数千亿乃至一万亿参数。两条推导最终指向同一件事,也解释了为什么交易公司会拥有那么多 GPU。你也可以拿这套信封背面数学去给朋友留下印象。

从事件规模和预测期限估算可行模型参数
从事件规模和预测期限估算可行模型参数

市场模型的上下文与横截面依赖

下面转向真正解决问题时需要面对的事情。这一部分我只给思想实验,不交出知识产权。

LLM 有上下文问题。预训练常在较短上下文完成,之后再通过中期训练或持续预训练延长上下文。上下文很昂贵,因为 Transformer 以及几乎所有处理方法的成本都随输入长度增加。

十年前、在 LLM 流行以前,我不会想到语言模型用相对短的上下文就能完成那么多任务。现实中,32K 上下文已经覆盖很大一部分有用场景。但 32K 对市场够吗?

传统时间序列建模还有一条经验:若要预测未来  秒,至少应回看过去  秒,最好是  秒。这可以看作 ARIMA 一类时间序列思路的延伸,并非非常激进的主张。Nvidia 在高峰时每秒可产生数千条事件。如果要预测十分钟后的 Nvidia,合理做法似乎是至少记住过去二十分钟活动,这会超过 100 万条事件,已经大于几乎所有现成模型的上下文。

预测期限决定需要记忆的市场上下文
预测期限决定需要记忆的市场上下文

即便 100 万事件的问题有办法解决,市场模态还有一个更棘手、近乎独有的性质:横截面性。金融标的从不孤立,彼此存在相关和更深的互动。我们也不想退回“计算相关系数”的手工特征工程,而是希望直接处理原始底层事件。

我心中的柏拉图式理想模型,会同时听取全世界每一个标的上的每一条事件。但即使你能设计出模型,也很难造出一台计算机完成这种工作。

只看 Nvidia,就需要同时接收经微波链路传来的 CME Nasdaq 期货、Broadcom 股票和 Micron 股票,因为它们都与 Nvidia 高度相关。若要对 Nvidia 的未来价格做出最好预测,还可能需要听取更多标的。把所有事件塞进线性上下文,任何合理长度都会被撑爆。

预测 Nvidia 时需要处理的横截面市场事件
预测 Nvidia 时需要处理的横截面市场事件

LLM 世界遇到上下文过大时会想到 RAG——虽然到了 2026 年,我感觉 RAG 已经很“2024”了,MCP 则很“2025”。不知道会场里还有多少 RAG 海报;如果你正好带着一张,先向你道歉。你当然可以先压缩其他股票的信息,做 embedding,再把结果传给模型。但这并不能真正解决问题:这些不是可以离线索引、静态引用的文档;所有标的都在持续变化,模型要同时预测它们,它们也在共同演化。必须直接正面处理这种动态性。

从响应速度到异构推理

我们为什么会害怕超长上下文?归根结底是因为它慢。若有一台魔法计算机能提供无限内存,也许问题就容易了,但交易必须快速决策。

很多与我讨论 AI 交易的人存在一个误解:以为一切都必须在纳秒内完成。这不是真的,因为纳秒里本来就做不了多少事情。只要你在自己的响应时间层级上是最聪明的参与者之一,就可以有竞争力。

纳秒里不能跑 100 万上下文的 Transformer,只能做有限计算。到了微秒,就有更多工具可用:自研芯片、FPGA、把 CPU 超频到尖叫。还不能运行最神奇的深度学习模型,但只要愿意投入工程努力,可以做出不少事情。

给我一毫秒,就能做近乎魔法的计算——严格说不是我本人,我感觉自己已经没那么擅长计算机了,但我的团队很聪明。再给更多时间,几乎任何需要的东西都可以算出来。因而响应时间与“智能”之间形成一条帕累托前沿:只要你在某个时延位置足够聪明,就能找到有效的交易空间。之后再努力向左移动,在保持判断质量的同时把响应做得越来越快。市场不是“纳秒交易者或者什么都不是”的二元世界;同一家公司可以同时分布在多个速度层级,最好的公司确实如此。

速度与智能之间的 Pareto 前沿
速度与智能之间的 Pareto 前沿

这些约束直接影响模型设计。我们需要记住非常多信息。可以下采样,也可以做特征工程,但那违背深度学习“尽量把一切交给模型”的精神;一旦开始人工压缩,必然丢失信息。

Attention 已经能够扩展到 100 万 Token,但在这种约束下还能否快速推理?也许可以借助技巧,却绝不是小问题,训练同样会非常慢。

也可以使用循环神经网络。这里的“循环”包括从 GRU 到 Mamba 的整个谱系,它们可以用近似  的更新成本维护状态,理论上拥有无限上下文。但它们的效果通常更差;LLM 没有全面使用纯状态空间模型是有原因的。现在虽然出现混合模型,它们仍可能因为并行效率等问题训练更慢。HRT 到底采用什么方案?我们采用很多方案,但具体不说。

大型市场模型在上下文、Attention 与循环结构之间的取舍
大型市场模型在上下文、Attention 与循环结构之间的取舍

LLM 领域有一些值得类比的推理架构。一个例子是 speculative decoding:一个小型 draft model 快速向前生成 Token,后面的大模型再验证候选。这与交易很相像——先尽快给出一个合理响应,稍后用更慢、更聪明的系统跟上。它不会逐字照搬到市场,但很好地说明了思路。

市场模型与大模型推理架构的类比
市场模型与大模型推理架构的类比

另一个更前沿的例子是:用吞吐量很高的 GPU 完成 prefill,处理庞大上下文并计算 KV cache;再把状态传给 Groq LPU、Etched ASIC 或其他专用硬件,快速执行迭代生成。也就是让合适的工具完成慢而重的计算,再让合适的工具完成快速响应。要做到这一点,必须拥有复杂的异构系统。

Speculative Decoding 与 GPU 到 ASIC 的异构推理
Speculative Decoding 与 GPU 到 ASIC 的异构推理

这几张图本身也是 AI 生成的。左边是我认真提示 ChatGPT 5.5 Pro 做出来的,我觉得还不错;右边那张说实话有点“slop”,只是想表达 GPU prefill 后把状态交给 ASIC 或 LPU。后面还有 Gemini 生成的另一版图,我觉得更差一些,不过其中那个小 ASIC 倒是画得挺好。它们只是同一思路的不同画法。

LLM 推理吞吐与异构计算示意图
LLM 推理吞吐与异构计算示意图

交易世界过去很孤立,但我职业生涯中很有意思的一件事,是看着外部 AI 研究与交易需求不断跳着舞:交易行业早就在意的问题会在外部世界时而流行、时而退潮。现在 LLM 世界高度重视“每秒产生尽可能多的智能”,这恰好也是市场模型的核心问题。

合成市场数据的难题

另一个多年来一直吸引我们的思想实验是:合成市场数据应该是什么样?很多实习生都和我们研究过这个问题,我们可能还写过博客。过去它只是一个有趣问题;随着合成数据成为 LLM 训练的一阶因素,它越来越现实。

最近两个开放模型的技术报告可以说明变化。Nvidia Nemotron 的预训练语料里有很大部分是经过质量过滤的合成网页爬取数据;Arcee Trinity Large 的 17 万亿 Token 数据集中,超过 8 万亿 Token 是 DatologyAI 生成的合成网页、代码和 STEM 数据。

开放 LLM 训练中的合成数据规模
开放 LLM 训练中的合成数据规模

我过去觉得这有些愚蠢和循环,仿佛免费午餐。让合成数据真正改善训练仍有很多困难,但现在很清楚,它已经进入 LLM 配方。大型市场模型是否也要生成合成数据?我不知道,但我们会想办法。

第一,单一标的和横截面之间存在巨大差别。合成文本时,可以生成一篇独立的高质量文档;合成市场数据若只生成一个标的,几乎没有用。有效训练数据必须同时生成许多相关标的的事件流,而且彼此一致、自洽。这会立刻把问题复杂度推高。

第二,存在 Bootstrap 问题。开放模型常让一个更昂贵、更强的 LLM 生成数据,再用它训练较小模型。但如果我们已经拥有市场上最好的模型,就没有另一个更昂贵的现成市场模型来当老师。如何生成足够高质量的数据?这会不会与直接训练强模型一样难?也许有办法绕开,但值得认真思考。值得一提的是,Arcee 的报告没有依赖更强模型来取得结果,这一点很难得。

第三,市场数据呈厚尾分布:大多数时间很无聊,直到突然不无聊。一个生成器产生 100 条合成轨迹时,我们怎样知道它做对了?LLM 数据清洗在很大程度上依赖人眼查看;市场事件即使能看,人脑也未必能解释,更难判断是否保留了真正重要的极端结构。

第四,长 Rollout 可能累积误差。Yann LeCun 曾用一张很有名的幻灯片批评语言模型:每次生成下一个 Token 都有一点随机出错的概率,滚动生成  个 Token 后,误差会不断积累,最后整个序列发疯。后来我们发现,LLM 的长输出并不必然这样崩溃,似乎存在一定自我修正。但这些解释能否适用于市场生成,没有答案。

最后的检验当然是:合成数据对训练到底有没有用。Oxford 有一个很酷的学术项目 sigma0,把类似思路用于订单流市场数据,值得关注。

合成市场数据面对的四项难题
合成市场数据面对的四项难题

LLM 如何进入市场模型?

到这里我一直刻意没有谈“用 LLM 做市场”。我想纠正另一个误解:仅凭市场数据,就已经可以在市场里做很多事情。

Twitter 塑造了一种市场印象,仿佛市场只是对新闻标题快速反应,竞争看谁先读到消息。这确实存在,但它严重低估了市场自身的信息量。所有参与者行动汇总而成的那场舞蹈,本身就是一个极丰富的信息源。多数自营量化公司的自动化策略,主要处理的正是这些数据。

但自然语言当然也包含大量信息,有些交易如果不接触市场外部信息就不成立。所以在大型市场模型已经面对的全部难题之上,还要再加入语言。

LLM 与多资产市场数据融合
LLM 与多资产市场数据融合

这里有几条研究路径。HRT 明天不可能突然训练出一个与最好开放模型并肩的万亿参数 LLM;不是我们不够聪明,而是经济上不明智。因此,可以考虑复用现有模型。

问题在于,所有人都希望开放模型拥有尽可能新的知识截止日期,因为这样日常用途最大。量化金融却要做 Point-in-time 回测:只使用历史某一时点当时可获得的信息训练模型,再检查它在之后的表现。一个知识截止到 2025 年末的模型,不可能直接拿去做更早年份的干净回测。

能否从较老模型出发,再用市场数据进行后训练,让它追上当代能力?如何摆脱这种两难?这是一个很好的研究问题,我们也在取得进展。

此外,还可以问:应把市场数据作为新模态加入 LLM,还是把语言作为新模态加入大型市场模型(LMM)?或者干脆从头联合预训练一个多模态的语言模型加市场模型?

LLM 融合中的 Point-in-time 与模态选择
LLM 融合中的 Point-in-time 与模态选择

一篇《Training Language Models via Neural Cellular Automata》论文给了我另一个启发。它先用神经元胞自动机规则生成结构化数据,对语言模型做 pre-pre-training,再进入语言训练。这相当于先加入“生命游戏”一类非语言模态。既然模型喜欢学习数据里的结构,为什么不把市场数据也直接倒进预训练这锅汤里,看看会发生什么?或许只需要购买非常多 GPU 来做这个实验。

先解决市场,再解决其他一切

当前 AI 的时代精神仍然非常相信 Scaling。过去大家扩展预训练,现在则扩展 RL 环境,但核心仍是规模。量化交易同样高度依赖 Scaling,前面的信封计算就是证据。

HRT 拥有大量 GPU,也有自研硬件团队。把二者结合,就能训练更强的模型;模型产生更多收益,再把收益投入更多 GPU,形成继续扩展的循环。我们在挪威矿井里还有一座数据中心,网上有视频可以看到。

“扩展金融市场中的深度学习”与一般意义上的扩展深度学习很相似,只是模态不同。你在 LLM 中知道的许多概念,都可能在市场中找到类比。这既让问题有趣,也让人跃跃欲试:答案不会相同,但思考过程相通。可以从 LLM 获取灵感,却不能盲目照搬,仍然必须自己解决市场特有的问题。

既然大家都喜欢说一些超级宏大的话,那我就说:先解决市场,再解决其他一切。

HRT AI Labs 的模型、算力与收益扩展循环
HRT AI Labs 的模型、算力与收益扩展循环

Q&A

听众:谢谢你的演讲。现在很多人不仅相信模型规模扩展,也在扩展“研究”本身。刚才 Google 有一场关于递归自我改进的演讲,一些前沿实验室似乎也在押注这个方向。HRT 是否在思考或尝试它?如果尚未成功,哪些限制仍需要人的判断和 Human-in-the-loop?

Iain: 这是一个完美的问题,因为我现在几乎每周都会讨论它。

今天 HRT 的每个人都在“Token maxing”——不是为了表演,而是因为他们真的想加速工作。但我们的共识是:目前基本不可能让 LLM 完成有用研究,也就是提出新颖想法,再运行有意义的自动研究流程。我们拥有尝试所需的一切,也确实试过,但能力还没有到那里。

这并不让我意外,我也不知道它能否说明一两年后的情况。我不会断言这种能力永远不会出现。

观察我们这届实习生与 Claude 互动,我感觉其中有训练数据问题。LLM 在不同领域的进步未必均匀,我们已经看到很多“尖峰式智能”的迹象,很难用一个统一能力水平来解释。

我有位朋友是 AlphaFold 的关键贡献者之一。我们谈过 AlphaFold 1 的经历,他们做的事情让我想起自己的量化研究:有定义清楚的排行榜和评价指标,可以在不同蛋白质上反复运行折叠方法,像做回测一样看结果。但 AlphaFold 1 最终是否成功,要由蛋白质折叠竞赛里的留出集合决定。团队可以在自己的验证集上测试任意多次,可研究者越根据验证结果挑选和调整想法,就越会在模型训练之外,以人的研究过程对验证集过拟合。

这与量化金融非常相似。因此,思考自动研究时可以问:如果事先不知道正确方法,距离“一句话提示 LLM,让它自主提出想法并赢得蛋白质折叠竞赛”还有多久?直接告诉它“去做,想出方法”就行。

AlphaFold 1 的组件本身并不离奇,它只是把标准深度学习组件应用到新模态。即便如此,应该很少有人相信今年、甚至明年的 LLM 已经能一次性提出 AlphaFold 级别的研究方案。这也是我认为量化交易还剩一点时间的原因。等量化研究真的被自动化时,其他很多事情也会变得极其古怪,大家只能一起面对。

所以,HRT 当然非常希望用 AI 加速研究,也已经在这样做。它写代码非常好;但要让它自主完成研究,我目前仍然不确定。如果自动研究很快突然起飞,那我们所有人都麻烦了——这是我的热门观点。

听众:随着金融与市场数据规模增长,决策树、集成模型等传统方法会怎样与 Transformer 一起演进?它们未来还有多重要?

Iain:  我刚才提到了预测期限,却没有彻底展开。假如有人对我说:“Iain,请做一个平均持有或预测期限为三十天的交易策略。”我会在很长一段时间里远离神经网络,可能先用线性回归。

这里有一个值得拆解的矛盾。按照我关于独立预测区间的第二套论证,预测期限越长,独立样本越少,需要使用的模型类别就越简单。但按照我对深度学习和大型市场模型的信念,真正理解市场的基础模型似乎不应与某个固定交易期限绑定。它既然理解市场,就应在一定程度上独立于预测期限。

行业里的每个人都在努力把深度学习推向更长的期限。但这很像 LLM 的长期推理:怎样稳定地做真正长期的推理非常困难。即使数据足以训练万亿参数大型市场模型,也不代表它能预测一个月后的 Tesla 价格。这两件事之间仍缺了一环。

因此,在最长预测期限上,传统方法仍有位置。另一方面,深度学习显然正在从最快期限向外扩张,逐步吞噬系统化交易的大部分领域。我想会场里其他交易公司的人多半也同意——除非你来自 QRT。

听众:我在 IIT Kharagpur 研究金融数据的上下文长度。我们探索过 RAG 和 MCP,后来认为,语言模型必须深入理解金融数据的内在属性与 embedding;除非 Token 本身理解金融数据的含义,否则 LLM 无法推理。因此,我们转向微调,而不是继续扩充上下文。是否应该建立独立的金融 LLM,拥有自己的 Token 和 embedding,成为单独垂直领域,从而摆脱超长上下文问题?金融公司是否应训练自己的 Finance LLM,而不是反复挑战现有 LLM 的上下文长度?

Iain: 这基本就是我刚才那张幻灯片提出的问题,对吧?它确实是值得推进的研究方向。但为什么不同时尝试所有路径?从长期看,其中某条大概会胜出。

听众:数值型市场数据在实践中怎样 Token 化?损失函数仍然是 Next-token prediction,还是别的方法?第二,数据规模如此大,模型多久重训一次?是否持续训练?如果不能频繁重训,怎样反映市场冲击?

Iain: 我不能直接回答这些问题,否则之后大概就没有工作了。但这些确实是我团队每天处理的细节问题。

关于市场变化后的重训,我想指出,人类容易夸大所谓 Regime 以及市场数据状态变化的本质。即使 COVID 期间市场出现非常疯狂的崩溃,从我今天讨论的数据粒度看,也不清楚底层机制是否真正发生了根本变化。它多数时候仍是一个双边市场,人们继续买入和卖出。

如果模型学到的是市场的一般表征,那么即使对人类而言极端、像是脱离历史分布的事件,在模型眼里也未必严重 Out-of-domain。这带来一个很有意思的问题:在如此细粒度上,“泛化”到底是什么意思?我们怎样知道模型没有泛化?除了“赚的钱低于预期”这种表面结果之外,泛化失败会呈现什么形态?而在高压力环境里,即便收益低于预期,也很难判断有多少真是模型失效。

听众:我想挑战“不断用新市场数据重训”的范式。最新 Gemini 模型的知识截止大约在 2025 年 1 月,Opus 大约在 2026 年 1 月,GPT 模型则大约在 2025 年 12 月;它们未必拥有当天知识,却仍可以通过 Agent 系统把新信息提供给旧模型。市场模型反复训练,到底是为了学习新的市场数据、新策略,还是学习市场动态?如果十年历史已经让它学会所有策略,为什么还需要重训?

Iain: 时间向前走,总会出现更多数据,就是这么简单。LLM 公司不断抓取互联网,因为永远还有更多 Token;同样,有更多 Token 时继续训练通常就是好事。

你后半个问题可能混合了两件不同的事情:一个是“市场如何运作”的模型,另一个是你依据这个模型采取什么行动。两者可以是不同系统。我今天主要讲的是前者——怎样理解市场;这种理解再去为策略提供信息,而不是把模型本身等同于策略。你提出的区分是有用的,只是其中的关系相当微妙。

 


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/200371