作者:老余捞鱼
原创不易,转载请标明出处及原作者。
文中示例仅用于技术讨论,不构成任何操作建议。
量化策略开发应以学习和技术交流为目的。
本号不荐股、不卖课、不承诺收益。
市场有风险,请合法合规投资。
本文约 5200 字 | 预计阅读 10-15 分钟
· · ·
做量化的人都知道一个尴尬的事实:LLM从几亿参数缩放到几千亿参数,性能蹭蹭涨,但时间序列预测模型呢?放大反而可能变差。
Datadog的团队刚发布的Toto-2.0,终于把这事儿给解决了。5个模型规模,从400万到25亿参数,同一套训练配方,每一个更大的模型都比更小的模型预测得更准。听起来理所当然,但在时序预测领域,这是头一回。
一、Toto-2.0是什么?
Toto-2.0是Datadog开发的decoder-only(仅解码器)时间序列基础模型,专门做多变量零样本预测。说直白点:给它一段历史数据,不用微调,直接预测未来。
先说几个关键标签:
- Decoder-only架构:基于Patched Transformer,交替使用时间轴注意力和变量轴注意力,支持变长上下文,能接受未来已知的协变量。
- u-µP缩放:超参数在1000万参数的小模型上调一次,直接迁移到25亿参数的大模型,不用每个规模重新调。
- CPM单次推理:连续补丁掩码(Contiguous Patch Masking)让模型一次前向传播就生成长 horizon 预测,不用像以前那样一步步自回归解码。
- 概率预测:分位数头(quantile head)+ pinball loss,输出9个分位数,既有预测值也有不确定性估计。
- 开源:Apache 2.0协议,权重开放,GitHub仓库可直接用。
在GIFT-Eval、BOOM、TIME三个公开基准测试上,Toto-2.0全部拿下第一名。
图1:Toto-2架构——Patched Transformer,交替时间轴/变量轴注意力
二、四个核心设计选择
Toto-2.0能实现干净缩放,靠的是四个互相配合的设计决策。咱们一个个看。
1. Arcsinh归一化:小波动和极端尖峰都照顾到
这个设计借自Chronos模型。传统对数归一化有个毛病:接近零的时候行为不线性,会把小幅波动吃掉。对于稀疏和间歇性时间序列(比如某些交易频率低的品种),这种信息丢失很要命。
Arcsinh归一化不一样:接近零时表现为线性,保留小幅波动的细节;大值时表现为对数,压缩极端尖峰。两者兼顾,恰好是基础模型预训练需要的,因为训练数据横跨多个数量级。
图2:Arcsinh归一化 vs 对数归一化,接近零时Arcsinh保持线性
2. 分位数输出头:替换掉不稳定的SMM
Toto-1.0用的是Student-T混合模型(SMM)做概率预测,在小规模时还行,但模型变大后SMM数值不稳定,预测值接近零时会发散。
Toto-2.0换成简单的分位数头:每个未来时间步预测9个分位数水平{0.1, 0.2, ..., 0.9},用pinball loss训练。这种方式现在已经是主流,Chronos-2、Moirai-2、TimesFM 2.5都用这套。为防止分位数交叉(quantile crossing),推理时对预测结果排序。
点预测不再单独生成,直