DataDog/toto
Time-Series-Optimized Transformer for Observability
解决的问题
Toto 是一个专为多变量时间序列预测设计的基础模型,特别针对可观测性指标(系统监控数据)进行了优化。它解决了在不同软件栈和服务中,无需为每个新数据集进行大量领域特定训练,即可预测多个相关变量未来值的挑战。
工作原理
Toto 采用仅解码器的 Transformer 架构。Toto 2.0 使用 u-μP 缩放的 Transformer,并交替使用时间与变量注意力机制,以高效处理高维时间序列。它提供概率预测,即生成点预测和不确定性估计(分位数),而不仅仅是单一预测值。
Toto 1.0 使用比例因子分解时空注意力机制和学生 t 混合模型进行概率预测。项目还包括 BOOM(可观测性指标基准)数据集,用于评估真实世界可观测性数据上的预测性能。
适用人群
- SRE 和 DevOps 工程师:监控系统指标以预测潜在故障或容量问题的人。
- 数据科学家:从事时间序列预测和基础模型研究的研究人员。
- ML 工程师:在生产可观测性流水线中实现零样本或微调预测模型的开发者。
主要亮点
- 零样本预测:无需在特定数据集上微调即可预测未来值。
- 概率预测:通过分位数头(2.0)或学生 t 混合模型(1.0)生成不确定性估计。
- 大规模预训练:Toto 1.0 在超过 2 万亿个时间序列数据点上进行训练,其中包括来自 Datadog 指标的 1 万亿个数据点。
- 可扩展的模型家族:Toto 2.0 提供从 400 万到 25 亿参数的多种模型。
- 外生变量支持:Toto 1.0 支持使用已知的未来协变量以提高预测准确性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目