
Time-Series-Library 时间序列数据增强实战指南15种算法、3档拆解、5行配置【免费下载链接】Time-Series-LibraryA Library for Advanced Deep Time Series Models for General Time Series Analysis.项目地址: https://gitcode.com/GitHub_Trending/ti/Time-Series-Library上周同事的模型准备上线内部测试集 MAE 表现不错但接到真实业务数据流后第一天指标就掉了十几个点。问题不在模型结构而是训练数据只覆盖了半年的业务节奏分布一漂移泛化就撑不住。Time-Series-Library 是时间序列深度学习模型库它的时间序列数据增强模块正是为这类问题设计的用轻量变换扩充训练样本多样性改善时间序列预测模型的泛化能力。项目背景与模块定位时间序列数据增强在哪找Time-Series-Library 是面向通用时序任务长短期预测、分类、异常检测、插补等的深度学习模型库。全部时间序列数据增强算法集中在一个文件 utils/augmentation.py 中共 15 种内置方法从最基础的抖动jitter到基于 DTW 的引导式变形完整参数定义在 run.py 里。图Time-Series-Library 项目中不同时间序列任务的数据结构样本维度正是数据增强作用的对象增强在 Pipeline 中的位置只碰训练集整体流程是数据加载 →训练集数据增强 → 模型训练 → 测试集评估。增强的触发点在数据加载器内部data_provider/data_loader.py 中只有当set_type 0 and augmentation_ratio 0时才会调用run_augmentation_single即只对训练集做增强验证集与测试集保持原样。放在加载层有两个好处一是增强与数据预处理完全解耦你不需要改动任何数据管道逻辑二是评估数据不被污染前后指标对比才公平、可复现。核心算法分档拆解15种时间序列数据增强算法按复杂度分3档15 种算法的实现成本和风险差异很大按复杂度分三档按任务对号入座。第一档 · 扰动类增强jitter、scaling给每个时间点叠加小幅高斯噪声jitter默认 σ0.03或对整条序列乘一个小的随机系数scaling默认 σ0.1。就像给照片加一点点胶片颗粒主体不变只是细节轻微晃动。适合带测量噪声的传感器读数、工业监控数据打开即用能明显提升模型抗噪能力。第二档 · 结构类增强time_warp、magnitude_warp用三次样条对时间轴或幅度轴做非线性拉伸默认 σ0.2、4 个节点像把磁带录音拉伸再压缩模拟同一事件以不同节奏、不同幅度发生。适合节奏可能漂移的周期任务如销量、流量。注意变形会平移周期性相位对依赖严格日历对齐星期、小时相位的任务请调小 σ 或干脆不用。图时间序列频域FFT分解出的多周期分量理解周期结构才能判断数据增强该用哪一档第三档 · 组合类增强窗口切片、DTW 引导、多算法组合一次运行可以同时打开多个开关augment()按固定顺序逐轮施加共执行augmentation_ratio轮。其中 spawner、dtwwarp、wdba、discdtw 等基于 DTW 对齐需要类别标签更适合分类任务window_slice、window_warp 则通过切片重组扩展样本多样性。scripts/long_term_forecast/AugmentSample/ 下的示例脚本在 UEA 数据集上逐一跑了全部算法可直接复制做对照。最小可运行配置数据增强参数怎么配分类任务UEA 数据集 PatchTST的最小示例augmentation_ratio1表示在训练集上追加一轮增强样本python -u run.py \ --task_name classification --data UEA \ --model PatchTST \ --augmentation_ratio 1 \ --jitter --scaling --timewarp参数含义建议值备注augmentation_ratio增强轮数1~3每轮追加与原始训练集等量的样本--jitter抖动开关开默认 σ0.03最安全--scaling幅度缩放开关开默认 σ0.1只改幅度不改形状--timewarp时间扭曲开关按需对严格周期数据影响大全部开关清单见 run.py预测任务把--task_name换成long_term_forecast即可。避坑清单三类高频问题自查以下问题在落地中最高频建议逐条自查。常见错误表现症状正确做法过度增强ratio 越大损失越抖测试集指标停滞甚至下降从 ratio1 起步确认优于基线后再逐步加多变量预测用了 permutation / rotation变量间关系被打乱上线后指标骤降多变量场景优先 jitter、scaling 等逐点方法避免乱序与翻转缺乏基线对比分不清提升来自增强还是随机种子平行跑一组augmentation_ratio为 0 的同配置对照效果量化对比增强前后示例指标下表为示例数据请以实际运行结果为准。指标增强前增强后变化测试集准确率分类任务89%92%3%训练/测试集差距13 个百分点6 个百分点-7 个百分点训练样本量1x2xratio1翻倍图时间序列预测结果对比示例增强后的预测曲线与真实值贴合度通常更好最终以实际评估为准按团队规模的落地建议个人/小团队样本量 1 万只开 jitter scalingratio 设 1其余参数不动。中型团队1 万~10 万叠加 timewarp 做组合策略先自查多变量相关性一坑跑基线对比后再定参。大规模生产 10 万把增强纳入数据流水线参考 exp/ 目录的实验流程在训练日志中记录 enhancement 标签便于回溯。数据增强不是万能药但组合用对能让有限的数据多跑几轮、泛化稳一分。15 种算法的完整实现在 utils/augmentation.py各任务的实验代码在 exp/可继续深挖。【免费下载链接】Time-Series-LibraryA Library for Advanced Deep Time Series Models for General Time Series Analysis.项目地址: https://gitcode.com/GitHub_Trending/ti/Time-Series-Library创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考