Feature-engine中LagFeatures的正确使用方法与注意事项

2025-07-05 16:39:29作者：卓炯娓

概述

Feature-engine是一个强大的Python特征工程库，其中的LagFeatures转换器可以方便地为时间序列数据创建滞后特征。本文将详细介绍LagFeatures的工作原理、常见误区以及正确使用方法。

LagFeatures的基本原理

LagFeatures转换器通过将变量的历史值作为新特征添加到当前观测中，为时间序列建模提供历史上下文。例如，它可以创建"1小时前"、"24小时前"等特征。

常见误区分析

许多用户在使用LagFeatures时会遇到测试集开头出现NaN值的问题，这通常源于对transform方法的误解。关键在于理解：

fit_transform方法在训练集上学习特征转换规则
transform方法在测试集上应用相同的规则，但不会自动填充历史值

正确使用方法

要确保测试集开头不出现NaN值，必须保证：

测试集包含足够的历史数据，覆盖最长的滞后周期
测试集的历史数据范围应至少比预测起点提前最长滞后周期

例如，如果最大滞后周期为3天，测试集从10月1日开始，那么传递给transform的测试数据必须包含9月28日及之后的数据。

实际应用建议

数据准备阶段：确保数据集包含足够的历史缓冲期
训练测试分割：不要简单随机分割时间序列数据
滞后周期选择：根据业务周期合理设置periods参数
缺失值处理：考虑添加缺失值填充策略作为后续步骤

性能优化技巧

对于大数据集，考虑使用dask或modin等库加速处理
合理选择滞后周期，避免创建过多冗余特征
结合其他时间序列特征工程方法，如滚动统计量

总结

正确使用Feature-engine的LagFeatures需要理解时间序列数据的连续性特点。通过确保测试集包含足够的历史数据，可以避免NaN值的出现，构建更稳健的时间序列模型。

feature_engine

Feature engineering package with sklearn like functionality

项目地址：https://gitcode.com/gh_mirrors/fe/feature_engine

登录后查看全文

项目优选

收起

kernel

deepin linux kernel

docs

OpenHarmony documentation | OpenHarmony开发者文档

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

Ascend Extension for PyTorch

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

Java

RuoYi-Vue3

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统