在使用Pandas处理时间序列相关的数据时,经常会遇到DataFrame的日期或时间列存在缺失的情况,比如按天统计的数据中漏了某几天的记录,或者按小时采集的数据少了部分时段的数据,这些缺失会直接影响后续的趋势分析、聚合计算等操作的准确性,需要针对性地进行填充。

生成完整的日期范围作为基准
填充缺失日期或时间的第一步,通常是先生成一份完整的、无缺失的目标日期时间范围,再和原有的DataFrame进行对齐,这样就能快速定位到缺失的部分。Pandas的pd.date_range方法可以很方便地生成指定频率的日期时间序列。
比如我们需要生成2024年1月1日到2024年1月10日的每日日期范围,代码如下:
import pandas as pd # 生成每日日期范围,freq='D'表示按天 full_dates = pd.date_range(start='2024-01-01', end='2024-01-10', freq='D') print(full_dates)
如果需要生成小时级别的时间范围,只需要把freq参数改为'H'即可,支持的频率还包括'M'(按月)、'W'(按周)等,可以根据实际需求调整。
对齐现有DataFrame补全缺失日期
生成完整的日期范围后,我们可以将其作为新的DataFrame的索引,再把原有的数据对齐到这个索引上,缺失的日期对应的数据会自动填充为NaN,之后再根据需求填充这些NaN值即可。
假设我们有一个包含部分日期销售数据的DataFrame,现在需要补全所有日期的记录:
import pandas as pd
# 原有缺失部分日期的数据
data = {
'date': ['2024-01-01', '2024-01-03', '2024-01-05', '2024-01-10'],
'sales': [100, 150, 200, 120]
}
df = pd.DataFrame(data)
# 将date列转换为datetime类型
df['date'] = pd.to_datetime(df['date'])
# 生成完整的日期范围
full_dates = pd.date_range(start=df['date'].min(), end=df['date'].max(), freq='D')
# 创建以完整日期为索引的新DataFrame,对齐原有数据
new_df = pd.DataFrame(index=full_dates)
new_df = new_df.join(df.set_index('date')).reset_index()
new_df.rename(columns={'index': 'date'}, inplace=True)
print(new_df)
执行后可以看到,2024-01-02、2024-01-04、2024-01-06到2024-01-09这些原本缺失的日期已经被补全,对应的sales列值为NaN,接下来就可以对这些NaN进行填充。
填充缺失的日期对应数据
补全日期后,还需要对缺失日期对应的其他列数据进行填充,常见的填充方式有前向填充、后向填充、填充固定值等,可以根据业务场景选择。
前向填充
前向填充就是用缺失日期前最近的一个有效数据来填充当前缺失值,适合数据变化平缓的场景,使用ffill()方法即可:
# 对sales列进行前向填充 new_df['sales'] = new_df['sales'].ffill() print(new_df)
后向填充
后向填充是用缺失日期后最近的一个有效数据来填充当前缺失值,适合后续数据能代表当前情况的场景,使用bfill()方法:
# 重新生成带NaN的new_df后,对sales列进行后向填充 new_df['sales'] = new_df['sales'].bfill() print(new_df)
填充固定值
如果缺失日期的数据适合用固定值填充,比如填充为0,可以直接使用fillna()方法:
# 填充固定值0 new_df['sales'] = new_df['sales'].fillna(0) print(new_df)
处理带时间列的多频率缺失场景
如果DataFrame的时间列是时间戳格式,包含时分秒信息,同样可以用类似的方法处理,只需要调整pd.date_range的频率参数即可。比如处理按小时统计的数据:
import pandas as pd
# 原有按小时统计的缺失数据
data = {
'timestamp': ['2024-01-01 08:00:00', '2024-01-01 10:00:00', '2024-01-01 13:00:00'],
'count': [5, 8, 12]
}
df = pd.DataFrame(data)
df['timestamp'] = pd.to_datetime(df['timestamp'])
# 生成小时级完整时间范围
full_time = pd.date_range(start=df['timestamp'].min(), end=df['timestamp'].max(), freq='H')
# 对齐数据
new_df = pd.DataFrame(index=full_time)
new_df = new_df.join(df.set_index('timestamp')).reset_index()
new_df.rename(columns={'index': 'timestamp'}, inplace=True)
# 前向填充count列
new_df['count'] = new_df['count'].ffill()
print(new_df)
这样就能补全所有缺失的小时时段数据,完成时间列的填充操作。