如何使用Pandas填充DataFrame中缺失的日期或时间

来源:建站作者:高永康头衔:资深程序员
导读:本期聚焦于小伙伴创作的《如何使用Pandas填充DataFrame中缺失的日期或时间》,敬请观看详情,探索知识的价值。以下视频、文章将为您系统阐述其核心内容与价值。如果您觉得《如何使用Pandas填充DataFrame中缺失的日期或时间》有用,将其分享出去将是对创作者最好的鼓励。

在使用Pandas处理时间序列相关的数据时,经常会遇到DataFrame的日期或时间列存在缺失的情况,比如按天统计的数据中漏了某几天的记录,或者按小时采集的数据少了部分时段的数据,这些缺失会直接影响后续的趋势分析、聚合计算等操作的准确性,需要针对性地进行填充。

如何使用Pandas填充DataFrame中缺失的日期或时间

生成完整的日期范围作为基准

填充缺失日期或时间的第一步,通常是先生成一份完整的、无缺失的目标日期时间范围,再和原有的DataFrame进行对齐,这样就能快速定位到缺失的部分。Pandas的pd.date_range方法可以很方便地生成指定频率的日期时间序列。

比如我们需要生成2024年1月1日到2024年1月10日的每日日期范围,代码如下:

import pandas as pd

# 生成每日日期范围,freq='D'表示按天
full_dates = pd.date_range(start='2024-01-01', end='2024-01-10', freq='D')
print(full_dates)

如果需要生成小时级别的时间范围,只需要把freq参数改为'H'即可,支持的频率还包括'M'(按月)、'W'(按周)等,可以根据实际需求调整。

对齐现有DataFrame补全缺失日期

生成完整的日期范围后,我们可以将其作为新的DataFrame的索引,再把原有的数据对齐到这个索引上,缺失的日期对应的数据会自动填充为NaN,之后再根据需求填充这些NaN值即可。

假设我们有一个包含部分日期销售数据的DataFrame,现在需要补全所有日期的记录:

import pandas as pd

# 原有缺失部分日期的数据
data = {
    'date': ['2024-01-01', '2024-01-03', '2024-01-05', '2024-01-10'],
    'sales': [100, 150, 200, 120]
}
df = pd.DataFrame(data)
# 将date列转换为datetime类型
df['date'] = pd.to_datetime(df['date'])
# 生成完整的日期范围
full_dates = pd.date_range(start=df['date'].min(), end=df['date'].max(), freq='D')
# 创建以完整日期为索引的新DataFrame,对齐原有数据
new_df = pd.DataFrame(index=full_dates)
new_df = new_df.join(df.set_index('date')).reset_index()
new_df.rename(columns={'index': 'date'}, inplace=True)
print(new_df)

执行后可以看到,2024-01-02、2024-01-04、2024-01-06到2024-01-09这些原本缺失的日期已经被补全,对应的sales列值为NaN,接下来就可以对这些NaN进行填充。

填充缺失的日期对应数据

补全日期后,还需要对缺失日期对应的其他列数据进行填充,常见的填充方式有前向填充、后向填充、填充固定值等,可以根据业务场景选择。

前向填充

前向填充就是用缺失日期前最近的一个有效数据来填充当前缺失值,适合数据变化平缓的场景,使用ffill()方法即可:

# 对sales列进行前向填充
new_df['sales'] = new_df['sales'].ffill()
print(new_df)

后向填充

后向填充是用缺失日期后最近的一个有效数据来填充当前缺失值,适合后续数据能代表当前情况的场景,使用bfill()方法:

# 重新生成带NaN的new_df后,对sales列进行后向填充
new_df['sales'] = new_df['sales'].bfill()
print(new_df)

填充固定值

如果缺失日期的数据适合用固定值填充,比如填充为0,可以直接使用fillna()方法:

# 填充固定值0
new_df['sales'] = new_df['sales'].fillna(0)
print(new_df)

处理带时间列的多频率缺失场景

如果DataFrame的时间列是时间戳格式,包含时分秒信息,同样可以用类似的方法处理,只需要调整pd.date_range的频率参数即可。比如处理按小时统计的数据:

import pandas as pd

# 原有按小时统计的缺失数据
data = {
    'timestamp': ['2024-01-01 08:00:00', '2024-01-01 10:00:00', '2024-01-01 13:00:00'],
    'count': [5, 8, 12]
}
df = pd.DataFrame(data)
df['timestamp'] = pd.to_datetime(df['timestamp'])
# 生成小时级完整时间范围
full_time = pd.date_range(start=df['timestamp'].min(), end=df['timestamp'].max(), freq='H')
# 对齐数据
new_df = pd.DataFrame(index=full_time)
new_df = new_df.join(df.set_index('timestamp')).reset_index()
new_df.rename(columns={'index': 'timestamp'}, inplace=True)
# 前向填充count列
new_df['count'] = new_df['count'].ffill()
print(new_df)

这样就能补全所有缺失的小时时段数据,完成时间列的填充操作。

PandasDataFrame日期填充时间填充缺失值处理修改时间:2026-07-20 07:21:27

免责声明:​ 已尽一切努力确保本网站所含信息的准确性。网站内容多为原创整理与精心编撰,观点力求客观中立。本站旨在免费分享,内容仅供个人学习、研究或参考使用。若引用了第三方作品,版权归原作者所有。如内容涉及您的权益,请联系我们处理。
内容垂直聚焦
专注技术核心技术栏目,确保每篇文章深度聚焦于实用技能。从代码技巧到架构设计,为用户提供无干扰的纯技术知识沉淀,精准满足专业提升需求。
知识结构清晰
覆盖从开发到部署的全链路。AI、前端、编程、数据库、服务器、建站、系统层层递进,构建清晰学习路径,帮助用户系统化掌握开发与运维所需的核心技术。
深度技术解析
拒绝泛泛而谈,深入技术细节与实践难点。无论是数据库优化还是服务器配置,均结合真实场景与代码示例进行剖析,致力于提供可直接应用于工作的解决方案。
专业领域覆盖
精准对应开发生命周期。从前端界面到后端编程,从数据库操作到服务器运维,形成完整闭环,一站式满足全栈工程师和运维人员的技术需求。
即学即用高效
内容强调实操性,步骤清晰、代码完整。用户可根据教程直接复现和应用于自身项目,显著缩短从学习到实践的距离,快速解决开发中的具体问题。
持续更新保障
专注既定技术方向进行长期、稳定的内容输出。确保各栏目技术文章持续更新迭代,紧跟主流技术发展趋势,为用户提供经久不衰的学习价值。