在数据分析工作中,日期字段常常因为录入错误、系统导出问题而出现年份缺失或整条日期为空的情况。用Pandas可以非常高效地完成这类数据的筛选与清理,不需要写复杂的循环。

识别缺失年份的日期数据
如果日期已经是datetime类型,可以通过访问.dt.year来判断年份是否缺失;如果日期还是字符串,先用to_datetime解析,无法解析的会变成NaT,也就是缺失时间。
import pandas as pd
# 构造示例数据,包含正常日期、缺失年份字符串和空值
data = {
'id': [1, 2, 3, 4],
'date_str': ['2021-03-12', '03-12', None, '2022-08-01']
}
df = pd.DataFrame(data)
# 解析日期,无法解析的设为NaT
df['date'] = pd.to_datetime(df['date_str'], errors='coerce')
# 筛选年份缺失或日期为空的数据
missing_year = df[df['date'].isna()]
print(missing_year)
清理包含缺失年份的记录
最常见的做法是直接丢弃这些无效行,或者把缺失日期的行单独导出以便追溯。使用dropna可以基于日期列删除空值。
# 删除日期解析后为NaT的行 clean_df = df.dropna(subset=['date']) # 重置索引 clean_df = clean_df.reset_index(drop=True) print(clean_df)
补充默认年份
有时业务上允许给缺失年份补一个默认年,比如统一补为1900年,这时可以用掩码赋值。
# 将缺失日期补为1900-01-01
df.loc[df['date'].isna(), 'date'] = pd.Timestamp('1900-01-01')
print(df)
使用布尔索引提升效率
面对大体量数据,应避免逐行判断。Pandas的向量化操作配合isna、notna以及dt访问器,能在单次扫描中完成筛选。
| 方法 | 作用 |
|---|---|
| isna() | 标记缺失值,返回布尔序列 |
| notna() | 标记非缺失值 |
| dt.year | 提取日期中的年份信息 |
完整处理示例
下面把解析、筛选与清理串起来,形成可复用的小函数。
def clean_date_column(frame, col_name):
# 解析日期列
frame['parsed_date'] = pd.to_datetime(frame[col_name], errors='coerce')
# 返回清理后的数据和问题数据
bad = frame[frame['parsed_date'].isna()]
good = frame[frame['parsed_date'].notna()].copy()
good = good.drop(columns=[col_name])
good = good.rename(columns={'parsed_date': col_name})
return good, bad
good_df, bad_df = clean_date_column(df, 'date_str')
print('有效数据:')
print(good_df)
print('异常数据:')
print(bad_df)
通过上述方式,我们可以用简洁且高效的代码完成Pandas中缺失年份日期数据的筛选与清理,保证后续分析的准确性。