导读:本期聚焦于小伙伴创作的《如何用Python Pandas根据列名模式批量对比数据并生成新特征列》,敬请观看详情,探索知识的价值。以下视频、文章将为您系统阐述其核心内容与价值。如果您觉得《如何用Python Pandas根据列名模式批量对比数据并生成新特征列》有用,将其分享出去将是对创作者最好的鼓励。

在Python Pandas的数据处理场景中,经常需要根据列名的特定规律批量对比多列数据,再基于对比结果生成新的特征列,比如对比不同渠道的转化数据、不同时间段的指标数据等。这种需求如果逐列手动处理会非常繁琐,通过列名模式匹配可以实现高效的批量操作。

如何用Python Pandas根据列名模式批量对比数据并生成新特征列

核心实现思路

整个流程可以分为三个核心步骤:首先通过列名的字符串匹配规则筛选出符合模式的列,然后对这些列进行批量对比运算,最后将对比结果赋值给新的特征列。Pandas提供了filter方法可以快速筛选符合列名模式的列,结合向量化运算可以高效完成批量对比。

基础示例:对比同前缀列的大小

假设我们有一份用户消费数据,包含2023_q1_spend2023_q2_spend2023_q3_spend等多个季度的消费列,需要对比每个季度的消费是否高于上一季度,生成对应的布尔特征列。

步骤1:筛选符合模式的列

首先使用filter方法筛选所有以2023_q开头且包含spend的列:

import pandas as pd

# 构造示例数据
data = {
    'user_id': [1, 2, 3],
    '2023_q1_spend': [100, 200, 150],
    '2023_q2_spend': [120, 180, 160],
    '2023_q3_spend': [90, 210, 140],
    '2023_q4_spend': [130, 190, 170]
}
df = pd.DataFrame(data)

# 筛选符合列名模式的列,这里匹配包含spend的列
spend_cols = df.filter(like='spend').columns.tolist()
print(spend_cols)

步骤2:批量对比并生成新列

接下来按照列名的季度顺序,逐列对比当前季度和上一季度的消费,生成是否增长的特征列:

# 对列名按季度排序,确保对比顺序正确
spend_cols_sorted = sorted(spend_cols, key=lambda x: int(x.split('_')[1][1]))

# 批量生成对比特征列
for i in range(1, len(spend_cols_sorted)):
    prev_col = spend_cols_sorted[i-1]
    curr_col = spend_cols_sorted[i]
    # 提取季度标识作为新列名后缀
    quarter = curr_col.split('_')[1]
    new_col_name = f'q{quarter}_spend_increase'
    # 向量化对比,生成布尔特征列
    df[new_col_name] = df[curr_col] > df[prev_col]

print(df)

进阶场景:自定义列名模式匹配

如果列名的模式更复杂,比如需要匹配以score_开头且结尾是数字的列,可以使用正则表达式配合filterregex参数:

# 构造新的示例数据,列名模式为score_数字
data2 = {
    'user_id': [1, 2],
    'score_1': [80, 90],
    'score_2': [85, 88],
    'score_3': [82, 92],
    'other_col': ['a', 'b']
}
df2 = pd.DataFrame(data2)

# 使用正则表达式筛选列名匹配score_数字的列
score_cols = df2.filter(regex=r'^score_d+$').columns.tolist()
print(score_cols)  # 输出 ['score_1', 'score_2', 'score_3']

# 批量对比所有score列是否都大于等于80,生成达标特征
df2['all_score_pass'] = df2[score_cols].ge(80).all(axis=1)
print(df2)

注意事项

  • 筛选列名后一定要对列名进行排序,避免对比顺序错误,尤其是列名包含顺序标识的场景。
  • 批量生成新列时,新列名最好和原有列名模式保持关联,方便后续识别和使用。
  • 如果对比逻辑比较复杂,可以先将对比逻辑封装成函数,再通过apply方法应用到批量列上,提升代码可读性。

总结

通过Pandas的列名筛选能力结合批量运算,可以快速实现按列名模式批量对比数据并生成新特征列的需求,相比手动逐列处理,效率可以提升数倍,同时减少人为逻辑错误。这种方法适用于所有列名存在规律的多列批量处理场景,开发者可以根据实际的列名模式调整筛选规则和对比逻辑。

PythonPandas列名模式批量比较新特征列修改时间:2026-07-19 10:18:23

免责声明:​ 已尽一切努力确保本网站所含信息的准确性。网站内容多为原创整理与精心编撰,观点力求客观中立。本站旨在免费分享,内容仅供个人学习、研究或参考使用。若引用了第三方作品,版权归原作者所有。如内容涉及您的权益,请联系我们处理。
内容垂直聚焦
专注技术核心技术栏目,确保每篇文章深度聚焦于实用技能。从代码技巧到架构设计,为用户提供无干扰的纯技术知识沉淀,精准满足专业提升需求。
知识结构清晰
覆盖从开发到部署的全链路。AI、前端、编程、数据库、服务器、建站、系统层层递进,构建清晰学习路径,帮助用户系统化掌握开发与运维所需的核心技术。
深度技术解析
拒绝泛泛而谈,深入技术细节与实践难点。无论是数据库优化还是服务器配置,均结合真实场景与代码示例进行剖析,致力于提供可直接应用于工作的解决方案。
专业领域覆盖
精准对应开发生命周期。从前端界面到后端编程,从数据库操作到服务器运维,形成完整闭环,一站式满足全栈工程师和运维人员的技术需求。
即学即用高效
内容强调实操性,步骤清晰、代码完整。用户可根据教程直接复现和应用于自身项目,显著缩短从学习到实践的距离,快速解决开发中的具体问题。
持续更新保障
专注既定技术方向进行长期、稳定的内容输出。确保各栏目技术文章持续更新迭代,紧跟主流技术发展趋势,为用户提供经久不衰的学习价值。