在用 pandas 进行数据合并时,如果左右两张表存在同名字段,merge 函数默认会通过 suffixes 参数加上 _x 和 _y 后缀。但很多实际业务中我们并不想让列名带上这些后缀,而是希望以更干净的方式解决冲突。下面介绍几种不添加后缀的处理思路。

方法一:合并前重命名冲突列
最简单直接的做法是在 merge 之前,先使用 rename 把其中一张表的冲突列改掉,这样合并时就不会触发后缀逻辑。
import pandas as pd
df1 = pd.DataFrame({'id': [1, 2], 'value': [10, 20]})
df2 = pd.DataFrame({'id': [1, 2], 'value': [100, 200]})
# 把右表的 value 改掉,避免冲突
df2_renamed = df2.rename(columns={'value': 'value_right'})
result = pd.merge(df1, df2_renamed, on='id')
print(result)
方法二:合并后统一重命名
如果已经用了默认后缀合并,也可以在合并之后通过 rename 把列名整理成自己想要的样子。
import pandas as pd
df1 = pd.DataFrame({'id': [1, 2], 'score': [88, 92]})
df2 = pd.DataFrame({'id': [1, 2], 'score': [75, 85]})
merged = pd.merge(df1, df2, on='id')
# 合并后去掉后缀
merged = merged.rename(columns={'score_x': 'score_math', 'score_y': 'score_english'})
print(merged)
方法三:只保留需要的列
当冲突列其实只需要其中一方的数据时,可以在合并前先删掉另一方不需要的列,从根本上避免冲突。
import pandas as pd
left = pd.DataFrame({'user_id': [1, 2], 'name': ['a', 'b'], 'age': [20, 30]})
right = pd.DataFrame({'user_id': [1, 2], 'age': [21, 31]})
# 右表不需要 age,直接丢弃
right_only_id = right.drop(columns=['age'])
res = pd.merge(left, right_only_id, on='user_id')
print(res)
方法四:用指示列区分来源
如果不想改列名也不想加后缀,还可以通过 indicators 参数增加一列来标记数据来源,冲突列各自保留但用不同前缀手动管理。
| 方式 | 适用场景 |
|---|---|
| 合并前 rename | 字段含义不同,需长期区分 |
| 合并后 rename | 已合并,需快速整理 |
| 删列 | 一方数据无用 |
通过上述方法,就可以在 pandas merge 时灵活处理列名冲突,而不必依赖默认后缀。