Pandas是Python数据分析中常用的库,DataFrame是其核心数据结构,实际开发中经常需要把DataFrame里的数据转换为Python原生的列表类型,用于适配其他不支持DataFrame的接口或者简化数据处理逻辑。

整体DataFrame转列表:values.tolist()方法
如果需要把整个DataFrame的所有数据转换为嵌套列表,每一行对应一个子列表,最常用的方法就是先通过values属性获取DataFrame的NumPy数组,再调用tolist()方法完成转换。
我们先创建一个示例DataFrame:
import pandas as pd
# 创建示例DataFrame
data = {
'name': ['张三', '李四', '王五'],
'age': [20, 25, 22],
'score': [88.5, 92.0, 85.5]
}
df = pd.DataFrame(data)
print('原始DataFrame:')
print(df)
使用values.tolist()转换整个DataFrame的代码如下:
# 整体转换为列表
all_list = df.values.tolist()
print('转换后的列表:')
print(all_list)
运行后输出的结果是[['张三', 20, 88.5], ['李四', 25, 92.0], ['王五', 22, 85.5]],可以看到每一行数据对应一个子列表,顺序和DataFrame中的行顺序完全一致。
提取特定列转换为列表
实际场景中更多时候只需要提取DataFrame中的某一列或者某几列转换为列表,这里有两种常用的实现方式。
方式1:直接提取单列转换
如果只需要提取单个列,可以直接选中该列后调用tolist()方法,这种方式代码更简洁,执行效率也更高。
# 提取name列转换为列表
name_list = df['name'].tolist()
print('name列转换后的列表:')
print(name_list)
输出结果为['张三', '李四', '王五'],符合预期。
方式2:提取多列后转换
如果需要提取多个特定列,可以先选中这些列组成新的DataFrame,再调用values.tolist()方法,得到的是每个子列表对应多列数据的嵌套列表。
# 提取name和score两列转换为列表
multi_col_list = df[['name', 'score']].values.tolist()
print('name和score列转换后的列表:')
print(multi_col_list)
输出结果为[['张三', 88.5], ['李四', 92.0], ['王五', 85.5]],每个子列表对应选中列的一行数据。
两种转换方式的对比
我们可以通过表格直观对比不同转换方式的特点:
| 转换场景 | 实现方式 | 输出结果形式 | 适用情况 |
|---|---|---|---|
| 整个DataFrame转列表 | df.values.tolist() | 嵌套列表,每个子列表为一行所有列数据 | 需要全部数据且保留行结构的场景 |
| 单个列转列表 | df['列名'].tolist() | 一维列表,元素为该列所有行数据 | 只需要单列数据的场景 |
| 多个特定列转列表 | df[['列名1','列名2']].values.tolist() | 嵌套列表,每个子列表为选中列的对应行数据 | 需要多列数据且保留行对应关系的场景 |
注意事项
- 使用
values.tolist()时,DataFrame中的NaN值会被转换为Python的None类型,需要注意后续处理时的空值判断。 - 如果DataFrame的列包含日期时间类型,转换后的列表中的元素会是对应的时间戳或者日期对象,需要根据实际需求做格式处理。
- 单列转换时直接使用
df['列名'].tolist()比先选列再调用values.tolist()效率更高,优先选择更简洁的写法。
总结来说,整体转换用values.tolist(),单列转换直接用列的tolist()方法,多列转换先选列再用values.tolist(),根据实际场景选择合适的方式即可。