Polars DataFrame 中如何在窗口内添加行号

来源:菜鸟站长作者:南京GEO公司头衔:草根站长
导读:本期聚焦于小伙伴创作的《Polars DataFrame 中如何在窗口内添加行号》,敬请观看详情,探索知识的价值。以下视频、文章将为您系统阐述其核心内容与价值。如果您觉得《Polars DataFrame 中如何在窗口内添加行号》有用,将其分享出去将是对创作者最好的鼓励。

在Polars的数据处理场景中,窗口内添加行号是分组统计、排序标记等需求的常见操作,通过合理的窗口配置和函数组合就能轻松实现,不需要复杂的自定义逻辑。

基础实现:排序后添加全局行号

如果只需要在排序后的DataFrame中添加全局的行号,不需要分组,可以直接使用with_row_count方法,这个方法会按照当前DataFrame的顺序添加从1开始的行号。

import polars as pl

# 构造示例数据
df = pl.DataFrame({
    "name": ["张三", "李四", "王五", "赵六"],
    "score": [89, 92, 78, 95]
})

# 先按分数降序排序,再添加行号
sorted_df = df.sort("score", descending=True)
result = sorted_df.with_row_count("rank", offset=1)
print(result)

上述代码中,with_row_count的第一个参数是行号的列名,offset参数用来设置行号的起始值,默认是0,这里设置为1符合常见的排名习惯。

分组窗口内添加行号

如果需要在每个分组内单独添加行号,比如统计每个班级内学生的成绩排名,就需要结合over窗口函数和row_number函数来实现。

import polars as pl

# 构造分组示例数据
df = pl.DataFrame({
    "class": ["一班", "一班", "一班", "二班", "二班", "二班"],
    "name": ["张三", "李四", "王五", "赵六", "钱七", "孙八"],
    "score": [89, 92, 78, 95, 88, 90]
})

# 按班级分组,组内按分数降序添加行号
result = df.with_columns(
    pl.col("score").rank(method="dense", descending=True).over("class").alias("class_rank")
)
print(result)

这里使用rank函数结合over("class")指定窗口为班级分组,method="dense"表示密集排名,相同分数会获得相同排名,且排名连续不跳跃。如果需要严格的行号,即使分数相同也按顺序编号,可以使用row_number函数。

import polars as pl

df = pl.DataFrame({
    "class": ["一班", "一班", "一班", "二班", "二班", "二班"],
    "name": ["张三", "李四", "王五", "赵六", "钱七", "孙八"],
    "score": [89, 92, 89, 95, 88, 90]
})

# 分组内按分数降序,相同分数按姓名排序后添加行号
result = df.with_columns(
    pl.row_number().over("class").alias("class_row_num")
).sort(["class", "score"], descending=[True, False])
print(result)

自定义排序规则的窗口行号

如果在窗口内需要按照多个字段排序再添加行号,可以在over之前先对数据排序,或者在窗口函数内指定排序规则。Polars的row_number函数支持在窗口内指定排序字段。

import polars as pl

df = pl.DataFrame({
    "class": ["一班", "一班", "一班", "二班", "二班", "二班"],
    "name": ["张三", "李四", "王五", "赵六", "钱七", "孙八"],
    "score": [89, 92, 89, 95, 88, 90],
    "age": [18, 17, 18, 19, 18, 17]
})

# 分组内先按分数降序,再按年龄升序,最后添加行号
result = df.with_columns(
    pl.row_number()
    .over("class")
    .alias("custom_rank")
).sort(["class", "score", "age"], descending=[False, True, False])
print(result)

上述代码中,先对整体数据按照需要的规则排序,再在每个班级分组内添加行号,就能得到符合自定义排序规则的窗口行号结果。

不同场景的选择建议

  • 如果是全局排序后的行号,优先使用with_row_count,性能更高且逻辑简单。
  • 如果需要分组内的排名,且相同值需要相同排名,使用rank函数结合over
  • 如果需要分组内严格顺序的行号,即使值相同也按顺序编号,使用row_number结合over
  • 如果窗口内的排序规则比较复杂,建议先对数据整体排序,再添加行号,避免窗口函数内的排序逻辑过于复杂。

PolarsDataFrame窗口函数行号over修改时间:2026-07-23 12:24:20

免责声明:​ 已尽一切努力确保本网站所含信息的准确性。网站内容多为原创整理与精心编撰,观点力求客观中立。本站旨在免费分享,内容仅供个人学习、研究或参考使用。若引用了第三方作品,版权归原作者所有。如内容涉及您的权益,请联系我们处理。
内容垂直聚焦
专注技术核心技术栏目,确保每篇文章深度聚焦于实用技能。从代码技巧到架构设计,为用户提供无干扰的纯技术知识沉淀,精准满足专业提升需求。
知识结构清晰
覆盖从开发到部署的全链路。AI、前端、编程、数据库、服务器、建站、系统层层递进,构建清晰学习路径,帮助用户系统化掌握开发与运维所需的核心技术。
深度技术解析
拒绝泛泛而谈,深入技术细节与实践难点。无论是数据库优化还是服务器配置,均结合真实场景与代码示例进行剖析,致力于提供可直接应用于工作的解决方案。
专业领域覆盖
精准对应开发生命周期。从前端界面到后端编程,从数据库操作到服务器运维,形成完整闭环,一站式满足全栈工程师和运维人员的技术需求。
即学即用高效
内容强调实操性,步骤清晰、代码完整。用户可根据教程直接复现和应用于自身项目,显著缩短从学习到实践的距离,快速解决开发中的具体问题。
持续更新保障
专注既定技术方向进行长期、稳定的内容输出。确保各栏目技术文章持续更新迭代,紧跟主流技术发展趋势,为用户提供经久不衰的学习价值。