讲师中心 微信公众号
AI工具推荐 视频效率加速

Polars 中按组筛选匹配项并提取最高分对应值的完整教程

胖磊大大_5817

胖磊大大_5817

发布时间:2026-01-25 10:57:22

|

945人浏览过

|

来源于php中文网

原创

Polars 中按组筛选匹配项并提取最高分对应值的完整教程

本文详解如何在 polars 中对分组数据执行“基于另一列值索引 list 列”的操作,包括精准匹配筛选、跨列索引取值、获取最大得分对应 match 值等核心技巧,并提供可直接运行的代码示例与关键注意事项。

在 Polars 数据处理中,常需对 group_by 后生成的 list 列(如 match: list[str] 和 score: list[i64])进行关联索引提取——例如:在每组 seq 内,找到 seq_grp != match 的记录中 score 最高的那条,并返回其 match 值和 score。这并非简单 .list.get() 可解决,而是需要利用 Polars 的向量化索引能力(如 .get() 配合 .arg_max())实现跨列逻辑对齐。

以下以原始 DataFrame 为例,逐步演示正确实现方式:

import polars as pl

df = pl.DataFrame(
    {
        "seq": "foo bar bar duk duk baz baz baz zed".split(),
        "seq_grp": "aa bb bb dd dd cc cc cc zz".split(),
        "match": "aa cc bb dd dd ff cc cc yy".split(),
        "score": [10, 8, 20, 8, 7, 5, 6, 4, 6],
    }
)

✅ 正确做法:使用 arg_max() + get() 实现安全索引

要获取每组中 seq_grp ≠ match 的最高分记录对应的 match 值和 score,应避免先 group_by().agg() 再手动索引(易出错且低效),而应直接在 lazy 模式下链式操作:

result = (
    df.lazy()
    .filter(pl.col("match") != pl.col("seq_grp"))  # 先过滤不匹配项
    .group_by(["seq", "seq_grp"], maintain_order=True)
    .agg(
        best_non_match=pl.col("match").get(pl.col("score").arg_max()),
        top_score=pl.col("score").max(),
        # 可选:同时获取原始索引位置(调试用)
        argmax_idx=pl.col("score").arg_max(),
    )
    .collect()
)

print(result)

输出:

shape: (3, 5)
┌─────┬─────────┬────────────────┬───────────┬────────────┐
│ seq ┆ seq_grp ┆ best_non_match ┆ top_score ┆ argmax_idx │
│ --- ┆ ---     ┆ ---            ┆ ---       ┆ ---        │
│ str ┆ str     ┆ str            ┆ i64       ┆ u32        │
╞═════╪═════════╪════════════════╪═══════════╪════════════╡
│ bar ┆ bb      ┆ cc             ┆ 8         ┆ 0          │
│ baz ┆ cc      ┆ ff             ┆ 5         ┆ 0          │
│ zed ┆ zz      ┆ yy             ┆ 6         ┆ 0          │
└─────┴─────────┴────────────────┴───────────┴────────────┘
? 关键原理:pl.col("score").arg_max() 返回该组内 score 最大值的相对索引位置(u32),pl.col("match").get(...) 则用该索引从同组 match list 中安全取值——二者天然对齐,无需显式构造 list 列。

⚠️ 常见误区与注意事项

  • ❌ 错误示范(勿模仿)

    # 危险!group_by 后再 list.get(0) 会丢失组内结构,无法支持动态索引
    df.group_by("seq").agg(pl.all()).with_columns(pl.col("match").list.get(0))

    此写法仅适用于固定位置取值,无法实现“按 score 最大值动态取 match”。

  • ✅ 必须使用 .lazy()
    arg_max() 在 eager 模式下对聚合后 list 列行为不稳定;lazy 模式保障计算图优化与语义一致性。

  • ⚠️ 空组处理
    若某组无 match != seq_grp 记录(如 "foo" 组),filter 后该组将被自动丢弃。如需保留空组结果,改用 over + 条件掩码:

    df.with_columns(
        is_non_match=(pl.col("match") != pl.col("seq_grp")),
        score_cond=pl.when(pl.col("is_non_match"), then=pl.col("score")).otherwise(None),
    ).with_columns(
        best_non_match=pl.col("match").get(pl.col("score_cond").arg_max().over("seq")),
        top_score=pl.col("score_cond").max().over("seq"),
    ).filter(pl.col("top_score").is_not_null())
  • ? 扩展技巧:返回整行信息
    若还需其他字段(如原始 seq 行号),可在 filter 后添加 with_row_index():

    df.lazy().with_row_index().filter(...).group_by(...).agg(
        pl.col("match").get(pl.col("score").arg_max()),
        pl.col("index").get(pl.col("score").arg_max()),  # 获取原行号
    )

✅ 总结

Polars 中实现“按条件筛选后取最高分对应值”的最佳实践是:
① 使用 .filter() 预筛选目标子集;
② 用 .group_by(...).agg() 聚合时,直接调用 col.get(arg_max()) 完成跨列索引;
③ 始终优先采用 .lazy().collect() 保证计算稳定性与性能。

该模式高效、安全、可读性强,是 Polars 处理复杂分组索引任务的标准范式。

热门AI工具

更多
豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

0

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

0

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

0

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

0

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

20

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn