Pandas条件列生成技巧分享
本文深入解析了Pandas中基于条件生成新列的实用技巧,重点介绍了如何利用`Series.where()`结合`bfill()`或`ffill()`方法,优雅地解决依赖于相邻行值的复杂逻辑。通过`Series.where()`筛选满足特定条件的行,并将不满足条件的行标记为NaN,再借助`bfill()`或`ffill()`智能填充缺失值,避免了传统循环的低效问题。文章通过实例演示了如何根据`Dimension 1`列的值,从`Colonne 1`列提取相应数据,并生成新的`new`列,详细对比了`bfill()`和`ffill()`在不同场景下的应用,为数据分析师和工程师提供了高效、简洁的Pandas数据处理方案。掌握这些技巧,能显著提升数据处理效率,优化代码质量。
在数据处理中,我们经常会遇到需要根据复杂逻辑生成新列的场景。有时,新列的值不仅取决于当前行的特定属性,还可能需要引用其上方或下方(即前一个或后一个)行的值。传统上,这可能导致使用循环迭代DataFrame,但这种方法在处理大型数据集时效率低下。Pandas提供了强大的向量化操作,可以优雅地解决这类问题。
场景描述
假设我们有一个Pandas DataFrame,其中包含两列:Colonne 1 和 Dimension 1。我们的目标是创建一个名为 new 的新列,其填充逻辑如下:
- 如果当前行的 Dimension 1 列的值为 'Organisation',则 new 列的值直接取自当前行的 Colonne 1 列。
- 如果当前行的 Dimension 1 列的值不为 'Organisation'(例如为 'Indicator'),则 new 列的值应取自其最近的下一个(在索引上)值为 'Organisation' 的行的 Colonne 1 值。
以下是示例DataFrame:
Colonne 1 Dimension 1 0 MTN_LI2 Indicator 1 MTN_IRU Indicator 2 MTN_ACE Indicator 3 MTN_IME Indicator 4 RIPP7 Organisation 5 CA_SOT Indicator 6 CA_OTI Indicator 7 CNW00 Organisation 8 BSNTF Organisation 9 RIPNJ Organisation
解决方案:结合 Series.where() 与填充方法
解决此类问题的关键在于利用Pandas的 Series.where() 方法进行条件筛选,并结合 Series.bfill()(反向填充)或 Series.ffill()(正向填充)来处理行间依赖。
1. 使用 Series.where() 筛选目标值
Series.where(cond, other=nan) 方法会根据条件 cond 返回一个与原Series相同大小的Series。如果条件为 True,则保留原Series的值;如果条件为 False,则用 other(默认为 NaN)填充。
对于我们的问题,我们首先筛选出 Dimension 1 为 'Organisation' 的行,并将其 Colonne 1 的值保留下来,其他行则标记为 NaN:
import pandas as pd import io data = """ Colonne 1 Dimension 1 0 MTN_LI2 Indicator 1 MTN_IRU Indicator 2 MTN_ACE Indicator 3 MTN_IME Indicator 4 RIPP7 Organisation 5 CA_SOT Indicator 6 CA_OTI Indicator 7 CNW00 Organisation 8 BSNTF Organisation 9 RIPNJ Organisation """ df = pd.read_csv(io.StringIO(data), sep='\s\s+', engine='python') # 步骤1:根据条件保留值,不满足条件的设为NaN # 只有当 'Dimension 1' == 'Organisation' 时,才保留 'Colonne 1' 的值 # 否则,该位置将是 NaN temp_series = df['Colonne 1'].where(df['Dimension 1'].eq('Organisation')) print("中间结果 (temp_series):") print(temp_series)
输出 temp_series 如下:
中间结果 (temp_series): 0 NaN 1 NaN 2 NaN 3 NaN 4 RIPP7 5 NaN 6 NaN 7 CNW00 8 BSNTF 9 RIPNJ Name: Colonne 1, dtype: object
可以看到,只有 Dimension 1 为 'Organisation' 的行保留了 Colonne 1 的值,其余都变成了 NaN。
2. 使用 Series.bfill() 填充缺失值(向前填充)
Series.bfill()(backward fill)方法用于填充Series中的 NaN 值。它会从当前 NaN 值的位置开始,向后(即沿着索引递增的方向)查找第一个非 NaN 值,并用该值填充当前的 NaN。这正是我们所需的“取最近的下一个组织值”的逻辑。
df['new_bfill'] = df['Colonne 1'].where(df['Dimension 1'].eq('Organisation')).bfill() print("\n使用 bfill() 的结果:") print(df)
输出结果:
使用 bfill() 的结果: Colonne 1 Dimension 1 new_bfill 0 MTN_LI2 Indicator RIPP7 1 MTN_IRU Indicator RIPP7 2 MTN_ACE Indicator RIPP7 3 MTN_IME Indicator RIPP7 4 RIPP7 Organisation RIPP7 5 CA_SOT Indicator CNW00 6 CA_OTI Indicator CNW00 7 CNW00 Organisation CNW00 8 BSNTF Organisation BSNTF 9 RIPNJ Organisation RIPNJ
解释:
- 对于索引0到3的行,Dimension 1 是 'Indicator',它们在 temp_series 中是 NaN。bfill() 会从这些位置向后查找,直到找到索引4的 RIPP7,然后用 RIPP7 填充索引0到3的 NaN。
- 对于索引5和6的行,Dimension 1 也是 'Indicator',它们在 temp_series 中是 NaN。bfill() 会向后查找,直到找到索引7的 CNW00,然后用 CNW00 填充索引5和6的 NaN。
3. 使用 Series.ffill() 填充缺失值(向后填充)
虽然题目描述更倾向于 bfill() 的效果,但了解 ffill()(forward fill)也很有用。Series.ffill() 方法用于填充Series中的 NaN 值。它会从当前 NaN 值的位置开始,向前(即沿着索引递减的方向)查找第一个非 NaN 值,并用该值填充当前的 NaN。这意味着它会使用最近的前一个有效值。
df['new_ffill'] = df['Colonne 1'].where(df['Dimension 1'].eq('Organisation')).ffill() print("\n使用 ffill() 的结果:") print(df)
输出结果:
使用 ffill() 的结果: Colonne 1 Dimension 1 new_bfill new_ffill 0 MTN_LI2 Indicator RIPP7 NaN 1 MTN_IRU Indicator RIPP7 NaN 2 MTN_ACE Indicator RIPP7 NaN 3 MTN_IME Indicator RIPP7 NaN 4 RIPP7 Organisation RIPP7 RIPP7 5 CA_SOT Indicator CNW00 RIPP7 6 CA_OTI Indicator CNW00 RIPP7 7 CNW00 Organisation CNW00 CNW00 8 BSNTF Organisation BSNTF BSNTF 9 RIPNJ Organisation RIPNJ RIPNJ
解释:
- 对于索引0到3的行,由于它们前面没有 Organisation 类型的行,ffill() 无法找到前一个有效值,因此这些 NaN 值会保留下来。
- 对于索引5和6的行,ffill() 会向前查找,找到索引4的 RIPP7,然后用 RIPP7 填充。
根据原始问题“Else the cell gets the value of the upper cell”,如果“upper cell”指的是“最近的下一个有效值”(即向下查找,然后向上填充),那么 bfill() 是正确的选择。如果指的是“最近的前一个有效值”(即向上查找,然后向下填充),那么 ffill() 则是适用的。在实际应用中,请根据具体业务逻辑选择 bfill() 或 ffill()。
注意事项与总结
- 向量化操作的效率: 这种方法利用了Pandas底层的C语言优化,相比于Python循环,在处理大量数据时具有显著的性能优势。
- 中间 NaN 的作用: where() 方法将不满足条件的值转换为 NaN 是关键一步,它为后续的填充操作提供了明确的标记。
- bfill() 与 ffill() 的选择:
- bfill():向后查找非 NaN 值,并向前填充。适用于“取最近的下一个有效值”的场景。
- ffill():向前查找非 NaN 值,并向后填充。适用于“取最近的前一个有效值”的场景。
- 需要注意,如果 ffill() 遇到Series开头的 NaN 且前面没有有效值,这些 NaN 将保持不变。同样,如果 bfill() 遇到Series末尾的 NaN 且后面没有有效值,这些 NaN 也将保持不变。
- 默认行为: bfill() 和 ffill() 默认会填充整个Series。如果需要在分组内进行填充,可以结合 groupby() 使用。
通过巧妙地结合 Series.where() 和 Series.bfill() 或 Series.ffill(),我们可以高效且优雅地解决Pandas DataFrame中涉及条件判断和行间依赖的复杂列生成问题,极大地提升数据处理的效率和代码的简洁性。
到这里,我们也就讲完了《Pandas条件列生成技巧分享》的内容了。个人认为,基础知识的学习和巩固,是为了更好的将其运用到项目中,欢迎关注golang学习网公众号,带你了解更多关于的知识点!

- 上一篇
- 小红书无店铺直播带货技巧解析

- 下一篇
- 用Golang搭建简易代理服务器步骤
-
- 文章 · python教程 | 5小时前 |
- Python如何定义函数?
- 489浏览 收藏
-
- 文章 · python教程 | 5小时前 |
- Python装饰器详解与实用技巧
- 437浏览 收藏
-
- 文章 · python教程 | 5小时前 |
- Python图像处理入门:Pillow库教程
- 280浏览 收藏
-
- 文章 · python教程 | 6小时前 |
- Pandas动态列赋值与向量化技巧解析
- 472浏览 收藏
-
- 文章 · python教程 | 6小时前 |
- Aiogram多聊室并发优化技巧
- 246浏览 收藏
-
- 文章 · python教程 | 6小时前 | 虚拟环境 激活 Python版本 环境隔离 python--version
- 虚拟环境激活后查Python版本方法
- 271浏览 收藏
-
- 文章 · python教程 | 6小时前 |
- PyCharm切换英文界面教程
- 409浏览 收藏
-
- 文章 · python教程 | 6小时前 |
- Python装饰器与工厂模式实战解析
- 149浏览 收藏
-
- 文章 · python教程 | 6小时前 |
- PythonTkinter入门教程详解
- 140浏览 收藏
-
- 文章 · python教程 | 7小时前 |
- 如何用正则匹配手机号码?完整示例解析
- 177浏览 收藏
-
- 文章 · python教程 | 7小时前 |
- Pandas快速更新DataFrame列值方法
- 213浏览 收藏
-
- 文章 · python教程 | 9小时前 |
- Python子进程实时输出带时间戳日志方法
- 399浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 511次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 499次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 484次学习
-
- 千音漫语
- 千音漫语,北京熠声科技倾力打造的智能声音创作助手,提供AI配音、音视频翻译、语音识别、声音克隆等强大功能,助力有声书制作、视频创作、教育培训等领域,官网:https://qianyin123.com
- 682次使用
-
- MiniWork
- MiniWork是一款智能高效的AI工具平台,专为提升工作与学习效率而设计。整合文本处理、图像生成、营销策划及运营管理等多元AI工具,提供精准智能解决方案,让复杂工作简单高效。
- 642次使用
-
- NoCode
- NoCode (nocode.cn)是领先的无代码开发平台,通过拖放、AI对话等简单操作,助您快速创建各类应用、网站与管理系统。无需编程知识,轻松实现个人生活、商业经营、企业管理多场景需求,大幅降低开发门槛,高效低成本。
- 671次使用
-
- 达医智影
- 达医智影,阿里巴巴达摩院医疗AI创新力作。全球率先利用平扫CT实现“一扫多筛”,仅一次CT扫描即可高效识别多种癌症、急症及慢病,为疾病早期发现提供智能、精准的AI影像早筛解决方案。
- 688次使用
-
- 智慧芽Eureka
- 智慧芽Eureka,专为技术创新打造的AI Agent平台。深度理解专利、研发、生物医药、材料、科创等复杂场景,通过专家级AI Agent精准执行任务,智能化工作流解放70%生产力,让您专注核心创新。
- 663次使用
-
- Flask框架安装技巧:让你的开发更高效
- 2024-01-03 501浏览
-
- Django框架中的并发处理技巧
- 2024-01-22 501浏览
-
- 提升Python包下载速度的方法——正确配置pip的国内源
- 2024-01-17 501浏览
-
- Python与C++:哪个编程语言更适合初学者?
- 2024-03-25 501浏览
-
- 品牌建设技巧
- 2024-04-06 501浏览