展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > Pandas保留指定列重复项方法

Pandas保留指定列重复项方法

本文旨在详细讲解如何在PandasDataFrame中筛选数据,仅保留指定列中所有重复值除了第一次出现以外的后续记录。我们将利用Pandas内置的duplicated()方法结合布尔索引,高效地实现这一常见的数据清洗和预处理任务,并通过具体代码示例进行演示。

Pandas DataFrame中保留指定列的后续重复项

本文旨在详细讲解如何在Pandas DataFrame中筛选数据,仅保留指定列中所有重复值除了第一次出现以外的后续记录。我们将利用Pandas内置的duplicated()方法结合布尔索引,高效地实现这一常见的数据清洗和预处理任务,并通过具体代码示例进行演示。

在数据处理过程中,我们经常会遇到需要识别和处理重复数据的情况。有时,我们希望完全移除重复项;而另一些时候,我们可能需要保留所有重复项,但排除它们首次出现的那一条记录。例如,在一个客户交易记录表中,如果某个客户有多笔交易,我们可能只关心其后续的交易记录,忽略其第一笔交易。Pandas库提供了一个非常便捷的方法duplicated()来解决这类问题。

理解 duplicated() 方法

pandas.Series.duplicated() 或 pandas.DataFrame.duplicated() 方法用于标记DataFrame或Series中的重复行或重复值。它返回一个布尔Series,其中True表示该行或该值是重复的,False表示它是唯一的或首次出现。

该方法有一个关键参数keep,它决定了如何处理重复项:

  • keep='first' (默认值): 标记除第一次出现之外的所有重复项为True。
  • keep='last': 标记除最后一次出现之外的所有重复项为True。
  • keep=False: 标记所有重复项(包括第一次和最后一次)为True。

对于本教程的目标——保留所有重复项,但排除第一次出现的那一条记录——我们正好可以利用keep='first'的默认行为。当duplicated()方法在指定列上调用时,它会为该列中所有非首次出现的重复值返回True。

实现步骤与示例

假设我们有一个包含客户ID、支付日期和支付金额的DataFrame,我们希望筛选出每个客户除了第一次交易之外的所有交易记录。

原始数据示例:

client_idpayment_datevalue
0678582021-05-30140.0
1682262021-05-30150.0
1414242021-05-31100.0
1414242021-06-01150.0
1515252021-06-01150.0
1682262021-06-02115.0
0678582021-06-05143.0
1515252021-06-0782.0

目标输出:

client_idpayment_datevalue
1414242021-06-01150.0
1682262021-06-02115.0
0678582021-06-05143.0
1515252021-06-0782.0

代码实现:

首先,创建示例DataFrame:

import pandas as pd

data = {
    'client_id': ['067858', '168226', '141424', '141424', '151525', '168226', '067858', '151525'],
    'payment_date': ['2021-05-30', '2021-05-30', '2021-05-31', '2021-06-01', '2021-06-01', '2021-06-02', '2021-06-05', '2021-06-07'],
    'value': [140.00, 150.00, 100.00, 150.00, 150.00, 115.00, 143.00, 82.00]
}
df = pd.DataFrame(data)
df['payment_date'] = pd.to_datetime(df['payment_date']) # 转换为日期类型
print("原始DataFrame:")
print(df)
print("-" * 30)

# 使用duplicated()方法筛选出除第一次出现外的所有重复项
# 默认情况下,keep='first',这意味着它会标记所有后续的重复项为True
# 然后通过布尔索引选择这些行
out = df[df['client_id'].duplicated()]

print("\n筛选后的DataFrame (保留后续重复项):")
print(out)

代码解释:

  1. df['client_id'].duplicated(): 这一步对client_id列调用duplicated()方法。由于keep参数默认为'first',它会检查client_id列中的每一个值。如果一个client_id之前已经出现过,那么当前这一行对应的布尔值为True;如果是第一次出现,则为False。 例如,对于client_id为141424的记录:
    • 第一条141424 (索引2) -> False (首次出现)
    • 第二条141424 (索引3) -> True (重复出现)
  2. df[...]: 接着,我们使用布尔索引将这个布尔Series应用于原始DataFrame df。只有对应布尔值为True的行才会被选中并构成新的DataFrame out。

拓展应用:基于多列的重复项判断

如果重复的定义需要基于多列的组合,例如,我们认为只有当client_id和payment_date都相同时才算重复,那么可以使用subset参数:

# 假设需要基于client_id和payment_date的组合来判断重复
# out_multi_col = df[df.duplicated(subset=['client_id', 'payment_date'])]
# print("\n基于多列判断重复并保留后续重复项:")
# print(out_multi_col)
# (此示例数据中,client_id和payment_date的组合没有重复,所以结果会是空的)

在当前示例数据中,client_id和payment_date的组合没有重复,因此上述代码将返回一个空DataFrame。这说明了subset参数的用法,以及它如何影响重复项的定义。

注意事项

  • 原DataFrame不变: duplicated()方法本身不会修改原始DataFrame。它返回一个布尔Series,你需要通过布尔索引将其应用于DataFrame才能得到筛选后的结果。
  • 性能: 对于非常大的数据集,duplicated()方法通常效率很高,因为它是在C语言层面实现的。
  • keep参数的理解: 务必清楚keep参数的含义,它直接决定了哪些重复项会被标记为True。在本例中,keep='first'是关键,它确保了我们只保留后续的重复项。

总结

通过Pandas的duplicated()方法结合布尔索引,我们可以非常简洁高效地实现“保留指定列中所有重复值除了第一次出现以外的后续记录”这一数据处理需求。理解duplicated()的keep参数是掌握此技巧的关键。这种方法不仅适用于单个列,通过subset参数也能轻松扩展到基于多列组合的重复项判断,极大地提升了数据清洗和预处理的灵活性。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。