展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > Pandas数据清洗:部分字符串删行无效解决方法

Pandas数据清洗:部分字符串删行无效解决方法

本教程详细阐述了在Pandas中如何高效、准确地根据列中包含的特定部分字符串来删除数据行。针对常见的问题,如大小写敏感性导致筛选失败,文章重点介绍了使用df.column.str.contains()方法时,结合case=False参数进行不区分大小写的匹配,并利用na=False处理缺失值,确保数据清洗操作的鲁棒性和有效性,同时展示了如何通过reset_index(drop=True)重置索引。

Pandas数据清洗:解决基于部分字符串删除行不生效的问题

本教程详细阐述了在Pandas中如何高效、准确地根据列中包含的特定部分字符串来删除数据行。针对常见的问题,如大小写敏感性导致筛选失败,文章重点介绍了使用`df.column.str.contains()`方法时,结合`case=False`参数进行不区分大小写的匹配,并利用`na=False`处理缺失值,确保数据清洗操作的鲁棒性和有效性,同时展示了如何通过`reset_index(drop=True)`重置索引。

在数据分析和预处理过程中,我们经常需要根据DataFrame中某一列的文本内容来筛选或删除行。一个常见的需求是,如果某一列包含特定的部分字符串,就将整行删除。Pandas提供了强大的字符串处理功能,但如果不正确使用,可能会遇到筛选不生效的问题,特别是涉及到大小写敏感性时。

1. 理解问题:为什么部分字符串删除不生效?

用户在尝试根据列中包含的特定部分字符串(例如“NQR”)删除行时,可能会遇到代码运行无错但目标行依然存在的情况。这通常是由于以下原因:

  • 大小写敏感性(Case Sensitivity):str.contains()方法默认是区分大小写的。如果目标字符串是“NQR”,而列中实际存在的是“nqr”或“Nqr”,默认的筛选将无法匹配。
  • 缺失值(NaN)的处理:如果目标列中存在缺失值(NaN),str.contains()在处理时可能会引发错误或产生非预期的结果。
  • 索引问题:删除行后,DataFrame的索引会变得不连续,这在后续操作中可能造成不便。

2. 解决方案:利用 str.contains() 的 case 和 na 参数

Pandas的Series.str.contains()方法是解决此类问题的核心工具。它允许我们检查字符串序列中是否包含某个模式。关键在于正确使用其参数。

2.1 核心参数详解

  • pattern:要查找的字符串或正则表达式模式。
  • case:布尔值,默认为True。如果设置为False,则执行不区分大小写的匹配。这是解决大小写敏感性问题的关键。
  • na:用于填充缺失值(NaN)的值。默认为NaN。如果设置为False,则缺失值会被视为不匹配。这有助于避免在包含NaN的列上操作时可能出现的错误。

2.2 示例代码与步骤

为了更好地演示,我们首先创建一个包含不同大小写和缺失值的示例DataFrame:

import pandas as pd
import numpy as np

# 创建示例DataFrame
data = {
    'ID': [1, 2, 3, 4, 5, 6, 7],
    'Title': [
        'Product NQR Alpha',
        'Service Beta',
        'ITEM nqr Gamma',
        'Solution Delta',
        'NQR Project Epsilon',
        np.nan, # 包含一个缺失值
        'Another NQR Thing'
    ],
    'Value': [100, 200, 150, 300, 250, 120, 180]
}
df = pd.DataFrame(data)

print("原始DataFrame:")
print(df)

输出:

原始DataFrame:
   ID                Title  Value
0   1    Product NQR Alpha    100
1   2         Service Beta    200
2   3       ITEM nqr Gamma    150
3   4       Solution Delta    300
4   5  NQR Project Epsilon    250
5   6                  NaN    120
6   7    Another NQR Thing    180

现在,我们将演示如何删除Title列中包含“NQR”(不区分大小写)的行。

步骤 1:使用 str.contains() 进行不区分大小写的匹配

我们使用case=False来确保无论是“NQR”、“nqr”还是其他大小写组合都能被匹配到。同时,设置na=False来确保缺失值不会被错误地匹配或引发异常。

# 筛选出包含“NQR”(不区分大小写)的行
# `~` 运算符用于取反,即选择不包含“NQR”的行
rows_to_keep = ~df['Title'].str.contains('NQR', case=False, na=False)
df_cleaned = df[rows_to_keep]

print("\n筛选后的DataFrame (未重置索引):")
print(df_cleaned)

输出:

筛选后的DataFrame (未重置索引):
   ID           Title  Value
1   2    Service Beta    200
3   4  Solution Delta    300
5   6             NaN    120

可以看到,ID为0, 3, 4, 6的行(包含“NQR”或“nqr”)已经被成功删除。同时,ID为5的缺失值行由于na=False而未被匹配,所以被保留了下来。

步骤 2:重置索引

在删除行之后,DataFrame的索引可能不再是连续的。为了保持索引的整洁和连续性,通常建议重置索引。reset_index(drop=True)会创建一个新的默认整数索引,并丢弃旧的索引。

df_final = df_cleaned.reset_index(drop=True)

print("\n最终清理并重置索引的DataFrame:")
print(df_final)

输出:

最终清理并重置索引的DataFrame:
   ID           Title  Value
0   2    Service Beta    200
1   4  Solution Delta    300
2   6             NaN    120

3. 完整代码示例

将上述步骤整合到一行代码中,可以实现简洁高效的行删除操作:

import pandas as pd
import numpy as np

# 原始DataFrame
data = {
    'ID': [1, 2, 3, 4, 5, 6, 7],
    'Title': [
        'Product NQR Alpha',
        'Service Beta',
        'ITEM nqr Gamma',
        'Solution Delta',
        'NQR Project Epsilon',
        np.nan,
        'Another NQR Thing'
    ],
    'Value': [100, 200, 150, 300, 250, 120, 180]
}
df = pd.DataFrame(data)

print("原始DataFrame:")
print(df)

# 一行代码实现删除包含“NQR”(不区分大小写)的行并重置索引
df_cleaned_final = df[~df['Title'].str.contains('NQR', case=False, na=False)].reset_index(drop=True)

print("\n使用一行代码清理后的DataFrame:")
print(df_cleaned_final)

4. 注意事项与进阶用法

  • 多个关键词删除:如果要删除包含多个关键词中的任意一个的行,可以使用正则表达式的|(或)操作符。
    # 删除包含 'NQR' 或 'Outdated' 的行
    keywords = ['NQR', 'Outdated']
    pattern = '|'.join(keywords) # 生成 'NQR|Outdated'
    df_multiple_keywords = df[~df['Title'].str.contains(pattern, case=False, na=False)].reset_index(drop=True)
  • 精确匹配与部分匹配:str.contains()是用于部分字符串匹配的。如果需要精确匹配整个单元格内容,应使用df['Column'].isin(['Exact String'])。
  • 性能考量:对于非常大的DataFrame,str.contains()的性能可能受到正则表达式复杂度的影响。但在大多数常见场景下,其性能是足够的。

总结

在Pandas中根据列中包含的部分字符串删除行是一项常见的任务。解决筛选不生效问题的关键在于理解Series.str.contains()方法的case和na参数。通过设置case=False可以实现不区分大小写的匹配,而na=False则能稳健处理缺失值。结合~运算符进行反向筛选和reset_index(drop=True)重置索引,可以确保数据清洗操作的准确性、鲁棒性和后续操作的便利性。掌握这些技巧将大大提升你在Pandas中处理文本数据的效率。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

PDF教程适合刚接触PDF文件的用户,本文整理PDF打开、编辑、转换、合并、压缩等常见基础操作。通过这些教程可以快速了解PDF文件怎么处理,解决办公、学习和资料科整理中的常见问题。使用极轻PDF可在线完成多种PDF操作,适合新手快速上手。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。