应分块读取+流式去重:用chunksize=50000逐块读CSV,统一列名和dtype后累加concat并立即按业务主键drop_duplicates(subset=['order_id'], keep='first'),最终用csv.writer边处理边写入避免内存膨胀。

多个CSV大文件如何用Python自动化合并去重

pandas.concat 合并大CSV,但别直接全读进内存

单个CSV文件超过500MB,用 pandas.read_csv 默认方式加载,内存直接告急。更别提多个文件一起 concat,那相当于内存翻倍再翻倍。正确的做法是分块读取,边读边处理。

实际操作中,有几个点值得注意:

去重必须指定 subset,且优先用 keep='first'

很多人习惯用 df.drop_duplicates() 做全字段去重,但在大数据量下,这招极慢——因为要哈希整行。更坑的是,如果某列有nan值,drop_duplicates 默认把所有nan视为相同,可能会误删有效行。

经验之谈:

csv.writer 直接写入避免中间DataFrame膨胀

即使处理完,最终结果DataFrame也可能很大,再用 to_csv 输出,等于二次内存占用。更稳妥的做法是绕过DataFrame,直接用Python原生的 csv 模块边处理边写入。

具体步骤:

遇到 MemoryErrorUnicodeDecodeError 怎么办

这两个错误在自动化脚本里很常见。前者是内存真爆了,后者往往是编码问题——部分文件是gbk,部分是utf-8-sig。如果不显式捕获,整个流程可能直接中断。

几个实用策略:

说到底,真正难的不是语法,是chunksize设多少、编码怎么试、主键字段有没有空值——这些都得看数据本身。脚本跑起来之前,最好先抽样检查三个文件的结构和内容,心里有底再动手。

本文转载于:https://www.php.cn/faq/2341586.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。