应分块读取+流式去重:用chunksize=50000逐块读CSV,统一列名和dtype后累加concat并立即按业务主键drop_duplicates(subset=['order_id'], keep='first'),最终用csv.writer边处理边写入避免内存膨胀。

用 pandas.concat 合并大CSV,但别直接全读进内存
单个CSV文件超过500MB,用 pandas.read_csv 默认方式加载,内存直接告急。更别提多个文件一起 concat,那相当于内存翻倍再翻倍。正确的做法是分块读取,边读边处理。
实际操作中,有几个点值得注意:
- 设置
chunksize=50000(具体数值看机器内存,16GB机器建议不要超过10万),逐块读成DataFrame,每块立刻处理,别攒着。 - 合并前一定要统一列名和数据类型(dtype),否则
concat会隐式转换,导致后续去重失效——比如字符串列混入nan,变成float,去重时就乱了。 - 别用
pd.concat([df1, df2, ...])一次性拼接所有块。正确做法:先初始化一个空result_df,每读一块就pd.concat([result_df, chunk], ignore_index=True),然后立刻drop_duplicates,这样能有效控制内存峰值。
去重必须指定 subset,且优先用 keep='first'
很多人习惯用 df.drop_duplicates() 做全字段去重,但在大数据量下,这招极慢——因为要哈希整行。更坑的是,如果某列有nan值,drop_duplicates 默认把所有nan视为相同,可能会误删有效行。
经验之谈:
- 明确业务主键字段,比如订单号
order_id或用户IDuser_id,传给subset=['order_id']。这样只针对关键字段去重,效率高得多。 keep='first'比'last'快大约15%,因为底层跳过了重复项扫描,而且语义清晰:保留首次出现的记录。- 如果需要按时间保留最新记录,那就先
sort_values('update_time', ascending=False),再drop_duplicates(subset=['order_id'], keep='first')。顺序别搞反,否则白费功夫。
用 csv.writer 直接写入避免中间DataFrame膨胀
即使处理完,最终结果DataFrame也可能很大,再用 to_csv 输出,等于二次内存占用。更稳妥的做法是绕过DataFrame,直接用Python原生的 csv 模块边处理边写入。
具体步骤:
- 提前打开输出文件句柄:
with open('merged_unique.csv', 'w', newline='') as f: - 用
csv.writer(f)写表头——从第一块chunk的chunk.columns.tolist()获取。 - 每处理完一块,直接用
writer.writerows(chunk.values.tolist())写入,不经过DataFrame序列化,内存占用更低。 - 注意:这种方式要求所有chunk的列顺序和类型完全一致。所以读取时务必用
usecols和dtype强制对齐。
遇到 MemoryError 或 UnicodeDecodeError 怎么办
这两个错误在自动化脚本里很常见。前者是内存真爆了,后者往往是编码问题——部分文件是gbk,部分是utf-8-sig。如果不显式捕获,整个流程可能直接中断。
几个实用策略:
MemoryError:先降低chunksize到10000,实在不行可以考虑dask.dataframe。但要注意,dask的drop_duplicates不支持subset参数,得用map_partitions手动实现。UnicodeDecodeError:读取时先试encoding='utf-8',失败则回退到encoding='gb18030'(中文Windows常见)。用try/except包裹read_csv即可。- 加日志:每完成一个文件打印
f"Processed {file_path}: {len(chunk)} rows",方便定位问题出在哪一步。
说到底,真正难的不是语法,是chunksize设多少、编码怎么试、主键字段有没有空值——这些都得看数据本身。脚本跑起来之前,最好先抽样检查三个文件的结构和内容,心里有底再动手。