商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 多个CSV大文件如何用Python自动化合并去重

多个CSV大文件如何用Python自动化合并去重

  发布于2026-07-18 阅读(0)

扫一扫,手机访问

应分块读取+流式去重:用chunksize=50000逐块读CSV,统一列名和dtype后累加concat并立即按业务主键drop_duplicates(subset=['order_id'], keep='first'),最终用csv.writer边处理边写入避免内存膨胀。

多个CSV大文件如何用Python自动化合并去重

pandas.concat 合并大CSV,但别直接全读进内存

单个CSV文件超过500MB,用 pandas.read_csv 默认方式加载,内存直接告急。更别提多个文件一起 concat,那相当于内存翻倍再翻倍。正确的做法是分块读取,边读边处理。

实际操作中,有几个点值得注意:

  • 设置 chunksize=50000(具体数值看机器内存,16GB机器建议不要超过10万),逐块读成DataFrame,每块立刻处理,别攒着。
  • 合并前一定要统一列名和数据类型(dtype),否则 concat 会隐式转换,导致后续去重失效——比如字符串列混入nan,变成float,去重时就乱了。
  • 别用 pd.concat([df1, df2, ...]) 一次性拼接所有块。正确做法:先初始化一个空 result_df,每读一块就 pd.concat([result_df, chunk], ignore_index=True),然后立刻 drop_duplicates,这样能有效控制内存峰值。

去重必须指定 subset,且优先用 keep='first'

很多人习惯用 df.drop_duplicates() 做全字段去重,但在大数据量下,这招极慢——因为要哈希整行。更坑的是,如果某列有nan值,drop_duplicates 默认把所有nan视为相同,可能会误删有效行。

经验之谈:

  • 明确业务主键字段,比如订单号 order_id 或用户ID user_id,传给 subset=['order_id']。这样只针对关键字段去重,效率高得多。
  • keep='first''last' 快大约15%,因为底层跳过了重复项扫描,而且语义清晰:保留首次出现的记录。
  • 如果需要按时间保留最新记录,那就先 sort_values('update_time', ascending=False),再 drop_duplicates(subset=['order_id'], keep='first')。顺序别搞反,否则白费功夫。

csv.writer 直接写入避免中间DataFrame膨胀

即使处理完,最终结果DataFrame也可能很大,再用 to_csv 输出,等于二次内存占用。更稳妥的做法是绕过DataFrame,直接用Python原生的 csv 模块边处理边写入。

具体步骤:

  • 提前打开输出文件句柄:with open('merged_unique.csv', 'w', newline='') as f:
  • csv.writer(f) 写表头——从第一块chunk的 chunk.columns.tolist() 获取。
  • 每处理完一块,直接用 writer.writerows(chunk.values.tolist()) 写入,不经过DataFrame序列化,内存占用更低。
  • 注意:这种方式要求所有chunk的列顺序和类型完全一致。所以读取时务必用 usecolsdtype 强制对齐。

遇到 MemoryErrorUnicodeDecodeError 怎么办

这两个错误在自动化脚本里很常见。前者是内存真爆了,后者往往是编码问题——部分文件是gbk,部分是utf-8-sig。如果不显式捕获,整个流程可能直接中断。

几个实用策略:

  • MemoryError:先降低 chunksize 到10000,实在不行可以考虑 dask.dataframe。但要注意,daskdrop_duplicates 不支持 subset 参数,得用 map_partitions 手动实现。
  • UnicodeDecodeError:读取时先试 encoding='utf-8',失败则回退到 encoding='gb18030'(中文Windows常见)。用 try/except 包裹 read_csv 即可。
  • 加日志:每完成一个文件打印 f"Processed {file_path}: {len(chunk)} rows",方便定位问题出在哪一步。

说到底,真正难的不是语法,是chunksize设多少、编码怎么试、主键字段有没有空值——这些都得看数据本身。脚本跑起来之前,最好先抽样检查三个文件的结构和内容,心里有底再动手。

本文转载于:https://www.php.cn/faq/2341586.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注