发布于2026-07-18 阅读(0)
扫一扫,手机访问
应分块读取+流式去重:用chunksize=50000逐块读CSV,统一列名和dtype后累加concat并立即按业务主键drop_duplicates(subset=['order_id'], keep='first'),最终用csv.writer边处理边写入避免内存膨胀。

pandas.concat 合并大CSV,但别直接全读进内存单个CSV文件超过500MB,用 pandas.read_csv 默认方式加载,内存直接告急。更别提多个文件一起 concat,那相当于内存翻倍再翻倍。正确的做法是分块读取,边读边处理。
实际操作中,有几个点值得注意:
chunksize=50000(具体数值看机器内存,16GB机器建议不要超过10万),逐块读成DataFrame,每块立刻处理,别攒着。concat 会隐式转换,导致后续去重失效——比如字符串列混入nan,变成float,去重时就乱了。pd.concat([df1, df2, ...]) 一次性拼接所有块。正确做法:先初始化一个空 result_df,每读一块就 pd.concat([result_df, chunk], ignore_index=True),然后立刻 drop_duplicates,这样能有效控制内存峰值。subset,且优先用 keep='first'很多人习惯用 df.drop_duplicates() 做全字段去重,但在大数据量下,这招极慢——因为要哈希整行。更坑的是,如果某列有nan值,drop_duplicates 默认把所有nan视为相同,可能会误删有效行。
经验之谈:
order_id 或用户ID user_id,传给 subset=['order_id']。这样只针对关键字段去重,效率高得多。keep='first' 比 'last' 快大约15%,因为底层跳过了重复项扫描,而且语义清晰:保留首次出现的记录。sort_values('update_time', ascending=False),再 drop_duplicates(subset=['order_id'], keep='first')。顺序别搞反,否则白费功夫。csv.writer 直接写入避免中间DataFrame膨胀即使处理完,最终结果DataFrame也可能很大,再用 to_csv 输出,等于二次内存占用。更稳妥的做法是绕过DataFrame,直接用Python原生的 csv 模块边处理边写入。
具体步骤:
with open('merged_unique.csv', 'w', newline='') as f:csv.writer(f) 写表头——从第一块chunk的 chunk.columns.tolist() 获取。writer.writerows(chunk.values.tolist()) 写入,不经过DataFrame序列化,内存占用更低。usecols 和 dtype 强制对齐。MemoryError 或 UnicodeDecodeError 怎么办这两个错误在自动化脚本里很常见。前者是内存真爆了,后者往往是编码问题——部分文件是gbk,部分是utf-8-sig。如果不显式捕获,整个流程可能直接中断。
几个实用策略:
MemoryError:先降低 chunksize 到10000,实在不行可以考虑 dask.dataframe。但要注意,dask 的 drop_duplicates 不支持 subset 参数,得用 map_partitions 手动实现。UnicodeDecodeError:读取时先试 encoding='utf-8',失败则回退到 encoding='gb18030'(中文Windows常见)。用 try/except 包裹 read_csv 即可。f"Processed {file_path}: {len(chunk)} rows",方便定位问题出在哪一步。说到底,真正难的不是语法,是chunksize设多少、编码怎么试、主键字段有没有空值——这些都得看数据本身。脚本跑起来之前,最好先抽样检查三个文件的结构和内容,心里有底再动手。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8