当前位置:

首页 > 编程开发 > 数据帧高效去重保留最新记录教程

数据帧高效去重保留最新记录教程

本教程旨在解决数据分析中常见的挑战:如何从PandasDataFrame中高效地筛选出基于特定列的重复项,并仅保留每组重复项中的最新N条记录。我们将探讨一种简洁且性能优越的方法,即利用groupby().tail()组合操作,并提供详细的代码示例与性能考量,以帮助读者在处理大规模数据集时做出最佳选择。

数据帧中高效筛选重复项并保留最新N条记录的教程

本教程旨在解决数据分析中常见的挑战:如何从Pandas DataFrame中高效地筛选出基于特定列的重复项,并仅保留每组重复项中的最新N条记录。我们将探讨一种简洁且性能优越的方法,即利用groupby().tail()组合操作,并提供详细的代码示例与性能考量,以帮助读者在处理大规模数据集时做出最佳选择。

引言:数据帧重复项处理的挑战

在数据清洗和预处理阶段,处理数据帧中的重复记录是一项常见任务。有时,我们不仅需要识别重复项,还需要根据特定业务逻辑进行筛选,例如,保留每组重复项中的最新或最旧的几条记录。当数据集规模庞大时,选择一个高效的处理方法至关重要,以避免不必要的计算资源消耗和漫长的等待时间。

考虑一个场景,您有一个包含用户活动记录的数据帧,其中可能存在基于用户姓名和性别等信息的多条记录。您的目标是针对每个唯一的姓名-性别组合,仅保留其最新的三条活动记录。

常见但可能效率较低的方法(基于窗口函数)

一种常见的思路是使用窗口函数(在PySpark等分布式计算框架中尤为常见,但在Pandas中也可以通过模拟实现)。其基本步骤包括:

  1. 分区 (PartitionBy):根据重复项的定义列(例如 first_name, last_name, sex)对数据进行分组。
  2. 排序 (OrderBy):在每个分区内,根据一个唯一标识符(例如 id 列,代表记录的顺序或时间戳)进行排序,通常是降序以获取最新记录。
  3. 行号分配 (row_number):为每个分区内的记录分配一个行号。
  4. 过滤 (Filter):筛选出 row_number 小于或等于N的记录。

以下是这种思路的示例代码(模仿Spark的Window函数概念):

# 假设df是一个Pandas DataFrame,且F是pandas的函数别名
# import pandas.api.extensions as F
# from pandas.core.window import RollingGroupby, ExpandingGroupby # 实际Pandas中没有直接的Window函数
# 这里的代码是用户尝试的Spark风格代码,在Pandas中实现会更复杂,且可能效率不高
# window_spec = Window.partitionBy('first_name', 'last_name', 'sex').orderBy(F.desc('id'))
# df_with_row_number = df.withColumn('row_number', F.row_number().over(window_spec))
# filtered_df = df_with_row_number.filter('row_number <= 3')
# result_df = filtered_df.drop('row_number')

尽管这种方法逻辑清晰,但在处理大规模Pandas DataFrame时,手动实现复杂的窗口函数逻辑(如自定义排序和行号分配)可能涉及多次数据遍历和中间DataFrame的创建,从而导致性能开销较大,尤其是在内存使用方面。

Pandas groupby().tail() 的高效解决方案

Pandas库提供了一个更为简洁和高效的方法来解决这个问题:groupby().tail()。这个组合操作允许我们首先根据指定的列对数据帧进行分组,然后从每个组的末尾(或头部)选择指定数量的行。结合预排序,这可以非常高效地实现我们的目标。

示例代码

让我们通过一个具体的例子来演示如何使用 groupby().tail(N) 来筛选并保留每组重复项的最后N条记录。

import pandas as pd

# 原始数据帧示例
data = {
    'id': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10],
    'first_name': ['John', 'John', 'John', 'Mark', 'John', 'Mark', 'John', 'Mark', 'Mark', 'John'],
    'last_name': ['Doe', 'Doe', 'Doe', 'Kay', 'Doe', 'Kay', 'Doe', 'Kay', 'Kay', 'Doe'],
    'sex': ['Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male'],
    'country': ['USA', 'Canada', 'Mexico', 'Italy', 'Spain', 'France', 'Peru', 'India', 'Laos', 'Benin']
}

df = pd.DataFrame(data)

print("原始数据帧:")
print(df)
print("-" * 30)

# 步骤1: 确保数据按 'id' 列(或其他代表顺序的列)排序
# 这一步至关重要,它定义了“最后N个”的含义。
# 如果id越大代表越新,则按id升序排列。
df_sorted = df.sort_values(by='id', ascending=True)

# 步骤2: 使用 groupby() 和 tail() 保留每组的最后3条记录
# 根据 'first_name', 'last_name', 'sex' 进行分组,并从每个组的末尾选择3条记录
result_df = df_sorted.groupby(['first_name', 'last_name', 'sex']).tail(3)

# 步骤3: 重置索引(可选)
# 如果需要一个干净的、从0开始的整数索引,可以执行此步骤。
result_df = result_df.reset_index(drop=True)

print("\n筛选后的数据帧 (保留每组最新3条):")
print(result_df)

代码详解

  1. 数据准备: 首先,我们创建了一个示例 pd.DataFrame,它模拟了具有重复 first_name, last_name, sex 组合的数据。
  2. 数据排序 (df.sort_values(by='id', ascending=True)): 这是实现“保留最新N条”的关键一步。tail(N) 方法总是从组的末尾选择行。因此,为了确保这些“末尾”的行确实是您想要的“最新”记录,您必须在执行 groupby().tail() 之前,根据一个能够表示记录顺序(例如时间戳、ID号)的列对整个数据帧进行排序。在这里,我们假设 id 值越大代表记录越新,因此按 id 升序排列。
  3. 分组与截取 (df_sorted.groupby(['first_name', 'last_name', 'sex']).tail(3)):
    • groupby(['first_name', 'last_name', 'sex']):根据 first_name, last_name, sex 这三列的值将数据帧分成多个逻辑组。例如,所有 John Doe Male 的记录将形成一个组。
    • .tail(3):对于每个分组,此方法会选择该组中最后3行。由于我们之前已经按 id 进行了排序,这确保了选出的3行是该组中 id 值最大的(即最新的)3条记录。
  4. 重置索引 (result_df.reset_index(drop=True)): groupby().tail() 操作会保留原始索引。如果您希望结果数据帧拥有一个从0开始的连续新索引,可以使用 reset_index(drop=True)。drop=True 参数表示不将旧索引作为新列添加到数据帧中。

输出结果

执行上述代码后,您将得到以下结果:

原始数据帧:
   id first_name last_name   sex country
0   1       John       Doe  Male     USA
1   2       John       Doe  Male  Canada
2   3       John       Doe  Male  Mexico
3   4       Mark       Kay  Male   Italy
4   5       John       Doe  Male   Spain
5   6       Mark       Kay  Male  France
6   7       John       Doe  Male    Peru
7   8       Mark       Kay  Male   India
8   9       Mark       Kay  Male    Laos
9  10       John       Doe  Male   Benin
------------------------------

筛选后的数据帧 (保留每组最新3条):
   id first_name last_name   sex country
0   5       John       Doe  Male   Spain
1   6       Mark       Kay  Male  France
2   7       John       Doe  Male    Peru
3   8       Mark       Kay  Male   India
4   9       Mark       Kay  Male    Laos
5  10       John       Doe  Male   Benin

性能考量与最佳实践

  • 效率对比: groupby().tail() 方法在Pandas中通常比手动实现复杂的窗口函数(如使用 apply 结合自定义逻辑)更高效。Pandas的 groupby 操作是高度优化的,并且 tail 方法直接作用于分组对象,减少了中间数据结构的创建和内存消耗。
  • 排序的重要性: 务必记住,tail(N) 总是选择组的“末尾”N行。如果“最新”或“最旧”有特定定义,您必须在 groupby 之前对数据帧进行适当的排序。
    • 要保留最新N条,按时间/ID升序排序,然后使用 tail(N)。
    • 要保留最旧N条,按时间/ID降序排序,然后使用 tail(N),或者更直接地使用 head(N) (在升序排序后)。
  • 数据规模: 对于中等规模的数据集(GB级别),Pandas的 groupby().tail() 表现优异。对于超大规模数据集(TB级别或更大),您可能需要考虑使用分布式计算框架,如PySpark,其中窗口函数是其核心功能,并能更好地利用集群资源。
  • 处理 NaN 值: groupby 操作默认会忽略分组键中的 NaN 值。如果您的分组列中可能包含 NaN,并且您希望将它们视为一个独立的组或进行特定处理,请在 groupby 之前进行适当的缺失值处理(如填充或删除)。

总结

本教程详细介绍了如何利用Pandas的 groupby().tail() 方法高效地从数据帧中筛选出基于特定列的重复项,并仅保留每组的最新N条记录。通过结合 sort_values 进行预排序,这种方法不仅代码简洁,而且在性能上通常优于手动实现的窗口函数逻辑。理解并正确应用这些Pandas操作,将极大地提升您在数据清洗和预处理任务中的效率。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发
相关文章 更多
C++动态数组初始化怎么写?常用语句与代码示例
C++动态数组初始化怎么写?常用语句与代码示例

深入解析C++中动态数组的初始化机制,涵盖new操作符的不同用法、基本类型与类对象的初始化差异,以及为何在现代C++开发中应优先使用std::vector。

using namespace 使用中遇到的问题怎么解决
using namespace 使用中遇到的问题怎么解决

命名空间的基本概念与常见引入问题在C++等编程语言中,命名空间(namespace)是一种将代码标识符(如变量、函数、类名)封装在特定名称下的机制,其主要目的是避免命名冲突,尤其是在大型项目或使用多个第三方库时。使用“using namespace”指令可以将指定命名空间中的所有名称引入当前作用域,

c语言函数递归 实操经验总结:这些技巧很实用
c语言函数递归 实操经验总结:这些技巧很实用

理解递归的基本原理在C语言中,递归是一种函数调用自身的编程技术。要掌握它,首先需要理解其核心思想:将一个复杂的大问题,分解为一个或几个与原问题相似但规模更小的子问题,直到子问题足够简单,可以直接求解。这个过程通常包含两个关键部分:递归出口和递归体。递归出口定义了问题何时不再继续分解,即最简单、可直接

c语言函数递归 怎么选?常见方案对比分析
c语言函数递归 怎么选?常见方案对比分析

递归函数的基本概念与适用场景在C语言编程中,递归是一种函数调用自身的编程技巧。它并非适用于所有问题,但在处理某些具有自相似结构的问题时,能提供极其清晰和优雅的解决方案。递归的核心思想是将一个大规模问题分解为一个或多个同类型但规模更小的子问题,直到子问题简单到可以直接求解。典型的适用场景包括树形结构的

Objective-C 内存管理入门:从 alloc 到 dealloc 的生命周期详解
Objective-C 内存管理入门:从 alloc 到 dealloc 的生命周期详解

理解内存管理的基石在Objective-C的编程世界中,内存管理是开发者必须掌握的核心技能之一。它直接关系到应用的性能、稳定性与资源利用效率。与一些采用自动垃圾回收机制的语言不同,Objective-C在很长一段时间里,依赖一套基于引用计数的、需要开发者部分介入的管理规则。这套规则的核心思想是明确的

如何正确使用 dealloc 以避免 iOS 应用中的内存泄漏
如何正确使用 dealloc 以避免 iOS 应用中的内存泄漏

理解 dealloc 的角色与时机在 iOS 应用开发中,内存管理是保障应用性能与稳定性的基石。dealloc 方法是 Objective-C 中对象生命周期结束时的关键回调,它标志着对象即将被系统回收内存。正确理解其触发时机至关重要:当一个对象的引用计数降为零时,运行时系统会自动调用该对象的 de

深入理解 Objective-C 中的 dealloc 方法:内存管理核心机制
深入理解 Objective-C 中的 dealloc 方法:内存管理核心机制

内存管理的基石在Objective-C的世界里,内存管理是开发者必须掌握的核心技能之一。作为一门在手动引用计数(MRC)时代诞生的语言,Objective-C要求程序员对对象的生命周期有清晰的认识。dealloc方法正是这一生命周期中至关重要的终点站。它是一个实例方法,当对象的引用计数降为零时,系统

理解 native2ascii:Java 国际化开发中的字符编码工具
理解 native2ascii:Java 国际化开发中的字符编码工具

native2ascii 工具的基本定位在Ja va应用程序的国际化与本地化开发过程中,处理非拉丁字符集是一个常见且关键的环节。Ja va内部使用Unicode字符集来统一表示全球各种语言的文字,但其属性文件(.properties)在历史上要求使用ASCII编码,或者更准确地说,要求非ASCII字

如何使用 native2ascii 转换中文字符为 Unicode 转义序列
如何使用 native2ascii 转换中文字符为 Unicode 转义序列

理解 native2ascii 工具的基本用途在软件开发,特别是涉及国际化处理的场景中,开发者常常需要处理不同编码的文本资源。native2ascii 是 Ja va 开发工具包(JDK)中提供的一个命令行实用程序,其主要功能是将包含本地字符编码(非ASCII字符)的文件,转换为包含 Unicode

Java native2ascii 命令详解:解决属性文件乱码问题
Java native2ascii 命令详解:解决属性文件乱码问题

native2ascii 命令的由来与作用在Ja va开发中,处理国际化资源文件是一个常见需求。资源文件通常以.properties格式存储,用于支持多语言界面。然而,Ja va属性文件默认采用ISO-8859-1字符集编码,这导致了一个直接的问题:当文件中包含非拉丁字符(如中文、日文、韩文等)时,

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。