商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 如何基于条件比较两个 DataFrame 并筛选保留匹配的优质策略记录

如何基于条件比较两个 DataFrame 并筛选保留匹配的优质策略记录

  发布于2026-07-20 阅读(0)

扫一扫,手机访问

在实际的数据分析工作中,我们经常会遇到这样一个场景:手头有两张表,一张是原始策略清单,另一张是状态更新记录,需要根据某个关键字段去筛选出符合要求的记录。比如,你想从原始策略表(df)中,只保留那些在更新表(df_2)中状态为“good”的保单。这个问题看起来简单,但如果用循环去逐行判断,效率会非常低,尤其是在数据量大的时候。

那么,有没有一种既高效又简洁的方法?答案是肯定的,而且完全可以用pandas的向量化操作来实现,避免任何显式循环。

关键在于两步走:先筛选出符合条件的“钥匙”,再用它去匹配目标表。

# 第一步:从df_2中提取所有状态为"good"的保单号
good_policy_numbers = df_2.loc[df_2["policy status"] == "good", "policy number"]

# 第二步:在df中筛选出保单号存在于上述集合中的行
result = df[df["policy number"].isin(good_policy_numbers)]

如果你喜欢更紧凑的写法,也可以把这两步合并成一行:

result = df[df["policy number"].isin(df_2.loc[df_2["policy status"] == "good", "policy number"])]

运行后,你会得到类似这样的结果:

   policy number  policy status
3             44           good
5             66           good
7             88           good

这个方法的效率优势很明显。`df_2.loc[...]`这一步是O(n)的向量化过滤,而`isin()`底层用的是哈希查找,平均时间复杂度接近O(m)。相比之下,如果用嵌套循环,时间复杂度是O(m×n),数据量一大就完全跑不动了。整个过程没有Python层的循环,完全由pandas的Cython引擎加速,这才是真正的“优雅”。

当然,使用时有几个细节需要注意。首先,要确保两个DataFrame中“policy number”列的数据类型一致,比如都是int类型,否则`isin()`可能会因为类型不匹配而返回空结果。稳妥的做法是先用`df["policy number"] = df["policy number"].astype(int)`统一一下。其次,如果df_2中存在重复的保单号,`isin()`仍然能正确匹配——只要至少有一条记录状态是“good”就行。但如果你需要严格的一对一最新状态,那最好先对df_2按时间戳去重,或者只取最新的一条记录。最后,如果你想同时筛选多个状态,比如“good”或“a verage”,可以这样写:`df_2["policy status"].isin(["good", "a verage"])`。

这个方法简洁、可读性强,而且能轻松应对百万级的数据量,可以说是生产环境中处理跨表状态筛选的标准做法了。

本文转载于:https://www.php.cn/faq/2324599.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注