商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 如何使用Python实现数据清洗中的缺失值填充_基于Pandas的fillna策略

如何使用Python实现数据清洗中的缺失值填充_基于Pandas的fillna策略

  发布于2026-07-02 阅读(0)

扫一扫,手机访问

做数据清洗的朋友应该都遇到过这样的场景:拿到一份数据,跑起来全是NaN,顺手敲一行fillna(0)或者fillna("unknown"),以为万事大吉。结果呢?后面建模的时候,数值列莫名其妙变成了字符串,分类列里凭空多出来一个本该不存在的“0”类别,整个数据分析流程直接卡住。这事并不稀奇——fillna看似简单,但踩坑的人从来不少。

先提个醒:fillna的第一个教训,就是绝对不能一刀切。直接用fillna(0)去填所有列,数值列可能还没太大问题,一旦碰到时间列或分类列,那麻烦就大了。时间列填进去一个整数,Pandas会强制把它转成object,后续所有时间计算全废;分类列填0,可能被模型当成一个有效类别,但业务上这个0压根不存在。所以动手填充前,第一件事是搞清楚每列的dtype和业务含义。

数值列的处理相对简单:均值和中位数是首选。异常值偏多的时候,中位数更稳。写法上就是fillna(df["col"].mean())或者fillna(df["col"].median())。时间列得特殊照顾——不能用数字或字符串去填,必须用pd.NaT,或者一个合理的默认时间点,比如fillna(pd.Timestamp("1970-01-01"))。分类列的玩法不一样,填"Missing"比填None更可控,但关键是提前把列转成category类型,确保新值能被系统识别为合法类别,否则填进去也会被忽略。

如何使用Python实现数据清洗中的缺失值填充_基于Pandas的fillna策略

fillna 填什么值?先看缺失类型再选策略

直接用 fillna(0)fillna("unknown") 很危险——数值型列填字符串会强制转为 object 类型,后续计算全报错;分类列填 0 可能被误当有效类别。必须先确认 dtype 和业务含义。

  • 数值列(float64):优先考虑 fillna(df["col"].mean())fillna(df["col"].median()),异常值多时用中位数更稳
  • 时间列(datetime64):不能填数字或字符串,得用 pd.NaT 或合理默认时间,比如 fillna(pd.Timestamp("1970-01-01"))
  • 分类列(objectcategory):填 "Missing"None 更可控,且要提前用 df["col"] = df["col"].astype("category") 确保新值能被识别为合法类别

按列差异调用 fillna:避免整表一刀切

df.fillna({"A": 0, "B": "N/A", "C": df["C"].mode()[0]}) 是最常用也最安全的方式。整表统一填一个值(如 df.fillna(0))会污染非数值列,且无法处理众数为空(所有值唯一)的情况。

  • mode() 返回 Series,必须取 [0];若列全空,mode() 返回空 Series,直接取 [0]IndexError,得加判断:df["col"].mode().iloc[0] if not df["col"].mode().empty else "Unknown"
  • 对时间列单独处理:先用 pd.to_datetime(df["time"], errors="coerce") 转成 datetime64,再填 pd.NaT 或前向填充 fillna(method="ffill")
  • 别在原地改:始终写 df_clean = df.fillna(...),而不是 df.fillna(..., inplace=True),后者在链式操作中容易出不可复现的 bug

用 method 参数做时序/结构化填充:ffill 和 bfill 的边界问题

method="ffill" 不是万能的——它只沿指定轴向前传播最后一个有效值,遇到开头连续缺失就完全无效。实际中常需组合使用或加限制。

  • 限制填充长度:fillna(method="ffill", limit=3) 防止一个有效值撑起后面几十行
  • 按组填充更合理:比如用户行为日志,应先 groupby("user_id")apply(lambda x: x.fillna(method="ffill")),否则用户 A 的数据会污染用户 B 的字段
  • bfill 在末尾缺失多时有用,但和 ffill 一样不校验逻辑合理性——比如“注册时间”列用 bfill 填了未来日期,程序不会报错,但业务上绝对错误

fillna 后必须验证:dtype 和非空计数是否符合预期

填完不检查等于没填。尤其要注意 object 列混入 floatint 后,isna() 仍返回 True,但 sum() 会直接报错。

  • 快速核对:df_clean.dtypes 看有没有意外变成 objectdf_clean.isna().sum() 确认目标列确实为 0
  • 数值列验证:填均值后用 df_clean["num_col"].describe()min/max 是否仍在合理区间,避免因原始数据有极端异常值导致均值失真
  • 写进清洗函数里:每次 fillna 后加一句 assert df_clean[col].notna().all(), f"{col} still has NaN after fill",CI 流程里就能立刻暴露问题

最后说一个容易被忽视的点:fillna不是万能的,它不会改变缺失模式带来的分布偏移。比如用中位数去填充大量缺失的收入字段,建模时模型会误以为中位数就是真实的高频值,结果自然不准。真正严谨的清洗,往往需要配合插值、建模预测填充,或者明确标记“已填充”的列供下游感知。数据清洗不是填个值就完事,后续的验证和审计同样不可少。

本文转载于:https://www.php.cn/faq/2462482.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注