发布于2026-07-18 阅读(0)
扫一扫,手机访问
处理字典列的标准思路,很多人第一反应就是 df['info'].apply(pd.Series)。这招确实最直接,但实际用起来有几个坑要提前注意——数据类型的确认、空值的处理,还有字典键不一致的情况。如果行数一多,性能也成问题,这时候就该考虑 pd.json_normalize() 了;要是只想要某几个字段,用 map() 按需提取反而更清爽。
apply(pd.Series) 展开字典列最直接,但要注意空值和键不一致假设 DataFrame 里有一列 info,每个单元格都是一个字典,想把每个 key 变成独立列,df['info'].apply(pd.Series) 确实是最轻量的解法。它会自动对齐所有字典的 key,缺失的自动填 NaN。但很多人踩过的坑是——直接 apply 后没处理空值或结构不齐。比如有的字典是 {'a': 1, 'b': 2},有的却是 {'a': 1, 'c': 3},甚至还有 None 或空字典。这时候 pd.Series 虽然还能跑,但结果里会冒出大量 NaN,而且列名混合了所有出现过的 key(包括你根本没预料到的),后续 merge 就容易对不上。
df['info'].apply(type).unique(),确认全是 dictdf['info'].str.len().fillna(0) 快速看字典长度分布,排查空/Nonedf['info'].apply(lambda x: {k: v for k, v in x.items() if k in ['a', 'b', 'c']}) 显式过滤pd.concat(..., axis=1) 比 join 更稳展开后得到一个新 DataFrame(比如叫 expanded),需要和原表拼回去。很多人习惯用 df.join(expanded),但默认左索引对齐,一旦原表索引被重排过、或中间有 dropna 等操作,就容易错位。pd.concat([df, expanded], axis=1) 更可靠——它按位置拼接,只要 expanded 是由 df['col'].apply(...) 生成的,二者行数和顺序天然一致,不会因为索引值变化而错行。
pd.concat([df.drop('info', axis=1), expanded], axis=1)query 或 iloc),join 更可能出问题,concat 几乎无感expanded.columns = [f'info_{c}' for c in expanded.columns] 提前改好,避免后续引用麻烦pd.json_normalize 替代 apply(pd.Series)当字典列超过几千行,apply(pd.Series) 会明显变慢——每行都新建一个 Series 对象,Python 层循环开销大。这时候 pd.json_normalize(df['info']) 是更优的选择,它是 C 实现的,专为嵌套 JSON/字典设计,速度通常快 3–5 倍。注意 json_normalize 默认会把嵌套字典也展开(比如 {'user': {'name': 'A', 'id': 1}} 会变成 user.name 和 user.id 两列),如果只要一级 key,加参数 max_level=0:
pd.json_normalize(df['info'], max_level=0)
json_normalize 对 None 和非字典值更敏感,遇到会报 TypeError,需提前清洗:df['info'] = df['info'].apply(lambda x: x if isinstance(x, dict) else {})concat 配合最稳妥json_normalize 默认会跳过;要展开 list 字段得用 record_path 参数,那是另一个场景了map 提取关键字段不是所有字典列都适合全量展开。比如日志字段 metadata 里 key 每次都不一样({'req_id': 'x', 'trace_id': 'y'} vs {'session_id': 'z', 'region': 'cn'}),强行展开会导致列爆炸,而且多数列长期为空。这时候更务实的做法是明确你要哪几个字段,用 .map() 单独提出来:
df['req_id'] = df['metadata'].map(lambda x: x.get('req_id') if isinstance(x, dict) else None)
df['trace_id'] = df['metadata'].map(lambda x: x.get('trace_id') if isinstance(x, dict) else None)
map 比 apply 轻,不构造中间 DataFrame,内存友好.get(key, default) 避免 KeyError,比直接 x[key] 安全得多user_ 开头),可以用 df['metadata'].apply(lambda x: {k: v for k, v in x.items() if k.startswith('user_')}).apply(pd.Series) 先过滤再展真正难的不是展开动作本身,而是字典数据质量——键不统一、空值混杂、嵌套层级不一。这些不会在 apply(pd.Series) 报错,却会在下游计算中悄悄引入 NaN 或错列,等你发现时往往已经跑完几轮分析。