处理字典列的标准思路,很多人第一反应就是 df['info'].apply(pd.Series)。这招确实最直接,但实际用起来有几个坑要提前注意——数据类型的确认、空值的处理,还有字典键不一致的情况。如果行数一多,性能也成问题,这时候就该考虑 pd.json_normalize() 了;要是只想要某几个字段,用 map() 按需提取反而更清爽。

apply(pd.Series) 展开字典列最直接,但要注意空值和键不一致

假设 DataFrame 里有一列 info,每个单元格都是一个字典,想把每个 key 变成独立列,df['info'].apply(pd.Series) 确实是最轻量的解法。它会自动对齐所有字典的 key,缺失的自动填 NaN。但很多人踩过的坑是——直接 apply 后没处理空值或结构不齐。比如有的字典是 {'a': 1, 'b': 2},有的却是 {'a': 1, 'c': 3},甚至还有 None 或空字典。这时候 pd.Series 虽然还能跑,但结果里会冒出大量 NaN,而且列名混合了所有出现过的 key(包括你根本没预料到的),后续 merge 就容易对不上。

合并回原表时,pd.concat(..., axis=1)join 更稳

展开后得到一个新 DataFrame(比如叫 expanded),需要和原表拼回去。很多人习惯用 df.join(expanded),但默认左索引对齐,一旦原表索引被重排过、或中间有 dropna 等操作,就容易错位。pd.concat([df, expanded], axis=1) 更可靠——它按位置拼接,只要 expanded 是由 df['col'].apply(...) 生成的,二者行数和顺序天然一致,不会因为索引值变化而错行。

性能差?试试 pd.json_normalize 替代 apply(pd.Series)

当字典列超过几千行,apply(pd.Series) 会明显变慢——每行都新建一个 Series 对象,Python 层循环开销大。这时候 pd.json_normalize(df['info']) 是更优的选择,它是 C 实现的,专为嵌套 JSON/字典设计,速度通常快 3–5 倍。注意 json_normalize 默认会把嵌套字典也展开(比如 {'user': {'name': 'A', 'id': 1}} 会变成 user.nameuser.id 两列),如果只要一级 key,加参数 max_level=0

pd.json_normalize(df['info'], max_level=0)

键名含特殊字符或动态变化时,别硬展,考虑用 map 提取关键字段

不是所有字典列都适合全量展开。比如日志字段 metadata 里 key 每次都不一样({'req_id': 'x', 'trace_id': 'y'} vs {'session_id': 'z', 'region': 'cn'}),强行展开会导致列爆炸,而且多数列长期为空。这时候更务实的做法是明确你要哪几个字段,用 .map() 单独提出来:

df['req_id'] = df['metadata'].map(lambda x: x.get('req_id') if isinstance(x, dict) else None)
df['trace_id'] = df['metadata'].map(lambda x: x.get('trace_id') if isinstance(x, dict) else None)

真正难的不是展开动作本身,而是字典数据质量——键不统一、空值混杂、嵌套层级不一。这些不会在 apply(pd.Series) 报错,却会在下游计算中悄悄引入 NaN 或错列,等你发现时往往已经跑完几轮分析。

本文转载于:https://www.php.cn/faq/2342057.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。