发布于2026-07-20 阅读(0)
扫一扫,手机访问
在用 pickle.dump 序列化对象时,最容易踩的坑就是那些不可序列化的属性——比如 threading.Lock、socket 套接字、lambda 表达式、文件句柄等等。一碰上就直接抛 TypeError。更隐蔽的问题是:有些属性本来就不该被持久化(比如缓存、临时计算结果、数据库连接),但它们也会被一股脑塞进序列化流里。怎么办?通过 __getstate__ 可以精确控制哪些属性被序列化,再配合 __setstate__ 在反序列化后补回必要的对象。

pickle.dump 会报错或序列化出不该有的属性当你用 pickle 序列化一个对象时,默认调用的是对象的 __dict__——也就是全部实例属性。如果里头混入了不可序列化的值(threading.Lock、socket.socket、lambda、文件句柄等),就会直接报 TypeError: can't pickle ...。更麻烦的是,有些属性本来就没必要持久化,比如缓存、临时计算结果、数据库连接,但它们也被一股脑地塞进去了。这就好比出门旅行,把家里的锁和没吃完的零食都带上了,不但多余还可能出问题。
__getstate__ 排除特定属性__getstate__ 是 pickle 在序列化前调用的钩子函数,返回一个字典,决定哪些属性真正写入序列化流。你只需在类中定义它,返回一个过滤后的状态字典即可。
常见做法:
__dict__,然后用 del 或字典推导删掉不想保存的键。super().__getstate__()(不过大多数情况下父类没重写,直接操作 self.__dict__ 就够了)。示例:
class CacheManager:
def __init__(self):
self.data = {"a": 1}
self._cache = {}
self._lock = threading.Lock() # 不可序列化
self._temp_result = None
def __getstate__(self):
state = self.__dict__.copy()
for attr in ["_lock", "_temp_result"]:
state.pop(attr, None)
return state
__setstate__ 必须配对实现吗不是必须,但强烈建议配对。如果你在 __getstate__ 中删了某些属性,反序列化时 __dict__ 就不包含它们。而有些属性(比如 _lock)是运行时必需的,否则后续调用就会报 AttributeError。
__setstate__ 在 unpickle 后立即执行,接收的就是 __getstate__ 返回的字典。你可以在这里补回缺失的属性:
threading.Lock())self._temp_result = None)state 到 self.__dict__,否则会绕过你的初始化逻辑示例续写:
def __setstate__(self, state):
self.__dict__.update(state)
self._lock = threading.Lock()
self._temp_result = None
__getstate__ 更轻量的替代方案:__reduce__如果你只是想跳过几个字段,又不想写两套方法,__reduce__ 是更底层、更灵活的选择。它返回一个元组:(callable, args, state),其中 state 就是给 __setstate__ 的字典。你可以只传部分属性过去,甚至完全绕过 __dict__。
但它容易出错:一旦 callable 和 args 构造不出正确实例,反序列化就失败;而且调试起来比 __getstate__ 更难以追踪。
所以除非你有特殊构造逻辑(比如必须调用工厂函数),否则优先用 __getstate__ + __setstate__。它们语义清晰、调试友好,也符合大多数人的直觉。
真正容易被忽略的是:如果你的类用了 __slots__,__dict__ 可能根本不存在,这时 __getstate__ 必须手动拼出状态字典,不能无脑用 self.__dict__.copy() —— 这种情况得先检查 hasattr(self, '__dict__') 或改用 getattr(self, '__slots__', []) 来遍历。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8