商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 如何在Python中处理JSON中的NaN或Infinity非法字符_通过simplejson库

如何在Python中处理JSON中的NaN或Infinity非法字符_通过simplejson库

  发布于2026-07-09 阅读(0)

扫一扫,手机访问

经常处理跨语言数据交互的朋友,大概率都遇过这个场景:明明JSON格式看着没问题,一用simplejson.loads解析就直接报错。问题往往出在那些不合规范的浮点值——NaNInfinity-Infinity。标准JSON规范(ECMA-404)不允许这些值出现,所以Python的标准库jsonsimplejson都不买账,直接抛ValueError

典型的触发场景很常见:前端用JSON.stringify({x: NaN})发送数据,或者某些数据库导出JSON时没清洗浮点异常值。粗暴处理?直接try/except吞错误再手动替换字符串?危险操作,容易误伤合法字段名里的"NaN"字符串。也不能指望ast.literal_eval,它本来就不是处理JSON格式的工具。

如何在Python中处理JSON中的NaN或Infinity非法字符_通过simplejson库

用simplejson.JSONDecoder的object_hook绕过非法浮点检查

说白了,核心思路就是在解析过程中拦截每个原始值,把JSON文本中的"NaN""Infinity"等字符串提前转成Python对应的float('nan')float('inf'),再交给默认解码器继续处理。

这里有个常见误区:不是改parse_float参数——那个只作用于数字字面量,对字符串无效。正确做法是用object_hook预处理字典/列表里的所有值:

import simplejson as json

def handle_nan_inf(obj):
    if isinstance(obj, str):
        if obj == "NaN":
            return float("nan")
        elif obj == "Infinity":
            return float("inf")
        elif obj == "-Infinity":
            return float("-inf")
    elif isinstance(obj, dict):
        return {k: handle_nan_inf(v) for k, v in obj.items()}
    elif isinstance(obj, list):
        return [handle_nan_inf(v) for v in obj]
    return obj

data = json.loads('{"x": "NaN", "y": "Infinity", "z": [1, "NaN"]}', object_hook=handle_nan_inf)

# → {'x': nan, 'y': inf, 'z': [1, nan]}

不过要注意几点:

  • object_hook必须递归处理嵌套结构,否则只生效于顶层键值
  • 字符串匹配严格区分大小写,JSON规范里只有"NaN",不是"nan""null"
  • 如果源数据混合合法数字和非法字符串(比如"123"),千万别在object_hook里尝试float(obj)——会把所有数字字符串转成float,破坏整数精度

更安全的做法:预清洗JSON字符串再解析

再说第二种思路:当输入来源可控(比如你确定所有NaN都出现在值位置且前后有引号),用正则预处理比递归object_hook更轻量、更可预测。但必须严格锚定上下文,避免替换到字符串内容中:

import re
import simplejson as json

def clean_json_for_nan_inf(s):
    # 只替换被冒号+空格/换行+双引号包围的NaN/Infinity
    s = re.sub(r':\s*"NaN"', ': NaN', s)
    s = re.sub(r':\s*"Infinity"', ': Infinity', s)
    s = re.sub(r':\s*"-Infinity"', ': -Infinity', s)
    return s

raw = '{"score": "NaN", "msg": "user said NaN"}'
cleaned = clean_json_for_nan_inf(raw)
data = json.loads(cleaned, parse_constant=lambda x: float(x))

# → {'score': nan, 'msg': 'user said NaN'}

这里parse_constant参数是专为处理NaN/Infinity设计的,比parse_float更准确。正则替换后,simplejson会把NaN识别为常量而非字符串,自然触发parse_constant。如果JSON里有换行或复杂缩进,正则需增强(例如匹配任意空白\s*),但过度宽松可能误伤。

为什么不用json.loads + object_hook?

最后回答一个常见疑问:Python标准库json模块的object_hook在遇到NaN字符串时根本不会调用——因为解析器在进入object_hook前就已因非法值崩溃。这是simplejsonjson的关键差异:simplejson允许你在object_hook里接管所有原始类型(包括字符串),而标准json只传入已成功解析的dict/list。

所以选择方案时可以参考这个思路:

  • 如果项目已经用了simplejson,优先选object_hook方案,逻辑清晰、不依赖字符串操作
  • 如果项目强制用标准json,只能走正则预清洗+parse_constant,且要确保simplejson没被意外导入覆盖
  • 无论哪种方式,都得测试float('nan') == float('nan')返回False——后续做相等判断时不能用==,得用math.isnan()
本文转载于:https://www.php.cn/faq/2412416.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注