发布于2026-07-18 阅读(0)
扫一扫,手机访问
先聊几个核心判断。在金融数据分析里,计算四分位数几乎是家常便饭,但就是这么一个看似基础的操作,在实际处理脏数据、缺失数据时,坑却不少。很多人用NumPy一把梭,结果要么被NaN静默污染,要么样本量不够就硬算,最后画出来的箱线图、做出来的异常检测,自己心里都没底。
这篇文章不讲虚的,直接聚焦几个最关键的实操要点:用什么函数、怎么处理缺失值、样本量多少才算够、以及如何跟Pandas的结果对齐。把这些搞定了,你的四分位数计算才算真正靠谱。

np.percentile,别去碰那些花里胡哨的NumPy里算四分位数,最稳、最常用、文档最清晰的,其实就是 np.percentile。它默认用线性插值,这个行为和Excel、Pandas的describe(),以及大多数金融分析工具完全对齐。那 np.quantile 呢?虽然语义上更“统计”,但参数名和默认行为容易让人摸不着头脑,尤其是在旧版本里 method 参数还不支持,生产环境中反倒容易翻车。所以,别折腾,就用 np.percentile。
假设你有一组日收益率数组 rets,直接传百分位点进去就行:
import numpy as np rets = np.array([0.012, -0.005, 0.021, -0.013, 0.008, 0.017, -0.009]) q1, q2, q3 = np.percentile(rets, [25, 50, 75])
算出来 q1 ≈ -0.009、q2 = 0.008、q3 ≈ 0.017,和Excel的PERCENTILE.INC结果完全一致。
nan_policy='omit' 是救命稻草真实的金融时间序列,停牌、接口异常导致的数据缺失太常见了。np.percentile默认遇到NaN会直接返回nan,它不会报错,而是静默地污染你的结果。这一点极其容易被忽略,尤其是在你后续做箱线图或异常值过滤时,整个逻辑就崩了,你还浑然不知。
rets 里有一个 np.nan,np.percentile(rets, 25) 就返回 nannp.percentile(rets, 25, nan_policy='omit')nan_policy='propagate'(默认)和 'raise' 都不适合生产场景;'omit' 才是唯一合理的选项来看个例子:
rets_with_nan = np.array([0.012, np.nan, -0.005, 0.021]) print(np.percentile(rets_with_nan, 25)) # nan → 错误! print(np.percentile(rets_with_nan, 25, nan_policy='omit')) # -0.005 → 正确
四分位距(IQR)是风控和异常检测的关键指标,但它的可靠性高度依赖样本量。金融日频数据,如果只取5天,算出来的IQR基本没意义;月频数据,只给3个月,也基本不可信。
valid_count = np.count_nonzero(~np.isnan(rets))valid_count < 20,应该跳过IQR计算,或者打一个warning,而不是硬算个数字出来糊弄自己一个完整稳健的写法应该长这样:
if np.count_nonzero(~np.isnan(rets)) >= 20:
q1 = np.percentile(rets, 25, nan_policy='omit')
q3 = np.percentile(rets, 75, nan_policy='omit')
iqr = q3 - q1
else:
iqr = np.nan # 或 raise ValueError("Insufficient data for IQR")
如果你从Pandas的 Series.quantile(0.25) 切换到NumPy,需要注意一个细节:早期版本的Pandas用 interpolation='linear',新版本(1.5+)已经改为 method='linear'。而 np.percentile 的底层逻辑和Pandas新版完全一致,所以这一步无需额外调整。
但有一个核心差异必须警惕:Pandas默认会自动drop NaN,而NumPy不会。所以,等价的写法一定是:
ser.quantile(0.25, method='linear')np.percentile(ser.dropna(), 25) 或 np.percentile(ser, 25, nan_policy='omit')漏掉 nan_policy='omit' 或忘了 dropna(),数值就会差一截,尤其是在小样本、高缺失率的情况下,结果会完全失真。
四分位数本身是个基础操作,难的是在金融数据“脏、稀、断、异步”的场景下,让每一个 np.percentile 调用都可复现、可解释、不静默失败。重点盯住三个地方:NaN处理、样本量底线、以及和上下游工具的参数对齐。把这些搞定了,其他都是细枝末节。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8