当前位置:

首页 > 编程开发 > 用相关性分析消除“冗余特征”

用相关性分析消除“冗余特征”

本文目录

    刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。 所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。 一个原本 20 列的数据集,经常被我搞到七八十列。 然后我就发现事情不太对劲了: 训练时间明显变

    刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。

    用相关性分析消除“冗余特征”

    所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。

    一个原本 20 列的数据集,经常被我搞到七八十列。

    然后我就发现事情不太对劲了:

    • 训练时间明显变长了,这我能忍
    • 但模型在测试集上的表现并没有变好,有时候反而变差了
    • 更离谱的是,有些模型输出的特征重要度排名,排在前面的几个特征我一看——它们之间好像说的根本就是同一件事

    后来我才知道,这就是所谓的特征冗余问题。

    而解决它的一个简单有效的方法,就是相关性分析。

    什么是"冗余特征"?

    我用一个特别直观的场景来解释。

    假设你要判断一个人胖不胖,你收集了这些指标:

    特征说明
    体重(kg)直接称重
    体重(斤)就是上面那个乘以 2
    BMI由体重和身高算出来的
    腰围用尺子量的
    鞋码脚的大小

    其实一眼就能判断出来,"体重(kg)"和"体重(斤)"说到底只是同一项信息的两种单位表达。要是把这两个字段同时交给模型,它并不会因此获得额外信息,反而更容易被这种重复内容带偏。

    真实场景里当然不会这么夸张,但本质是一样的。比如:

    • 电商数据里"累计消费金额"和"历史订单总额",往往是高度重合的
    • 房产数据里"建筑面积"和"使用面积",趋势几乎一致
    • 用户画像里"登录次数"和"活跃天数",很多时候强相关

    这些特征单独看都有意义,但放在一起就冗余了。

    如何发现"冗余特征"?

    答案就是相关性。这也是我们在机器学习训练之前消除**"冗余特征"**的实现原理。

    实现的核心思想就是,如果两个特征之间高度相关,它们携带的信息大量重叠,只需保留其中一个。

    而保留哪个?取决于是否提供了目标变量 y :

    • 有 y :比较两个特征各自与 y 的相关性,保留与目标更相关的那个
    • 无 y :默认保留遍历顺序靠前的特征

    根据这个原理,实现的思路也特别直接,就三步:

    第一步:构建相关系数矩阵

    相关系数大家应该都见过,最常用的是 Pearson 相关系数,取值 -1 到 1:

    • 接近 1 → 强正相关,你增我也增
    • 接近 -1 → 强负相关,你增我减
    • 接近 0 → 没啥线性关系

    我们用 pandas 一行就能算出来:

     复制代码corr_matrix = df.corr().abs()  # 取绝对值,因为我们只关心"强度"
    

    假设我们有 5 个特征,算出来大概是这么一张表:

     复制代码              体重kg   体重斤   BMI    腰围    鞋码
    体重kg        1.00    1.00   0.85   0.78   0.30
    体重斤        1.00    1.00   0.85   0.78   0.30
    BMI           0.85    0.85   1.00   0.72   0.25
    腰围          0.78    0.78   0.72   1.00   0.35
    鞋码          0.30    0.30   0.25   0.35   1.00
    

    "体重kg"和"体重斤"的相关系数是 1.0——完全冗余,一眼就能看出来。

    第二步:设定阈值,筛出冗余对

    接下来就是设一个阈值。根据经验:

    • 0.95 以上 → 几乎可以肯定是冗余,放心删
    • 0.85 ~ 0.95 → 大概率冗余,需要结合业务判断
    • 0.85 以下 → 一般可以保留

    上面那张表里,如果阈值设 0.95,那"体重kg"和"体重斤"这一对就被揪出来了。

    第三步:删谁留谁?这才是关键

    找出冗余对之后,问题来了——删哪个?

    这里有个很实用的策略:看谁跟目标变量(也就是你要预测的那个东西)更相关,留那个更有用的。

    还是上面的例子。假设我们的目标是预测"健康状况评分":

     复制代码与健康评分的相关性:
        体重kg  → 0.45
        体重斤  → 0.45(一样的,因为它就是体重kg × 2)
        BMI     → 0.62
        腰围    → 0.58
    

    如果"体重kg"和"体重斤"必须删一个,删哪个其实无所谓(反正信息完全一样)。

    但如果两个特征的相关系数是 0.96 而不是 1.0,它们就不完全相同了,这时候保留与目标变量更相关的那个,就更有意义。

    代码实现

    理解了原理和思路之后,封装了一个工具类。核心逻辑是这样的:

     复制代码class CorrelationSelector:
        """
        基于相关系数的特征冗余过滤器。
        """    def __init__(self, corr_threshold: float = 0.95, corr_method: str = 'pearson'):
            self.corr_threshold = corr_threshold
            self.corr_method = corr_method
            self.kept_features_ = None
            self.dropped_features_ = None
            self.redundant_pairs_ = None
            self._fitted_flag = False    def fit(self, X, y=None):
            # 构建绝对值相关系数矩阵
            abs_corr = X.corr(method=self.corr_method).abs()        col_names = list(abs_corr.columns)
            num_features = len(col_names)
            pair_records = []
            drop_set = set()        # 只遍历上三角,避免重复比较
            for i in range(num_features):
                for j in range(i + 1, num_features):
                    pair_corr = abs_corr.iloc[i, j]                if pair_corr <= self.corr_threshold:
                        continue  # 没超过阈值,跳过                feat_a = col_names[i]
                    feat_b = col_names[j]                # 决定保留谁:看谁跟目标变量更相关
                    if y is not None:
                        corr_a = abs(X[feat_a].corr(y))
                        corr_b = abs(X[feat_b].corr(y))
                        if corr_a >= corr_b:
                            keep, drop = feat_a, feat_b
                        else:
                            keep, drop = feat_b, feat_a
                    else:
                        keep, drop = feat_a, feat_b                pair_records.append({
                        'feature_x': feat_a,
                        'feature_y': feat_b,
                        'corr_value': pair_corr,
                        'kept': keep,
                        'dropped': drop,
                    })
                    drop_set.add(drop)        self.redundant_pairs_ = pd.DataFrame(pair_records)
            self.dropped_features_ = list(drop_set)
            self.kept_features_ = [f for f in col_names if f not in drop_set]
            self._fitted_flag = True
            return self    def transform(self, X):
            if not self._fitted_flag:
                raise ValueError("请先调用 fit()")
            return X[self.kept_features_]    def fit_transform(self, X, y=None):
            self.fit(X, y)
            return self.transform(X)
    

    用法非常简单,三行搞定:

     复制代码selector = CorrelationSelector(corr_threshold=0.95)
    X_clean = selector.fit_transform(X_train, y_train)# 看看哪些特征被干掉了
    print(selector.dropped_features_)
    

    完整的代码和使用方式见文末的分享链接。

    注意事项

    只看了 Pearson,忽略了非线性关系

    Pearson 相关系数只能捕捉线性关系。如果两个特征之间是某种曲线关系(比如二次函数),Pearson 可能算出来接近 0,但它们其实是强相关的。

    我的做法: 如果对数据分布不太确定,我会换成 spearman 方法,它基于排序,能捕捉单调关系:

     复制代码selector = CorrelationSelector(corr_threshold=0.95, corr_method='spearman')
    

    阈值设太低,把有用的特征也删了

    比如把阈值设成 0.7,心想"相关性超过 0.7 就算冗余了吧"。

    结果一跑,将近一半的特征被删掉了,模型效果直接崩了。

    我们需要注意:相关性高不等于冗余,只有"高度到几乎可替代"的程度才算冗余。

    0.8 的两个特征,各自还是有独立信息量的。

    我现在一般默认用 0.95,最少也不低于 0.85。

    贪心删除的"连锁反应"

    这个坑比较隐蔽。假设有三个特征 A、B、C:

     复制代码corr(A, B) = 0.97  → 删 B
    corr(B, C) = 0.96  → 删 C
    corr(A, C) = 0.98  → 应该删 C,但 C 已经被删了
    

    最后只剩下 A。但如果你仔细看,A 和 C 的相关性最高(0.98),也许应该删的是 A 而保留 C。

    当特征维度飙升时,这种“贪心策略”引发的连锁反应往往会被放大。但回归到大多数实际业务场景,你大可不必为此过度焦虑,因为这个问题影响不大。毕竟,我们的核心诉求并非穷尽所有可能去锁定那个不存在的“最优子集”,而是果断剔除那些一眼就能看穿的冗余特征,从而让模型结构更加清爽高效。

    如果真的很在意,可以用迭代式的方式:每次只删一个特征,然后重新计算相关矩阵,再来一轮。

    但这样计算量会大不少,一般没必要。

    一张热力图,胜过千言万语

    在跑选择器之前,可以先画一张相关系数热力图,对数据有个直观感受:

     复制代码import seaborn as sns
    import matplotlib.pyplot as pltcorr = X_train.corr().abs()plt.figure(figsize=(12, 10))
    sns.heatmap(corr, annot=True, fmt='.2f', cmap='Reds', 
                square=True, linewidths=0.5)
    plt.title('特征间相关性热力图')
    plt.tight_layout()
    plt.show()
    

    颜色越深的格子,就越是"危险区域"——大概率存在冗余。看一眼热力图,你对哪些特征需要处理就心里有数了。

    总结

    回过头来看,相关性特征选择这个技术真的很朴素,但越朴素的东西越容易被人忽略。

    总结起来大概有这几点:

    1. 特征不在于多,在于精。 10 个精心挑选的特征,往往比 100 个堆砌出来的特征效果更好。
    2. 冗余特征不是一眼就能看出来的。 数据量一大,人脑根本处理不过来,必须靠工具。
    3. 阈值别太激进。 0.95 是一个比较稳妥的起点。
    4. 先看热力图,再跑选择器。 有个全局视角很重要。
    5. 这个方法不是银弹。 它只是特征选择工具箱里的一个工具,配合其他方法一起用效果最好。

    文中封装的 class CorrelationSelector 和测试其使用方式的完整代码分享在网盘中:

    url11.ctfile.com/d/45455611-… (访问密码: 6872)

    相关文件是:correlation_selector.py 和 test_correlation_selector.py。

    我的测试结果如下:

     复制代码样本数: 50, 特征数: 45 (5 真实 + 50 冗余)【全特征】   特征数  45 | RMSE: 7.76 | 耗时: 0.031s
    【筛选后】   特征数   5 | RMSE: 3.12 | 耗时: 0.026s
      保留的特征: ['体重_副本4', '身高_副本2', '腰围_副本4', '年龄_副本0', '鞋码_副本0']
      移除的特征数: 40冗余报告(前5条):
      feature_x feature_y  corr_value    kept dropped
    0    体重(kg)    体重_副本1    0.988230  体重(kg)  体重_副本1
    1        年龄    年龄_副本4    0.986350      年龄  年龄_副本4
    2        年龄    年龄_副本5    0.985934  年龄_副本5      年龄
    3    腰围(cm)    腰围_副本5    0.984395  腰围(cm)  腰围_副本5
    4        鞋码    鞋码_副本4    0.984352      鞋码  鞋码_副本4
    

    消除"冗余特征"之后,RMSE 显著降低。

    本文内容来源于网友投稿,如有侵权请联系删除。
    作者最新文章
    编程开发 机器学习
    相关文章 更多
    Claude Code AI编程工具实力揭秘与编程助手实测
    Claude Code AI编程工具实力揭秘与编程助手实测

    通过实测展示Claude Code在终端中如何理解自然语言指令、自动修改代码文件并处理复杂编程任务,帮助开发者评估其实际辅助能力。

    winforms教程自学入门与基础开发步骤详解
    winforms教程自学入门与基础开发步骤详解

    本教程详细讲解如何使用Visual Studio创建WinForms项目,通过添加按钮和标签控件并编写点击事件代码,实现一个基础的计数器功能,适合C#初学者快速上手Windows窗体应用开发。

    Cursor自动补全设置教程教你快速开启代码补全功能
    Cursor自动补全设置教程教你快速开启代码补全功能

    详解Cursor编辑器中自动补全功能的开启与优化设置,涵盖Tab触发机制、上下文窗口调整及模型切换,帮助开发者解决补全延迟、干扰大等问题,提升编码流畅度。

    pandas的数据格式怎么转换和设置方法教程
    pandas的数据格式怎么转换和设置方法教程

    详解Pandas中数据格式转换的核心方法,包括astype强制转换、to_numeric容错处理及日期解析技巧,解决常见类型错误并提升数据处理效率。

    VS Code中文设置方法 简体语言包安装与切换教程
    VS Code中文设置方法 简体语言包安装与切换教程

    详细介绍在Visual Studio Code中安装Chinese (Simplified)语言包的方法,包括通过扩展市场搜索、安装及自动重启切换至简体中文界面的完整步骤,帮助开发者快速将编辑器本地化。

    cursor安装过程无法更改安装位置的解决方法
    cursor安装过程无法更改安装位置的解决方法

    针对Cursor安装包默认锁定C盘且无路径选择界面的问题,提供通过手动移动文件并创建目录联结(Symbolic Link)的解决方案,实现将软件安装在其他磁盘分区。

    rust下载安装教程详解及Windows环境配置方法
    rust下载安装教程详解及Windows环境配置方法

    详解Windows系统下Rust语言的安装步骤,重点解析rustup工具链管理机制,解决环境变量配置错误及MSVC链接器缺失问题,提供可复制的命令验证方法与常见报错的因果排查思路。

    vs code怎么配置 chat实用设置教程步骤
    vs code怎么配置 chat实用设置教程步骤

    详解VS Code中Chat插件的安装与核心配置步骤,重点解决API连接失败、响应慢等常见问题,通过优化上下文设置提升代码生成质量,适合希望集成AI辅助工具的开发者阅读。

    uniapp实例教程代码详解与项目实战指南
    uniapp实例教程代码详解与项目实战指南

    本教程通过实战案例详解UniApp开发流程,包括项目初始化、页面结构解析、数据绑定与事件处理,帮助初学者快速上手跨平台应用开发。

    android studio安装教程2026
    android studio安装教程2026

    详细讲解2026年最新版Android Studio的下载与安装步骤,涵盖JDK环境检查、组件选择及初始配置,助您顺利开启安卓应用开发之旅。

    查看更多
    精品专题 更多
    装机必备
    装机必备

    正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

    Windows
    Windows

    正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

    macOS软件
    macOS软件

    正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

    Mac软件 更多
    Blender
    Blender
    Windows、macOS 和 Linux

    Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

    灵活计算器
    灵活计算器
    macOS/iOS/Android

    灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

    赤友清理大师
    赤友清理大师
    macOS

    赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

    WINDOWS 更多
    Blender
    Blender
    Windows、macOS 和 Linux

    Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

    Windows 10
    Windows 10
    Windows

    Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

    极度公式
    极度公式
    Windows/macOS/Linux

    极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。