展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > 用相关性分析消除“冗余特征”

用相关性分析消除“冗余特征”

刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。 所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。 一个原本 20 列的数据集,经常被我搞到七八十列。 然后我就发现事情不太对劲了: 训练时间明显变

刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。

用相关性分析消除“冗余特征”

所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。

一个原本 20 列的数据集,经常被我搞到七八十列。

然后我就发现事情不太对劲了:

  • 训练时间明显变长了,这我能忍
  • 但模型在测试集上的表现并没有变好,有时候反而变差了
  • 更离谱的是,有些模型输出的特征重要度排名,排在前面的几个特征我一看——它们之间好像说的根本就是同一件事

后来我才知道,这就是所谓的特征冗余问题。

而解决它的一个简单有效的方法,就是相关性分析。

什么是"冗余特征"?

我用一个特别直观的场景来解释。

假设你要判断一个人胖不胖,你收集了这些指标:

特征说明
体重(kg)直接称重
体重(斤)就是上面那个乘以 2
BMI由体重和身高算出来的
腰围用尺子量的
鞋码脚的大小

其实一眼就能判断出来,"体重(kg)"和"体重(斤)"说到底只是同一项信息的两种单位表达。要是把这两个字段同时交给模型,它并不会因此获得额外信息,反而更容易被这种重复内容带偏。

真实场景里当然不会这么夸张,但本质是一样的。比如:

  • 电商数据里"累计消费金额"和"历史订单总额",往往是高度重合的
  • 房产数据里"建筑面积"和"使用面积",趋势几乎一致
  • 用户画像里"登录次数"和"活跃天数",很多时候强相关

这些特征单独看都有意义,但放在一起就冗余了。

如何发现"冗余特征"?

答案就是相关性。这也是我们在机器学习训练之前消除**"冗余特征"**的实现原理。

实现的核心思想就是,如果两个特征之间高度相关,它们携带的信息大量重叠,只需保留其中一个。

而保留哪个?取决于是否提供了目标变量 y :

  • 有 y :比较两个特征各自与 y 的相关性,保留与目标更相关的那个
  • 无 y :默认保留遍历顺序靠前的特征

根据这个原理,实现的思路也特别直接,就三步:

第一步:构建相关系数矩阵

相关系数大家应该都见过,最常用的是 Pearson 相关系数,取值 -1 到 1:

  • 接近 1 → 强正相关,你增我也增
  • 接近 -1 → 强负相关,你增我减
  • 接近 0 → 没啥线性关系

我们用 pandas 一行就能算出来:

 复制代码corr_matrix = df.corr().abs()  # 取绝对值,因为我们只关心"强度"

假设我们有 5 个特征,算出来大概是这么一张表:

 复制代码              体重kg   体重斤   BMI    腰围    鞋码
体重kg        1.00    1.00   0.85   0.78   0.30
体重斤        1.00    1.00   0.85   0.78   0.30
BMI           0.85    0.85   1.00   0.72   0.25
腰围          0.78    0.78   0.72   1.00   0.35
鞋码          0.30    0.30   0.25   0.35   1.00

"体重kg"和"体重斤"的相关系数是 1.0——完全冗余,一眼就能看出来。

第二步:设定阈值,筛出冗余对

接下来就是设一个阈值。根据经验:

  • 0.95 以上 → 几乎可以肯定是冗余,放心删
  • 0.85 ~ 0.95 → 大概率冗余,需要结合业务判断
  • 0.85 以下 → 一般可以保留

上面那张表里,如果阈值设 0.95,那"体重kg"和"体重斤"这一对就被揪出来了。

第三步:删谁留谁?这才是关键

找出冗余对之后,问题来了——删哪个?

这里有个很实用的策略:看谁跟目标变量(也就是你要预测的那个东西)更相关,留那个更有用的。

还是上面的例子。假设我们的目标是预测"健康状况评分":

 复制代码与健康评分的相关性:
    体重kg  → 0.45
    体重斤  → 0.45(一样的,因为它就是体重kg × 2)
    BMI     → 0.62
    腰围    → 0.58

如果"体重kg"和"体重斤"必须删一个,删哪个其实无所谓(反正信息完全一样)。

但如果两个特征的相关系数是 0.96 而不是 1.0,它们就不完全相同了,这时候保留与目标变量更相关的那个,就更有意义。

代码实现

理解了原理和思路之后,封装了一个工具类。核心逻辑是这样的:

 复制代码class CorrelationSelector:
    """
    基于相关系数的特征冗余过滤器。
    """    def __init__(self, corr_threshold: float = 0.95, corr_method: str = 'pearson'):
        self.corr_threshold = corr_threshold
        self.corr_method = corr_method
        self.kept_features_ = None
        self.dropped_features_ = None
        self.redundant_pairs_ = None
        self._fitted_flag = False    def fit(self, X, y=None):
        # 构建绝对值相关系数矩阵
        abs_corr = X.corr(method=self.corr_method).abs()        col_names = list(abs_corr.columns)
        num_features = len(col_names)
        pair_records = []
        drop_set = set()        # 只遍历上三角,避免重复比较
        for i in range(num_features):
            for j in range(i + 1, num_features):
                pair_corr = abs_corr.iloc[i, j]                if pair_corr <= self.corr_threshold:
                    continue  # 没超过阈值,跳过                feat_a = col_names[i]
                feat_b = col_names[j]                # 决定保留谁:看谁跟目标变量更相关
                if y is not None:
                    corr_a = abs(X[feat_a].corr(y))
                    corr_b = abs(X[feat_b].corr(y))
                    if corr_a >= corr_b:
                        keep, drop = feat_a, feat_b
                    else:
                        keep, drop = feat_b, feat_a
                else:
                    keep, drop = feat_a, feat_b                pair_records.append({
                    'feature_x': feat_a,
                    'feature_y': feat_b,
                    'corr_value': pair_corr,
                    'kept': keep,
                    'dropped': drop,
                })
                drop_set.add(drop)        self.redundant_pairs_ = pd.DataFrame(pair_records)
        self.dropped_features_ = list(drop_set)
        self.kept_features_ = [f for f in col_names if f not in drop_set]
        self._fitted_flag = True
        return self    def transform(self, X):
        if not self._fitted_flag:
            raise ValueError("请先调用 fit()")
        return X[self.kept_features_]    def fit_transform(self, X, y=None):
        self.fit(X, y)
        return self.transform(X)

用法非常简单,三行搞定:

 复制代码selector = CorrelationSelector(corr_threshold=0.95)
X_clean = selector.fit_transform(X_train, y_train)# 看看哪些特征被干掉了
print(selector.dropped_features_)

完整的代码和使用方式见文末的分享链接。

注意事项

只看了 Pearson,忽略了非线性关系

Pearson 相关系数只能捕捉线性关系。如果两个特征之间是某种曲线关系(比如二次函数),Pearson 可能算出来接近 0,但它们其实是强相关的。

我的做法: 如果对数据分布不太确定,我会换成 spearman 方法,它基于排序,能捕捉单调关系:

 复制代码selector = CorrelationSelector(corr_threshold=0.95, corr_method='spearman')

阈值设太低,把有用的特征也删了

比如把阈值设成 0.7,心想"相关性超过 0.7 就算冗余了吧"。

结果一跑,将近一半的特征被删掉了,模型效果直接崩了。

我们需要注意:相关性高不等于冗余,只有"高度到几乎可替代"的程度才算冗余。

0.8 的两个特征,各自还是有独立信息量的。

我现在一般默认用 0.95,最少也不低于 0.85。

贪心删除的"连锁反应"

这个坑比较隐蔽。假设有三个特征 A、B、C:

 复制代码corr(A, B) = 0.97  → 删 B
corr(B, C) = 0.96  → 删 C
corr(A, C) = 0.98  → 应该删 C,但 C 已经被删了

最后只剩下 A。但如果你仔细看,A 和 C 的相关性最高(0.98),也许应该删的是 A 而保留 C。

当特征维度飙升时,这种“贪心策略”引发的连锁反应往往会被放大。但回归到大多数实际业务场景,你大可不必为此过度焦虑,因为这个问题影响不大。毕竟,我们的核心诉求并非穷尽所有可能去锁定那个不存在的“最优子集”,而是果断剔除那些一眼就能看穿的冗余特征,从而让模型结构更加清爽高效。

如果真的很在意,可以用迭代式的方式:每次只删一个特征,然后重新计算相关矩阵,再来一轮。

但这样计算量会大不少,一般没必要。

一张热力图,胜过千言万语

在跑选择器之前,可以先画一张相关系数热力图,对数据有个直观感受:

 复制代码import seaborn as sns
import matplotlib.pyplot as pltcorr = X_train.corr().abs()plt.figure(figsize=(12, 10))
sns.heatmap(corr, annot=True, fmt='.2f', cmap='Reds', 
            square=True, linewidths=0.5)
plt.title('特征间相关性热力图')
plt.tight_layout()
plt.show()

颜色越深的格子,就越是"危险区域"——大概率存在冗余。看一眼热力图,你对哪些特征需要处理就心里有数了。

总结

回过头来看,相关性特征选择这个技术真的很朴素,但越朴素的东西越容易被人忽略。

总结起来大概有这几点:

  1. 特征不在于多,在于精。 10 个精心挑选的特征,往往比 100 个堆砌出来的特征效果更好。
  2. 冗余特征不是一眼就能看出来的。 数据量一大,人脑根本处理不过来,必须靠工具。
  3. 阈值别太激进。 0.95 是一个比较稳妥的起点。
  4. 先看热力图,再跑选择器。 有个全局视角很重要。
  5. 这个方法不是银弹。 它只是特征选择工具箱里的一个工具,配合其他方法一起用效果最好。

文中封装的 class CorrelationSelector 和测试其使用方式的完整代码分享在网盘中:

url11.ctfile.com/d/45455611-… (访问密码: 6872)

相关文件是:correlation_selector.py 和 test_correlation_selector.py。

我的测试结果如下:

 复制代码样本数: 50, 特征数: 45 (5 真实 + 50 冗余)【全特征】   特征数  45 | RMSE: 7.76 | 耗时: 0.031s
【筛选后】   特征数   5 | RMSE: 3.12 | 耗时: 0.026s
  保留的特征: ['体重_副本4', '身高_副本2', '腰围_副本4', '年龄_副本0', '鞋码_副本0']
  移除的特征数: 40冗余报告(前5条):
  feature_x feature_y  corr_value    kept dropped
0    体重(kg)    体重_副本1    0.988230  体重(kg)  体重_副本1
1        年龄    年龄_副本4    0.986350      年龄  年龄_副本4
2        年龄    年龄_副本5    0.985934  年龄_副本5      年龄
3    腰围(cm)    腰围_副本5    0.984395  腰围(cm)  腰围_副本5
4        鞋码    鞋码_副本4    0.984352      鞋码  鞋码_副本4

消除"冗余特征"之后,RMSE 显著降低。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系bd@zhengruan.com
作者最新文章
编程开发 机器学习
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Mac
Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。