展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > 用方差阈值过滤掉“惰性特征”

用方差阈值过滤掉“惰性特征”

机器学习实战中,大家往往把精力花在调参和选模型上,却忽略了一个更基础的问题:喂给模型的数据里,有多少特征是真正有用的? 刚开始学机器学习那会儿,很多人特别喜欢堆特征——不管有用没用先一股脑全塞进去,总觉得特征越多模型越聪明。直到有一次跑练习数据集,X_train.shape 直接干到了 (50000

机器学习实战中,大家往往把精力花在调参和选模型上,却忽略了一个更基础的问题:喂给模型的数据里,有多少特征是真正有用的?

用方差阈值过滤掉“惰性特征”

刚开始学机器学习那会儿,很多人特别喜欢堆特征——不管有用没用先一股脑全塞进去,总觉得特征越多模型越聪明。直到有一次跑练习数据集,X_train.shape 直接干到了 (50000, 1024),训练速度慢得像蜗牛,内存还经常告警。耐着性子把每列统计信息看了一遍才意识到问题所在:"产权年限" 这一列5万条数据全是70,"是否配备灭火器" 99.8%都是1。这些在所有样本上几乎不变的列,就是所谓的“惰性特征”——对预测没有任何贡献,却实实在在占内存、拖慢训练,有时候还会让线性模型数值不稳定。

方差阈值过滤,正是帮模型在起跑前甩掉这些“无用包袱”的最简利器。

如何过滤

过滤的原理特别简单:方差为0的特征,信息量就是0,直接删掉就行。方差衡量数据离散程度,方差越大越可能包含区分样本的信息;方差为零就意味着这个特征对所有样本都一样,模型从它身上什么都学不到。

基于这个思路,封装了一个 class,代码遵循了 scikit-learnFit-Transform API 设计模式。

 复制代码    def fit(
        self,
        X: Union[pd.DataFrame, np.ndarray],
        feature_names: Optional[List[str]] = None,
    ) -> "VarianceThresholdSelector":
        """
        在训练数据上拟合筛选器,学习哪些特征应当保留。        Returns:
            self: 返回自身以支持链式调用。
        """
        # ---------- 统一提取数值矩阵与列名 ----------
        if isinstance(X, pd.DataFrame):
            col_names = X.columns.tolist()
            matrix = X.values.astype(float)
        else:
            matrix = np.asarray(X, dtype=float)
            if feature_names is not None:
                col_names = list(feature_names)
            else:
                col_names = [f"特征_{i}" for i in range(matrix.shape[1])]        if matrix.ndim != 2:
            raise ValueError(f"输入数据必须为二维矩阵,当前维度为: {matrix.ndim}")        # ---------- 计算方差得分并生成筛选掩码 ----------
        scores = self._compute_scores(matrix)
        keep_mask = scores > self.threshold        # ---------- 记录拟合结果 ----------
        self.retained_cols_ = [name for name, kept in zip(col_names, keep_mask) if kept]
        self.dropped_cols_ = [name for name, kept in zip(col_names, keep_mask) if not kept]
        self.variance_scores_ = dict(zip(col_names, scores))        return self    def transform(self, X: Union[pd.DataFrame, np.ndarray]) -> Union[pd.DataFrame, np.ndarray]:
        """
        根据拟合结果移除低方差特征。
        
        Returns:
            筛选后的特征矩阵,类型与输入保持一致。
        """
        if self.retained_cols_ is None:
            raise RuntimeError("筛选器尚未拟合,请先调用 fit() 方法。")        if isinstance(X, pd.DataFrame):
            return X[self.retained_cols_]        # ndarray 场景:通过列名映射回索引位置
        all_cols = [f"特征_{i}" for i in range(X.shape[1])]
        indices = [all_cols.index(name) for name in self.retained_cols_]
        return X[:, indices]    def fit_transform(
        self,
        X: Union[pd.DataFrame, np.ndarray],
        feature_names: Optional[List[str]] = None,
    ) -> Union[pd.DataFrame, np.ndarray]:
        """
        拟合并立即转换,等价于依次调用 fit() 和 transform()。        Returns:
            筛选后的特征矩阵。
        """
        return self.fit(X, feature_names).transform(X)

scikit-learn 原生的 VarianceThreshold 使用方法一样,没有学习成本,改进之处在于:

  1. 内置归一化:解决了多量纲特征混合时的阈值设定难题
 复制代码    def _compute_scores(self, data_matrix: np.ndarray) -> np.ndarray:
        """
        计算每个特征的方差得分(内部方法)。        Args:
            data_matrix: 纯数值型的二维数组,形状为 (n_samples, n_features)。        Returns:
            一维数组,长度为 n_features,表示每个特征的方差得分。
        """
        raw_variance = np.var(data_matrix, axis=0)        if not self.use_normalized:
            return raw_variance        # 计算极差 (max - min),作为归一化的分母
        feature_ranges = np.ptp(data_matrix, axis=0)        # 安全处理:将极差为0的位置替换为1,避免除零错误
        # 此时该位置原始方差也为0,归一化结果仍为0,不影响后续筛选逻辑
        safe_ranges = np.where(feature_ranges == 0, 1.0, feature_ranges)
        normalized_scores = raw_variance / (safe_ranges ** 2)        return normalized_scores
  1. Pandas原生支持:保持了列名索引,提升了易用性
  2. 可解释性报告:让特征筛选过程透明可追溯
 复制代码    def get_selection_report(self) -> pd.DataFrame:
        """
        生成特征筛选的详细报告。        Returns:
            包含特征名、方差得分、是否保留等信息的DataFrame,
            按方差得分降序排列。
        """
        if self.variance_scores_ is None:
            raise RuntimeError("筛选器尚未拟合,请先调用 fit() 方法。")        records = []
        for feat_name, score in self.variance_scores_.items():
            is_retained = feat_name in self.retained_cols_
            records.append({
                "特征名称": feat_name,
                "方差得分": round(score, 6),
                "是否保留": is_retained,
                "筛选状态": " 保留" if is_retained else " 移除",
            })        report = pd.DataFrame(records)
        return report.sort_values("方差得分", ascending=False).reset_index(drop=True)

VarianceThresholdSelector 的核心机制是计算各特征的方差,并可选用“方差除以极差平方”的归一化方式消除量纲差异,再根据预设阈值标记并移除低方差特征。在拟合阶段,它自动记录保留与移除的列名及对应得分,并通过 transform 按此记录对 DataFrame 或 ndarray 进行列筛选,同时提供 get_selection_report 生成详细筛选报告。

测试效果

下面,模拟一个房价预测的场景,看看使用 VarianceThresholdSelector 带来的效果。

首先创建一个模拟数据,模拟主要特征和一些无关紧要的特征。

 复制代码# ==================== 数据集构造 ====================
np.random.seed(42)
n_samples = 150  # 适中样本
n_sparse = 200  # 稀疏噪声
n_cont = 50  # 伪连续噪声# 5 个真实特征
rooms = np.random.randint(2, 8, n_samples)
distance = np.random.uniform(1, 30, n_samples)
crime_rate = np.random.beta(2, 5, n_samples)  # 归一化方差 ≈ 0.039,高于阈值
age = np.random.uniform(1, 100, n_samples)
tax = np.random.normal(400, 100, n_samples)df_real = pd.DataFrame(
    {
        "房间数": rooms,
        "市中心距离": distance,
        "犯罪率": crime_rate,
        "房龄": age,
        "房产税": tax,
    }
)# 100 个稀疏二值噪声 (p=0.995,归一化方差 ≈ 0.005,低于阈值)
sparse_cols = [
    pd.Series(np.random.choice([0, 1], n_samples, p=[0.995, 0.005]), name=f"稀疏_{i}")
    for i in range(n_sparse)
]
# 50 个伪连续噪声:大部分为0,偶尔有极端值
# 归一化方差 ≈ 0.01,低于阈值 0.02,会被正确过滤
pseudo_cols = []
for i in range(n_cont):
    col = np.zeros(n_samples)
    n_outliers = np.random.randint(1, 3)
    outlier_idx = np.random.choice(n_samples, n_outliers, replace=False)
    col[outlier_idx] = np.random.uniform(100, 1000, n_outliers)
    pseudo_cols.append(pd.Series(col, name=f"伪连续_{i}"))df_noise = pd.concat(sparse_cols + pseudo_cols, axis=1)
n_noise = n_sparse + n_contX = pd.concat([df_real, df_noise], axis=1)

然后分别用三种方式(全特征,不归一化筛选和归一化筛选)来训练这个数据集。

 复制代码# 1. 全特征
rmse_full, t_full = evaluate(X, y)
print(
    f"【全特征】       特征数 {X.shape[1]:3d} | RMSE: {rmse_full:.2f} 万 | 耗时: {t_full:.3f}s"
)# 2. 不归一化筛选(阈值 0.1)
sel_raw = VarianceThresholdSelector(threshold=0.1, use_normalized=False)
X_raw = sel_raw.fit_transform(X)
rmse_raw, t_raw = evaluate(X_raw, y)
print(
    f"【不归一化筛选】 特征数 {X_raw.shape[1]:3d} | RMSE: {rmse_raw:.2f} 万 | 耗时: {t_raw:.3f}s"
)
print(
    f"  被误删的有用特征: {[c for c in df_real.columns if c not in sel_raw.retained_cols_]}"
)# 3. 归一化筛选(阈值 0.02,恰好剔除稀疏噪声)
sel_norm = VarianceThresholdSelector(threshold=0.02, use_normalized=True)
X_norm = sel_norm.fit_transform(X)
rmse_norm, t_norm = evaluate(X_norm, y)
print(
    f"【归一化筛选】   特征数 {X_norm.shape[1]:3d} | RMSE: {rmse_norm:.2f} 万 | 耗时: {t_norm:.3f}s"
)
print(f"  保留的特征: {sel_norm.retained_cols_}")

运行结果:

 复制代码样本数: 150, 特征数: 255 (5 真实 + 250 噪声)【全特征】       特征数 255 | RMSE: 12.78 万 | 耗时: 0.062s
【不归一化筛选】 特征数  54 | RMSE: 11.87 万 | 耗时: 0.028s
  被误删的有用特征: ['犯罪率']
【归一化筛选】   特征数   5 | RMSE: 5.81 万 | 耗时: 0.024s
  保留的特征: ['房间数', '市中心距离', '犯罪率', '房龄', '房产税']

从结果可以看出,做了特征筛选之后,耗时明显下降;归一化之后,防止特征误删,RMSE 更小(也就是效果更好)。最后,只用了 5 个特征,将 RMSE12.78 万美元降至约 5.81 万美元,降低了 54%,显著提升了模型泛化能力。

注意事项

方差阈值最大的优势是快且安全。它是纯无监督操作,不需要标签、不依赖模型假设,毫秒级即可完成数万维特征的粗筛,且完全不存在数据泄露风险。在文本 tf-idf 矩阵、用户行为 one-hot 编码等超高维稀疏场景中,它往往是特征工程 pipeline 的第一道防线。

但它也有明确的能力边界方差≠预测力。一个低方差特征可能对某个稀有类别有极强的区分度(比如“是否vip”仅5%为真,但精准标识高价值用户),方差阈值会误杀它;而一个高方差的自增id与目标变量毫无因果关系,方差阈值却无法识别。因此,它只适合做“粗筛”,精细选择仍需交给互信息、lasso等有监督方法。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发 机器学习
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

PDF教程适合刚接触PDF文件的用户,本文整理PDF打开、编辑、转换、合并、压缩等常见基础操作。通过这些教程可以快速了解PDF文件怎么处理,解决办公、学习和资料科整理中的常见问题。使用极轻PDF可在线完成多种PDF操作,适合新手快速上手。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。