展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > Python怎么处理具有缺失值的分类问题_直方图梯度提升树原生支持

Python怎么处理具有缺失值的分类问题_直方图梯度提升树原生支持

HistGradientBoostingClassifier原生支持缺失值,自动学习分裂时缺失样本的最佳分支方向,无需预处理填充或删除。数值列保留np.nan,类别列需先编码且不能含缺失,目标变量不能有缺失。训练速度更快、内存更省,但需注意全nan列被静默跳过、预测时缺失分布变化影响泛化等边界情况。

在分类问题里,特别是碰到包含缺失值的真实数据集时,大家最关心的问题之一就是:算法能不能“吃下”这些 nan?好消息是,HistGradientBoostingClassifier 给出的答案是肯定的。它原生支持 np.nanNone,这意味着你无需像传统方式那样,在预处理阶段花大量精力去做填充或删除。它的处理逻辑很有意思——在分裂节点时,算法会自动去学习“把缺失样本分到哪边更优”,本质上就是把缺失当成了一个可学习的分支方向。

Python怎么处理具有缺失值的分类问题_直方图梯度提升树原生支持

这与 XGBoost(需设置 missing=nan)或 LightGBM(默认处理)的逻辑类似,但 sklearn 的实现更简洁,不需要依赖额外的参数来控制——只要传入 np.nan,它就能识别并参与到最优切分搜索中。不过,有几个细节需要注意:

  • 输入数据中的缺失必须用 np.nan 表示,字符串 "NaN" 或空字符串是行不通的。
  • 分类特征(object 或 category 类型)如果含有缺失值,需要先用 pd.get_dummiesOneHotEncoder 编码,否则会直接报 ValueError: Input X contains NaN
  • 目标变量 y 中绝对不能有缺失值,否则拟合阶段就会报错。

与普通 GradientBoostingClassifier 的关键区别

说到这,就不得不提它的前辈 GradientBoostingClassifier。后者对缺失值的态度是“零容忍”,遇到 np.nan 会直接抛出异常。而 HistGradientBoostingClassifier 不仅不报错,还在内部通过“缺失导向分裂”(missing-aware split)机制来提升鲁棒性。

背后的机制是这样的:对于每个候选分裂点,算法会分别评估三种策略的损失下降情况——“把缺失样本全部分到左子树”、“全部分到右子树”、“忽略缺失样本”,然后选择损失下降最多的那一种。这意味着缺失值不是被粗暴地丢弃,而是被建模为一种隐式的特征行为。不报错,这在工程上意味着更少的预处理代码,更快的实验迭代。

  • 训练速度更快:基于直方图近似分割的设计,天然适配缺失值处理逻辑。
  • 内存更省:不需要像传统 GBDT 那样为缺失值单独维护 surrogate splits。
  • 但有一个小限制:你无法通过 tree_.threshold 反推出某个带 nan 的样本具体被分到了哪边,缺失值的路由路径是黑盒的。

实际使用时怎么准备数据

流程其实非常简单:数值型列保留 np.nan,类别列先编码再确保无缺失,y 删掉含缺失的行。你不需要动用 SimpleImputer,也绝不建议用均值或众数去填充——那反而可能引入偏差,尤其是当缺失本身带有业务含义时(比如“用户未填写年龄”可能本身就代表一个特定的年轻群体)。

下面是一个典型的预处理流程示例,一目了然:

import numpy as np
from sklearn.ensemble import HistGradientBoostingClassifier
from sklearn.preprocessing import OneHotEncoder
import pandas as pd

# 示例数据:数值列含 nan,类别列含 nan
df = pd.DataFrame({
    "age": [25, np.nan, 35, 40, np.nan],
    "city": ["Beijing", "Shanghai", np.nan, "Guangzhou", "Shenzhen"]
})
y = np.array([0, 1, 1, 0, 1])  # 注意:这里 y 不能有 nan

# 步骤1:数值列保持原样(nan 留着)
X_num = df[["age"]]

# 步骤2:类别列先填充再编码(不能留 nan 进去)
X_cat = df[["city"]].fillna("MISSING")
X_cat_encoded = OneHotEncoder(sparse_output=False).fit_transform(X_cat)

# 步骤3:拼接
X = np.hstack([X_num, X_cat_encoded])

# 步骤4:训练 —— age 列里的 np.nan 会被原生处理
clf = HistGradientBoostingClassifier()
clf.fit(X, y)

容易被忽略的边界情况

缺失值处理虽然方便,但有几个隐蔽的坑点常常导致结果异常,值得警惕:

  • 如果某个数值特征全部是 nanHistGradientBoostingClassifier 会静默地跳过该列(不报任何错误),最终训练出的模型里根本没有这个特征。所以,检查 clf.feature_names_in_ 是否和你的输入列一致是很有必要的。
  • 当你使用 sample_weight 时,如果一个样本的权重为 0 且其特征包含 nan,该样本仍然会参与缺失分裂的逻辑,但不贡献梯度。这种组合很容易导致特征重要性失真。
  • 在预测阶段,如果新数据中间出现训练时未见过的缺失模式(比如训练时某列只有 5% 的缺失率,而预测时突然上升到 90%),模型不会发出任何警告,但泛化性能很可能断崖式下跌。

说到底,真正需要注意的其实不是“算法能不能用”,而是“缺失分布是否稳定”以及“类别型缺失有没有被正确编码”。这两点要是出了问题,对模型的影响远大于算法本身是否支持缺失值。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发 Python
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。