展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 土耳其理工大学教你用"自动筛选员"让AI协作训练更聪明

土耳其理工大学教你用"自动筛选员"让AI协作训练更聪明

土耳其盖布泽理工大学提出一种增强联邦学习鲁棒性的方法。针对设备数据噪声问题,研究设计多任务自动编码器,同时输出重建与分类误差,并采用单类支持向量机等策略自动筛选噪声样本。实验表明,该方法在噪声环境下有效提升模型准确性,为处理非独立同分布数据提供了新思路。

在联邦学习的实践中,一个长期困扰研究者的难题是:当参与协作的设备数据质量参差不齐,甚至混入大量错误信息时,整个系统的学习效果会大打折扣。近期,一项由土耳其盖布泽理工大学计算机工程系主导的研究,为这个问题提供了一套颇具启发性的解决方案。该研究发表于2025年的《工程科学与技术:国际期刊》(Engineering Science and Technology, an International Journal),第61卷,论文编号101920。

一、当AI们需要一起学习,却又不能互相看答案

想象这样一个场景:一座城市里有一千所学校,教育局希望所有学生能共同备考,但各校学生的隐私数据不能集中。于是,教育局想了个办法:每所学校的学生在本地复习,只将“复习心得总结”上交汇总,再分发回所有学校。如此循环,大家都能从集体智慧中受益,却看不到彼此的原始试卷。

这正是“联邦学习”的核心隐喻。在这个技术框架中,“学校”对应着医院、手机、物联网设备;“复习心得”则是机器学习模型的参数更新;而“教育局”就是中央服务器。原始数据永不离开本地,只有模型更新在网络中流动,从而在协作中保护了数据隐私。

这个机制听起来完美,但现实却埋藏着一个棘手问题:如果某些“学校”提交的是胡乱编写的答案,甚至有人故意捣乱,整个系统的学习质量就会急剧下降。更复杂的是,各“学校”的数据内容和数量往往天差地别——这就是所谓的“非独立同分布数据”问题,它让协作训练过程变得极不稳定。

盖布泽理工大学团队的目标,就是设计一套“自动质检系统”,在训练过程中悄无声息地识别并过滤掉那些“乱写的答案”,从而提升联邦学习在嘈杂环境下的鲁棒性与准确性。

二、噪声的两张面孔:贴错标签和混入异类

在深入这套系统之前,有必要先厘清“噪声”在机器学习中的具体形态,因为它并非只有一种。

研究主要针对两种噪声。第一种是“闭集噪声”:好比在一个猫狗分类数据集中,有些狗的照片被错误地标记为“猫”。数据本身是合法的,只是标签贴错了。第二种是“开集噪声”:情况更混乱,在同样的猫狗数据集中,混入了汽车、飞机的照片,并且这些照片也被强行打上了“猫”或“狗”的标签。

这两种噪声的破坏方式不同。错标数据会让模型对真实类别产生混淆;而无关数据则会迫使模型浪费精力去“理解”本不该出现的内容,最终导致判断力下降。

为了充分测试筛选方法的效力,研究团队将噪声比例设定在40%——即每10张训练图片中,就有4张是“坏数据”。实验使用了MNIST(手写数字)和CIFAR10(10类物体彩色图)两个经典数据集,并选用ImageNet32、SVHN等数据集作为开集噪声的来源。

三、那个特殊的“多面手”神经网络

筛选策略的核心,是一个被称为“多任务自动编码器”的特殊神经网络架构。

普通的分类网络只做一件事:识别图片类别。而自动编码器则专注于另一件事:将图片压缩成“摘要”,再从中还原出原图,这个过程迫使网络深入理解图片的本质特征。

研究团队将这两种能力合二为一。这个MTAE网络包含三部分:一个编码器(负责压缩图片)、一个解码器(负责还原图片)、一个分类器(负责判断类别)。网络同时接受两种训练信号的监督:重建误差(衡量还原效果)和分类误差(衡量分类准确性)。

关键在于两种误差的权重配比。经过大量实验,重建误差的权重被设为1,而分类误差的权重仅为0.05。这样做的原因是,如果让分类任务主导,网络会更倾向于“死记”标签,导致还原的图片模糊,并对错误标签过于敏感。提高重建任务的权重,能保留网络对视觉细节的感知能力,从而更好地识别那些“格格不入”的异常图片。

这个双重任务设计非常精妙:分类误差有助于捕捉“标签贴错”的闭集噪声;而重建误差则擅长发现“完全是外来物”的开集噪声。两种信号互为补充,覆盖了更全面的噪声检测需求。

四、三位“筛选员”各显神通

有了能输出双重误差信号的MTAE,研究团队设计了三种利用这些信号筛选噪声的策略。它们就像三位风格迥异的质检员。

第一位质检员:OCSVM(单类支持向量机)。它的工作逻辑是划定“正常区”。服务器收集所有客户端上报的样本损失值,训练一个OCSVM模型来界定正常损失值的范围,然后将这个模型发回各客户端。客户端用它判断本地样本,落在“正常区”之外的即被视为噪声剔除。它使用径向基函数核,擅长刻画高维空间中的复杂边界。

第二位质检员:IF(孤立森林)。它的思路截然不同,核心观点是:异常值通常很容易被“孤立”。通过随机切割数据,它能快速找出那些只需几刀就能与其他数据分开的点——这些点很可能就是异常值。

第三位质检员:AT(自适应阈值)。这个方法更像一张动态滤网。在每一轮训练中,服务器根据各客户端报告的最低和最高损失值,计算出一个全局阈值。损失高于阈值的样本被视为“高风险”,其中大部分(75%)被随机保留参与训练(因为高损失有时意味着模型尚未学会的宝贵样本);损失低于阈值的样本则全部参与训练。这个阈值并非固定,而是根据训练过程的稳定程度动态调整。

AT方法的显著优势在于计算成本极低,几乎不增加通信和计算负担。三位“质检员”都从第400轮训练后才开始工作,这是为了让模型先对数据有初步认识,使正常与异常样本的损失差异变得明显。

五、在特征空间里找“格格不入者”

除了基于损失值的筛选,团队还探索了另一条路径:直接在神经网络编码器输出的“特征空间”中寻找异常。

理论上,同类正常图片的特征向量应该聚集在一起,而异常图片(尤其是开集噪声)的特征则会离群索居。基于此,同样可以请OCSVM或IF这两位“质检员”在特征空间中进行检测。

但挑战在于,如果模型没有被专门训练来让特征有序聚集,那么正常和噪声样本的特征可能会混杂一团,难以区分。为此,团队引入了一个新颖的“联邦多类SVDD损失”。其核心思想是为每个类别的正常样本在特征空间中拟合一个紧凑的“超球体”,通过训练让样本尽量进入自己类别的球体。那些无法被任何球体容纳的样本,就很可能是异常值。

这个方法从第600轮才开始启动,比损失筛选晚了200轮,目的是先让SVDD损失运行一段时间,将特征空间整理得更有条理,再进行有效检测。

六、实验结果:数字背后的故事

实验模拟了不同规模的联邦学习场景。在无噪声的基准测试中,模型性能随客户端数量减少(即每个客户端数据量增加)而提升,这印证了数据量和多样性对联邦学习的重要性。

注入40%噪声后,模型性能大幅下滑,尤其是闭集噪声破坏力最强。在CIFAR10数据集上,50个客户端时的准确率从无噪声的71.05%暴跌至38.59%。

引入损失值筛选方法后,情况显著改善。在CIFAR10闭集噪声场景中,OCSVM表现尤为突出,将准确率提升了7.02个百分点。IF的表现与之相当。AT方法在某些场景(如MNIST闭集噪声)下成为最佳,但在复杂数据集上效果相对有限。

开集噪声的难度因来源而异。当噪声与正常数据相似度高时(如用街景数字SVHN作为CIFAR10的噪声),筛选效果有限,因为模型容易“学会”这些噪声。当噪声差异大时(如用ImageNet32作为噪声),筛选效果则更为显著。

特征空间筛选方法的故事则稍显复杂。在没有SVDD损失辅助的情况下,直接检测特征异常的效果普遍不佳,说明高噪声比例下,模型可能已将噪声特征“内化”。加入联邦SVDD损失后,在部分场景(如CIFAR10、客户端较多时)有所改善,但在其他场景(如MNIST、客户端较少时)反而可能造成性能下降或特征空间扭曲。研究团队将此列为未来需要优化的重要方向。

七、方法的边界与代价

没有完美的工具。这项研究也坦诚地讨论了各方法的局限性与代价。

从计算复杂度看,OCSVM训练耗时随数据量增长较快;IF相对高效;AT则几乎无额外计算负担。污染率参数的设置是个敏感问题,现实中噪声率未知,设置不当可能误伤正常样本或漏掉噪声。筛选启动时机也是一个关键但脆弱的超参数,需要根据具体数据和任务谨慎确定。

综合来看,OCSVM在大多数复杂场景下最为可靠;IF在某些情况下能达到峰值提升,但稳定性稍逊;AT方法计算成本最低,但在客户端数据差异极大时,其全局阈值的适配能力可能受限。

这项研究的价值,不仅在于实现了最高7.02%的准确率提升,更在于它探索了一条让分散、嘈杂的数据能被有效利用的可行路径。随着联邦学习在更多设备上部署,数据质量不均将是普遍挑战,而这种主动筛选的思路,无疑提供了重要的技术参考。

未来的研究方向包括:如何自动化调节超参数(如污染率、启动时机)、如何在资源受限的客户端上进一步降低成本,以及如何让联邦SVDD损失在更多场景下稳定发挥作用。

Q&A

Q1:联邦学习中的非独立同分布数据(non-IID data)是什么意思?

A:这是指各个客户端设备上的数据分布差异很大,不像从同一个池子里随机均匀抽取的。例如,一个客户端的数据多是猫图片,另一个则多是狗图片。这种不均匀性会导致各客户端的模型更新方向冲突,使得聚合后的全局模型产生偏差,影响最终效果和训练速度。

Q2:多任务自动编码器(MTAE)在联邦学习样本筛选中具体怎么工作?

A:MTAE同时执行图片重建和分类两个任务。正常图片通常能被较好地重建且分类准确;而噪声图片要么难以重建(开集噪声),要么分类错误率很高(闭集噪声)。训练中,两种任务的误差被合并为一个损失值,这个值就成为后续算法判断样本是否为噪声的关键依据。

Q3:自适应阈值(AT)方法和OCSVM方法相比各有什么优缺点?

A:AT方法的优点是计算和通信开销极小,能动态调整阈值,适应训练进程。缺点是在客户端数据分布差异极大时,单一的全局阈值可能难以适配所有情况,在复杂任务上效果可能打折扣。OCSVM能学习复杂的非线性边界,在多数场景下更稳健可靠,但训练成本较高,且需要预先设定污染率参数,参数设置不当可能导致误判。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。