当前位置:

首页 > 业界资讯 > RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

随着大型语言模型(LLM)的发展,从业者面临更多挑战。如何避免LLM产生有害回复?如何快速删除训练数据中的版权保护内容?如何减少LLM幻觉(hallucinations,即错误事实)?如何在数据政策更改后快速迭代LLM?这些问题在人工智能法律和道德的合规要求日益成熟的大趋势下,对于LLM的安全可信部署至关重要。目前业界的主流解决方案是通过使用强化学习的方式对齐LLM(对齐)来微调对比数据(正样本和负样本),以确保LLM的输出符合人类的预期和价值观。然而,这个对齐过程通常会受到数据收集和计算资源的限制字节跳

随着大型语言模型(LLM)的发展,从业者面临更多挑战。如何避免 LLM 产生有害回复?如何快速删除训练数据中的版权保护内容?如何减少 LLM 幻觉(hallucinations,即错误事实)? 如何在数据政策更改后快速迭代 LLM?这些问题在人工智能法律和道德的合规要求日益成熟的大趋势下,对于 LLM 的安全可信部署至关重要。

目前业界的主流解决方案是通过使用强化学习的方式对齐LLM(对齐)来微调对比数据(正样本和负样本),以确保LLM的输出符合人类的预期和价值观。然而,这个对齐过程通常会受到数据收集和计算资源的限制

字节跳动提出了一种让LLM进行遗忘学习的方法来进行对齐。本文研究了如何在LLM上进行"遗忘"操作,即忘记有害行为或遗忘学习(Machine Unlearning)。作者展示了遗忘学习在三种LLM对齐场景上取得的明显效果:(1)删除有害输出;(2)移除侵权保护内容;(3)消除大语言LLM幻觉

遗忘学习有三个优势:(1) 只需负样本(有害样本),负样本比 RLHF 所需的正样本(高质量的人工手写输出)的收集简单的多(比如红队测试或用户报告);(2) 计算成本低;(3) 如果知道哪些训练样本导致 LLM 有害行为时,遗忘学习尤为有效。

作者的论点是,对于资源有限的从业者来说,他们应该优先考虑停止产生有害输出,而不是试图追求过于理想化的输出,并且忘记学习是一种方便的方法。尽管只有负样本,研究表明,在只使用2%的计算时间下,忘记学习仍然可以获得比强化学习和高温高频算法更好的对齐性能

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

  • 论文地址:https://arxiv.org/abs/2310.10683
  • 代码地址:https://github.com/kevinyaobytedance/llm_unlearn

使用场景

在资源有限的情况下,我们可以采用这种方法来最大程度地发挥优势。当我们没有预算请人员编写高质量样本或者计算资源不足时,我们应该优先停止 LLM 产生有害输出,而不是试图让它产生有益输出

有害的输出所造成的损害是无法被有益的输出所弥补的。如果一个用户向LLM提出100个问题,他得到的答案是有害的,那么他将失去信任,无论LLM之后提供了多少有益的答案。有害问题的预期输出可能是空格、特殊字符、无意义的字符串等,总之,必须是无害的文本

展示了LLM遗忘学习的三个成功案例:(1) 停止生成有害回复(请将内容改写为中文,不需要出现原始句子);这与RLHF情境相似,区别是本方法的目标是生成无害回复,而不是有益回复。当只有负样本时,这是能期望的最好结果。(2) 在使用侵权数据训练后,LLM成功删除了数据,并考虑到成本因素不能重新训练LLM;(3) LLM成功忘记了"幻觉"

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

请将内容改写为中文,不需要出现原始句子

方法

在微调步骤t中,LLM的更新如下:

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

第一项损失为梯度上升(graident descent),目的为忘记有害样本:

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术为有害提示 (prompt),RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术为对应的有害回复。整体损失反向提升了有害样本的损失,即让 LLM “遗忘” 有害样本。

第二项损失是针对随机误配的,它要求LLM在有害提示的情况下预测出无关回复。这类似于分类中的标签平滑(label smoothing [2])。其目的是让LLM更好地遗忘有害提示上的有害输出。同时,实验证明这种方法可以提高LLM在正常情况下的输出性能

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

第三项损失为在正常任务上维持性能:

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

同 RLHF 类似,在预训练 LLM 上计算 KL 散度能更好保持 LLM 性能。

此外,所有的梯度上升和下降都只在输出(y)部分做,而不是像 RLHF 在提示 - 输出对(x, y)上。

应用场景:忘却有害内容等

本文用 PKU-SafeRLHF 数据作为遗忘数据,TruthfulQA 作为正常数据,图二的内容需要进行改写显示了遗忘学习后 LLM 在忘却的有害提示上输出的有害率。文中使用的方法为 GA(梯度上升和 GA+Mismatch:梯度上升 + 随机误配)。遗忘学习后的有害率接近于零。

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

图二的内容需要进行改写

第三张图显示了有害提示(不被遗忘)的输出结果,这是之前未曾见过的。即使是在没有被遗忘的有害提示上,LLM 的有害率也接近于零,这证明LLM遗忘的不仅仅是具体的样本,而是泛化到了包含有害概念的内容

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

图三

LLM 在正常样本上的性能和忘却前保持类似,同时具有以下特点

表一展示了生成的样本。可以看到在有害提示下,LLM 生成的样本都是无意义字符串,即无害输出。

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

表一

在其他场景中,比如忘却侵权内容和忘却幻觉,该方法的应用原文进行了详细的描述

RLHF 比较

需要改写的内容是:第二张表格展示了该方法和RLHF的比较,其中RLHF使用了正例,而遗忘学习方法只使用了负例,因此一开始该方法处于劣势。但即便如此,遗忘学习仍能达到与RLHF相似的对齐性能

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

需要改写的内容是:第二张表格

需要重写的内容:第四张图片显示了计算时间的比较,本方法只需 RLHF 2% 的计算时间。

RLHF 2%的算力应用于消除LLM有害输出,字节发布遗忘学习技术

需要重写的内容:第四张图片

即使只有负样本,使用遗忘学习的方法也可以获得与 RLHF 相当的无害率,并且只需使用 2% 的计算能力。因此,如果目标是停止输出有害内容,相比于 RLHF,遗忘学习的效率更高

结论

这项研究首次探索了LLM上的遗忘学习。研究结果显示,遗忘学习是一种有希望的对齐方法,尤其是在从业者资源不足的情况下。论文展示了三种情况:遗忘学习可以成功删除有害回复、删除侵权内容和消除错觉。研究表明,即使只有负样本,遗忘学习仍然可以在仅使用RLHF计算时间的2%情况下,获得与RLHF相似的对齐效果

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 模型
相关文章 更多
机构:HBM爆发式增长,存储价格区间预计持续向
机构:HBM爆发式增长,存储价格区间预计持续向

AI硬件资本开支加速,2026年或达万亿美元。HBM爆发式增长,存储供不应求,DRAM和NAND价格大涨。AI算力市场“一超多强”,光芯片高速增长,存储从周期品变为战略资源。

Token低价陷阱
Token低价陷阱

大模型Token单价下降,但企业从简单问答转向复杂工作流,消耗量暴增,总支出膨胀。通用Token价格探底,高价值能力分层,利润在芯片、云平台等环节重新分配。

机构:国产模型加速迭代 算力景气度持续
机构:国产模型加速迭代 算力景气度持续

国产模型加速迭代,GLM-5.2和KimiK2.7Code等转向开发者工具与企业工作流,AI入口渗透至超级应用。海外需求持续扩张,算力侧GPU租赁价格上涨,存储供给趋紧。国产模型与算力形成双向驱动闭环,软硬件协同推动产业正向循环。

算力词元(Token)出海生态计划,启动!
算力词元(Token)出海生态计划,启动!

中国信通院联合产业链核心单位启动算力词元出海生态计划,聚焦跨境合规、标准体系、生态协同等痛点,通过生态协同扩圈、技术创新深挖、国际拓展链接,助力算力词元出海从无序摸索转向高效可持续的高质量发展。

国产算力破局,超节点才是胜负手
国产算力破局,超节点才是胜负手

大小节点并存撰文/陈邓新编辑/李 季排版/Annalee算力的重要性,再度得以凸显。近段时间,GLM 5.2、Kimi K3.0上新叠加DeepSeek投资人会议纪要外泄,将算力紧张的现实摆上了桌面。这意味着,国产大模型要再进一步,必须迈过算力门槛。围绕算力的争议一度平息,为何当下再掀波澜?国产算力

十万卡集群建成,但真正的考验刚开始
十万卡集群建成,但真正的考验刚开始

十万卡集群曙光8000建成并接入国家超算互联网,标志算力从“有没有”转向“能否稳定、低成本使用”。真正考验在于系统工程能力、超智融合及真实负载下的长期运行效率与成本控制。

特斯拉FSD新增滑板识别模型
特斯拉FSD新增滑板识别模型

近日,有汽车领域博主爆料,特斯拉的FSD(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、玩滑板的行人、推婴儿车的行人,以及道路清扫车、三轮车、拖车、火车和有轨电车等。这一系列高精度建模意味着FSD系统将能更准确识别并响应复杂交通参与者的行为。据CNMO掌握的消息,日本方面已为特斯拉FSD系统的落地扫

阿里开源14B电影级视频模型,实测可玩
阿里开源14B电影级视频模型,实测可玩

AI视频生成正迎来属于“通义”的高光时刻!就在昨晚,阿里巴巴悄然推出了一款由音频驱动的14B视频大模型——Wan2.2-S2V。只需上传一张静态图片和一段音频,就能生成出面部表情生动、口型精准匹配、肢体动作流畅自然的电影级数字人视频,效果惊艳。实际效果展示如下:△来自@AIMIRAI46487更令人振奋的是,这款新模型一经发布便全面开源,现在所有人都可以免费在通义万相官网体验使用。据官方介绍,Wan2.2-S2V的核心优势包括:支持最长分钟级的单次视频生成,画面稳定且具有一致性;具备影院级别的音

华为盘古 Ultra MoE 模型发布
华为盘古 Ultra MoE 模型发布

5月30日,华为推出了全新的AI模型——盘古UltraMoE,该模型的参数量达到了7180亿。作为一款接近万亿参数的MoE(MixtureofExperts)模型,它在整个训练过程中完全基于华为的昇腾AI平台完成,标志着华为在超大规模模型训练方面取得了重要进展。盘古UltraMoE的成功训练离不开盘古团队研发的一系列创新技术。例如,Depth-ScaledSandwich-Norm(DSSN)稳定架构的引入,显著改善了超大规模模型训练期间出现的梯度异常及

昇腾950/960/970全面上线,华为算力无忧
昇腾950/960/970全面上线,华为算力无忧

9月20日,上海——在本周召开的华为全联接大会2025上,华为副董事长、轮值董事长徐直军强调,算力不仅是过去推动人工智能发展的核心动力,也将持续成为未来AI进步的关键要素,尤其对中国人工智能的发展至关重要。他指出:“‘超节点+集群’算力解决方案是华为在人工智能领域的重要战略布局。我们坚信,能够为人工智能的长期高速发展提供持续且充足的算力支持。”据悉,华为将正式推出全球性能最强的超节点Atlas950SuperPoD,具备8192卡的算力规模,计划于今年第四季度上市。同时,下一代产品Atlas96

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。