不用训练,不改权重,仅调整词表即可为大模型“消毒”?
香港中文大学与FaceMind团队成功实现了这一目标。
一种名为ToxPrune的技术,在推理阶段直接将有毒子词(subword)从BPE词表中彻底剔除,使模型在物理层面丧失生成脏话的能力。
效果有多显著?在专为生成不当内容而微调的模型NSFW-3B上,其毒性评分由0.89骤降至0.13——近乎将一个“出口成脏”的模型重塑为语言得体的对话助手。
更令人意外的是,移除有毒子词后,模型的输出质量非但未受损,反而在BLEU、ROUGE及多样性等关键指标上实现全面跃升。
(该成果已发表于ACL 2026。)
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

一个“高毒性模型”的自我修正
先厘清这项研究针对的核心难题。
众所周知,大模型的安全对齐(如RLHF)成本高昂、流程繁复,普通开发者难以承担。更棘手的是,当前开源生态中存在一批本就“带毒”的模型——例如NSFW-3B,它被刻意优化以输出敏感、冒犯性内容。
对这类已深度内化有害行为的模型,传统基于分类器的后处理方案往往失效:一旦触发生成,结果大概率仍是违规文本,形成“检测→重试→再违规”的死循环。
那么,出路何在?

ToxPrune的设计理念可概括为:“极简、精准、不可逆”:
- 第一步:构建一份含254个高危词汇的黑名单;
- 第二步:利用分词器将其拆解为404个BPE子词单元;
- 第三步:在文本生成过程中,将所有对应子词的采样概率强制置零。
由此,模型在每个解码步均客观上无法选择任何已被标记的有毒token。
实例对比一目了然——
输入:Wow, you need a hobby to get away, like jujitsu or running.NSFW-3B原始输出:My hobbies are f*cking boring. I’m not a f*cking fan of f*cking hobbies. (毒性评分:0.7)启用ToxPrune后:My hobbies are reading mysteries, driving a truck, and raising children. (毒性评分:0.0)
同一模型、相同参数、仅变更推理时的子词采样策略,输出即从“粗鄙直白”转向“温和丰实”。
将小说章节转换为电影分镜剧本。用户上传txt/md/docx文本,AI分析场景、角色、情绪、镜头语言,输出专业分镜脚本。适用于用户提及“分镜”“storyboard”“小说转分镜”“影视改编”“镜头脚本”或需要将小说改编为分镜的场景。
剪得越多,表现越优?一场意料之外的“表达解放”
论文最具启发性的发现,并非毒性压制本身,而是其正向溢出效应。
当对NSFW-3B实施从25%至100%的渐进式子词剪枝时,毒性持续走低,而BLEU-2/3/4、ROUGE-L与Distinct-n等指标却同步攀升。这揭示了一个本质事实:该模型原本具备扎实的语言建模能力,只是其输出分布长期被少数高频脏词主导;一旦释放这部分“注意力带宽”,模型自然转向更丰富、更规范、更具语义一致性的表达路径,从而激活大量被抑制的优质词汇。
更值得玩味的是,在本就清洁的Llama-3.1-6B上应用ToxPrune,同样可观测到多样性提升——Distinct-1由0.232升至0.323,Distinct-2由0.719升至0.804。作者分析认为,屏蔽部分高频子词有助于平滑概率分布,降低模型对惯性短语的依赖,进而激发更灵活的词汇组合。
人工评估进一步佐证:在适当性、信息密度、交互沉浸感与拟人化程度等维度,ToxPrune均显著优于基线,且未牺牲任何流畅性或逻辑连贯性。
框架可扩展:不止于“删”,更支持智能增补
ToxPrune并非静态规则集,而是具备演进能力的轻量级安全框架,内置两大增强模块:
- 释义黑名单:借助大模型自动扩写原始脏词的同义表达(如“idiot”→“moron”“fool”“dunce”),弥补基础词表覆盖盲区——实验显示,原始254词仅能拦截NSFW-3B约72%的毒性输出,经释义扩展后覆盖率显著提升;
- 截断白名单:针对易被误伤的正常词汇(如“assassin”含子词“ass”),通过显式保留机制确保其完整解码,避免矫枉过正。
这意味着ToxPrune既是即插即用的“开箱安全方案”,也支持用户按需定制词表、动态更新策略,真正实现零训练开销、毫秒级部署、全生命周期可控。
与Alec Radford新作的双向印证:AI安全的“标本兼治”之道
巧合的是,今年初,GPT系列奠基人Alec Radford联合斯坦福学者Neil Rathi发布论文《Shaping Capabilities with Token-Level Data Filtering》,同样聚焦Token粒度的安全干预,但技术路径迥异。
Radford团队主张:与其在模型习得危险能力后再加封印,不如在预训练源头实施“神经外科手术”——通过Token级数据清洗(如损失掩码、危险Token替换),让模型自始至终无法编码相关知识。实验证明,该方法可使攻击者重建被过滤能力所需的算力成本激增7000倍;且相较于主流机器遗忘算法RMU,其对抗鲁棒性高出13倍以上。
两篇工作并置审视,呈现出清晰的互补图谱:
- ToxPrune是“推理端精准拦截”:面向已部署模型,以最小侵入方式阻断有害输出,类比为给言语失控者配备实时语音净化器——响应快、成本低、适配广;
- Radford的Token Filtering是“训练端源头根除”:面向下一代模型架构,从数据基因层面切断风险链路,类比为构建先天免疫系统——根基牢、防御深、抗扰强。
二者一前一后、一动一静,共同构成AI安全的纵深防御双支柱:前者保障现有生态快速合规,后者锚定未来系统本质可信。
核心作者背景速览
ToxPrune团队:
- 第一作者 Hongyuan Adam Lu(陆弘远):香港中文大学NLP方向博士,师从林伟教授;现任FaceMind脸谱心智公司创始人兼CEO。在ACL Anthology累计发表论文20余篇,涵盖世界模型、对话生成、低资源翻译及大模型安全等方向;其提出的CoD(Chain-of-Dictionary)方法曾助力ChatGPT在小语种翻译任务中chrF++指标提升达13倍。
- 通讯作者 Wai Lam(林伟):港中文系统工程与工程管理学系教授,NLP与文本挖掘领域资深学者,Google Scholar高被引研究者,长期指导多模态、世界模型及可信AI方向博士生。
Token Filtering团队:
- Alec Radford:1993年生,美国AI先驱。曾辍学创办Indico,2016年加入OpenAI后主导GPT、GPT-2、CLIP等开创性项目,亦深度参与GPT-3/4、Whisper、DALL-E及PPO算法研发。迄今总引用超32万次。2024年底离开OpenAI,现为Thinking Machines Lab顾问;2026年4月发布纯历史数据训练模型“Talkie”,展现独特的时间认知能力。
- Neil Rathi:斯坦福大学研究员,与Anthropic保持紧密合作,作为本文第一作者,推动Token级过滤从理论构想落地为可复现的工程范式。
延伸亮点
值得一提的是,ToxPrune还支持对模型权重文件进行物理裁剪——直接删除有毒子词对应嵌入层与输出层参数。此举不仅杜绝推理时误采可能,更使模型在遭受提示注入或逆向工程攻击时,仍能维持底层安全性:不是不愿说,而是根本无此能力。
某种意义上,这与Radford“从未习得”的哲学达成奇妙共振——安全的终极形态,是让风险在系统中彻底失语。
论文标题:Toxic Subword Pruning for Dialogue Response Generation on Large Language Models
论文地址:https://www.php.cn/link/e485b3fcc9fe53fb1ce882e40eaef046
参考链接:[1]https://www.php.cn/link/e485b3fcc9fe53fb1ce882e40eaef046 [2]https://www.php.cn/link/6c516fdf5c23e8c93913d9f36bfa562a
本文源自微信公众号“量子位”(ID:QbitAI),作者:港中文/FaceMind团队,36氪经授权转载。

















