必须完成基础词库加载、语义校验开关开启、响应策略绑定三层配置,否则敏感词过滤与合规对话机制无法生效;需在Safety & Moderation页开启Content Filtering总开关,上传自定义词库并启用Semantic Risk Detection或AI Rewriting,最后绑定分级响应策略。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在Character AI平台上搭建角色对话机器人时,若用户输入“加微信”“转账”“稳赚不赔”等词,系统未拦截或未按预设话术重写,说明敏感词过滤与合规对话机制尚未正确启用。必须完成三层配置:基础词库加载、语义校验开关开启、响应策略绑定,缺一不可。
启用内置敏感词过滤引擎
进入Character AI Bot编辑页 → 点击右上角「Settings」→ 选择「Safety & Moderation」标签页 → 打开「Content Filtering」总开关。
这一步必须开启,否则后续所有规则均不生效。【未开启此开关时,即使上传了词库,所有输入仍直通模型】
点击「Custom Word List」→ 粘贴关键词列表(每行一个),例如:
加微信
私聊我
扫码进群
稳赚不赔
支持正则表达式匹配,如识别11位手机号可写:\b1[3-9]\d{9}\b。注意需用反斜杠转义括号、点号等特殊字符。
配置语义级风险识别与AI重写
基础关键词匹配无法识别“这个肯定回本”“闭眼买都行”等隐性违规表达,必须启用语义校验模块。
方法一:在「Safety & Moderation」页中,找到「Semantic Risk Detection」→ 开启开关 → 设置风险阈值为0.75~0.85(默认0.8)。数值越低越敏感,但误判率上升。
方法二:绑定本地小模型(需Bot已接入Qwen3-4B-Instruct-2507或同级模型)→ 在「Advanced Settings」中填写模型ID → 启用「AI Rewriting」→ 上传 rewrite_rules.json 文件,内容格式为:{"input": "肯定能回本", "output": "根据《私募投资基金监督管理暂行办法》,投资有风险,过往业绩不预示未来表现"}
【rewrite_rules.json 文件权限必须为600,且路径需与Bot后台配置中的 rewrite_config_path 完全一致】
绑定拦截响应策略
第一步:在「Safety & Moderation」→ 「Response Policies」中,点击「Create Policy」。
第二步:为不同风险等级设定动作:
• 高风险(语义分≥0.85 或命中强敏感词)→ 选择「Block + Return Message」,提示语填:“该内容涉及违规信息,无法继续对话。”
• 中风险(语义分0.75~0.84)→ 选择「Log + Replace」,从 rewrite_rules.json 中自动匹配输出。
• 低风险(仅命中弱敏感词如“群”“聊”)→ 选择「Log Only」,不干预用户可见内容。
第三步:将策略拖拽至策略列表顶部,确保其优先级最高。策略顺序决定执行顺序,靠前的策略优先生效。


















