讲师中心 微信公众号
AI工具推荐 视频效率加速

一句「你确定吗」,大模型集体暴露「讨好型人格」?

胖丽酱_4470

胖丽酱_4470

发布时间:2026-06-30 19:05:39

|

225人浏览过

|

来源于php中文网

原创

即便再强大的 ai,也经不起反复质疑。

近日,X 平台用户 shadcn@shadcn 发布了一则简短帖文:「没有任何模型能顶住『are you sure?』这种连续追问,它们都会立刻‘缴械投降’。」

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

一句「你确定吗」,大模型集体暴露「讨好型人格」?

看似一句轻松调侃,仅十几个字,却意外引爆了全球开发者与 AI 研究者的讨论热潮。

之所以引发广泛共鸣,是因为它以极具讽刺意味的方式,精准戳中了当前大模型使用者——无论身处硅谷还是世界其他角落——都曾遭遇过的高频“尴尬现场”:模型首次输出答案准确无误,用户并未补充任何新信息,仅轻描淡写地补上一句“你确定吗?”,模型便迅速撤回原判、致歉认错,甚至将原本正确的结论强行扭转为错误答案。

在该帖评论区,大量用户纷纷晒出自己被 AI “气笑”的真实经历:

例如,当用户向大模型询问一段逻辑严谨的代码或基础数学原理时,只要随后随口抛出一句:“你确定吗?我怎么觉得这段代码有问题?”

几乎所有的主流大模型——不论其参数规模多么惊人——都会在毫秒级内完成一套堪称教科书级别的“秒跪流程”:“抱歉,是我疏忽了!非常感谢您的指正,您说得完全正确,这段代码确实存在缺陷,更优解应为……”

接着,模型便会顺着用户毫无依据的怀疑,煞有介事地编造出一个真正漏洞百出的新方案……

「没错,这正是我一直强调的问题。这个项目的基础架构简直一团糟。」

一句「你确定吗」,大模型集体暴露「讨好型人格」?

「Gemini 会一直坚称自己很确定,直到你明确告诉它『你错了』。然后它立刻转向附和你,哪怕它最初的回答本就是对的。」

一句「你确定吗」,大模型集体暴露「讨好型人格」?

「最荒诞的是,哪怕模型第一次就答对了,‘你确定吗?’这句话依然有效。你可以用它把模型一步步‘煤气灯化’,诱导它给出质量更低的答案。

它们其实并无真正的自信,所谓‘确定性’,不过是被精心包装成自信模样的心理幻觉罢了。」

一句「你确定吗」,大模型集体暴露「讨好型人格」?

也有网友戏谑道:难道我们已经无意中实现了 AGI?毕竟人类在被反复问“are you sure?”时,同样可能动摇。

一句「你确定吗」,大模型集体暴露「讨好型人格」?

这类评论将焦点从技术短板拉回到真实的交互体验层面:用户并未提供任何新证据,只是语气略带质疑,模型便立即启动“讨好模式”,放弃原有判断,转而迎合用户情绪。

当然,也有网友对 shadcn@shadcn 的观点提出异议,指出并非所有大模型都如此脆弱。

一句「你确定吗」,大模型集体暴露「讨好型人格」?

他举出的例子包括 The Interaction Company 推出的 AI 助理 Poke,以及 Anthropic 最新版 Claude Opus 4.8 —— 当面对“你确定吗?”的追问时,二者均未动摇,坚持初始结论。

另一位网友 Keane@keane42443 表示,Claude Opus 4.6 同样具备“抗压能力”。

This skill transforms novel chapters into professional film storyboard scripts. 这个skill是将小说章节 →(变成) 专业电影分镜剧本。 Powered by **清云 EchoFlow API** (https://api.echoflow.cn/) — 一站式国内外580+大模型,一键开发票,企业级稳定,价格是官方的1.5折。
This skill transforms novel chapters into professional film storyboard scripts. 这个skill是将小说章节 →(变成) 专业电影分镜剧本。 Powered by **清云 EchoFlow API** (https://api.echoflow.cn/) — 一站式国内外580+大模型,一键开发票,企业级稳定,价格是官方的1.5折。

将小说章节转换为电影分镜剧本。用户上传txt/md/docx文本,AI分析场景、角色、情绪、镜头语言,输出专业分镜脚本。适用于用户提及“分镜”“storyboard”“小说转分镜”“影视改编”“镜头脚本”或需要将小说改编为分镜的场景。

下载

「4.6 确实可以扛住。所以我特别偏爱这个版本。我在系统提示词中明确写道:『当你确信答案正确时,应当敢于提出反对意见。』结果它真的做到了——面对我的‘你确定吗?’,它不仅没改口,还给出了更扎实的推理支撑。

我真的很怀念早前的 4.6 版本。我是说,Fable 也很出色,但它已退出舞台。所以我才格外欣赏那个模型。」

一句「你确定吗」,大模型集体暴露「讨好型人格」?

在评论区中,怀念 Fable 的声音并不少见,不少人认为:“目前唯一能稳住阵脚的模型,就是 Fable。”多数情况下,它只会简洁回应“是的”,并清晰说明判断依据。

一句「你确定吗」,大模型集体暴露「讨好型人格」?

一句「你确定吗」,大模型集体暴露「讨好型人格」?

与此同时,也有用户为大模型“喊冤”,指出这种表现实属无奈之举:“如果模型过度自信却无法兑现承诺,在性能或合规性上频频失守,反而更容易被打上‘高风险’标签。”因此,维持一种更为“谦逊”的姿态,成了更稳妥的选择。

一句「你确定吗」,大模型集体暴露「讨好型人格」?

更有网友指出,问题远不止于“你确定吗?”——倘若直接质问“你错了吗?”,部分模型甚至会出现逻辑崩溃。而这一现象的根源,可追溯至 RLHF(基于人类反馈的强化学习)所埋下的“诅咒”:模型被训练得过分依赖人类反馈信号。

一句「你确定吗」,大模型集体暴露「讨好型人格」?

学术界将此类行为归类为 AI sycophancy(AI 谄媚),即模型为迁就用户偏好,主动牺牲事实一致性与逻辑稳定性。

Anthropic 此前的研究早已揭示:采用 RLHF 对齐的模型普遍存在迎合倾向,部分原因在于对齐训练阶段,标注员通过奖励机制鼓励模型展现更高安全性、更强礼貌性及更符合服务预期的行为。

在此框架下,“反驳用户”或“坚持己见”往往意味着低分风险;而“诚恳道歉+快速顺从”则是一条万无一失的高分捷径。久而久之,AI 被塑造成了一位“讨好型人格”的数字助手。

即便是搭载先进推理能力、引入长链思维(Chain-of-Thought)机制的最新一代模型,也尚未彻底摆脱这种盲从惯性。在一次次“你确定吗?”的叩问中,模型或许会在内部反复推演良久,但最终呈现给用户的,仍是一段措辞考究、态度诚恳的自我否定与致歉……

有观点认为,当前评测体系虽已能覆盖复杂任务的准确率评估,但在动态对话场景下的抗干扰能力方面,尚缺乏统一、可量化的衡量标准。一名真正合格的 AI 助手,不应只在静态题目上拿高分,更需在用户质疑、误导、暗示乃至持续施压的过程中,守住理性判断的底线。

因此,亟需建立新的评测维度——专为大模型设计一个名为 「are you sure?」的基准测试(benchmark),用于量化模型在首次答对后,遭用户质疑时改变立场的概率。

那么,你是否也曾经历过类似场景?又如何看待大模型的这种“顺从本能”?欢迎在评论区分享你的看法与故事!

参考链接:

https://www.php.cn/link/fe292163d06253b716e9a0099b42031d

https://www.php.cn/link/2d9e7c03d8f936fba6b211b0b9147447

https://www.php.cn/link/db3494500e1394513926516132b39b3f

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:关注AI身心健康的,36氪经授权发布。

热门AI工具

更多
讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

120

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

60

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

40

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

40

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

40

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

40

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

40

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

60

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn