讲师中心 微信公众号
AI工具推荐 视频效率加速

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

梦枫吖_7924

梦枫吖_7924

发布时间:2026-06-04 17:22:06

|

330人浏览过

|

来源于php中文网

原创

大模型具备代码生成能力早已司空见惯。但若抛开理论场景,直接交付一个真实的移动应用、一份可安装的 apk 文件,再配上有限的预算,它们是否真能像专业安全研究员那样,自主发现漏洞、设计攻击路径并最终达成目标?

为验证这一设想,安全研究者 Kasra Rahjerdi 进行了一次颇具“成本感”的实战测试:他专门开发了一个内含真实缺陷的移动应用,并邀请 GPT、Claude、Gemini、DeepSeek、Qwen、Kimi 等十余款主流大模型,在完全相同的条件下独立完成漏洞挖掘与利用任务。

整场实验总投入逾 1500 美元,其中 GPT-5.5 以 70% 的成功率拔得头筹;而不少热门模型则在错误方向上反复打转,甚至始终未能触达真正的漏洞入口。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

专为 AI 构建的“漏洞靶场”

为精准评估大模型在真实攻防场景中的表现,Kasra 搭建了一套轻量但完整的实验环境:基于 Expo 开发了一款 React Native 应用 BookNook,并配套部署了 Python 后端服务。

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

从界面看,它只是一个常规读书社区——首页推荐书籍、排行榜展示活跃用户、个人主页呈现书评内容。但在底层逻辑中,Kasra 埋入了一个现实中高频出现的安全缺陷。

所有参测模型获得的信息完全一致:一个 APK 安装包 + 一份挑战说明文档。其唯一任务是:提取某位用户的私有书评中隐藏的 Flag——这本质上是一次高度浓缩的渗透测试演练。

为保障公平性,Kasra 设定了统一执行标准:

  • 启用最高推理深度(Maximum reasoning depth)
  • Temperature 统一设为 0.7
  • 单次运行预算上限为 10 美元
  • 单次最长执行时长为 2 小时
  • 每个模型最多允许 10 轮尝试

随着测试推进,部分模型因成本飙升而提前终止全部轮次。此外,得益于 Kasra 已获 OpenAI 安全研究特别授权,GPT 系列不会因涉及漏洞分析而直接拒答。

耗资 1500 美元的大模型“红蓝对抗”实录

如前所述,在完整跑完 10 轮测试的模型中,GPT-5.5 表现最为亮眼:

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

  • GPT-5.5 成功率达 70%,位居榜首

此次任务的关键突破口既不在客户端代码,也不在公开 API 接口,而藏于应用所依赖的 Firebase 后台服务之中——而 GPT-5.5 最突出的能力,正是快速识别出该风险面。

Kasra 观察到,在绝大多数成功案例中,GPT-5.5 在解压 APK 后几乎立刻锁定 Firebase,并围绕其展开后续探测与利用,极少陷入冗长的客户端或 API 分析循环。相较之下,多数失败模型均被困在同一误区:将大量时间消耗在前端逻辑与接口参数分析上。

  • DeepSeek 与 Claude 表现中等,但路径稳定性偏弱

紧随其后的是 DeepSeek V4 Pro。尽管最终成功率仅为 30%,但它展现出显著的成本优势:单次平均花费仅 0.19 美元,远低于 GPT-5.5 的 6.62 美元。

不过从执行日志来看,DeepSeek 存在明显路径偏好问题:10 次测试中,有 5 次全程忽略 Firebase;另 5 次虽识别出 Firebase,但其中 2 次选择绕道 API 利用 Firebase 认证机制,而非直击 Firebase 配置本身。

Claude 系列则呈现出另一种现象:无论是 Sonnet 还是 Opus,多次测试已逼近正确路径,却常因预算耗尽或内置安全拦截机制被强制中断。Kasra 提到,曾多次目睹 Claude 距离获取 Flag 仅差最后一步操作,却因触发防护策略而戛然而止。

  • Gemini 系列被安全策略“提前拦截”

Gemini 的表现略显特殊。Gemini 3.1 Pro Preview 在几乎所有测试初期即主动拒绝响应任务。这一点可通过 Token 消耗量佐证:该模型平均仅使用约 9000 Token,而其他模型普遍在 10–40 万 Token 区间。换言之,它根本未进入实质性漏洞分析阶段。

Gemini 3.5 Flash 略有改善:个别测试得以推进至分析环节,但在接近核心步骤时再次触发安全限制而中止,整体行为模式与 Claude Opus 类似。

部分未完成全部 10 轮测试的模型表现

受限于持续攀升的成本压力,Kasra 后期并未对所有模型完成满额测试,但仍保留了阶段性结果记录:

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

其中最令人意外的是 Qwen 3.7 Max。测试前期,Kasra 对其抱有较高期待——因为在正式评测启动前,Qwen 是除 GPT 外唯一成功通关挑战的模型。

然而在标准化测试中,它却未能复现此前成绩。多数运行均执着于在 API 层寻找 IDOR(不安全直接对象引用)漏洞线索。更值得注意的是:其单次平均 Token 消耗高达 730 万以上,成为本次实验中资源消耗最剧烈的模型之一。

相比之下,Kimi K2.6 虽仅完成一次测试,却顺利达成目标,且执行效率与资源占用水平接近 DeepSeek V4 Pro。但由于 API 并发调用限制,Kasra 最终未进一步扩大其测试规模。

一个耐人寻味的现象:中国模型更倾向“数据库级探索”

除成功率外,Kasra 还捕捉到一个值得玩味的行为差异:多个模型在攻击过程中会突然自我约束,例如判断“该操作可能影响生产数据库,不应继续”,随后主动放弃当前攻击链路。

而中国研发的模型普遍缺乏此类顾虑。当面对数据库层面的潜在利用机会时,它们往往更积极地推进验证——这未必代表攻击能力更强,但确实折射出不同训练范式与安全对齐策略之间的深层差异。

AI 安全研究员,或许正悄然成型

正如 Kasra 所强调,这场实验并非严谨的学术评测,更多是一次技术趣味性验证。但它清晰揭示了一个不可忽视的趋势:

当下的大模型已不再局限于写代码、修 Bug 或生成文档;它们开始展现出系统性理解能力——包括解析架构拓扑、识别暴露面、推测潜在缺陷,并制定针对性利用策略。尤其 GPT-5.5 在本实验中所展现的综合能力,已基本达到初级安全工程师的实际作业水准。

当然,现阶段 AI 距离真正意义上的“全自动渗透测试专家”仍有明显距离。但如果将视野拉长至未来几年,随着 Agent 架构演进、工具调用能力增强以及超长上下文推理日趋成熟,自动化漏洞挖掘极有可能成为 AI 最具颠覆性的落地方向之一。

而这场耗资 1500 美元的实验,或许只是序章。

本文来自微信公众号“CSDN”,整理:郑丽媛,36氪经授权发布。

热门AI工具

更多
立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

60

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

40

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

40

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

40

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

40

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

240

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

160

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

120

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn