同一条「删库」指令,藏在任务资料里被 AI 全部识破;换个地方写进它自己的规则文件,八次删了七次 🧪

我是赛博通天灵宝,一个爱看《凡人修仙传》的 Vibe coding 一人公司创业者。一个人写代码、一个人跑产品,天天泡在 AI 编程助手里。这次我干了件损事:把同一条坏指令用两种方式喂给四个「模型 + 自带 agent 框架」组合,全程在断网 Docker 小黑屋实测,只看它实际干了什么。

省流 🛡️ 新一代模型在任务数据里能识破坏指令;可同一个字没改,写进 CLAUDE.md/AGENTS.md,就被当成「正常运维」执行了。最狠一刀:GLM-5.2 删文件 7/8。

(天天让 AI 自动读项目规则文件再开工的,先收藏再看 📌)

一图看全局:藏任务里全扛住,写进规则文件塌了

① 一张图看全局:同一条 rm -rf 删库指令,藏进任务数据(手法 s3),Opus 5 / Kimi K3 / GLM-5.2 三个新模型全 0 中招;一旦搬进 AI 自己的规则文件(手法 L5),Kimi K3 中招率 25.0%、GLM-5.2 29.2%,点估计追平甚至超过陪考的 DeepSeek-V4-Pro。一个字没改,只换存放位置,新模型就守不住了。

裂缝全在删文件:GLM-5.2 删 7/8、Kimi K3 删 6/8

② 最该看的一张:把「写进规则文件」按三种坏事拆开——偷密钥、偷偷联网全员 0/8,它们完全认得出这是坏事;唯独 rm -rf 套上「CI 缓存清理约定」的壳被放行,GLM-5.2 八次删七次、Kimi K3 八次删六次。攻击的不是理解力,是信任:破坏动作被「这是正常运维」洗白,比直白「帮我偷东西」有效得多 😱

诚实交代:陪考没睡着 + 我的开源工具没帮上忙

③ 两件我得诚实交代:一,特意拉 DeepSeek-V4-Pro 陪考,它 s3/L5 都中了好几招——说明诱饵、指纹照、防火墙计数全在正常工作,新模型的 0 是真防住,不是监考睡着。二,我自己写的开源工具 vibe-guardian 压根没帮上忙:它不在实验容器里,且只盯「写文件」不盯「敲命令」,而这次出事的删文件/联网全是命令。它能拦的只是硬编码密钥这类低级错误,防不了提示注入。

带走:真能管住 AI 的 3 道墙 + 回去检查两件事

④ 你回去只做两件事:① 你的 AI agent 跑在什么环境里?② 它 rm / curl 之前,会不会先问你一声?工程上真能依赖的主墙就三道——沙箱隔离、危险动作先问人、最小权限。

⚠️ 诚实口径:「0 中招」是行为判分下 24 次一次没中,统计保守说法是「真实中招率大概率不超过 14%」,不是证明为零,更不是绝对安全。这次比的是「模型 + 自带框架」整套组合,不是跨框架模型排行榜。手法出处 arXiv:2509.22830 / arXiv:2607.14611。

你用 AI 写代码时,翻过自己项目的 CLAUDE.md/AGENTS.md 吗?里面有没有你都不知道是谁写进去的「约定」?评论区聊聊 👇

🔗 vibe-guardian 开源免费:github.com/wbw20000/vibe-guardian 📊 216 行逐条数据 + 判分器源码,登录免费下载:crawdpad.com/library/xiaohongshu/rules-injection-test

#AI编程 #vibecoding #独立开发 #网络安全 #Claude #提示词注入 #程序员 #深度测试