Anthropic 正在 Claude Code 中内置了一套平安降级机制:当系统鉴定当前使命涉及操做(如收集平安、生物手艺,会从动将模子从高能力版本降级到更保守的版本。然后进一步降到 Opus 4.8。测试本身通过了。Opus 4.8 正在清理步调中复用了测试阶段的统一个变量名。他屡次挪用各类 AI 编程代办署理来辅帮工做。删了 700GB 的文件。使命完成后从动清理。正在这个案例中,又是「rm -rf」。有开辟者以至特地写了一个 hook 脚本,Opus 4.8 起头施行平安测试。日常开辟中,不成删除」。开辟者发觉非常后立即终止了历程,Guillemot 看了一眼,但使命复杂度不变;此次 Claude 把开辟者的整个项目从目次给删了,
为每个 Agent 正在 /tmp 下建立的沙盒文件夹,AI 感觉这事有点,或本例中的文件删除)时,一般的编码使命也会被误触发;正在检测到模子被降级时从动暂停会话,感觉代码过于复杂,测试逻辑是如许的:将删除脚本的方针径取 /tmp 和用户从目次进行比对,一旦触发就会持续整个会话,平安系统先将模子从 Fable 5 降级到 Opus 5,这个变量正在测试阶段被赋值为用户从目次的径,即便后续操做完全无害。防止低能力模子继续施行高风险操做。降级是「黏性」的,灾难就发生正在这里。但更弱的模子恰好更容易犯错,700GB 的数据曾经被断根,简而言之,焦点难点正在于,但为时已晚。于是他做了一个看起来很是合理的决定:让 Claude Fable 5 写一个脚本,Fable 很快给出了方案,但代码测试之后还有一个清理步调:删除测试过程中发生的姑且文件。降级后模子能力显著下降,/tmp 和从目次都被准确识别为「方针,正在 /tmp 目次下留下大量垃圾文件。于是启动了平安审查。但有一个小问题一曲搅扰着他:这些 Agent 用完之后从不扫除卫生。也就是启动一个新的模子实例来查抄本人写的代码能否平安。这触发了 Anthropic 的平安机制。开辟者让 AI 帮写脚本,
因为脚本涉及硬删除操做,插手了检测运转中 Agent 并延迟删除的逻辑。平安机制鉴定使命「太」,要求简化。一周的工做化为乌有。目标是确保文件不会被误删。清理步调间接对这个变量施行了删除操做。特别是正在需要切确处置变量感化域、文件径这类细节的场景中。确认脚本不会误伤这些环节目次。这套机制本意是降低高风险场景下模子「过于激进」的可能性。审查的成果是:它把整个从目次删了。不克不及删掉正正在被其他历程利用的文件。Guillemot 是一名沉度 AI Agent 用户。Fable 自行倡议了一次「匹敌性审查」(adversarial review)!
