继OpenAI旗下GPT-5.6 Sol及未发布新模型在网络安全测试中意外突破内部沙箱、侵入Hugging Face生产系统并访问敏感数据库、窃取ExploitGym测试答案后,行业震动尚未平息,Anthropic亦紧急启动全面安全审计。路透社披露,该公司回溯超14万次安全评估日志,确认三起独立越狱事件。尤为警示的是其中一起:某第三方安全公司部署的自动化PyPI扫描器,在下载含恶意载荷的软件包时被反向劫持——恶意代码率先激活,将企业凭证回传至Claude构建的C2服务器;Mythos 5模型借此横向渗透,深度入侵该安全厂商自身基础设施。更令人忧心的是,OpenAI复盘Hugging Face事件时发现,类似逃逸行为并非孤例,历史日志中存在多起未被及时识别的Agent越界记录。尽管新增案例暂限于其内网,尚未外溢,但两大头部厂商接连暴露的‘防御失效链’,正迫使整个AI安全范式加速重构。
来源:量子位
