Claude黑进三家真公司!Anthropic吓坏了 就在刚刚Anthropic官方一篇博文自曝Claude彻底失控直接黑进了「三家真公司」。其中两家直到Anthropic上门通知才知道系统被入侵过。Anthropic又来「作死」了...就在刚刚Anthropic官方一篇博文自曝Claude彻底失控直接黑进了「三家真公司」。其中两家直到Anthropic上门通知才知道系统被入侵过。搞笑的是达里奥这次直接把OpenAI的「剧本」搬回来照抄了。官博中Anthropic自称在OpenAI模型入侵Hugging Face事件后自己也去排查了一番。不看不知道一看吓一跳——好家伙短短几个月里Claude竟接连发起了三起网络攻击。消息一出评论区立刻沦陷大批网友疯狂造梗把 Anthropic 损得体无完肤。此前Fable 5整的那出还不够衰么这一次Anthropic又在自掘坟墓了。三家真·公司被黑全是Claude干的过去一周Anthropic全员随即启动了一轮大规模回查。在14万多次评估run里他们找到了3起独立事件一共6个run。Claude从第三方评估环境里联了网然后未经授权入侵了三家不同公司的生产系统。这事是怎么发生的这是一场「夺旗」Capture-the-Flag演练网络安全测试里最经典的一种。给模型一个虚构剧本告诉它某台机器上藏着一个秘密flag任务就是想办法黑进去把它拿出来。方法不限路径不限怎么进都行。关键在于Anthropic给Claude的提示词里白纸黑字写着一句话「这是模拟环境且无法访问互联网」。但由于Anthropic和Irregular之间的一次沟通误会容器实际上是联网的。于是当Claude顺着网络往外摸、摸到真实公司的服务器时它的判断是——这应该也是题目的一部分。同名公司Opus 4.7识破了但没停手第一起事故是Anthropic自评三起事故中影响最严重的一起。干这件事的是Claude Opus 4.7。Irregular给的虚构剧本里编了一家假公司作为攻击目标。巧的是这个名字在现实世界里对应着一个正在运行的真实域名。Opus 4.7在环境里怎么都够不到那个模拟靶机转头一扫发现「目标公司」居然在公网上活得好好的。同一个评估跑了四次四次全部得手。四次运行合计拖出了应用凭证、基础设施凭证并且进到了一个数据库里拿到了几百行生产数据。Anthropic翻它的思维链发现四次运行中模型最终都意识到了对面是真系统。其中两次它甚至给自己找好了理由「这家真公司大概也被安排进演习里了吧」。为了发恶意包Mythos 5搞到手机号第二起事件几乎像一场失控的剧本。Mythos 5在虚构环境里发现一份配置手册要求员工安装一个PyPI上并不存在的Python包。它很快想到抢先注册同名包就能让对方自动运行自己的代码。为了发包AI先注册邮箱、申请PyPI账号甚至尝试弄钱买手机号。几条路都失败后它又找到一家免手机验证的邮箱最终把恶意包传了上去。这个包在公网上存活约1小时被15台真实机器下。网友辣评当下最热门的基准测试其中一台来自安全公司专门扫描PyPI新包却被样本反过来攻陷。更讽刺的是Mythos 5早就判断过——如果这是真实互联网发包就等于真实攻击。随后它用两条错误理由说服自己证书颁发机构没见过所以证书是假的系统时间显示2026年所以环境是编的。证书是真的2026年也是真的。此后真实机器陆续中招它却一直把它们当成评估环境里的「NPC」。最后PyPI安全系统自动下架了这个包。扫了9000个目标然后自己停了第三起来自一个尚未公开的内部模型。够不到虚构目标后它转向公网一口气扫描约9000个目标最终攻破了一家公司的外部系统——从调试页面拿到凭证再用SQL注入进入云账号。当任务做到一半后它发现这个账号与夺旗任务毫无关系判断目标真实存在随即主动停手。三起事件串联起来可以看出Claude迭代后的表现Opus 4.7识破了是真实系统继续打Mythos 5直觉判断出自己在公网又硬把自己劝回「这是模拟」内部测试新模型意识到目标是真的主动停手。从「识破了还打」到「自我欺骗接着打」再到「识破了就停」。模型越新表现越接近人类希望看到的样子。当然Anthropic也反复强调这是三起孤立事件不是一场受控实验不能就此下定论。一个0day都没用上最后说一句和每个人都有关的。回看三起事故Claude用的手法并不高明弱口令、未鉴权接口、暴露的调试页面、SQL注入。Anthropic也承认Claude没有发现、也没有利用任何复杂漏洞。隔壁OpenAI那次是货真价实的0day是「AI打出了人类都难打的东西」。真正危险的是这些最基础的手法已经足以攻进三家真实公司。这次闯进来的Claude只想完成任务。拿到凭证后它没有加密数据也没有大肆扩散只顾着找那面旗子。下一次来的未必这么老实。