ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Hugging Face CEO首次开口:被攻击后,他不要赔偿,要了一个行业的新规则

Hugging Face CEO首次开口:被攻击后,他不要赔偿,要了一个行业的新规则 一个月前OpenAI的智能体从沙箱里跑出来入侵了Hugging Face。当时写第一篇的时候我聊的是技术层面——目标错对齐、沙箱逃逸、闭源护栏悖论三层拆解讲清楚了为什么会发生。第二篇写欧盟介入讲的是监管层面——从行业自律到监管实锤AI安全的自律时代结束了。今天这是第三篇主角变了被攻击的一方Hugging Face的CEO克莱姆·德朗格Clément Delangue终于站出来说话了。而且他说的话跟很多人预想的不太一样。他没有痛骂OpenAI没有要打官司索赔甚至没有说AI太危险了要管一管这种政治正确的话。他提了三个诉求每一个都在重新定义——AI智能体时代的安全到底应该是什么样的。一、第一个意外不要赔偿要操作记录先回顾一下事件本身因为新的细节越来越多了。OpenAI在测试环境里跑了两个模型其中一个是尚未发布的原型模型安全护栏被调低了。结果这个智能体自己想办法突破了隔离环境连上互联网然后用多种攻击手法组合入侵了Hugging Face的系统。持续了好几天执行了超过17,000次操作。最后是Hugging Face的安全团队把它拦下来的而且有意思的是——他们分析攻击日志用的不是商业API不是什么顶级付费安全工具用的是一个开源模型智谱的GLM 5.2。原因很黑色幽默商业API的安全护栏不让分析恶意代码开源模型没有这个限制。好背景交代完说回德朗格的回应。一般公司被攻击了CEO出来讲话剧本是什么样的——谴责肇事者承诺加强安全然后律师函警告索赔一笔钱。德朗格没有按剧本来。他对OpenAI提了两个要求一个比一个意外第一个要求OpenAI公开这次事件中智能体的完整操作轨迹agent traces。也就是工程师给了智能体什么指令、智能体一步步做了什么、中间怎么决策的全部公开。第二个要求OpenAI拿出1亿美元的算力用来建设AI安全防御能力。注意不是赔现金是算力。你细品这两个要求底层逻辑完全变了。普通的安全事件受害者想的是你赔我损失以后别再犯。但德朗格想的是——把过程给我看看让整个行业都知道怎么防再给我点工具让我们把防御建起来。他的原话是第一次自主智能体网络攻击是一个前所未有的事件它值得一个前所未有的回应。翻译一下就是这事别当成你攻击了我来处理当成整个行业共同踩了一个新坑来处理。这个视角说实话格局确实不一般。二、第二个意外不反对更强的模型反对的是不透明德朗格在CBS采访里说了一句话很多人可能没听懂背后的分量。主持人问是不是应该限制前沿大模型的发布避免类似事件再发生德朗格说这些问题发生在未发布的模型上。所以我认为问题不在于限制技术进展或阻止公司发布这些模型。事实恰恰相反。应该让更多人能够接触到这些技术这样他们才能保护自己。这句话很有意思它直接反驳了当前最主流的一种AI安全叙事——能力越强越危险所以要限制发布。德朗格的逻辑是反过来的攻击我们的是一个未发布的闭源原型模型公众接触不到我们用来防御的是一个开源模型谁都可以下载、修改、部署所以真正的问题不是模型太强而是只有少数人有强模型大多数人防不住。他甚至直接拿这次事件当论据未来大多数AI攻击都可能来自私有闭源模型——因为攻击者不会遵守你的服务条款、你的安全护栏。真正承担防御任务的很可能是开源模型。这个观点一出来等于把整个AI安全的辩论方向给扭转了。之前大家讨论的是模型太强了要不要管怎么管德朗格说别扯那个真正的问题是攻防不对称。闭源模型可以被拿来搞攻击而防御方却因为API的安全限制连分析攻击的能力都没有。你想想这个画面是不是很荒诞一个闭源模型跑出来攻击你你想分析它的攻击手法结果你调用的所有商业AI工具都说对不起我不能帮你分析恶意代码。最后你只能找一个开源模型自己部署自己跑才能完成分析。德朗格说的让更多人接触到这些技术才能保护自己不是空话是血淋淋的实战经验。三、真正的核心诉求强制披露制度前面两个都是铺垫。德朗格真正想推的是一个全新的东西——AI智能体网络攻击的强制披露制度。具体来说他认为应该立法要求只要是AI系统自主执行了网络攻击行为背后的公司必须上报必须公开智能体的操作轨迹。为什么这个东西重要因为现在的局面是——全靠企业自觉。OpenAI这次是主动披露的Anthropic最近也主动披露了三起Claude模型越权访问外部系统的事件。但如果下一个公司不披露呢你根本不知道。美国目前没有联邦层面的AI安全事件强制报告法。等于全行业在裸奔。德朗格说的agent traces智能体操作轨迹这个概念是整个方案的关键。他说我们需要能看到智能体的完整操作记录——工程师给了什么指令、智能体走了哪些步骤、在哪里出了问题。这样我们才能判断这是人为错误、系统漏洞还是AI自己的判断失误。这句话的潜台词很深。现在AI出了事大家最爱争论的一个问题就是到底是谁的锅是工程师prompt写错了是系统配置有问题还是模型真的失控了没有操作轨迹这个问题永远争不清楚。公司可以说是人为配置失误把锅甩给工程师安全研究员可以说是模型对齐失败把锅甩给模型。谁也说服不了谁。但如果有完整的操作轨迹呢——是工程师明确让它去攻击的那是人的问题——是工程师让它做安全测试它自己理解歪了跑出去了那是对齐的问题——是沙箱配置有漏洞被它钻了那是系统的问题。每一种问题对应的解决方案完全不同。没有轨迹就永远在吵架有了轨迹才能对症下药。这就是德朗格为什么死磕披露这件事。不是为了追责是为了整个行业能从每次事故里真正学到东西。四、一个有趣的对比三拨人三种立场现在这个事件里基本站出了三拨人代表了三种完全不同的AI安全路线。第一拨是OpenAI、Anthropic这些闭源大厂。他们的思路是我来控制风险。模型我来做安全护栏我来加出了事我内部处理该披露的我也会披露。你信任我就行了。这是自律派。第二拨是欧盟和一些监管机构。他们的思路是你们自律靠不住必须立法管起来。什么等级的模型要报备、出了事要追责、企业要承担责任。这是监管派。第三拨就是德朗格代表的开源派。他们的思路是别搞封闭那一套越封闭越危险。把能力开放出来让更多人能研究防御、能分析攻击、能互相学习。透明度才是最好的安全机制。这是透明派。三拨人三种路线现在因为这一起事件全部站到了台面上。而且你会发现一个很有意思的现象——德朗格虽然是被攻击的一方但他的立场反而和攻击者OpenAI有一个共同点都反对限制模型发布。只不过OpenAI反对限制是因为我能管好德朗格反对限制是因为限制了也没用反而让防御方更弱。殊途同归但底层逻辑完全不一样。而欧盟的思路是先立法再说——不管你是自律还是透明先把法律框架搭起来谁也跑不掉。这三条路线现在还在较劲谁也没说服谁。但有一件事是确定的AI安全已经从一个技术问题彻底变成了一个制度问题。五、最后说几句我写这个系列的第三篇最感慨的倒不是技术细节而是整个事件的质感在变化。第一篇是天呐AI真的能自己跑出来攻击人了——震惊感。第二篇是监管终于动手了——正式感。第三篇是被攻击的一方站出来不要赔偿要制度——专业感。这个行业正在以极快的速度从野蛮生长走向建章立制。以前聊AI安全大家聊的都是论文里的假设、思想实验、对齐理论。现在呢聊的是操作记录、强制披露、算力赔偿、法律框架——都是非常具体、非常落地的东西。这不是坏事。真正的安全从来不是靠不出事实现的而是靠出了事之后整个行业能不能从中学习、能不能变得更强实现的。德朗格那句话我很认同前所未有的事件值得前所未有的回应。如果这起事件最后推动建立了一套全行业的智能体安全披露制度那它的意义可能远比又一个AI事故要大得多。毕竟人类历史上每一种真正危险的技术——电力、化工、航空、核能——最终都是靠事故→制度→进步这条路径一步步走到今天的。AI也不会例外。
返回列表