ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

OpenAI自曝新模型逼近严重安全风险线

OpenAI自曝新模型逼近严重安全风险线 Astra评估逼近Critical风险阈值OpenAI宣布将有意放缓其即将推出的前沿AI模型Astra的开发进度。此前内部评估显示Astra在Agentic Coding代理式编码和网络安全方面的能力进步可能将其推入“严重Critical”风险区间。OpenAI表示这一决定是在审查近期内部测试结果并参考外部专家评估后作出的。该公司得出结论根据其Preparedness Framework准备框架——OpenAI自2023年12月以来一直使用的内部安全指南——目前无法排除Astra具备Critical级别网络能力的可能性。该框架专门用于跟踪和应对AI在生物学、化学、网络安全和自我改进等领域不断增强的能力。Astra相较此前发布的模型是一次显著飞跃。包括GPT-5.6-Sol在内的早期模型此前在前沿网络能力评估中均被评为“高High”风险等级而非“严重Critical”。根据OpenAI的框架若某个模型能在无人协助的情况下独立识别并构建针对经过加固的现实世界关键系统的功能性0Day漏洞利用覆盖所有严重性等级或者仅凭一个高层级目标便能规划并执行针对高防护目标的完整新型网络攻击策略则该模型跨入“严重Critical”风险区间。OpenAI的初步测试表明Astra的性能之强已令公司无法排除其触及上述阈值的可能性。为向安全研究社区保持透明该公司决定公开披露这一发现。需要澄清的是OpenAI表示Astra并未参与近期发生的Hugging Face漏洞利用事件因此该模型不断提升的能力水平与任何实际发生的真实世界入侵事件没有关联。OpenAI放缓Astra新模型开发作为回应OpenAI已加强对防护措施和安全控制的稳健性测试以匹配这一更高的风险水平。针对高能力模型该公司正在引入更严格的安全措施包括隔离测试环境、受限网络与工具访问权限、更强的模型权重保护与加密、扩展的监控与检测系统以及沙箱执行环境。OpenAI还暂停了Astra相关且尚未满足上述强化安全要求的内部工作。OpenAI还部署了一个通用监控系统覆盖Astra的所有Agentic用途包括训练和评估环节。该系统会审查模型的思维链并可在高风险活动发生时实时触发安全响应进行中断。此外OpenAI还计划与政府机构及部分AI安全组织合作对Astra的能力进行独立测试并将与开展更高风险评估的第三方合作伙伴共享推荐的安全控制措施。这并非OpenAI首次公开提示能力等级转变。2025年6月OpenAI在其模型逼近生物能力高风险阈值时也采取了类似行动当时强化了防护措施并扩大了外部测试合作。OpenAI表示如今正将同样的治理原则应用于Astra的网络安全能力。OpenAI将其更广泛的目标描述为确保高能力模型能够帮助防御者在攻击者利用漏洞之前发现并修补漏洞而不是让攻防天平向进攻方倾斜。OpenAI重申其承诺将与各国政府、安全研究机构和民间社会组织合作确保Astra等前沿系统在能力持续提升的同时得到负责任地部署。
返回列表