OpenAI 将 Astra 归类为网络安全“Critical”并限制发布

OpenAI 的 Astra 是首个通过独立发现零日漏洞跨越 Preparedness Framework “Critical”门槛的语言模型。由于高风险,发布将受到公司安全规则的限制,据 AI Weekly 和 TechCrunch 报道。

OpenAI 将 Astra 归类为网络安全“Critical”并限制发布

OpenAI 报告称,其名为 Astra 的新模型在 Preparedness Framework 中达到最高警报级别,是首个达到此风险程度的模型。该决定通过 AI Weekly 简报的新版本宣布,并于 2026 年 9 月 2 日星期三经 TechCrunch 确认。据两份出版物称,该模型能够自主利用安全漏洞,甚至在无人协助的情况下发现零日漏洞。这种网络攻击的主动性导致框架将 Astra 归类为“Critical”。作为回应,该公司宣布将对模型进行公开发布,但会施加严重的使用限制,以降低即时风险。

Preparedness Framework 是 OpenAI 的一套政策,定义与其系统能力相关的威胁级别,这一标准现在指导发布决策。“Critical”级别位于量表顶端,表明模型可在敏感领域自主或在极少监督下造成伤害。在 Astra 的案例中,发现第三方软件安全漏洞的核心能力被直接引用为最高分类的原因。在出版物引用的声明中,OpenAI 表示安全团队建议在任何广泛部署前加速使用调查。对该行业而言,这是 LLM 系统首次独立达到这一门槛,为其他 AI 公司创造了先例。

OpenAI classifica Astra como 'Critical' em ciber e restringe lançamento
OpenAI classifica Astra como 'Critical' em ciber e restringe lançamento

零日漏洞是制造商尚不知晓且因此没有现成补丁的漏洞,正是这种漏洞推动对服务器、金融系统和政府的严重攻击。通过自主发现这些漏洞,Astra 展示了令部分安全社区担忧的技术飞跃。另一方面,同样的能力可帮助合法公司主动搜索漏洞,防止犯罪分子利用。然而,OpenAI 进入灰色地带,需要平衡技术能力与不大规模暴露网络武器的义务。这些限制应侧重于授权机构的有限访问,而非通过开放 API 发布。目前尚无关于公开测试窗口或商业合作伙伴合格规则的细节。

这一分类还重新定位了基于 AI 的安全市场,将 OpenAI 从界面提供商转变为网络攻击的积极主角。相比之下,DeepMind 和 Anthropic 等其他实验室的方法现在应以 Astra 案例为基础制定自身标准,可能加速内部审查。分析师指出,孤立识别零日漏洞通常会消耗专业团队的时间,每年研究和自动化成本数百万美元。现在这一步骤可由像 Astra 这样训练的模型完成,并采用受控许可。迄今公布的唯一确定性是 OpenAI 更倾向于限制早期使用而非阻碍执行。然而,该主题的高度敏感性表明,这一领域的应用仍将引发新争议。

Astra 案例重新开启了如何验证模型而不关闭相关益处大门的辩论,尤其在网络防御领域。AI Weekly 报告和独立的 TechCrunch 分析提供了类似证据,强化了在出现如此重大变化时需要透明度的必要性。与 OpenAI 相关的专家在匿名条件下强调,该决定基于避免先进 AI 在无控制情况下攻击全球系统的风险前提。验证要求、内部决策日志和调整训练以防止……出于同样原因,该公司的回应被监管机构和行业视为激烈伦理监控的早期步骤。该模型在保真度测试中保持严格,新限制可能随着科学访问回合推进而披露。

Comments 0

Loading comments...

Loading comments...