当地时间9月1日,OpenAI正式官宣下一代AI模型Astra。这是OpenAI首个达到“关键”(Critical)网络安全能力门槛的AI模型——Astra在ExploitBench基准测试中实现了已知漏洞的满分,并在内部测试中发现了两个真实零日漏洞,已披露给软件维护方。
“关键”是什么概念?
OpenAI有一套内部“准备框架”(Preparedness Framework),对模型能力进行分级评估。Astra是第一个达到最高级别“关键”的模型。OpenAI称,Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下利用漏洞并发起攻击。
这意味着,这台AI已经具备了“自主黑客”的能力——自己找漏洞、自己制定攻击方案、自己执行攻击。全程不需要人类写一行代码、发一条指令。
更让人担忧的是它的“学习方式”。
Astra采用了“recurrent depth”技术,多位安全研究人员质疑其推理过程的可监控性。简单说,它的思考过程像人的思维一样层层递进、不断深入,外人很难追踪它“到底在想什么”。OpenAI首席科学家Jakub Pachocki回应称相关担忧基于“混淆的报道”。
OpenAI也怕了。
Astra的部分功能将推迟数周发布以加强安全防护,其高级网络安全功能最初仅限经过审查的用户使用。OpenAI表示将限制该模型的使用范围。
当一个AI被发明者自己限制使用、被安全专家质疑“不可监控”、被发现能自主发起网络攻击——这已经不是一个“技术问题”,而是一个“安全问题”。
同一天,谷歌发布Gemini 3.8 Flash及面向网络安全场景的Cyber安全变体。谷歌的Cyber变体实测两小时即可发现高危漏洞,但不对公众完全开源,仅对可信机构开放。
当AI不仅能写诗画画,还能自主“黑”进别人的系统——安全的底线正在被技术重新定义。 而Astra的名字,注定会成为AI安全史上一个绕不开的坐标。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
