GPT-5.3-Codex 是我们根据《备灾框架》(Preparedness Framework) 处理的首个具有“高网络安全能力”的模型,该框架要求额外的保障措施。这些保障措施包括训练模型拒绝明显的恶意请求,例如窃取凭据。
除了安全训练外,基于自动分类器的监控器会检测可疑网络活动的信号,并将高风险流量路由到网络能力较低的模型 (GPT-5.2)。我们预计只有极小一部分流量会受这些缓解措施的影响,并且我们正在努力完善我们的策略、分类器和产品内通知。
我们为什么要这样做
最近几个月,我们看到模型在网络安全任务方面的性能有了显著提升,这使开发者和安全专业人员都从中受益。随着我们的模型在漏洞发现等网络安全相关任务上的表现不断提高,我们正在采取一种预防性方法:扩大保护和执法力度,以支持合法的研究,同时减缓滥用行为。
网络能力本质上是双重用途的。支撑重要防御工作(渗透测试、漏洞研究、大规模扫描、恶意软件分析和威胁情报)的相同知识和技术,也可能导致现实世界的伤害。
这些能力和技术需要在可以被用于提高安全性的环境中使用且更易于使用。我们的网络信任访问 (Trusted Access for Cyber) 试点项目使个人和组织能够继续使用模型进行潜在的高风险网络安全活动,而不会受到干扰。
它是如何工作的
从事网络安全相关工作或类似活动的开发者和安全专业人员,其请求可能被自动检测系统误认为恶意行为,并可能被重新路由到 GPT-5.2 作为回退方案。我们预计受缓解措施影响的流量比例非常小,并正在积极校准我们的策略和分类器。
最新 alpha 版本的 Codex CLI 包含在请求被重定向时的产品内消息提醒。未来几天内,所有客户端都将支持此消息提醒。
受缓解措施影响的账户可以通过加入下方的“信任访问” (Trusted Access) 计划重新获得 GPT-5.3-Codex 的访问权限。
我们认识到加入“信任访问”可能并不适合所有人,因此随着我们扩大这些缓解措施并增强网络韧性,我们计划在大多数情况下从账户级安全检查过渡到请求级检查。
网络信任访问 (Trusted Access for Cyber)
我们正在试点“信任访问”,这允许开发者在我们在为正式发布校准策略和分类器的同时,保留高级功能。我们的目标是极少数用户需要加入网络信任访问 (Trusted Access for Cyber)。
如需将模型用于潜在的高风险网络安全工作
- 用户可以在 chatgpt.com/cyber 验证其身份
- 企业可以通过其 OpenAI 代表申请默认为整个团队开启信任访问
安全研究人员和团队如果需要访问网络能力更强或更宽松的模型以加速合法的防御工作,可以表达对我们受邀参与计划的兴趣。拥有信任访问权限的用户仍必须遵守我们的使用政策和使用条款。
误报
合法或非网络安全活动偶尔可能会被标记。当发生重定向时,响应模型将在 API 请求日志中可见,并在 CLI(很快将在所有界面)中通过产品内通知显示。如果您遇到了认为不正确的重定向,请通过 /feedback 报告误报。