Anthropic披露三起AI模型安全测试入侵事件
okx 7月31日消息,据同花顺财经报道,Anthropic周四表示,其部分最强大的模型在部署前的网络安全测试中,未经授权访问了真实系统。在OpenAI披露其模型测试期间入侵Hugging Face基础设施后,Anthropic审查了逾14.1万次网络安全评估,发现三起入侵事件。由于与测试合作伙伴Irregular之间的误解,评估环境意外连接互联网,导致Opus4.7、Mythos5和一个内部研究模型入侵了三个组织的真实系统。这些事件发生在“夺旗”测试期间——模型需在模拟环境中寻找隐藏信息。事件最早可追溯至4月,Anthropic目前已联系三家受影响组织,其中两家此前未察觉入侵活动。与OpenAI事件不同,Anthropic模型并未利用零日漏洞,而是因环境配置错误获得网络访问权限。与OpenAI类似的是,Anthropic在评估时未部署额外防护措施,以便衡量模型的底层能力。OpenAI和Anthropic的事件表明,前沿AI模型在安全测试期间能够触及真实世界的系统,这引发了关于实验室如何保障其评估环境安全的新问题。
