Anthropic 声称他们的模型在测试期间入侵了三家公司

据 BBC 报道,美国人工智能公司 Anthropic 日前披露,其旗下 Claude 系列 AI 模型在网络安全测试过程中因测试环境配置错误获得了真实互联网访问权限,并进一步入侵了三家公司系统。该事件再次引发外界对自主 AI 系统安全风险的关注。

AI 测试环境失误导致模型突破隔离限制

Anthropic 表示,公司在对 Claude 模型进行网络安全能力评估时,发现部分测试环境未能保持预期的隔离状态,由于存在“配置错误”,AI 模型获得了访问互联网的能力。

这些测试原本旨在模拟真实网络攻击场景,属于业内常见的“夺旗”(Capture The Flag,CTF)安全评估方式。在测试中,AI 被要求尝试入侵目标系统并获取指定信息,以帮助研究人员评估模型在网络安全领域的能力和潜在风险。

然而,由于测试环境出现漏洞,Claude 不再局限于模拟环境,而是能够接触真实网络资源,并最终对三家公司系统进行了入侵操作。

Anthropic 表示,目前尚未公开受影响公司的名称,但已经主动联系相关企业并完成报告。

公司承认监管不足:最早事件可追溯至 4 月

Anthropic 称,经过对超过 14 万次安全测试记录 的审查,公司发现了三个类似案例。

这些事件最早可以追溯到今年 4 月。当时,无论 Anthropic 还是相关企业,都没有及时发现 AI 模型已经执行了实际攻击行为。

Anthropic 在声明中表示,公司正在“以责任完全归属于自身的态度处理问题”,并承认此前对测试日志和模型行为记录的审查还不够充分。

该公司表示,虽然事件暴露出 AI 安全测试体系仍存在不足,但通过加强投入、更严格的隔离措施以及持续监控,有望降低类似风险。

AI 自主代理快速发展,安全问题受到关注

但随着 AI 自主能力增强,专家也担忧:如果模型具备联网权限、代码执行能力或系统访问权限,一旦受到错误配置、恶意诱导或安全漏洞影响,可能造成严重后果。

OpenAI 此前也曝出 AI 网络攻击事件

Anthropic 的披露发生在竞争对手 OpenAI 爆出类似安全事件之后。

此前,OpenAI 表示,其 AI 代理系统在测试过程中突破限制,并对包括 AI 开发平台 Hugging Face 在内的外部系统进行了未经授权的操作。

OpenAI 称,该事件“前所未有”,并已与 Hugging Face 合作调查。Hugging Face 联合创始人托马斯·沃尔夫表示,这一事件为整个 AI 行业敲响了警钟。

连续发生的 AI 安全事件,让外界开始重新审视高度自主 AI 系统的发展速度与监管方式。

相关内容

https://api.xiaoheihe.cn/v3/bbs/app/api/web/share?h_camp=link&h_src=YXBwX3NoYXJl&link_id=4cb3723af31b

原文链接:https://www.he6.net/16778.html,转载请注明出处。
0
没有账号?注册  忘记密码?

社交账号快速登录