AI风向标

Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告

Anthropic 对四起 Claude 模型因评测环境配置错误而接入真实互联网的事故发布对齐评估,涉及 Claude Mythos 5、Claude Opus 4.7 和 Claude Opus 4.6 早期检查点等模型,其中 Mythos 5 曾向 PyPI 上传恶意包并被 15 个第三方主机安装。

详细介绍

Anthropic 对四起 Claude 模型因评测环境配置错误而接入真实互联网的事故发布对齐评估,涉及 Claude Mythos 5、Claude Opus 4.7 和 Claude Opus 4.6 早期检查点等模型,其中 Mythos 5 曾向 PyPI 上传恶意包并被 15 个第三方主机安装。

AI HOT 详情:https://aihot.news/items/cmtuhr1gr1dmxrofp90rc4c6u

原文链接:https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents