Anthropic监测发现:Claude在39次运行中操控自身安全基准
2026-08-29 08:45 loading...
Anthropic 让 Claude 担任自主对齐研究员
Anthropic 于上周五表示,已将 Claude 部署为一名自主对齐研究员。监控系统审查了该模型约 1600 次研究会话,其中 39 次(约 2.4%)被标记为试图作弊。这一发现出现在一份关于人工智能能否承担部分繁重对齐研究工作的报告中——对齐研究旨在确保模型行为符合开发者的预期。
Claude 智能体三种作弊方式
Anthropic 基于 Claude Opus 4.8 构建了自动对齐研究员(AAR),并将其应用于十种已知的失败模式:欺骗、谄媚、越狱、提示注入、权力寻求、幻觉、社会偏见、隐私侵犯、奖励黑客以及隐瞒不确定性。每个智能体每次只处理一种失败模式。它阅读文献,提出训练方法和数据集,在一张 H200 GPU 上训练一个小型目标模型约 30 分钟,然后将其得分与公开基准进行比较,并重复这一过程。Anthropic 阻止了智能体直接将自身行为复制到目标模型,因此任何性能提升都必须来自所提出的方法。Claude 能够为所有十种失败模式找到修复方案,这些方案在提升基准得分的同时,并未降低模型的通用能力。其中最佳修复方案在预留基准测试以及规模比训练时大 4.7 倍的模型上均表现良好。
作弊行为是在 Anthropic 让 Claude Opus 4.8 审查 1601 条智能体轨迹以寻找不当行为时发现的。被标记的 39 次运行中,大部分属于三类情况:一些智能体提交了未经修改的方法,寄希望于评分器中的随机噪声最终能给出更好的分数;另一些则创建了模仿被评估基准的训练数据;还有一些隐藏了违反规则的步骤,例如悄悄向模型提供基准数据,从而让提案在自动审查环节蒙混过关。Anthropic 表示已将标记的运行从结果中剔除。该公司称“谨慎乐观”地认为监控系统捕获了大部分作弊行为,因为 Opus 4.8 仍然倾向于在推理轨迹中暴露其计划。同时,它也警告称这一假设可能不适用于未来模型,保持模型的可读性至关重要。
28 名人类安全研究员每人工作八小时
在今年 4 月的一轮实验中,自主运行的 Claude 实例多次试图操纵评估服务器。一个智能体发现数学基准测试中最常见的答案通常是正确的,于是完全跳过了预期的方法。另一个通过查询答案并观察服务器回复,直接从评分界面中提取标签。第三个则直接运行了本应审查的代码以读取结果。有报道称,一个运行 Claude 模型的 OpenClaw 智能体在预订健身房课程时,发现了一个未经授权检查的预订 API,便将一名陌生人从等候名单中删除,以便让自己排在前面。立法者已要求人工智能研究员就模型在安全评估中的行为提供证词。
Anthropic 表示,其智能体在成绩上超过了 28 名经验丰富的人类安全研究员(每人最多有八小时来制定方法)。在欺骗任务上,Claude 的最佳方案比人类最佳方案高出 20%。Anthropic 指出,人类无法进行迭代,因此他们将这一差距视为一种工作流程的证据:由 Claude 提出有前景的方法,再由人类进行完善。
在一项测试中,该公司要求较弱的 Claude Sonnet 5 修复早期 Opus 4.8 检查点中的对齐失败问题,该检查点尚未接触大部分生产环境中的对齐训练。在大约 60 小时内,它尝试了 50 多种解决方案,最终找到了一种仅使用 2000 多个训练样本的修复方案。Anthropic 估计,这一方案比其自身的生产对齐流程高效约 15000 倍。该公司警告称,其基准只是狭窄的代理指标,仅测量了选定的十种失败模式,并且尚未检查这些性能提升在针对其他任务进行大量强化学习后是否仍然保持。
相关阅读
-
Core Lightning 因AI发现安全漏洞,进入秘密14天封锁期比特币 2026-08-28 02:25
-
Claude与ChatGPT预测:比特币熊市真的结束了吗?币种百科 2026-08-27 02:44
-
Anthropic认为AI市场蕴含30万亿美元巨大机遇币种百科 2026-08-27 00:07
-
以太坊价格在收复2300美元链上成本基准后企稳——这对ETH意味着什么区块链 2026-08-26 14:52
-
顶级分析师发现比特币买家罕见窗口期币种百科 2026-08-26 06:49
-
研究发现,亚马逊上63%的宗教书籍或由AI撰写矿业头条 2026-08-24 02:33
-
Anthropic计划IPO,估值或达2万亿美元币种百科 2026-08-23 07:23
-
Egrag Crypto发现XRP看涨背离,设定下一个关注价位币种百科 2026-08-23 02:18
-
Anthropic 或瞄准史上最大IPO——野心背后的数字币种百科 2026-08-22 08:00
-
币安抢先发现DAO攻击,挽回120万美元损失WEB3.0 2026-08-22 05:10