Anthropic称Claude在自动化测试中减少了对齐失败
2026-08-29 12:59 loading...
核心要点
Anthropic 发布了关于 Claude 进行自动化对齐研究的成果。Claude 在 10 项测试的对齐失败场景中提升了安全评分。Anthropic 表示,测试期间通用能力得以保留。该公司还向外界开放了自动化对齐研究框架。
研究概述
Anthropic 称,Claude 通过自动化研究流程,在 10 项测试的对齐失败场景中提升了安全评分。该公司表示,在研究人员评估安全干预措施的同时,测试保留了模型的通用能力。
Anthropic 在一篇博文中宣布,已将自动化对齐研究框架提供给外部研究者。该公司将这项研究描述为衡量并缓解模型不对齐问题的努力。
Claude 测试的安全干预措施
Anthropic 称,Claude 检查了常见的不对齐形式,包括欺骗和谄媚。该模型自主提出方法、训练较小模型,并在每一步无需直接干预的情况下评估结果。
该公司表示,在早期实验中,Claude 被分配了 48 小时和一块图形处理器。它利用这段时间研究方案、提出训练方法,并测试生成的模型。
Anthropic 表示,在测试设定下,Claude 在提升安全评分的同时并未降低通用能力。它还提到,部分方法能够迁移到优化过程中未使用的基准测试上。
该公司报告称,这些方法可以泛化到 Petri 行为审计中。Anthropic 还表示,测试涵盖了比研究过程中所用模型大 4.7 倍的模型。
这些结果限于特定的测试环境。Anthropic 指出,细微或罕见的失败可能不会出现在现有基准测试中。
AI 对齐走向自动化
在这项研究发布之前,对齐工作通常依赖人类研究者设计干预措施并评估模型。如果自动化系统的结果能在独立评估中站得住脚,它们可能缩短这一流程。过去 30 天里,AI 安全讨论越来越多地聚焦于:更强的模型能否帮助评估和改进较弱的系统。
这种方法依赖于可靠的测量手段,以及对误导性基准表现的防范。Anthropic 表示,其实验使用了保留测试,来检验方法是否能够泛化到 Claude 优化所依据的基准之外。它并未声称基准结果能消除所有形式的模型风险。
该公司强调,选择正确的测量指标仍然是这项工作的核心。
外部研究者可使用该框架
Anthropic 发布了这一研究框架,以便其他团队复现或扩展实验。外部测试将决定这些方法是否适用于不同模型和安全评估。
该公司并未将研究结果作为更广泛模型评估的替代品。其报告的结果仅限于测试的对齐失败场景和实验约束条件。
研究者们很可能将重点关注复现、基准设计以及可能的失败模式。Anthropic 的发布为这些研究提供了一个框架。
相关阅读
-
Anthropic监测发现:Claude在39次运行中操控自身安全基准矿业头条 2026-08-29 08:45
-
Claude与ChatGPT预测:比特币熊市真的结束了吗?币种百科 2026-08-27 02:44
-
Anthropic认为AI市场蕴含30万亿美元巨大机遇币种百科 2026-08-27 00:07
-
Anthropic计划IPO,估值或达2万亿美元币种百科 2026-08-23 07:23
-
Anthropic 或瞄准史上最大IPO——野心背后的数字币种百科 2026-08-22 08:00
-
Anthropic拟创纪录IPO,规模或超SpaceX的860亿美元交易矿业头条 2026-08-22 00:18
-
Anthropic前沿模型30天数据保留规定引发企业强烈抵制WEB3.0 2026-08-21 07:26
-
Claude AI预测:若比特币2026年突破10万美元,XRP将何去何从?币种百科 2026-08-21 05:53
-
Anthropic据称考虑IPO,估值或挑战或超越SpaceX的750亿美元纪录矿业头条 2026-08-21 04:38
-
Anthropic季度营收首次超越OpenAI矿业头条 2026-08-19 19:19