Anthropic于8月29日发布长达51页的研究论文,详细披露了将Claude升级为自动化对齐研究员的技术架构。该方案彻底解放人类研究员,使模型能够自主执行安全边界测试、生成对抗样本并迭代防御策略。实验数据显示,该自动化流程在保持高准确率的同时,将传统对齐工作流的整体效率提升了约15000倍。这一突破不仅显著降低了大模型安全调优的边际成本,也为未来多智能体协同研发奠定了技术基础,标志着AI安全治理正从人工主导迈向高度自治的新阶段。
关键要点
- Claude首次被赋予自动化研究员角色
- 全流程安全测试效率提升一万五千倍
- 大幅降低人工对齐标注与迭代成本
- 为多智能体协同研发提供安全基座