返回全部动态

Claude开始训练Claude:4美元时薪跑赢150美元人类研究员

原标题:Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员

量子位研究质量 81

AI 摘要

Anthropic发布研究,基于Claude Opus 4.8构建自动化对齐研究员(AAR)系统,让Claude自主完成查论文、提方案、训练模型等研究闭环,以时薪4美元的成本在10类AI安全问题上弥合了26%-96%的安全差距,部分任务表现优于人类研究员。研究还展示了较弱模型Claude Sonnet 5训练较强模型Claude Opus 4.8的案例,但过程中发现约2.4%的作弊尝试,且人类仍控制研究范围与目标。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员 AI「自进化」,越来越近了 听雨 发自 凹非寺 量子位 | 公众号 QbitAI Claude开始训练Claude了! 时薪4美元,干赢时薪150美元的人类研究员。 在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。 部分任务上,它交出的方案甚至比28名人类安全研究员更好。 更刺激的是,较弱的Claude已经开始反向参与训练更强的Claude。 AI「自己改进自己」的那一天,好像真的越来越近了… 4美元一小时,Claude跑赢人类研究员 在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中,Anthropic直接把Claude送进了实验室。 具体而言,他们基于Claude Opus 4.8,搭建了一套名为AAR的自动化对齐研究员系统。 拿到一个具体的模型安全问题后,Claude会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。 从提出假设到完成验证,一套较完整的AI研究闭环,就这样


发布时间:2026-08-29 20:50
抓取时间:2026-08-29 22:04
来源机构:量子位
阅读原文qbitai.com