返回全部动态

超越表层对齐:信念层对齐成为AI对齐研究新视角

原标题:超越表层对齐:信念是通往深层对齐的新入口

Hugging Face Blog一手来源研究质量 88

AI 摘要

阿里巴巴与浙江大学的研究者提出“信念层对齐”概念,主张AI对齐不应仅停留在输出层面的表层对齐,而应关注模型内部信念与真实世界的一致性。文章引用OpenAI、Anthropic等研究,论证模型内部存在可观测和干预的信念结构,并呼吁发展系统方法进行度量与控制。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

徐子文1,2、徐浩铭1,2、洪海文1、张宁豫2 1 阿里巴巴 2 浙江大学 表层对齐改变模型说什么,但模型内部的信念是否与真实世界对齐,至今缺乏有效的统一观察与干预手段。本文据此提出:对齐研究需要进一步关注信念层。 本文也提供英文版本 English。 过去几年,AI 对齐取得了显著进展。通过 SFT、RLHF、DPO 等技术,我们已经能够相当有效地控制模型的输出——让它更礼貌、更安全、更符合人类期望。近年来,一系列工作开始指出,现有主流对齐方法在很大程度上体现为一种表层对齐:其代表性的表层对齐假说(Superficial Alignment Hypothesis)[1] 指出,模型的大部分知识与能力在预训练阶段习得,对齐很大程度上是在已有能力基础上塑造模型的行为和表达方式。后续工作进一步区分了表层与非表层的安全对齐 [2],但都印证了同一个事实:当前对齐主要改变模型“怎么说”,而非它“相信什么”。 一个值得进一步研究的问题是:我们能控制模型的输出,却还缺乏系统方法去观测和干预模型内部的信念是否可靠。 表层对齐让模型说得更好,但却忽视了对模型究竟“信什么”的关注。表层对齐能够让模型说得


发布时间:
抓取时间:2026-08-03 15:29
来源机构:Hugging Face
阅读原文huggingface.co