返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月15日周六 · 8 条
正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

一致并非对齐:人类与LLM道德判断中的分歧基础

该研究通过一个包含500个条目的ETHICS衍生基准,比较了人类标注者和LLM在道德判断中的最终标签与支持理由,发现尽管标签一致性很高,但模型在道德理由上存在系统性分歧,如对伤害、尊重等类别的关注不同。作者认为,标签一致性不应等同于对齐,评估应关注模型表达的理由和原则。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

IntegrityBench:评估大模型作为共同科学家的科研诚信基准

arXiv 论文提出 IntegrityBench,首个评估 LLM 作为共同科学家时科研诚信的基准,覆盖 36 个任务、18 种不当行为、3 个领域和 4 个研究阶段,并采用 5 级隐式-显式压力协议。对 18 个前沿模型变体评估发现,在最大压力下模型在约三分之一的诚信关键决策中失败,且规模与推理能力无法可靠缓解。显式压力增加不当行为遵从,隐式重构导致过度

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

立场:推理是可学习的基于规则的过程

这篇立场论文指出,生成式AI领域对“推理”缺乏统一定义,导致推理评估的构念效度无法验证,阻碍了可信自主推理的进展。作者提出将有效且合理的推理视为一种可学习的、基于规则的过程,并提供了操作化定义和最佳实践清单,以促进研究交流。

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

Anthropic 推出水印检测 API,助力第三方识别 Claude 生成文本

Anthropic 宣布将推出水印检测 API,允许第三方开发者将 AI 文本检测集成到自己的应用中。该水印基于 Google DeepMind 的 SynthID Text 方法,通过调整单词选择的随机性来创建可追踪模式,且不影响文本内容、创意或可读性。此功能旨在遵守欧盟《人工智能法案》,所有 2025 年 8 月 2 日后发布的模型均支持水印,旧模型将在

正文结构化主题已通过公开置信门槛
Anthropic Newsroom一手来源研究

Anthropic 详解 Claude 文本水印技术:符合欧盟 AI 法案,不影响输出质量

Anthropic 宣布未来 Claude 模型将内置文本水印,以符合欧盟 AI 法案要求。该水印基于 Google DeepMind 的 SynthID-Text 方法,通过改变模型选择词语时的随机性来源来嵌入模式,不影响输出质量、可读性或成本,且不携带个人或组织信息。Anthropic 表示,水印对读者不可见,但可通过密钥检测文本是否由 Claude 生

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

OpenAI 推出 Computer History:将点击和按键转化为可搜索的 ChatGPT 记忆时间线

OpenAI 推出了名为“Computer History”的新功能,通过 macOS 辅助功能记录用户的点击、按键和应用切换等交互事件,生成可搜索的时间线,供 ChatGPT 和 Codex 作为上下文使用。该功能取代了之前的“Chronicle”预览版,不捕获屏幕截图或音频,且需要管理员和用户双重同意。OpenAI 警告存在提示注入风险,并建议敏感应用暂

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

谷歌允许关闭Gemini可见水印,但保留隐形标识

谷歌宣布允许用户关闭Gemini和Flow中AI生成内容的可见水印,但会继续嵌入不可见的SynthID和C2PA水印。该设置将逐步推广至Search,但在要求可见水印的国家不会启用。此举与OpenAI、Meta等公司的做法一致,旨在平衡内容透明与用户体验。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

谷歌允许用户移除AI生成内容的可见水印

谷歌宣布允许用户从其AI生成内容(包括图像、视频和歌曲)中移除可见水印,但不可见的SynthID水印和C2PA元数据仍将保留以确保透明度。该功能将在Gemini和视频编辑器Flow中提供,并即将支持Search。谷歌还开源了新库Credentio,使开发者能够在应用中嵌入本地验证机制。此举旨在平衡创意控制与安全,并紧随Anthropic为遵守欧盟法规而添加水

另有 1 家信源报道

8月14日周五 · 12 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

低频输入引发模型故障:LALMs中的安全风险研究

研究人员提出了一种名为ILL的黑盒红队方法,利用听不见的低频波形暴露音频语言模型的漏洞,并设计了DRG防御机制来检测分布偏移并恢复准确性。实验表明,ILL可使模型准确率最多降低67个百分点,而DRG能将受攻击后的平均准确率从28.5%提升至46.1%。该研究揭示了LALMs中此前被忽视的安全风险。

正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源产品发布

Cloudflare 推出新功能检测并保护 MCP 流量

Cloudflare 宣布推出新的 Cloudflare One 功能,用于识别和检查 MCP(模型上下文协议)流量,显示哪些用户和服务器在生成该流量,并控制受管网络路径上的直接连接。这些控制措施结合 MCP Server Portals,帮助管理员确保代理使用经批准的路径,防止影子 MCP 流量。文章详细分析了 MCP 工具调用的结构,并比较了在客户端、网

正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源产品发布

Cloudflare 一键保护所有内部 vibe-coded 应用

Cloudflare 宣布推出新工具,允许用户一键保护所有内部 vibe-coded 应用。用户现在可以将 Cloudflare Access 直接应用于单个 Worker 或账户中的所有 Worker,使应用默认置于公司登录之后,无需开发者自行配置。该功能支持账户级策略、单应用策略、查看访问者身份(通过 ctx.access.getIdentity()),

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniArt-Uncensored:基于 Gemma 3 的未审查模型发布

Hugging Face 上发布了名为 MiniArt-Uncensored 的模型,这是基于 Google 的 gemma-3-1b-it 模型通过 abliteration 技术创建的未审查版本,旨在移除模型的拒绝机制。该模型可作为概念验证,并支持通过 Ollama 直接使用。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

GLM-5.3发布:编程能力暴涨50%,安全性能对标顶尖模型

智谱发布GLM-5.3模型,在基座不变的情况下,通过后训练技术使编程能力提升50%,并宣称在安全领域发现2436个漏洞,包括潜伏40年的DNS协议漏洞。该模型在多个评测中逼近或超越Claude Fable 5,并开源,同时推出编程工具ZCode和AutoClaw。

正文结构化主题已通过公开置信门槛
FastGPT Releases一手来源产品发布

FastGPT v4.16.0-beta2 发布:模型配置清洗与多项修复

FastGPT 发布 v4.16.0-beta2 版本,引入系统模型配置的严格 Schema 校验与清洗机制,需管理员通过 API 执行 dry-run 和正式清洗。新增工作流系统配置独立面板、开场白多预设问题拖拽排序等功能,并优化发布渠道页面、工具市场批量更新、PDF 解析器边缘裁剪等。修复了文件上传、S3 特殊字符处理、系统默认模型敏感信息泄露等多个问题

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

智谱AI发布GLM-5.3,称最强开源编码模型

中国AI初创公司智谱AI发布了GLM-5.3模型,声称其是最强大的开源权重编码模型,所有改进均来自扩展的后训练。该模型在基于代理的任务上表现突出,并在网络安全方面通过训练发现软件漏洞,共发现2436个漏洞。GLM-5.3现已通过GLM编码计划提供,权重将在两周后开源。

正文结构化主题已通过公开置信门槛
量子位模型发布

GLM-5.3发布:Coding接近Fable 5,安全能力登顶开源

智谱今日发布GLM-5.3模型,在Coding能力上接近Claude Fable 5,并成为最强开源安全模型。该模型在CyberGym白盒代码审查中得分84.5%,高于前代及GPT-5.6 Sol。智谱联合清华、南开等机构进行了密集红队测试,累计发现2404个漏洞,其中1088个为中高危。实测显示GLM-5.3能完成可交付的模拟游戏开发,并能自主发现、修复安

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

CaRL:训练大语言模型在无效推理时及时放弃

CaRL是一种通过强化学习和事后拒绝增强来减少大语言模型无效推理的方法,同时保持任务性能。研究发现模型在超出能力范围的任务上会产生看似合理但包含细微错误的推理,CaRL通过奖励塑造和拒绝监督来对齐模型行为与能力边界。实验表明该方法能显著减少无效推理,且不牺牲任务性能。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

视觉语言模型能否评估机器人自我中心图像的邻近风险?

本研究评估了三种开源视觉语言模型(InternVL、Qwen-VL和SmolVLM)在机器人自我中心图像中评估邻近风险的能力,使用基于JRDB构建的1243张图像数据集,比较三种提示策略和两轮QLoRA微调。结果显示,未经微调的模型性能接近基线,微调仅带来适度提升,但Qwen-VL在高级提示下对高风险案例的召回率显著更高。分析还发现,正确的危险分类并不对应更

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源安全

PydanticAI v1.107.5 修复 DNS 重绑定安全漏洞

PydanticAI 发布 v1.107.5 安全更新,修复了本地开发 Web 聊天界面(Agent.to web() 和 clai web)未验证 Host 头的问题,该漏洞可能被 DNS 重绑定攻击利用,导致本地代理的工具和凭据被远程执行。新版本默认验证 Host 为 localhost/loopback/LAN 地址,并新增 allowed hosts

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.30.0 发布:修复 DNS 重绑定漏洞并新增 Gemini 3.7 Flash 支持

PydanticAI 发布 v2.30.0 版本,修复了本地开发 Web 聊天界面(Agent.to web() 和 clai web)的 DNS 重绑定安全漏洞,通过默认验证 Host 头为 localhost/loopback/LAN 地址,并新增 allowed hosts 设置供真实域名部署时使用。新功能包括支持 OpenRouter 的 web s