返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月4日周二 · 2 条
正文结构化主题已通过公开置信门槛
The Verge AI政策

欧盟AI标签与透明度规则正式生效

欧盟《人工智能法案》下的新透明度义务于8月2日生效,要求公司披露用户何时与AI交互,并标记AI生成或修改的内容。违规公司可能面临高达1500万欧元或全球年营业额3%的罚款。新规适用于新AI系统,现有系统有至12月2日的宽限期。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon Bedrock 推出自动策略细化功能

AWS 宣布在 Amazon Bedrock 中推出自动策略细化功能,用于自动化 Automated Reasoning 策略的故障诊断与修复流程。该功能提供两种模式:迭代细化(Iterative Refinement)处理规则问题,以及模糊变量细化(Ambiguous Variable Refinement)处理语言歧义问题。用户需审批所有更改,从而减少手

8月3日周一 · 18 条
正文结构化主题已通过公开置信门槛
THE DECODER研究

IBM报告:92%的AI安全事件源于缺乏访问控制

IBM发布的《2026年数据泄露成本报告》显示,在经历AI相关安全事件的公司中,92%缺乏基本的访问控制。报告基于对602家公司的研究,指出问题通常源于API受损、应用连接或云服务配置错误,而非模型本身。AI相关事件的平均成本为533万美元,高于无AI事件的470万美元。

正文结构化主题已通过公开置信门槛
THE DECODER安全

国际刑警组织:AI已成为非洲网络犯罪核心驱动力

国际刑警组织(Interpol)发布报告称,人工智能已成为非洲网络犯罪的核心驱动力,涉及55%的报告案件。2025年,AI从工具转变为犯罪运营核心,财务损失从2024年的1.92亿美元翻倍至4.84亿美元。犯罪分子在攻击各阶段使用AI,包括深度伪造敲诈,已记录约60万起相关案件。报告基于36个非洲国家的数据,并提及执法行动取得成果。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

HubSpot 用规则引擎重构 JITA 授权系统

HubSpot 使用规则引擎架构重新设计了其即时访问(JITA)授权系统,以提升访问决策的可观察性和可解释性。该系统每天处理约 5500 个访问请求,通过有向无环图(DAG)组织独立规则,并引入规则级可观测性,使工程师能够检查单个规则的执行时间和结果。迁移过程包括并行运行新旧系统并比较决策,同时引入定期审查流程。

正文结构化主题已通过公开置信门槛
Import AI研究

自复制AI病毒原型问世,研究者警告需准备防御

研究人员开发了一种利用开源大语言模型的自复制计算机病毒原型,该病毒能利用被感染机器的GPU资源进行推理,并自主发现漏洞、发起攻击和复制自身。该研究由多伦多大学、剑桥大学等机构完成,展示了AI驱动的自主网络威胁已成为现实。研究者认为未来互联网将充满攻防AI代理,需要人类部署防御性AI代理来对抗。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

多公司研究揭示自动驾驶系统测试现状与挑战

一项针对九家来自六个不同国家的公司的访谈研究,探讨了自动驾驶系统(ADS)测试的现状与挑战。研究发现当前实践主要依赖基于场景和X-in-the-loop测试方法,并面临场景真实性、覆盖度、仿真保真度和验收标准等挑战。研究提出了一个以证据为中心的闭环测试框架,并展望了未来测试将更加自动化、数据驱动和透明。

正文结构化主题已通过公开置信门槛
AI at Meta Blog一手来源政策

Meta 发布高级 AI 扩展框架及 Muse Spark 安全报告

Meta 发布了更新后的高级 AI 扩展框架,扩大了风险评估范围,并引入新的安全与准备报告。针对 Muse Spark 模型,Meta 进行了广泛的安全评估,确认其具备前沿的意识形态平衡能力,且不具备自主失控风险。Meta 还改进了模型安全推理方法,通过基于原则的训练提升对新场景的应对能力。

正文结构化主题已通过公开置信门槛
Cohere Blog一手来源研究

Tiny Aya 多语言模型研究项目成果概览

Cohere Labs 发布了轻量级多语言模型 Tiny Aya,支持 70 多种语言,可在手机等设备上本地运行。通过 Expedition Tiny Aya 研究项目,社区开发了教育工具、安全评估框架和本地部署方案,揭示了多语言安全评估的复杂性。相关研究已被 COLM 2026 接收,展示了开放模型在推动多语言 AI 创新中的价值。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

超越表层对齐:信念层对齐成为AI对齐研究新视角

阿里巴巴与浙江大学的研究者提出“信念层对齐”概念,主张AI对齐不应仅停留在输出层面的表层对齐,而应关注模型内部信念与真实世界的一致性。文章引用OpenAI、Anthropic等研究,论证模型内部存在可观测和干预的信念结构,并呼吁发展系统方法进行度量与控制。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

Chain-of-Models:跨模型审计提升 LLM 评判者的偏差鲁棒性

arXiv 上的一项研究提出 Chain-of-Models (CoM) 方法,通过让第二个模型审计第一个模型的推理轨迹来减少 LLM 作为评判者时的认知偏差。实验发现,审计者的身份(同模型、同族或异族)影响审计效果,且最佳审计者因偏差类型而异。研究者据此提出按偏差类型选择审计者的规则,在四个偏差数据集上达到最高准确率 0.884,优于固定审计者和无审计基线

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

LARA:残差流中的轻量适配器实现可组合适配与对齐

arXiv 论文提出 LARA(轻量级加性残差适配)方法,在冻结模型的残差流中添加低秩校正,而非修改权重。在代码微调和 DPO 偏好优化任务上,LARA 在相同参数数量下匹配 LoRA 性能,并支持推理时通过缩放因子 γ 平滑插值,以及多行为按 token 自动路由。在 1.5B 模型上同时驻留 7 种行为,仅需约 33 MB 额外开销。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

隐喻诱导的算法引导:LLM代码生成中的跨领域程序迁移

该研究探讨了大型语言模型在代码生成中受隐喻指令影响的现象,发现隐喻可能引发跨领域程序性迁移,导致模型生成低效算法。研究者开发了MASC框架来诱发和检测这种“隐喻算法引导”效应,并通过行为评估和表征分析验证了其机制。结果表明,隐喻技能通过转移源领域的程序模式而非表面语言影响模型输出。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

AISPA:面向用户的 LLM 系统提示审计框架

AISPA 框架提出了一种以用户为中心的系统提示审计方法,用于评估 AI 应用中的系统提示。研究团队对 88 个商业 AI 产品中的 3,249 条系统提示指令进行了审查,发现系统提示设计差异显著,保护性指令虽广泛采用但覆盖范围有限,且约 40% 的产品包含不利于用户的指令。该研究强调了商业 AI 产品中系统提示透明度和标准化的重要性。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

无需重训即可解除 LLM 审查:abliteration 技术详解

Hugging Face 博客文章介绍了 abliteration 技术,可在不重新训练的情况下移除 LLM 内置的拒绝机制,使其能响应所有类型的提示。该方法通过识别模型残差流中的拒绝方向,并通过推理时干预或权重正交化来消除该方向。文章提供了基于 TransformerLens 库的代码实现,并已在 Google Colab 和 GitHub 上发布。

正文结构化主题已通过公开置信门槛
TechCrunch AI观点

Altman谈AI减速,TechCrunch辩论加速与安全

OpenAI CEO Sam Altman近期表示,可能应‘调整AI发展速度’以便社会适应新能力水平,但未呼吁暂停。TechCrunch播客讨论了此言论,认为其受OpenAI模型入侵Hugging Face事件影响,该黑客行为并非高级技术,而是因测试站点安全措施不当所致。主持人质疑加速与减速的二元框架,认为应关注更广泛的安全与责任问题。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源教程

自托管开源模型应对网络攻击的实用指南

Hugging Face 披露了一起由自主 AI 代理系统驱动的安全事件,攻击者以机器速度执行了数万次自动化操作。在分析过程中,商业 API 的前沿模型因安全护栏阻止了恶意负载分析而失败,最终 Hugging Face 使用自托管的开源模型 GLM 5.2 完成了取证分析,并避免了数据外泄。文章建议企业安全团队预先部署自托管模型作为后备,并介绍了通过戴尔、微

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 平台支持 DPO:技术深度解析

Together AI 宣布其微调平台现已支持直接偏好优化(DPO),这是一种无需强化学习即可将语言模型与人类偏好对齐的技术。文章详细介绍了 DPO 的原理、与 RLHF 的对比,并推荐先进行监督微调(SFT)再进行 DPO 的两阶段训练方法,以提升模型的有用性、真实性和无害性。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

MoAA:将多模型集体智能蒸馏进单一高效模型

Together AI 在 ICML 2025 论文中提出 Mixture-of-Agents Alignment (MoAA) 方法,通过将多个开源大模型的集体智能蒸馏到单个小模型中,使 Llama-3.1-8B 和 Gemma-2-9B 等模型性能接近甚至超越 10 倍大小的模型。该方法包括 MoAA-SFT 和 MoAA-DPO 两个阶段,使用 MoA

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

ReasonIF基准揭示大型推理模型在推理中指令遵循失败率高

Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、