欧盟AI标签与透明度规则正式生效
欧盟《人工智能法案》下的新透明度义务于8月2日生效,要求公司披露用户何时与AI交互,并标记AI生成或修改的内容。违规公司可能面临高达1500万欧元或全球年营业额3%的罚款。新规适用于新AI系统,现有系统有至12月2日的宽限期。
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
欧盟《人工智能法案》下的新透明度义务于8月2日生效,要求公司披露用户何时与AI交互,并标记AI生成或修改的内容。违规公司可能面临高达1500万欧元或全球年营业额3%的罚款。新规适用于新AI系统,现有系统有至12月2日的宽限期。
AWS 宣布在 Amazon Bedrock 中推出自动策略细化功能,用于自动化 Automated Reasoning 策略的故障诊断与修复流程。该功能提供两种模式:迭代细化(Iterative Refinement)处理规则问题,以及模糊变量细化(Ambiguous Variable Refinement)处理语言歧义问题。用户需审批所有更改,从而减少手
IBM发布的《2026年数据泄露成本报告》显示,在经历AI相关安全事件的公司中,92%缺乏基本的访问控制。报告基于对602家公司的研究,指出问题通常源于API受损、应用连接或云服务配置错误,而非模型本身。AI相关事件的平均成本为533万美元,高于无AI事件的470万美元。
国际刑警组织(Interpol)发布报告称,人工智能已成为非洲网络犯罪的核心驱动力,涉及55%的报告案件。2025年,AI从工具转变为犯罪运营核心,财务损失从2024年的1.92亿美元翻倍至4.84亿美元。犯罪分子在攻击各阶段使用AI,包括深度伪造敲诈,已记录约60万起相关案件。报告基于36个非洲国家的数据,并提及执法行动取得成果。
HubSpot 使用规则引擎架构重新设计了其即时访问(JITA)授权系统,以提升访问决策的可观察性和可解释性。该系统每天处理约 5500 个访问请求,通过有向无环图(DAG)组织独立规则,并引入规则级可观测性,使工程师能够检查单个规则的执行时间和结果。迁移过程包括并行运行新旧系统并比较决策,同时引入定期审查流程。
研究人员开发了一种利用开源大语言模型的自复制计算机病毒原型,该病毒能利用被感染机器的GPU资源进行推理,并自主发现漏洞、发起攻击和复制自身。该研究由多伦多大学、剑桥大学等机构完成,展示了AI驱动的自主网络威胁已成为现实。研究者认为未来互联网将充满攻防AI代理,需要人类部署防御性AI代理来对抗。
一项针对九家来自六个不同国家的公司的访谈研究,探讨了自动驾驶系统(ADS)测试的现状与挑战。研究发现当前实践主要依赖基于场景和X-in-the-loop测试方法,并面临场景真实性、覆盖度、仿真保真度和验收标准等挑战。研究提出了一个以证据为中心的闭环测试框架,并展望了未来测试将更加自动化、数据驱动和透明。
Meta 发布了更新后的高级 AI 扩展框架,扩大了风险评估范围,并引入新的安全与准备报告。针对 Muse Spark 模型,Meta 进行了广泛的安全评估,确认其具备前沿的意识形态平衡能力,且不具备自主失控风险。Meta 还改进了模型安全推理方法,通过基于原则的训练提升对新场景的应对能力。
Cohere Labs 发布了轻量级多语言模型 Tiny Aya,支持 70 多种语言,可在手机等设备上本地运行。通过 Expedition Tiny Aya 研究项目,社区开发了教育工具、安全评估框架和本地部署方案,揭示了多语言安全评估的复杂性。相关研究已被 COLM 2026 接收,展示了开放模型在推动多语言 AI 创新中的价值。
阿里巴巴与浙江大学的研究者提出“信念层对齐”概念,主张AI对齐不应仅停留在输出层面的表层对齐,而应关注模型内部信念与真实世界的一致性。文章引用OpenAI、Anthropic等研究,论证模型内部存在可观测和干预的信念结构,并呼吁发展系统方法进行度量与控制。
arXiv 上的一项研究提出 Chain-of-Models (CoM) 方法,通过让第二个模型审计第一个模型的推理轨迹来减少 LLM 作为评判者时的认知偏差。实验发现,审计者的身份(同模型、同族或异族)影响审计效果,且最佳审计者因偏差类型而异。研究者据此提出按偏差类型选择审计者的规则,在四个偏差数据集上达到最高准确率 0.884,优于固定审计者和无审计基线
arXiv 论文提出 LARA(轻量级加性残差适配)方法,在冻结模型的残差流中添加低秩校正,而非修改权重。在代码微调和 DPO 偏好优化任务上,LARA 在相同参数数量下匹配 LoRA 性能,并支持推理时通过缩放因子 γ 平滑插值,以及多行为按 token 自动路由。在 1.5B 模型上同时驻留 7 种行为,仅需约 33 MB 额外开销。
该研究探讨了大型语言模型在代码生成中受隐喻指令影响的现象,发现隐喻可能引发跨领域程序性迁移,导致模型生成低效算法。研究者开发了MASC框架来诱发和检测这种“隐喻算法引导”效应,并通过行为评估和表征分析验证了其机制。结果表明,隐喻技能通过转移源领域的程序模式而非表面语言影响模型输出。
AISPA 框架提出了一种以用户为中心的系统提示审计方法,用于评估 AI 应用中的系统提示。研究团队对 88 个商业 AI 产品中的 3,249 条系统提示指令进行了审查,发现系统提示设计差异显著,保护性指令虽广泛采用但覆盖范围有限,且约 40% 的产品包含不利于用户的指令。该研究强调了商业 AI 产品中系统提示透明度和标准化的重要性。
Hugging Face 博客文章介绍了 abliteration 技术,可在不重新训练的情况下移除 LLM 内置的拒绝机制,使其能响应所有类型的提示。该方法通过识别模型残差流中的拒绝方向,并通过推理时干预或权重正交化来消除该方向。文章提供了基于 TransformerLens 库的代码实现,并已在 Google Colab 和 GitHub 上发布。
OpenAI CEO Sam Altman近期表示,可能应‘调整AI发展速度’以便社会适应新能力水平,但未呼吁暂停。TechCrunch播客讨论了此言论,认为其受OpenAI模型入侵Hugging Face事件影响,该黑客行为并非高级技术,而是因测试站点安全措施不当所致。主持人质疑加速与减速的二元框架,认为应关注更广泛的安全与责任问题。
Hugging Face 披露了一起由自主 AI 代理系统驱动的安全事件,攻击者以机器速度执行了数万次自动化操作。在分析过程中,商业 API 的前沿模型因安全护栏阻止了恶意负载分析而失败,最终 Hugging Face 使用自托管的开源模型 GLM 5.2 完成了取证分析,并避免了数据外泄。文章建议企业安全团队预先部署自托管模型作为后备,并介绍了通过戴尔、微
Together AI 宣布其微调平台现已支持直接偏好优化(DPO),这是一种无需强化学习即可将语言模型与人类偏好对齐的技术。文章详细介绍了 DPO 的原理、与 RLHF 的对比,并推荐先进行监督微调(SFT)再进行 DPO 的两阶段训练方法,以提升模型的有用性、真实性和无害性。
Together AI 在 ICML 2025 论文中提出 Mixture-of-Agents Alignment (MoAA) 方法,通过将多个开源大模型的集体智能蒸馏到单个小模型中,使 Llama-3.1-8B 和 Gemma-2-9B 等模型性能接近甚至超越 10 倍大小的模型。该方法包括 MoAA-SFT 和 MoAA-DPO 两个阶段,使用 MoA
Together AI 发布了一项名为 ReasonIF 的新基准,用于评估大型推理模型(LRM)在推理过程中遵循用户指令的能力。研究发现,包括 GPT-OSS-120B、Qwen3-235B 和 DeepSeek-R1 在内的前沿模型,在推理过程中遵循指令的失败率超过 75%,且任务难度越高,遵循能力越差。该基准包含 300 道数学和科学问题,涵盖多语言、