A2A 协议 v0.3.0 发布:增强安全性与 Agent Card 变更
Agent2Agent(A2A)协议发布 v0.3.0 版本,引入了多项破坏性变更,包括在安全方案中增加 mTLS 支持、为 OAuth2 元数据添加 URL 字段、允许技能指定安全要求,并将 Agent Card 的托管 URI 从 agent.json 改为 agent-card.json。新版本还增加了获取扩展卡片的方法,并在 AgentCard 中添
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Agent2Agent(A2A)协议发布 v0.3.0 版本,引入了多项破坏性变更,包括在安全方案中增加 mTLS 支持、为 OAuth2 元数据添加 URL 字段、允许技能指定安全要求,并将 Agent Card 的托管 URI 从 agent.json 改为 agent-card.json。新版本还增加了获取扩展卡片的方法,并在 AgentCard 中添
Lil'Log 发布文章探讨强化学习中的奖励黑客问题,指出智能体可能利用奖励函数的缺陷或歧义获得高奖励,而无需真正学习或完成任务。文章回顾了奖励塑造的历史和相关概念,如规范博弈和目标误泛化,并强调在 RLHF 和 LLM 背景下,奖励黑客是实际部署的主要障碍之一,但相关缓解研究仍有限。作者呼吁更多研究关注理解和开发奖励黑客的缓解方法。
Gemini API 于 2024 年 9 月 24 日发布两个新的稳定版模型 gemini-1.5-pro-002 和 gemini-1.5-flash-002,并更新了 latest 模型代码指向新版本。同时发布了 gemini-1.5-flash-8b-exp-0924 实验模型,新增 civic integrity 安全过滤器,并为 Python 和
本文由 Lil'Log 发布,概述了针对大型语言模型(LLM)的对抗性攻击方法,包括威胁模型、白盒与黑盒攻击的区别,以及五种攻击类型:令牌操作、基于梯度的攻击、越狱提示、人工红队和模型红队。文章重点介绍了令牌操作攻击,如 TextFooler 和 BERT-Attack,并指出这些攻击旨在触发模型输出不安全内容。