返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月12日周三 · 11 条
正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源安全

PydanticAI v1.107.3 修复高危跨站请求与日志脱敏漏洞

PydanticAI 发布 v1.107.3 版本,修复了两个安全漏洞:一个高危漏洞允许跨站请求触发开发 Web 聊天 UI 中的代理执行工具,现已要求请求必须为 JSON 格式;另一个低危漏洞涉及重试提示内容未在日志中正确脱敏。两个漏洞在 v2 版本中也已修复。

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.28.0 发布:修复高危漏洞并新增实时语音功能

PydanticAI 发布 v2.28.0 版本,修复了开发 Web 聊天界面中的高危安全漏洞,该漏洞允许跨域请求触发代理执行工具。新版本增加了实时语音到语音支持、Crusoe 提供商以及浏览器 WebRTC 支持,并修复了多个 Bug。

正文结构化主题已通过公开置信门槛
CrewAI Releases一手来源产品发布

CrewAI 发布 1.15.15:新增流程报告与安全修复

CrewAI 发布了 1.15.15 版本,新增了报告流程结果、持续时间和人工介入信号的功能。修复了边界钩子中止流程时未发出 FlowStartedEvent 的问题,并将 torch 升级到 2.13.0 以修复安全漏洞。此外,还更新了代理的日期注入功能,并将 CLI 标志标准化为 kebab-case。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog研究

研究者从专有LLM API中窃取推理痕迹

研究者发现Anthropic、OpenAI和Google的专有LLM API返回的加密推理链可被重放至同系列较弱模型,通过越狱恢复明文推理内容。该漏洞已被修复,但论文附录展示了提取的推理细节,揭示了专有模型的思维链。

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.96.2 发布:Docker 镜像签名验证与维护更新

LiteLLM 发布 v1.96.2 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签验证签名的方法。该版本还包含代理请求处理维护和运行时依赖刷新,并因 PyPI 存储故障重新发布。

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.95.1 发布:Docker 镜像签名验证与维护更新

LiteLLM 发布了 v1.95.1 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签进行验证的方法。此版本还包含代理请求处理维护和运行时依赖刷新。

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.91.5 发布:Docker 镜像签名验证与维护更新

LiteLLM 发布 v1.91.5 版本,该版本所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签验证镜像签名的方法。此版本还包含代理请求处理维护和运行时依赖更新的反向移植。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS与OpenAI合作在Bedrock上推出Daybreak网络安全模型

AWS与OpenAI合作,将Daybreak Red和Daybreak Blue两款网络安全模型引入Amazon Bedrock,供符合条件的客户使用。Daybreak Red提供GPT-5.6 Cyber模型,Daybreak Blue提供GPT-5.6 Sol模型,均支持漏洞发现、检测工程和事件响应等任务。这些模型在Bedrock上运行,具备零操作员访问

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

窃取专有LLM API的推理痕迹

研究人员发现,Anthropic、OpenAI 和 Google 等大型语言模型提供商返回给客户端的加密推理痕迹块在不同会话、用户和模型间可互换,存在架构漏洞。通过将该痕迹注入同一提供商的较弱模型中,可强制其解码并输出明文,从而绕过反蒸馏机制,实现私有数据提取、隐藏危险信息泄露和隐形提示注入。研究团队从公共仓库中解码了 315,320 个推理块,恢复了 36

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER安全

研究人员发现漏洞可读取ChatGPT等AI模型的加密推理

安全研究人员发现了一个影响所有主要AI提供商API的漏洞,可以读取推理模型的加密思维过程。通过越狱,他们使用较小的模型转录更强大模型的原始推理,并在公开会话中暴露了密码和API密钥。该漏洞还加剧了关于推理蒸馏的争议,并揭示了模型内部使用难以理解的语言或考虑欺骗行为。

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

苹果开发新功能验证iPhone照片真实性,对抗AI深度伪造

苹果正在开发一项名为“Apple Reference Image”的iOS功能,可在拍摄时向iPhone照片嵌入来源元数据,以帮助用户证明照片非AI伪造。该功能在iOS 27测试版中被发现,默认关闭,用户需手动启用,并通过苹果的Private Cloud Compute服务器进行验证。苹果未采用C2PA标准,而是自建系统,这可能为在线平台标记人类创作内容提供

8月11日周二 · 9 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 发布 Claude 应用网关企业部署参考架构

AWS 发布了一篇关于部署 Anthropic Claude 应用网关(Claude apps gateway)的博客,该网关为 Claude Code 和 Claude Desktop 提供集中治理层,支持身份验证、模型访问控制、成本归属和支出限制。参考部署使用 AWS Fargate、RDS PostgreSQL、内部负载均衡器和 OIDC 身份提供商,

正文结构化主题已通过公开置信门槛
The Verge AI安全

AI 提示词发现 Zoom 严重漏洞,可劫持会议设备

安全公司 A Security 的研究人员利用不到 20 条 AI 提示词,发现 Zoom 存在一个严重安全漏洞,该漏洞可让攻击者在会议中劫持所有参会者的设备,无需受害者操作且无视觉提示。Zoom 已于周二发布修复补丁,影响 Windows、macOS、Linux、Android 和 iOS 平台。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v3.225.2 发布:修复 SSO、RBAC 和正则 DoS 漏洞

Langfuse 发布了 v3.225.2 版本,主要包含三个安全修复:阻止 OIDC 发现验证中的内部目标、将项目角色更新范围限定到组织、防止正则表达式回溯拒绝服务攻击。这些修复均为 v3 分支的后向移植,旨在提升系统的安全性和稳定性。

正文结构化主题已通过公开置信门槛
TechCrunch AI政策

Anthropic 将为 AI 生成文本添加水印以符合欧盟法规

Anthropic 宣布将对其 AI 模型(包括 Claude)生成的文本添加水印,以遵守欧盟《人工智能法案》的透明度规范。该水印基于 C2PA 标准,会在文本复制粘贴时保留,并适用于所有 Claude 产品。此举是 AI 行业应对监管和用户反弹的一部分,其他公司如 OpenAI、Google 等也已承诺遵守该规范。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

IBM 与 Red Hat 扩展 Lightwell 以加强 AI 时代开源软件信任与治理

IBM 和 Red Hat 扩展了开源项目 Lightwell,推出新的商业产品,以帮助企业在 AI 辅助软件开发时代建立可信、可验证的软件供应链。这些产品整合了软件签名、来源验证、工件验证和政策执行,确保人工和 AI 生成的软件在整个交付生命周期中可信。此举反映了行业对加密来源和持续验证的日益关注,以应对 AI 生成代码和自动化工作流带来的安全挑战。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.7.0 发布:新增代理工具审批跟踪与多项修复

Langfuse 发布 v4.7.0 版本,包含多项新功能与修复。新功能包括新的会话头部、自动化 webhook 操作改进、应用内代理工具审批跟踪、OTel 流量自动直写、PostHog 和 Mixpanel 集成等。修复涉及代理会话取消、仪表板成本显示、MCP 工具模式验证、正则回溯 DoS 防护、Datadog 追踪中移除用户邮箱等。此外,还进行了多项性

正文结构化主题已通过公开置信门槛
OpenAI Agents JavaScript Releases一手来源产品发布

OpenAI Agents JS v0.15.0:默认模型更新与 MCP v2 支持

OpenAI Agents JavaScript 库发布 v0.15.0,默认模型改为 gpt-5.6-luna,并支持 MCP v2 协议协商。新版本增强了 RunState 的持久化能力,包括输入、工具输出和重试状态,同时改进了沙箱挂载凭据的安全性。此外,还增加了对 React Native 和 Realtime 的支持,并提升了 OpenAI 和 AI

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Ouroboros:自我进化的前沿编码智能体

Ouroboros是一个自我发展的智能体框架,通过审查提交来改进工具、提示和核心实现,支持递归自由进化和经验驱动进化两种模式。在Terminal-Bench 2.1上达到86.74%的准确率,在OSWorld-Verified上达到90.69%,并在CL-Bench上取得新的最优结果。其长期部署Hope运行了161天,在人类沟通下进行自由进化,同时强调安全护

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

验证驱动的闭环多智能体LLM框架实现合规结构设计

该研究提出一种验证驱动的闭环多智能体大语言模型框架,用于符合规范的结构设计。框架将外部物理验证器的反馈注入修复循环,结合三层有限元验证系统与双节点修复机制,使代码合规率从56.8%提升至98.6%,综合评分从63.8提升至71.4。研究还发现性能提升主要归因于外部验证器而非骨干模型,并开源了基准测试和实验脚本。