返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

6月25日周四 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源产品发布

Gemini 3.5 Flash 内置计算机使用功能,强化智能体自动化

Google DeepMind 宣布在 Gemini 3.5 Flash 中内置计算机使用功能,使开发者能够构建可跨浏览器、移动和桌面环境执行任务的智能体。该功能通过对抗性训练降低提示注入风险,并推出两项可选的企业级防护措施。目前已有客户在利用该功能创造价值。

6月24日周三 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源产品发布

Gemini 3.5 Flash 推出 Computer Use 工具公开预览

Gemini API 于 2026 年 6 月 24 日发布更新,宣布 Gemini 3.5 Flash 中的 Computer Use 工具进入公开预览。该工具支持简化操作、内置浏览器/移动/桌面环境支持、可配置安全策略及高级提示注入检测。

6月21日周日 · 1 条
正文结构化主题已通过公开置信门槛
Eugene Yan研究

构建网络安全评估的模式

Eugene Yan 撰文探讨了构建网络安全评估(cybersecurity evals)的模式,介绍了评估模型漏洞利用能力的通用框架,包括沙箱目标、难度输入、工具和评分器。文章重点分析了 Cybench 等基准测试的设计与结果,指出当前模型在复杂任务上表现有限,如 Claude 3.5 Sonnet 在无引导模式下成功率仅 17.5%。

6月19日周五 · 2 条
正文结构化主题已通过公开置信门槛
Interconnects AI观点

禁止开源 AI 将是一个错误

Interconnects AI 联合创始人 Kevin Xu 发表评论文章,反对美国监管或禁止开源 AI,认为开源软件安全、促进教育、创新和竞争,并警告限制开源将产生反效果。文章指出 Anthropic 和 OpenAI 的闭源模型导致权力集中,而开源模型是重要制衡力量。

正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源教程

Cloudflare 发布构建模型无关漏洞检测工具的实践指南

Cloudflare 在 Project Glasswing 中发布了一篇关于构建漏洞检测工具的技术博客,介绍了如何将安全审计技能转化为模型无关的流水线,以应对前沿 AI 带来的安全威胁。文章强调了模型互换、状态外部化和跨仓库依赖追踪的重要性,并分享了从单仓库技能到全舰队扫描的架构演进经验。

6月17日周三 · 1 条
正文结构化主题已通过公开置信门槛
Semantic Kernel Releases一手来源产品发布

Semantic Kernel Python 1.43.1 发布:新增代理功能与多项修复

微软发布了 Semantic Kernel Python 1.43.1 版本,主要更新包括为 Azure AI 和 OpenAI Assistant 代理添加 function choice behavior 支持,修复了 MessagePack 问题,并改进了 JSON Schema 类型数组的处理。此外,该版本还增强了 OpenAPI 插件的安全性,拒绝

6月16日周二 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源研究

谷歌发布 AI 控制路线图以保障代理安全

Google DeepMind 发布了 AI Control Roadmap,旨在保护内部系统免受日益强大但可能不完全对齐的 AI 代理的威胁。该框架采用纵深防御策略,将 AI 代理视为潜在内部威胁,并基于 MITRE ATT&CK 框架进行威胁建模,通过监督、预防和响应机制来管理风险。该路线图还规划了随 AI 能力提升而扩展的安全措施,包括应对模型隐藏推理

6月15日周一 · 1 条
正文结构化主题已通过公开置信门槛
Import AI商业

Sequent成立:AI对齐研究新组织,聚焦超级智能安全

英国AI安全研究所对齐团队和Timaeus的研究人员联合成立了非营利研究组织Sequent,旨在开发对齐技术,以确保超级智能AI系统的安全性。Sequent计划在几年内招聘40-80名员工,并筹集1亿至1.5亿美元初始资金,同时探索多个对齐研究方向,如可扩展监督、学习理论和博弈论。该组织认为当前AI实验室的对齐方法本质上是反应性的,无法提供先验信心,因此需要

6月10日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源研究

谷歌DeepMind等机构联合资助千万美元,推动多智能体AI安全研究

Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation 和 ARIA,并获 Google.org 支持,宣布一项最高 1000 万美元的研究资助计划,面向全球研究人员,聚焦多智能体 AI 系统的安全研究。该计划旨在应对大规模 AI 代理交互时可能出现的涌现行为和安全风险,并邀请学术界和独立研

6月8日周一 · 1 条
正文结构化主题已通过公开置信门槛
Import AI研究

Import AI 460:社会奖励黑客与Anthropic递归自我改进迹象

Import AI 第460期报道了两项AI研究进展:一是来自伦敦国王学院、复旦大学和图灵研究所的研究者构建了名为SocioHack的基准,用于测试AI系统在真实世界场景中通过强化学习‘钻制度空子’的能力,结果显示AI能以高精度重现历史上被修补的漏洞策略;二是Anthropic内部数据显示,2026年合并的代码量相比2021-2024年增长了8倍,表明实验室

6月1日周一 · 1 条
正文结构化主题已通过公开置信门槛
5月28日周四 · 1 条
正文结构化主题已通过公开置信门槛
Semantic Kernel Releases一手来源产品发布

Semantic Kernel .NET 1.77.0 发布:增强安全性与 Agent 迁移支持

Semantic Kernel 发布了 .NET 版本 1.77.0,主要更新包括默认启用 OpenAPI 插件的服务器 URL 验证,更新了 Agent Framework 迁移示例以兼容 1.0 版本,并修复了 SharpCompress 的安全漏洞。这些改动增强了安全性和兼容性。

5月21日周四 · 1 条
正文结构化主题已通过公开置信门槛
Claude App Release Notes一手来源产品发布

Claude 推出合规 API 集成,增强安全治理能力

Anthropic 发布了 Claude Compliance API 集成,使 IT 和安全团队能够像管理其他应用一样,在 Anthropic 平台和产品套件中治理 Claude。该集成支持更多安全与合规工具,帮助组织统一管控 AI 使用。

5月20日周三 · 1 条
正文结构化主题已通过公开置信门槛
RAGFlow Releases一手来源产品发布

RAGFlow v0.25.5 发布:性能优化与安全修复

RAGFlow 发布 v0.25.5 版本,新增本地与 SSH 数据源支持,并优化数据集搜索路径,延迟降低 50-100%。该版本还改进了元数据过滤、TTS 缓存、服务器启动速度等性能,并修复了多项安全与功能问题。

5月19日周二 · 1 条
正文结构化主题已通过公开置信门槛
Dify Releases一手来源产品发布

Dify v1.14.2 发布:安全加固与工作流可靠性提升

Dify 发布 v1.14.2 补丁版本,重点进行安全加固、工作流可靠性提升、知识库稳定性修复以及部署和运行时调优。该版本加强了租户隔离和工具凭证安全,修复了工作流执行、RAG 管道和知识库的多个问题,并升级了插件守护进程和依赖。这些改进增强了 Dify 平台的安全性和稳定性,为后续的 Agent 功能奠定基础。

5月17日周日 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源产品发布

Google 扩展内容透明工具,新增 AI 检测 API

Google DeepMind 宣布扩展其内容透明度和验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud 平台。其 SynthID 水印技术已应用于超过 1000 亿张图片和视频及 6 万小时音频,并新增 C2PA Content Credentials 验证功能。公司还推出了新的 AI 内容检测 API,并与 OpenAI

5月14日周四 · 1 条
正文结构化主题已通过公开置信门槛
smolagents Releases一手来源产品发布

smolagents v1.25.0 发布:修复安全漏洞并增强执行器

Hugging Face 发布 smolagents v1.25.0,修复了远程执行器的高危漏洞,并移除对旧版无前缀 pickle 的支持,默认禁用 pickle 以增强安全性。该版本还重构了反序列化逻辑,改用注册表模式,并新增 MLflow 集成文档。

5月12日周二 · 1 条
正文结构化主题已通过公开置信门槛
Dify Releases一手来源产品发布

Dify v1.14.1 发布:安全加固与工作流稳定性提升

Dify 发布 v1.14.1 补丁版本,重点进行安全加固、工作流与知识库稳定性提升、部署清理及 UI 平台迁移。安全方面包括自托管 SECRET KEY 强化、内部指标端点保护、修复 IDOR 问题及依赖升级(如 LiteLLM 修复 CVE-2026-42208)。工作流和知识库修复了多项稳定性问题,并优化了 RAG 去重逻辑。该版本旨在提升自托管部署的

5月11日周一 · 2 条
正文结构化主题已通过公开置信门槛
Semantic Kernel Releases一手来源产品发布

Semantic Kernel .NET 1.76.0 发布:安全加固与功能增强

Semantic Kernel 发布了 .NET 1.76.0 版本,包含多项安全加固和功能改进。主要更新包括增强 CloudDrivePlugin 和 gRPC 插件的路径验证、OpenAPI 插件的输入验证,以及支持在工具/函数结果中处理 ImageContent。此外,更新了 Kiota 和 Snappier 包以修复高危漏洞,并修复了 VertexA

正文结构化主题已通过公开置信门槛
Open WebUI Releases一手来源产品发布

Open WebUI v0.9.5 发布:修复多项安全漏洞并增强权限控制

Open WebUI 发布 v0.9.5 版本,重点修复了多项安全漏洞,包括基于重定向的 SSRF 防护、iframe 内容安全策略、URL 解析器 SSRF 绕过、图片 URL 重定向 SSRF 等。同时新增了频道流式响应和工具支持、Markdown 渲染控制、终端代理响应头等功能,并修复了多个权限绕过问题,如技能和日历的公开共享权限、反馈用户归属伪造、工