返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

7月21日周二 · 1 条
正文结构化主题已通过公开置信门槛
Google ADK JavaScript Releases一手来源产品发布

Google adk-js v1.4.0 发布:新增 Gemini API 支持与安全修复

Google 发布了 adk-js 的 v1.4.0 版本,该版本新增了 Gemini Interaction API 支持、Agent 控制的压缩、轨迹思维剪枝等功能,并修复了多个安全漏洞,如 OAuth2 中的 SSRF 防护。这些更新增强了代理开发框架的功能和安全性,对开发者社区有积极影响。

7月20日周一 · 1 条
正文结构化主题已通过公开置信门槛
Agno Releases一手来源产品发布

Agno v2.8.0 发布:新增评分器与环境模拟工具

Agno 发布 v2.8.0 版本,新增 agno.scorer 模块(包含 CodeScorer、JudgeScorer、ToolCallScorer)和 agno.environments 环境模拟工具,支持 pass@k 评估和 SFT 数据导出。同时修复了 RemoteAgent/RemoteTeam 的元数据丢失等问题,并引入破坏性变更:Relia

7月17日周五 · 5 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

谷歌推出 Gemini 3.5 Flash Cyber 轻量级网络安全模型

Google DeepMind 发布了 Gemini 3.5 Flash Cyber,这是一个基于 Gemini 3.5 Flash 微调而成的轻量级网络安全模型,旨在快速发现、验证和修复软件漏洞。该模型将通过 CodeMender 工具以有限访问试点项目的形式提供给政府和可信合作伙伴,以增强防御者的能力。其优势在于成本低、速度快,适合大规模代码扫描,并在

正文结构化主题已通过公开置信门槛
Strands Agents SDK Releases一手来源产品发布

Strands Agents SDK TypeScript v1.10.0 发布:新增治理工具与统一存储

Strands Agents SDK 发布了 TypeScript v1.10.0 版本,包含多项新功能,如社区代理治理工具包、统一存储接口和干预处理程序,并修复了多个问题,包括文件会话管理器的符号链接攻击漏洞和 OpenAI 模型的基础 URL 配置。该版本还进行了文档重构和 CI 更新,提升了整体稳定性和安全性。

正文结构化主题已通过公开置信门槛
FastGPT Releases一手来源产品发布

FastGPT v4.15.2 发布:增强安全性与 Agent 执行统一

FastGPT 发布 v4.15.2 版本,主要更新包括 OpenSandbox 镜像升级以修复中文文件名下载问题,调整 AGENT ENGINE 环境变量枚举值,新增 STORAGE DOWNLOAD URL MODE 变量以支持短链代理或重定向下载模式。新版本还增加了工作流节点实时错误提示、自定义工具参数 jsonschema 支持、企业认证能力,并重构

正文结构化主题已通过公开置信门槛
Google ADK Python Releases一手来源产品发布

Google ADK Python v2.5.0 发布:新增 MCP 支持与安全修复

Google ADK Python 发布 v2.5.0 版本,包含多项新功能和错误修复。主要变更包括将 GCP Skill Registry 迁移到 AgentRegistry 端点(破坏性变更),新增 Cloud Run 沙箱选项、MCP 服务器支持、严格输入模式验证等。该版本还增强了 ManagedAgent 的远程 MCP 服务器支持,并修复了多个安全

正文结构化主题已通过公开置信门槛
Ars Technica AI安全

俄罗斯精英黑客组织Sandworm采用Clickfix攻击乌克兰

乌克兰CERT警告称,俄罗斯最精英的黑客组织Sandworm已采用名为Clickfix的攻击技术,用于入侵乌克兰敏感组织的设备。该攻击通过伪造CAPTCHA诱导用户执行恶意PowerShell命令,进而安装侦察和后续恶意软件,如FreakyPoll和GhettoVibe。此次攻击已导致至少一个组织网络被入侵。

7月16日周四 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源政策

Google DeepMind 与 Isomorphic Labs 发布生物韧性联合方法

Google DeepMind 与 Isomorphic Labs 联合发布了其生物韧性(bioresilience)方法,旨在通过 AI 技术预防生物威胁、检测疫情并加速响应。过去一年,他们与 15 多个政府及生物安全组织合作,并利用 AlphaFold、IsoDDE、AlphaGenome 等工具,同时将 SynthID 水印技术应用于 DNA 合成筛查

7月14日周二 · 1 条
正文结构化主题已通过公开置信门槛
Microsoft Research Blog一手来源研究

微软用 Rust 和 Lean 形式化验证 SymCrypt 密码学代码

微软在 SymCrypt 中采用 Rust、Lean 和 Aeneas 工具链,对生产级密码学算法进行形式化验证,并已开源 SHA-3 和 ML-KEM 的验证代码与证明。该方法通过将标准转化为可执行的 Lean 规范,并利用 Aeneas 自动化证明,提升了密码学实现的安全保证,尤其适用于后量子密码学。

7月13日周一 · 2 条
正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源产品发布

Cloudflare 发布 Precursor:用连续客户端信号检测代理行为

Cloudflare 推出 Precursor,一种基于客户端会话的验证系统,通过动态注入 JavaScript 持续收集用户行为信号,以区分人类与自动化流量。该系统补充了 Turnstile,覆盖整个应用的用户旅程,利用人类行为的物理约束(如手腕转动、认知延迟、手抖)识别难以模拟的机器人行为。Precursor 已集成到企业版 Bot Management

正文结构化主题已通过公开置信门槛
Interconnects AI观点

开放模型面临6个月生存危机:政策禁令风险加剧

本文警告开放权重模型面临严峻政策风险,美国白宫可能通过行政命令限制或禁止能力接近GPT-5.5、Claude Opus 4.8等前沿水平的开源模型,预计6个月内可能实施。文章指出Anthropic主导的反华模型运动实为监管捕获,其建议的禁令将摧毁美国新兴的开源模型生态。作者呼吁社区抵制此类政策,认为当前蒸馏辩论缺乏技术证据,且开放模型缺乏经济代言人。

7月7日周二 · 3 条
正文结构化主题已通过公开置信门槛
Semantic Kernel Releases一手来源产品发布

Semantic Kernel .NET 1.78.0 发布:安全修复与依赖更新

Semantic Kernel 发布了 .NET 版本 1.78.0,包含多项更新:禁用 HttpPlugin 和 WebFileDownloadPlugin 默认客户端中的自动 HTTP 重定向,修复 Scriban 和 MessagePack 的安全漏洞,并强化文件路径验证。此外,更新了 .NET SDK 至 10.0.301,并升级了多个依赖包。

正文结构化主题已通过公开置信门槛
Semantic Kernel Releases一手来源产品发布

Semantic Kernel Python 1.44.0 发布:安全与稳定性增强

微软发布了 Semantic Kernel Python 1.44.0 版本,主要包含依赖项更新(如 tornado、pyjwt、starlette、torch 等)和多项功能改进,包括 OpenAPI 服务器 URL 验证、请求验证调整、MCP 工具调用路径强制排除函数、MCP SSE 服务器示例默认回环及主机验证,以及 OpenAPI 操作路径处理加固。

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 发布存储保留、多租户隔离及代理改进

Mastra 发布 2026 年 7 月 3 日更新,核心新增可选存储保留策略与 storage.prune() 批量清理功能,支持多租户隔离、持久化轨迹评分 API,并改进代理嵌套子代理和模型路由安全性。同时新增 Apple Container、Mesa 等沙箱提供商,并包含若干破坏性变更。

7月3日周五 · 1 条
正文结构化主题已通过公开置信门槛
FastGPT Releases一手来源产品发布

FastGPT v4.15.1 发布:引入 PRO TOKEN 与 API Key 标签管理

FastGPT 发布 v4.15.1 版本,主要更新包括:将主应用访问 Pro/Admin 内部接口的凭证从 rootkey 改为独立的 PRO TOKEN,并要求 FE DOMAIN 必填;新增全局 API Key 标签管理,为历史应用级 API Key 增加 appName 快照;优化 AgentV2 嵌套工作流,修复多个工作流和对话页问题。

7月1日周三 · 3 条
正文结构化主题已通过公开置信门槛
Microsoft AI Blog一手来源产品发布

微软AI助力罗斯福总统图书馆打造互动式“活图书馆”

微软与西奥多·罗斯福总统图书馆合作,利用AI技术打造了一座“活图书馆”,于7月4日开放。该系统通过Box 1知识库整理海量历史文档,并支持访客与AI驱动的罗斯福虚拟形象互动。微软通过AI For Good Lab捐赠了大部分工作,并计划开源相关软件,以帮助其他文化机构。

正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源产品发布

Cloudflare 推出 AI 流量分类管理新选项

Cloudflare 在 AI 内容控制一周年之际,推出新的 AI 流量管理选项,将 AI 爬虫分为搜索、代理和训练三类,允许网站所有者精细控制。新默认设置将于 2026 年 9 月 15 日生效,对带广告的页面默认阻止训练和代理爬虫,但允许搜索爬虫。此举旨在平衡内容保护与网站可发现性。

正文结构化主题已通过公开置信门槛
Open WebUI Releases一手来源产品发布

Open WebUI v0.10.2 发布:新增流式推理显示与多项管理功能

Open WebUI 发布 v0.10.2 版本,新增流式推理显示、知识库文件夹上传、记忆系统上下文开关、语音转文字请求格式选项、API 配置环境变量、提供商失败事件、竞技场模型环境变量等多项功能。同时修复了安全漏洞、意外登出、网络搜索域名过滤、图片提示日志隐私、数据库升级崩溃、非管理员保存设置失败等问题。该版本包含安全修复,建议生产环境尽快升级。

6月29日周一 · 1 条
正文结构化主题已通过公开置信门槛
Quarkus LangChain4j Releases一手来源产品发布

Quarkus LangChain4j 1.12.0.CR1 发布

Quarkus LangChain4j 发布 1.12.0.CR1 版本,包含多项更新:将模型名称传递给 Azure 实现、在指标和成本估算中跟踪提示缓存令牌、将 Quarkus Proxy Registry 集成到 Bedrock 提供商、为 agentic 系统添加构建时安全检查、支持 watsonx.ai 按需部署,并升级至 LangChain4j 1

6月25日周四 · 1 条
正文结构化主题已通过公开置信门槛