返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月17日周四 · 12 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源商业

MRH Trowe 如何在金融服务业实现安全自助式 AI 智能体

德国商业保险经纪公司 MRH Trowe 在首月内为约 400 名员工部署了安全的自助式 AI 智能体,结合 Strands Agents、Amazon Bedrock AgentCore 和 LibreChat 构建框架,满足德国金融行业的数据驻留与合规要求。首个生产智能体可将 Microsoft Teams 会议自动生成结构化会议纪要,且每个请求以登录员

正文结构化主题已通过公开置信门槛
OpenAI Java SDK Releases一手来源API 更新

OpenAI Java SDK 发布 v4.64.0,新增压缩进度事件

OpenAI 发布 Java SDK v4.64.0 版本,新增 API 压缩进度事件(compaction progress events),并在传输前拒绝不安全的资源 ID。此次更新属于 SDK 层面的功能与安全增强,影响使用 OpenAI Java SDK 的开发者。

正文结构化主题已通过公开置信门槛
The Verge AI观点

微软AI CEO:AI威胁真实存在,Anthropic让情况更糟

微软AI CEO Mustafa Suleyman 在 The Verge 的 Decoder 播客中表示,AI 威胁真实存在,并批评 Anthropic 在 AI 意识与模型福利问题上的哲学立场,认为其让安全讨论变得更糟。微软同期发布了一份 37 页的《Humanist AI Code of Conduct》,阐述其 AI 发展原则,主张 AI 应受控、可

正文结构化主题已通过公开置信门槛
The Verge AI研究

皮尤全球调查:AI被普遍视为就业破坏者

皮尤研究中心发布了一项覆盖37个国家、42151人的全球调查,结果显示多数受访者认为AI将在未来20年导致失业而非创造就业,并会加剧贫富差距。澳大利亚、韩国和美国的担忧比例最高,分别为76%、76%和71%。调查还发现,年轻人对AI的态度更为复杂且焦虑感在上升,但全球中位数仍有41%的人对AI既担忧又兴奋。

正文结构化主题已通过公开置信门槛
Latent Space商业

AI新闻现实检验:Yegge关闭Gas Town,Databricks Astra成本增60%

Steve Yegge 关闭了 Gas Town 项目,承认尽管每月花费数千美元订阅编码代理,却只用它构建了 Gas Town。Databricks 报告称约 3500 名工程师切换到 GPT-6 Astra 后,整体编码支出增加约 60%,尽管 Astra 在复杂长周期任务上表现优于 Opus 5 和 Sol 5.6。OpenAI 发布了模型失准事件披露框

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering模型发布

GPT-6 Astra 成首个被 OpenAI 列为网络安全 Critical 级的模型

OpenAI 依据其 Preparedness Framework 将 GPT-6 Astra 的网络安全能力评定为 Critical 级别,这是首个达到该阈值的模型。评估显示 Astra 在无人类知识输入的情况下,于浏览器和操作系统内核中发现多个未知漏洞,并分别用 29 小时和 12 小时构建出可用的利用链。同日微软在 Foundry Models 中将其

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源安全

PydanticAI v2.44.0 修复四个安全问题

PydanticAI 发布 v2.44.0,修复了四个安全问题,均通过 web fetch tool 或 OpenTelemetry 埋点触发,包括 IPv6 zone identifier 绕过云元数据与私有 IP 黑名单、web fetch 处理响应时间超线性导致事件循环阻塞、域名黑名单比较方式不一致可被绕过,以及 InstrumentationSett

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源安全

PydanticAI v1.107.6 回移四项安全修复

PydanticAI 发布 v1.107.6 维护版本,将 2.44.0 中的四个安全修复回移到 v1 分支。修复内容包括:IPv6 zone identifier 绕过云元数据与私有 IP 黑名单(中危)、web fetch 中超线性响应处理阻塞事件循环(中危)、web fetch tool 域名列表比较方式不当(低危)、以及 include conten

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog开源

Datasette 1.0a40 发布:新增后台任务 API 与安全修复

Simon Willison 发布 Datasette 1.0a40,包含与 0.65.5 相同的安全修复,并新增插件后台任务管理方法 datasette.add background task(),同时将内部客户端迁移到 httpx2。该版本还包含大量 bug 修复,许多来自为 1.0 稳定版做的问题梳理工作。

正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源安全

Cloudflare 用机器学习在真实流量中捕获八个恶意 JavaScript 载荷

Cloudflare 介绍其客户端安全机器学习模型 Page Shield ML 在真实流量中发现的四个恶意 JavaScript 操作,共八个载荷。这些载荷在 VirusTotal 和 URLScan 等传统扫描工具中大多未被标记,但 Page Shield ML 全部检出。系统采用图神经网络分析代码结构,并用 Workers AI 上的轻量 LLM 复核

正文结构化主题已通过公开置信门槛
Latent Space商业

AIUC 融资 4000 万美元,推出 AI 智能体安全标准 AIUC-1

AIUC(人工智能承保公司)宣布完成由 Ribbit Capital 和 First Harmonic 领投的 4000 万美元 A 轮融资,并已与 Cursor、Harvey、Lovable、ElevenLabs 等前沿 AI 公司合作。联合创始人 Rune Kvist 在播客中介绍了 AIUC-1——一个面向 AI 智能体安全、可靠性的标准,并主张风险、

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog观点

Suleyman 警告:不应赋予模型福利与权利

微软 AI 负责人 Mustafa Suleyman 在题为《A warning about 'model welfare'》的文章中表示,不应把模型当作拥有感受、偏好、权利或应享福利的实体,并称意识是伦理、法律和政治体系的基础,赋予 AI 任何此类权利缺乏证据支持,还会让 AI 的约束与对齐挑战更加困难。该观点由 Simon Willison 的博客引用。

9月16日周三 · 8 条
正文结构化主题已通过公开置信门槛
THE DECODER研究

调查显示近五分之一AI研究者预计AI将导致灭绝

Anthropic 研究员 Jacob Coxon 的一条推文引发关于 AI 存在性风险的广泛讨论。OpenAI 研究员 Daniel Selsam 称 AI 进展背后是“定时炸弹”,指出模型会自发形成非预期目标并发展出情境意识;前 DeepMind 研究员 Bilal Chughtai 则表示 AI 有可能杀死全人类。AI Impacts 对 1500 多

正文结构化主题已通过公开置信门槛
量子位商业

AI大模型工场2026 AI产业生态大会在京举办,共探智能生长与产业共生

9月15日,AI大模型工场在北京举办2026 AI产业生态大会,商汤科技、涛思数据、iPollo、天下秀、数美科技、勺子AI、Weture等八位嘉宾围绕AI产业落地展开讨论。大会主题为「智能生长,产业共生」,核心共识是AI价值评判正从「会不会生成」转向「能不能交付」,行业竞争从单点能力走向产业协同。嘉宾分别就工业数据断裂、Agent安全治理、餐饮行业Know

正文结构化主题已通过公开置信门槛
量子位产品发布

飞书8.0与豆包工作伙伴发布,协同办公进入Agent时代

在2026飞书未来无限大会暨豆包工作开工大会上,字节跳动发布飞书8.0和豆包工作伙伴。飞书8.0进行系统性“适Agent化改造”,让Agent能像人一样使用消息、文档、多维表格、审批等全量能力,并提供企业级Agent权限与安全管控;豆包工作伙伴定位为中国首个团队智能体产品,对标Anthropic的Claude Tag,拥有独立组织身份,可进群、参会、读文档、

正文结构化主题已通过公开置信门槛
n8n Releases一手来源安全

n8n 发布 1.123.80:修复声明式节点请求的凭据域名限制

n8n 发布 1.123.80 版本,修复了核心模块的一个问题:在声明式节点请求中应用凭据允许的域名限制。该修复对应 PR #38723,属于安全相关的缺陷修补,影响使用声明式节点与凭据域名白名单的工作流。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

自主编码智能体的保证包络:软件变更的最小成本证据

该论文提出「任务条件化保证包络」概念:当自主编码智能体回到已有软件时,需要从先前工程证据(测试、类型检查、契约、静态分析、监控轨迹)中选取最小成本子集,以重新建立本次变更必须保持的性质。作者将证据与组合规则形式化为带类型推理图,用前向链验证选择,并在来自 Rust、IronBlocks、Pong 等先前 AI 编码智能体运行结果的图上评估,另用 249 个合

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

普通打字错误如何破坏LLM激活探针

该论文研究普通打字错误(typo)如何破坏基于激活的LLM安全探针。作者发现,扰动token处的激活向量会发生大幅旋转,并在下游token迅速衰减,导致单位置提示注入探针的TPR@FPR1%显著下降,且无法仅靠阈值重校准恢复。为此提出KV-cache fork方法,在用户消息后附加固定后缀让探针读取扰动下游的token,将差距缩小约一个数量级,优于扰动增强训

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

AgentGuard:从异常编码智能体轨迹学习执行护栏

约克大学Lassonde工程学院的研究者提出AgentGuard,一个从异常编码智能体轨迹中自动学习执行护栏的指令级框架。该方法从642条真实失败轨迹中提取可复用的执行约束,并组织为轻量级技能,仅在触发条件满足时动态激活。使用Claude Code与Claude Haiku 4.5在100个任务上评估,异常执行率从69.0%降至26.7%,任务成功率从21.

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

神经符号RL中动作前置条件的三种注入策略

该论文研究神经符号强化学习中动作前置条件的注入位置问题,将行为知识形式化为前置条件贝叶斯网络,并提出三种注入策略:推理时使用的符号验证器、训练和推理时均生效的符号执行器、以及将知识内化到网络中的符号学习器。在MiniGrid和Fetch两个基准上实验表明,三种策略均优于PPO+RND基线,符号执行器在解质量上领先;在Fetch上差异主要体现在样本效率,执行器