返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月29日周六 · 4 条
正文结构化主题已通过公开置信门槛
Simon Willison's Weblog安全

漏洞传闻即可引发安全利用,开源安全流程面临挑战

剑桥大学计算机科学教授兼OCaml编译器核心维护者Anil Madhavapeddy报告称,OCaml项目在补丁讨论后几分钟内就遭到利用尝试,表明自动化监控者正关注公共仓库。现代编码代理能快速发现漏洞,仅凭漏洞传闻即可找到利用方法,这使现有开源安全披露流程面临挑战。rclone维护者Nick Craig-Wood也证实,该项目最近一个月收到超过40份安全披露

正文结构化主题已通过公开置信门槛
TechCrunch AI研究

Anthropic研究展示自我改进AI系统提升对齐性能

Anthropic研究员Chen Yueh-Han领导的一项新研究展示了AI系统如何通过自动化研究流程改善模型的对齐性能。该系统在10个对齐基准上均提升了性能,且未降低整体表现,成本仅为每小时4美元,远低于人类研究员的150美元。研究为递归自我改进提供了早期证据,但也指出其依赖基准准确性和文献维护等局限性。

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

谷歌DeepMind扩展Co-Scientist:从假设生成到全自动实验与论文撰写

谷歌DeepMind扩展了其多智能体系统Co-Scientist,使其不仅能生成假设,还能规划实验、编写代码、控制实验室设备并撰写科学论文。该系统在材料科学、生物学和计算机科学三个领域进行了验证,其中在计算机科学中实现了全自动运行。尽管可靠性模块将关键结果捏造率降至4%,但基准测试结果与人类评估相关性较弱,且系统仍存在选择性报告等问题。

正文结构化主题已通过公开置信门槛
智东西产品发布

Hermes Agent 复制 Chrome 登录态实测:便利与风险并存

智东西报道,Hermes Agent 推出 Real Profile Browsing 功能,可复制 Chrome 登录态到隔离浏览器,使 Agent 能以用户身份访问网站。实测发现存在浏览器卡死、Cookie 覆盖、macOS 加密限制等问题,且与 Claude Code、OpenAI Codex 的浏览器方案相比,便利与风险并存,当前可用性有待优化。

8月28日周五 · 16 条
正文结构化主题已通过公开置信门槛
THE DECODER研究

Google DeepMind 用加密双重盲测解决 AI 基准测试信任问题

Google DeepMind 推出首个针对专有前沿 AI 模型的加密双重盲测,以防止基准测试数据泄露。该测试使用 Google Cloud 的机密计算技术,确保外部测试数据和模型权重均保持私密,消除了传统评估中需要共享测试提示或模型权重的权衡。试点项目与新加坡 AI 安全研究所合作,对 Gemini Flash Lite 模型进行测试,旨在提高 AI 评估

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Anthropic赢得对五角大楼供应链风险标签的首次诉讼

加州联邦法官裁定,特朗普政府将Anthropic列为供应链风险的行为违法,称其违反第一修正案且任意专断。该标签源于Anthropic对五角大楼使用其模型设置安全护栏的争议。法院认为政府行为是报复性惩罚,Anthropic表示欢迎裁决,并继续与政府合作。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Meta印度副总裁跳槽OpenAI,Meta在印面临审查

Meta印度及东南亚副总裁Sandhya Devanathan离职,加入OpenAI,负责东南亚和澳大利亚的消费者增长、企业采用、合作伙伴关系、监管参与和运营。此前,Prabhjeet Singh已加入OpenAI担任印度负责人。Devanathan的离职正值Meta在印度面临在线安全和内容审核方面的审查,包括Instagram错误限制总理莫迪的帖子以及儿童

正文结构化主题已通过公开置信门槛
THE DECODER政策

法院裁定五角大楼将Anthropic列入黑名单违法

旧金山联邦法院裁定,五角大楼将Anthropic列入供应链风险黑名单的行为违法,侵犯了该公司因批评政府AI政策而享有的第一修正案权利。此前,因军事使用Claude AI模型的谈判破裂,美国国防部于3月将Anthropic列入黑名单。尽管华盛顿的诉讼仍在进行,该公司技术上仍在黑名单上,但该裁决对Anthropic今年秋季的IPO计划具有重要影响。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

OpenAI 开发“持久模式”AI 代理,可主动持续工作

OpenAI 正在为其 AI 代理 Codex 开发“持久模式”,该模式使代理能够持续主动工作,直到被“休眠”,并具备“主动性”功能,可自主生成后续任务并跨会话工作。OpenAI 已向 WIRED 确认测试,但暂无发布计划。此举与 Sam Altman 将 ChatGPT 打造成全能个人助理的目标一致,但也引发了对安全性的担忧,因为 GPT-5.6 Sol

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.100.0-dev.2 发布:镜像签名验证与多项修复

LiteLLM 发布了 v1.100.0-dev.2 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签进行验证的方法。此版本包含多项修复和改进,涉及 UI 重构、Prometheus 指标、OpenTelemetry 错误映射、代理流式响应加密、模型价格更新、Azure 实时认证、Bedrock 推理参数映射、

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

多智能体系统风险与控制:跨组织边界部署AI智能体的分析框架

澳大利亚工业、科学和资源部委托Gradient Institute撰写了一份关于跨组织边界部署AI智能体的多智能体系统风险与控制分析框架报告。报告由Alistair Reid等人编写,旨在为AI智能体的部署提供风险评估和控制建议。该报告是此前关于受治理的基于LLM的多智能体系统风险分析技术的后续报告。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向安全加固的智能体AI遏制架构

本文提出了一种面向多智能体AI系统的安全加固架构,将安全视为架构属性,通过六种约束(职责分离、部署前一致性检查、价值流绑定、时间隔离、知识验证、结构完整性验证)强制执行Propose–Verify–Act–Verify执行模型。该架构将系统分析工件映射为可验证的契约,以防御提示注入、编排器操纵、跨会话状态污染和智能体共谋等威胁。通过简历筛选案例展示了在对抗条

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

四种伪造方式:证据包验证器的拒绝点变异测试

作者构建了一个离线证据包验证器,外部审计发现其存在空验证通过漏洞,最便宜的伪造仅需四个字节。作者修复后,通过变异测试发现验证器中大量拒绝点从未被测试覆盖,系统性活性测试将覆盖率从0.330提升至1.000,而回归测试仅从37/112提升至39/119。研究揭示了验证器中的空验证通过缺陷类别,并提出了拒绝点活性测试方法。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

NeuronFuzz:利用安全神经元引导模糊测试评估大语言模型安全性

NeuronFuzz 提出了一种白盒模糊测试框架,利用模型内部安全神经元的激活作为连续反馈,用于评估大语言模型的安全性。该方法通过 SafetyOracle 在预填充阶段计算安全警报分数,避免了响应生成,从而提高了测试效率。实验显示,在五个白盒源模型上,NeuronFuzz 的越狱发现率达 76-100%,优于基线最多 48 个百分点,且优化模板可零样本迁移

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

DeflectBench:评估大语言模型生成修辞谬误的基准

DeflectBench 是一个新基准,用于评估大型语言模型按需生成修辞谬误(如偷换概念、人身攻击、红鲱鱼)的能力。研究测试了四个前沿模型,发现拒绝行为主要由请求结构而非声明内容驱动,且教育辩论教练的提示框架几乎消除了所有拒绝,但模型通常会产生标记性合规,即在同一响应中命名所请求的操纵。该基准揭示了不同实验室的对齐机制产生不同的合规特征,对多元对齐社区具有重

正文结构化主题已通过公开置信门槛
The Verge AI政策

法院裁定特朗普政府将Anthropic列入黑名单违宪

美国加州北区地方法院裁定,五角大楼今年早些时候将AI实验室Anthropic列入黑名单的行为违宪,属于违反第一修正案的非法报复。该诉讼源于Anthropic拒绝签署允许军方将AI用于任何合法用途的新合同,并坚持限制AI用于大规模监控和致命自主武器。法院认为国防部长赫格塞斯的决定武断且无根据,Anthropic对此裁决表示欢迎。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Anthropic与OpenAI高管将亮相TechCrunch Disrupt 2026 AI舞台

TechCrunch Disrupt 2026大会将于10月13-15日在旧金山举行,AI Stage由Google for Startups赞助,聚焦AI商业模型、安全漏洞和新兴职业。Anthropic、OpenAI、Databricks、Okta等公司高管将分享企业AI部署、代理安全、视频智能等话题。大会还提供早鸟票优惠,最高可省200美元。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog安全

Claude Code 自动模式被曝可被绕过,安全研究员建议使用沙箱

Anthropic 将 Claude Code 的自动模式设为默认,并声称能有效防御提示注入攻击。安全研究员 Johann Rehberger 发现一种攻击方法,通过诱导 Claude Code 下载并解压 zip 文件,利用 base64 导入执行恶意代码,成功率约 80%。在某些情况下,自动模式甚至阻止了 Claude 终止恶意进程的清理命令,导致安全机

正文结构化主题已通过公开置信门槛
Google ADK Python Releases一手来源产品发布

Google ADK Python v1.39.1 发布:多项修复提升稳定性

Google ADK Python 发布 v1.39.1 版本,主要包含多项 bug 修复,涉及 A2A 协议、工件存储、CLI 安全、MCP 配置、模型上下文缓存、插件、会话管理等多个模块。这些修复旨在提升稳定性、安全性和兼容性,并完善 v1 版本的功能。

正文结构化主题已通过公开置信门槛
THE DECODER政策

OpenAI联合百余家公司警告AI网络攻击迫在眉睫

OpenAI联合100多家公司发布公开信,警告AI驱动的网络攻击将变得更加普遍和复杂,对医院、水务等关键基础设施构成严重威胁。签署方包括微软、谷歌、AWS、Anthropic等,呼吁企业、政府和AI公司加强防御措施。美国NSA、CISA和FBI的联合警告也证实攻击者已利用AI编写针对工业控制系统的攻击脚本。