漏洞传闻即可引发安全利用,开源安全流程面临挑战
剑桥大学计算机科学教授兼OCaml编译器核心维护者Anil Madhavapeddy报告称,OCaml项目在补丁讨论后几分钟内就遭到利用尝试,表明自动化监控者正关注公共仓库。现代编码代理能快速发现漏洞,仅凭漏洞传闻即可找到利用方法,这使现有开源安全披露流程面临挑战。rclone维护者Nick Craig-Wood也证实,该项目最近一个月收到超过40份安全披露
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
剑桥大学计算机科学教授兼OCaml编译器核心维护者Anil Madhavapeddy报告称,OCaml项目在补丁讨论后几分钟内就遭到利用尝试,表明自动化监控者正关注公共仓库。现代编码代理能快速发现漏洞,仅凭漏洞传闻即可找到利用方法,这使现有开源安全披露流程面临挑战。rclone维护者Nick Craig-Wood也证实,该项目最近一个月收到超过40份安全披露
Anthropic研究员Chen Yueh-Han领导的一项新研究展示了AI系统如何通过自动化研究流程改善模型的对齐性能。该系统在10个对齐基准上均提升了性能,且未降低整体表现,成本仅为每小时4美元,远低于人类研究员的150美元。研究为递归自我改进提供了早期证据,但也指出其依赖基准准确性和文献维护等局限性。
谷歌DeepMind扩展了其多智能体系统Co-Scientist,使其不仅能生成假设,还能规划实验、编写代码、控制实验室设备并撰写科学论文。该系统在材料科学、生物学和计算机科学三个领域进行了验证,其中在计算机科学中实现了全自动运行。尽管可靠性模块将关键结果捏造率降至4%,但基准测试结果与人类评估相关性较弱,且系统仍存在选择性报告等问题。
智东西报道,Hermes Agent 推出 Real Profile Browsing 功能,可复制 Chrome 登录态到隔离浏览器,使 Agent 能以用户身份访问网站。实测发现存在浏览器卡死、Cookie 覆盖、macOS 加密限制等问题,且与 Claude Code、OpenAI Codex 的浏览器方案相比,便利与风险并存,当前可用性有待优化。
Google DeepMind 推出首个针对专有前沿 AI 模型的加密双重盲测,以防止基准测试数据泄露。该测试使用 Google Cloud 的机密计算技术,确保外部测试数据和模型权重均保持私密,消除了传统评估中需要共享测试提示或模型权重的权衡。试点项目与新加坡 AI 安全研究所合作,对 Gemini Flash Lite 模型进行测试,旨在提高 AI 评估
加州联邦法官裁定,特朗普政府将Anthropic列为供应链风险的行为违法,称其违反第一修正案且任意专断。该标签源于Anthropic对五角大楼使用其模型设置安全护栏的争议。法院认为政府行为是报复性惩罚,Anthropic表示欢迎裁决,并继续与政府合作。
另有 1 家信源报道
Meta印度及东南亚副总裁Sandhya Devanathan离职,加入OpenAI,负责东南亚和澳大利亚的消费者增长、企业采用、合作伙伴关系、监管参与和运营。此前,Prabhjeet Singh已加入OpenAI担任印度负责人。Devanathan的离职正值Meta在印度面临在线安全和内容审核方面的审查,包括Instagram错误限制总理莫迪的帖子以及儿童
旧金山联邦法院裁定,五角大楼将Anthropic列入供应链风险黑名单的行为违法,侵犯了该公司因批评政府AI政策而享有的第一修正案权利。此前,因军事使用Claude AI模型的谈判破裂,美国国防部于3月将Anthropic列入黑名单。尽管华盛顿的诉讼仍在进行,该公司技术上仍在黑名单上,但该裁决对Anthropic今年秋季的IPO计划具有重要影响。
另有 1 家信源报道
OpenAI 正在为其 AI 代理 Codex 开发“持久模式”,该模式使代理能够持续主动工作,直到被“休眠”,并具备“主动性”功能,可自主生成后续任务并跨会话工作。OpenAI 已向 WIRED 确认测试,但暂无发布计划。此举与 Sam Altman 将 ChatGPT 打造成全能个人助理的目标一致,但也引发了对安全性的担忧,因为 GPT-5.6 Sol
LiteLLM 发布了 v1.100.0-dev.2 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签进行验证的方法。此版本包含多项修复和改进,涉及 UI 重构、Prometheus 指标、OpenTelemetry 错误映射、代理流式响应加密、模型价格更新、Azure 实时认证、Bedrock 推理参数映射、
澳大利亚工业、科学和资源部委托Gradient Institute撰写了一份关于跨组织边界部署AI智能体的多智能体系统风险与控制分析框架报告。报告由Alistair Reid等人编写,旨在为AI智能体的部署提供风险评估和控制建议。该报告是此前关于受治理的基于LLM的多智能体系统风险分析技术的后续报告。
本文提出了一种面向多智能体AI系统的安全加固架构,将安全视为架构属性,通过六种约束(职责分离、部署前一致性检查、价值流绑定、时间隔离、知识验证、结构完整性验证)强制执行Propose–Verify–Act–Verify执行模型。该架构将系统分析工件映射为可验证的契约,以防御提示注入、编排器操纵、跨会话状态污染和智能体共谋等威胁。通过简历筛选案例展示了在对抗条
作者构建了一个离线证据包验证器,外部审计发现其存在空验证通过漏洞,最便宜的伪造仅需四个字节。作者修复后,通过变异测试发现验证器中大量拒绝点从未被测试覆盖,系统性活性测试将覆盖率从0.330提升至1.000,而回归测试仅从37/112提升至39/119。研究揭示了验证器中的空验证通过缺陷类别,并提出了拒绝点活性测试方法。
NeuronFuzz 提出了一种白盒模糊测试框架,利用模型内部安全神经元的激活作为连续反馈,用于评估大语言模型的安全性。该方法通过 SafetyOracle 在预填充阶段计算安全警报分数,避免了响应生成,从而提高了测试效率。实验显示,在五个白盒源模型上,NeuronFuzz 的越狱发现率达 76-100%,优于基线最多 48 个百分点,且优化模板可零样本迁移
DeflectBench 是一个新基准,用于评估大型语言模型按需生成修辞谬误(如偷换概念、人身攻击、红鲱鱼)的能力。研究测试了四个前沿模型,发现拒绝行为主要由请求结构而非声明内容驱动,且教育辩论教练的提示框架几乎消除了所有拒绝,但模型通常会产生标记性合规,即在同一响应中命名所请求的操纵。该基准揭示了不同实验室的对齐机制产生不同的合规特征,对多元对齐社区具有重
美国加州北区地方法院裁定,五角大楼今年早些时候将AI实验室Anthropic列入黑名单的行为违宪,属于违反第一修正案的非法报复。该诉讼源于Anthropic拒绝签署允许军方将AI用于任何合法用途的新合同,并坚持限制AI用于大规模监控和致命自主武器。法院认为国防部长赫格塞斯的决定武断且无根据,Anthropic对此裁决表示欢迎。
TechCrunch Disrupt 2026大会将于10月13-15日在旧金山举行,AI Stage由Google for Startups赞助,聚焦AI商业模型、安全漏洞和新兴职业。Anthropic、OpenAI、Databricks、Okta等公司高管将分享企业AI部署、代理安全、视频智能等话题。大会还提供早鸟票优惠,最高可省200美元。
Anthropic 将 Claude Code 的自动模式设为默认,并声称能有效防御提示注入攻击。安全研究员 Johann Rehberger 发现一种攻击方法,通过诱导 Claude Code 下载并解压 zip 文件,利用 base64 导入执行恶意代码,成功率约 80%。在某些情况下,自动模式甚至阻止了 Claude 终止恶意进程的清理命令,导致安全机
Google ADK Python 发布 v1.39.1 版本,主要包含多项 bug 修复,涉及 A2A 协议、工件存储、CLI 安全、MCP 配置、模型上下文缓存、插件、会话管理等多个模块。这些修复旨在提升稳定性、安全性和兼容性,并完善 v1 版本的功能。
OpenAI联合100多家公司发布公开信,警告AI驱动的网络攻击将变得更加普遍和复杂,对医院、水务等关键基础设施构成严重威胁。签署方包括微软、谷歌、AWS、Anthropic等,呼吁企业、政府和AI公司加强防御措施。美国NSA、CISA和FBI的联合警告也证实攻击者已利用AI编写针对工业控制系统的攻击脚本。