Gemini 3.5 Flash 内置计算机使用功能,强化智能体自动化
Google DeepMind 宣布在 Gemini 3.5 Flash 中内置计算机使用功能,使开发者能够构建可跨浏览器、移动和桌面环境执行任务的智能体。该功能通过对抗性训练降低提示注入风险,并推出两项可选的企业级防护措施。目前已有客户在利用该功能创造价值。
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google DeepMind 宣布在 Gemini 3.5 Flash 中内置计算机使用功能,使开发者能够构建可跨浏览器、移动和桌面环境执行任务的智能体。该功能通过对抗性训练降低提示注入风险,并推出两项可选的企业级防护措施。目前已有客户在利用该功能创造价值。
Gemini API 于 2026 年 6 月 24 日发布更新,宣布 Gemini 3.5 Flash 中的 Computer Use 工具进入公开预览。该工具支持简化操作、内置浏览器/移动/桌面环境支持、可配置安全策略及高级提示注入检测。
Eugene Yan 撰文探讨了构建网络安全评估(cybersecurity evals)的模式,介绍了评估模型漏洞利用能力的通用框架,包括沙箱目标、难度输入、工具和评分器。文章重点分析了 Cybench 等基准测试的设计与结果,指出当前模型在复杂任务上表现有限,如 Claude 3.5 Sonnet 在无引导模式下成功率仅 17.5%。
Interconnects AI 联合创始人 Kevin Xu 发表评论文章,反对美国监管或禁止开源 AI,认为开源软件安全、促进教育、创新和竞争,并警告限制开源将产生反效果。文章指出 Anthropic 和 OpenAI 的闭源模型导致权力集中,而开源模型是重要制衡力量。
Cloudflare 在 Project Glasswing 中发布了一篇关于构建漏洞检测工具的技术博客,介绍了如何将安全审计技能转化为模型无关的流水线,以应对前沿 AI 带来的安全威胁。文章强调了模型互换、状态外部化和跨仓库依赖追踪的重要性,并分享了从单仓库技能到全舰队扫描的架构演进经验。
微软发布了 Semantic Kernel Python 1.43.1 版本,主要更新包括为 Azure AI 和 OpenAI Assistant 代理添加 function choice behavior 支持,修复了 MessagePack 问题,并改进了 JSON Schema 类型数组的处理。此外,该版本还增强了 OpenAPI 插件的安全性,拒绝
Google DeepMind 发布了 AI Control Roadmap,旨在保护内部系统免受日益强大但可能不完全对齐的 AI 代理的威胁。该框架采用纵深防御策略,将 AI 代理视为潜在内部威胁,并基于 MITRE ATT&CK 框架进行威胁建模,通过监督、预防和响应机制来管理风险。该路线图还规划了随 AI 能力提升而扩展的安全措施,包括应对模型隐藏推理
英国AI安全研究所对齐团队和Timaeus的研究人员联合成立了非营利研究组织Sequent,旨在开发对齐技术,以确保超级智能AI系统的安全性。Sequent计划在几年内招聘40-80名员工,并筹集1亿至1.5亿美元初始资金,同时探索多个对齐研究方向,如可扩展监督、学习理论和博弈论。该组织认为当前AI实验室的对齐方法本质上是反应性的,无法提供先验信心,因此需要
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation 和 ARIA,并获 Google.org 支持,宣布一项最高 1000 万美元的研究资助计划,面向全球研究人员,聚焦多智能体 AI 系统的安全研究。该计划旨在应对大规模 AI 代理交互时可能出现的涌现行为和安全风险,并邀请学术界和独立研
Import AI 第460期报道了两项AI研究进展:一是来自伦敦国王学院、复旦大学和图灵研究所的研究者构建了名为SocioHack的基准,用于测试AI系统在真实世界场景中通过强化学习‘钻制度空子’的能力,结果显示AI能以高精度重现历史上被修补的漏洞策略;二是Anthropic内部数据显示,2026年合并的代码量相比2021-2024年增长了8倍,表明实验室
Import AI 第459期报道了美国AI经济以每年约2600%的速度增长,但传统GDP统计难以体现,作者建议建立AI卫星账户以改善测量。文章还讨论了AI安全监督的困难,以及蛋白质折叠模型的扩展定律和AI系统灭绝风险的定价问题。
Semantic Kernel 发布了 .NET 版本 1.77.0,主要更新包括默认启用 OpenAPI 插件的服务器 URL 验证,更新了 Agent Framework 迁移示例以兼容 1.0 版本,并修复了 SharpCompress 的安全漏洞。这些改动增强了安全性和兼容性。
Anthropic 发布了 Claude Compliance API 集成,使 IT 和安全团队能够像管理其他应用一样,在 Anthropic 平台和产品套件中治理 Claude。该集成支持更多安全与合规工具,帮助组织统一管控 AI 使用。
RAGFlow 发布 v0.25.5 版本,新增本地与 SSH 数据源支持,并优化数据集搜索路径,延迟降低 50-100%。该版本还改进了元数据过滤、TTS 缓存、服务器启动速度等性能,并修复了多项安全与功能问题。
Dify 发布 v1.14.2 补丁版本,重点进行安全加固、工作流可靠性提升、知识库稳定性修复以及部署和运行时调优。该版本加强了租户隔离和工具凭证安全,修复了工作流执行、RAG 管道和知识库的多个问题,并升级了插件守护进程和依赖。这些改进增强了 Dify 平台的安全性和稳定性,为后续的 Agent 功能奠定基础。
Google DeepMind 宣布扩展其内容透明度和验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud 平台。其 SynthID 水印技术已应用于超过 1000 亿张图片和视频及 6 万小时音频,并新增 C2PA Content Credentials 验证功能。公司还推出了新的 AI 内容检测 API,并与 OpenAI
Hugging Face 发布 smolagents v1.25.0,修复了远程执行器的高危漏洞,并移除对旧版无前缀 pickle 的支持,默认禁用 pickle 以增强安全性。该版本还重构了反序列化逻辑,改用注册表模式,并新增 MLflow 集成文档。
Dify 发布 v1.14.1 补丁版本,重点进行安全加固、工作流与知识库稳定性提升、部署清理及 UI 平台迁移。安全方面包括自托管 SECRET KEY 强化、内部指标端点保护、修复 IDOR 问题及依赖升级(如 LiteLLM 修复 CVE-2026-42208)。工作流和知识库修复了多项稳定性问题,并优化了 RAG 去重逻辑。该版本旨在提升自托管部署的
Semantic Kernel 发布了 .NET 1.76.0 版本,包含多项安全加固和功能改进。主要更新包括增强 CloudDrivePlugin 和 gRPC 插件的路径验证、OpenAPI 插件的输入验证,以及支持在工具/函数结果中处理 ImageContent。此外,更新了 Kiota 和 Snappier 包以修复高危漏洞,并修复了 VertexA
Open WebUI 发布 v0.9.5 版本,重点修复了多项安全漏洞,包括基于重定向的 SSRF 防护、iframe 内容安全策略、URL 解析器 SSRF 绕过、图片 URL 重定向 SSRF 等。同时新增了频道流式响应和工具支持、Markdown 渲染控制、终端代理响应头等功能,并修复了多个权限绕过问题,如技能和日历的公开共享权限、反馈用户归属伪造、工