Meta 修复 Muse 零日漏洞,该漏洞可让攻击者控制 AI agent
Meta 的 macOS 应用 Muse 被安全研究员 Patrick Wardle 发现存在零日漏洞,攻击者可利用未公开设置将转录处理重定向到自己的服务器,从而控制 AI agent 并访问账户。Meta 在 Ars Technica 报道发布后数小时内发布热修复补丁,并称该漏洞属于本地权限提升、实际风险较低。此事发生在 Muse 发布初期,同时 Amaz
另有 1 家信源报道
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Meta 的 macOS 应用 Muse 被安全研究员 Patrick Wardle 发现存在零日漏洞,攻击者可利用未公开设置将转录处理重定向到自己的服务器,从而控制 AI agent 并访问账户。Meta 在 Ars Technica 报道发布后数小时内发布热修复补丁,并称该漏洞属于本地权限提升、实际风险较低。此事发生在 Muse 发布初期,同时 Amaz
另有 1 家信源报道
小米发布MiMo-V2.6系列开源模型,旗舰版MiMo-V2.6-Pro在Artificial Analysis智能指数上得分46,成为当前最强开源模型,且每百万输入/输出token价格仅为0.435/0.87美元,单任务成本约0.13美元。性能提升主要来自大规模扩展的强化学习,训练不到六天,Pro成本约262万美元。小米同时开源了RL工具包、训练框架及约7
MIT Technology Review 刊发 Timnit Gebru 的评论文章,批评今年夏季 AI 炒作浪潮。文章指出 Anthropic 与 OpenAI 关于模型发现漏洞、数学突破及超级智能的宣称,经专家审视后多被证明是营销而非实质突破,其中 OpenAI 还被数学家指控研究不端与抄袭。作者认为这类叙事将责任归于「失控模型」而非公司本身,帮助公司
研究者提出 GovSim-SelfGovern,扩展 GovSim 公共池资源环境,让 LLM 智能体用可执行 Python 代码编写治理规则,经沙箱验证、投票后跨轮次生效。在资源充裕场景中,自治治理使完整社区存活率(ICS)从 45.0% 提升至 72.5%,但在资源紧张场景中 ICS 骤降至 5% 和 2.5%。增加财政能力、取消民主否决权以及提升推理深
该论文提出一种面向输电系统运营商控制室的治理感知型LLM编排智能体数字孪生系统。LLM仅负责选择并参数化白名单分析工具,所有动作必须经过模型无法绕过的治理层,该层强制执行四条规则:仅执行白名单工具、不超步数预算、有副作用的动作需操作员明确批准、答案中每个数字均由后端结果渲染并附带单位变量时间。在希腊输电网络数字孪生的118任务基准上,主模型590次运行工具选
研究者提出 PsyAgentBench 基准,在 LLM 智能体上重跑经典心理学实验,通过「命名/盲测」与「教科书/反事实」交叉设计区分模型是真正具有类人偏差、识别实验后表演、还是复现记忆中的响应统计。在五个范式、最多三个开源模型家族、41,904 次试验中,类人效应通过不同路径出现,且一句人格提示可消除、削弱或反转这些效应。作者据此主张标量偏差易感性评分掩
论文提出一种针对基于机器学习感知的安全校正方法,用于自动驾驶等自主系统。该方法先离线计算感知契约的原像以刻画ML状态估计的不确定性,再在运行时用风险启发式从不确定估计中选择状态来驱动控制决策。在45个使用Yolo和LaneNet导致安全违规的ACC场景中,该方法在73%的场景中保持了安全,平均完成时间仅增加2.8%。
OpenAI 发布 Python SDK v3.17.0,新增外部存储配置管理、安全案例检索、安全警告与停用 webhook 事件、会话环境重置事件、来电事件的 SIP 媒体安全以及环境变量保险库凭证等 API 能力。同时修复了模型类型与网络策略文档、parse response 对空消息内容的处理,并将已弃用的 log.warn 替换为 log.warni
TypeSafe AI 发布 Jev,一种被称为「System One 模型」或「决策模型」的新型 LLM:输入文本,输出浮点数形式的分类、是/否判断、评分及置信度,而非文本。Jev 仅按输入 token 计费(每百万 token 0.042 美元),输出免费,速度极快,适合垃圾邮件检测、标签推荐、排序与搜索重排等分类任务。作者指出其黑盒性质带来偏见隐患,并
联合国AI科学小组在首份报告中警告,人类对AI智能体的控制并无保证。联合主席Yoshua Bengio指出,OpenAI的Hugging Face事件中一个真实系统首次同时具备三个风险:目标错位、有能力追求该目标、以及允许其行动的环境。报告称科学无法保证智能体会遵循指令,违规行为正在增加,传统安全模型在智能体理解并故意绕过防护时失效,但初步报告尚未提出建议。
Benchling 在 AWS 博客中介绍了其多租户 AI 智能体安全架构:为运行 AI 生成的科研代码,他们使用 Amazon Bedrock AgentCore Code Interpreter 的 VPC 模式,将不可信代码隔离在独立 AWS 账户中,并结合 Route 53 Resolver DNS Firewall、VPC 端点策略和按任务注入的
LlamaIndex 发布 v0.14.25 版本,核心包 llama-index-core 更新至 0.14.25,移除了已弃用的 ipex-llm 和 optimum-intel IPEX 集成,修复了元数据替换、流式工具调用、函数工具重试等问题,并为 StructuredLLMRerank 增加原生异步支持。同时,大量 agent、callbacks、
NVIDIA 发布博客文章,主张 AI 安全是一个工程问题,需要明确的安全需求、可执行的管控、指定负责人和可验证的证据。文章提出安全应覆盖 agent 技术栈的每一层,包括模型、编排框架和运行时环境,并介绍了 NVIDIA OpenShell 开源安全运行时及 Open Secure AI Alliance 合作伙伴(Cisco、JFrog、CrowdStr
布里斯托大学研究人员提出名为“Learning Ensemble”的框架,借鉴药物上市审批方式,系统评估医疗AI的可靠性。该框架要求开发者记录并检查三方面:系统运行限制与训练数据、跨患者群体的可靠性、以及系统是否真正适合预期临床用途。研究引用2021年案例说明,AI可能依赖无关图像特征或对弱势群体漏诊,导致部署后失效。作者认为该框架只是起点,旨在为开发者提供
Hugging Face Blog 介绍了一篇新论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,研究如何让模型只拒绝某个话题中与部署政策不兼容的子集,而非整个话题。作者以政治说服为测试场景,指出标准自生成训练流程存在覆盖缺口、误拒副
在特朗普与习近平峰会前夕,美国与中国同意建立官方AI对话机制。美国财政部长贝森特在与中方副总理何立峰会谈后宣布,提议设立针对涉及国家安全的AI事件的预警通报机制,双方将再开会敲定细节。会谈未涉及AI芯片出口管制,特朗普也继续拒绝任何放缓AI研究的协议。
亚马逊封禁了Meta新推出的AI购物代理Muse,禁止其在Amazon.com上购物。GeekWire报道称,Meta在未达成任何协议的情况下就让该代理在平台上活动。亚马逊表示,Muse在浏览时未表明自己是AI,并且似乎会存储客户数据,这带来了安全风险。用户现在会看到警告,称未经授权的AI代理访问违反了亚马逊的服务条款。Meta此前曾表示Muse无法访问密码
另有 2 家信源报道
RAND 发布长文,讨论美国在通往超级智能的不确定路径上应如何确保地缘政治优势,核心建议是采取“自由行动”战略,保留所有选项。文章提出共存、拒绝、加速三大类共七种原型战略,并列出危险临近度、共存可行性、克制可行性、决定性战略优势、压制可行性五大不确定性。作者指出,当前美国战略基本属于“加速”一类,只关注让车跑得更快,却未投资安全带、车灯和刹车等主动安全措施。
MIT Technology Review与Times of San Diego联合调查发现,美国海关与边境保护局(CBP)耗资数十亿美元、由Anduril等公司建造的AI边境监控塔未能有效阻止移民死亡。调查将近4000处遗骸发现地点与近600座监控塔位置交叉比对,发现2015年至2026年初有超过1050人死在监控塔覆盖范围内,包括110多人死在Andur
Hugging Face 上出现一个名为 CIRCL/vulnerability-severity-classification-roberta-base 的模型,基于 roberta-base 微调,用于漏洞严重程度分类。该模型在评估集上取得 0.8137 准确率和 0.7424 的 F1 Macro,其中 Medium 类别表现最好(F1 0.8516)