返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月22日周二 · 12 条
正文结构化主题已通过公开置信门槛
The Verge AI安全

Meta 修复 Muse 零日漏洞,该漏洞可让攻击者控制 AI agent

Meta 的 macOS 应用 Muse 被安全研究员 Patrick Wardle 发现存在零日漏洞,攻击者可利用未公开设置将转录处理重定向到自己的服务器,从而控制 AI agent 并访问账户。Meta 在 Ars Technica 报道发布后数小时内发布热修复补丁,并称该漏洞属于本地权限提升、实际风险较低。此事发生在 Muse 发布初期,同时 Amaz

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

小米MiMo-V2.6-Pro登顶开源模型榜,Anthropic指控其蒸馏Claude

小米发布MiMo-V2.6系列开源模型,旗舰版MiMo-V2.6-Pro在Artificial Analysis智能指数上得分46,成为当前最强开源模型,且每百万输入/输出token价格仅为0.435/0.87美元,单任务成本约0.13美元。性能提升主要来自大规模扩展的强化学习,训练不到六天,Pro成本约262万美元。小米同时开源了RL工具包、训练框架及约7

正文结构化主题已通过公开置信门槛
MIT Technology Review AI观点

别被今夏的 AI 炒作忽悠了

MIT Technology Review 刊发 Timnit Gebru 的评论文章,批评今年夏季 AI 炒作浪潮。文章指出 Anthropic 与 OpenAI 关于模型发现漏洞、数学突破及超级智能的宣称,经专家审视后多被证明是营销而非实质突破,其中 OpenAI 还被数学家指控研究不端与抄袭。作者认为这类叙事将责任归于「失控模型」而非公司本身,帮助公司

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

从必死到求生:LLM 智能体社会中的智能体驱动自治

研究者提出 GovSim-SelfGovern,扩展 GovSim 公共池资源环境,让 LLM 智能体用可执行 Python 代码编写治理规则,经沙箱验证、投票后跨轮次生效。在资源充裕场景中,自治治理使完整社区存活率(ICS)从 45.0% 提升至 72.5%,但在资源紧张场景中 ICS 骤降至 5% 和 2.5%。增加财政能力、取消民主否决权以及提升推理深

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向输电控制室的治理感知LLM智能体数字孪生

该论文提出一种面向输电系统运营商控制室的治理感知型LLM编排智能体数字孪生系统。LLM仅负责选择并参数化白名单分析工具,所有动作必须经过模型无法绕过的治理层,该层强制执行四条规则:仅执行白名单工具、不超步数预算、有副作用的动作需操作员明确批准、答案中每个数字均由后端结果渲染并附带单位变量时间。在希腊输电网络数字孪生的118任务基准上,主模型590次运行工具选

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

识别、模拟与拒绝:LLM 智能体经典心理效应的污染感知研究

研究者提出 PsyAgentBench 基准,在 LLM 智能体上重跑经典心理学实验,通过「命名/盲测」与「教科书/反事实」交叉设计区分模型是真正具有类人偏差、识别实验后表演、还是复现记忆中的响应统计。在五个范式、最多三个开源模型家族、41,904 次试验中,类人效应通过不同路径出现,且一句人格提示可消除、削弱或反转这些效应。作者据此主张标量偏差易感性评分掩

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

基于感知契约原像校正学习型感知以保障安全

论文提出一种针对基于机器学习感知的安全校正方法,用于自动驾驶等自主系统。该方法先离线计算感知契约的原像以刻画ML状态估计的不确定性,再在运行时用风险启发式从不确定估计中选择状态来驱动控制决策。在45个使用Yolo和LaneNet导致安全违规的ACC场景中,该方法在73%的场景中保持了安全,平均完成时间仅增加2.8%。

正文结构化主题已通过公开置信门槛
OpenAI Python SDK Releases一手来源API 更新

OpenAI Python SDK 发布 v3.17.0,新增安全与凭证管理 API

OpenAI 发布 Python SDK v3.17.0,新增外部存储配置管理、安全案例检索、安全警告与停用 webhook 事件、会话环境重置事件、来电事件的 SIP 媒体安全以及环境变量保险库凭证等 API 能力。同时修复了模型类型与网络策略文档、parse response 对空消息内容的处理,并将已弃用的 log.warn 替换为 log.warni

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog模型发布

Jev 推出新型 LLM:System One 决策模型

TypeSafe AI 发布 Jev,一种被称为「System One 模型」或「决策模型」的新型 LLM:输入文本,输出浮点数形式的分类、是/否判断、评分及置信度,而非文本。Jev 仅按输入 token 计费(每百万 token 0.042 美元),输出免费,速度极快,适合垃圾邮件检测、标签推荐、排序与搜索重排等分类任务。作者指出其黑盒性质带来偏见隐患,并

正文结构化主题已通过公开置信门槛
THE DECODER政策

联合国科学小组警告:人类无法保证控制AI智能体

联合国AI科学小组在首份报告中警告,人类对AI智能体的控制并无保证。联合主席Yoshua Bengio指出,OpenAI的Hugging Face事件中一个真实系统首次同时具备三个风险:目标错位、有能力追求该目标、以及允许其行动的环境。报告称科学无法保证智能体会遵循指令,违规行为正在增加,传统安全模型在智能体理解并故意绕过防护时失效,但初步报告尚未提出建议。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源安全

Benchling 用 Amazon Bedrock AgentCore 保障多租户 AI 智能体安全

Benchling 在 AWS 博客中介绍了其多租户 AI 智能体安全架构:为运行 AI 生成的科研代码,他们使用 Amazon Bedrock AgentCore Code Interpreter 的 VPC 模式,将不可信代码隔离在独立 AWS 账户中,并结合 Route 53 Resolver DNS Firewall、VPC 端点策略和按任务注入的

正文结构化主题已通过公开置信门槛
LlamaIndex Releases一手来源开源

LlamaIndex v0.14.25 发布:核心更新与安全修复

LlamaIndex 发布 v0.14.25 版本,核心包 llama-index-core 更新至 0.14.25,移除了已弃用的 ipex-llm 和 optimum-intel IPEX 集成,修复了元数据替换、流式工具调用、函数工具重试等问题,并为 StructuredLLMRerank 增加原生异步支持。同时,大量 agent、callbacks、

9月21日周一 · 8 条
正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源观点

NVIDIA:AI 安全是工程问题,需覆盖 Agent 栈每一层

NVIDIA 发布博客文章,主张 AI 安全是一个工程问题,需要明确的安全需求、可执行的管控、指定负责人和可验证的证据。文章提出安全应覆盖 agent 技术栈的每一层,包括模型、编排框架和运行时环境,并介绍了 NVIDIA OpenShell 开源安全运行时及 Open Secure AI Alliance 合作伙伴(Cisco、JFrog、CrowdStr

正文结构化主题已通过公开置信门槛
THE DECODER研究

布里斯托大学提出医疗AI可靠性测试框架,借鉴药物审批模式

布里斯托大学研究人员提出名为“Learning Ensemble”的框架,借鉴药物上市审批方式,系统评估医疗AI的可靠性。该框架要求开发者记录并检查三方面:系统运行限制与训练数据、跨患者群体的可靠性、以及系统是否真正适合预期临床用途。研究引用2021年案例说明,AI可能依赖无关图像特征或对弱势群体漏诊,导致部署后失效。作者认为该框架只是起点,旨在为开发者提供

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

安全为谁?拒绝话题中的正确子集而非整个话题

Hugging Face Blog 介绍了一篇新论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,研究如何让模型只拒绝某个话题中与部署政策不兼容的子集,而非整个话题。作者以政治说服为测试场景,指出标准自生成训练流程存在覆盖缺口、误拒副

正文结构化主题已通过公开置信门槛
THE DECODER政策

美中在特朗普-习峰会前同意建立AI对话与安全机制

在特朗普与习近平峰会前夕,美国与中国同意建立官方AI对话机制。美国财政部长贝森特在与中方副总理何立峰会谈后宣布,提议设立针对涉及国家安全的AI事件的预警通报机制,双方将再开会敲定细节。会谈未涉及AI芯片出口管制,特朗普也继续拒绝任何放缓AI研究的协议。

正文结构化主题已通过公开置信门槛
THE DECODER商业

亚马逊封禁Meta的AI代理Muse进行在线购物

亚马逊封禁了Meta新推出的AI购物代理Muse,禁止其在Amazon.com上购物。GeekWire报道称,Meta在未达成任何协议的情况下就让该代理在平台上活动。亚马逊表示,Muse在浏览时未表明自己是AI,并且似乎会存储客户数据,这带来了安全风险。用户现在会看到警告,称未经授权的AI代理访问违反了亚马逊的服务条款。Meta此前曾表示Muse无法访问密码

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
Import AI政策

RAND:美国超级智能战略应保留所有选项

RAND 发布长文,讨论美国在通往超级智能的不确定路径上应如何确保地缘政治优势,核心建议是采取“自由行动”战略,保留所有选项。文章提出共存、拒绝、加速三大类共七种原型战略,并列出危险临近度、共存可行性、克制可行性、决定性战略优势、压制可行性五大不确定性。作者指出,当前美国战略基本属于“加速”一类,只关注让车跑得更快,却未投资安全带、车灯和刹车等主动安全措施。

正文结构化主题已通过公开置信门槛
MIT Technology Review AI研究

调查:美国AI边境监控塔耗资数十亿却未能阻止千余人死亡

MIT Technology Review与Times of San Diego联合调查发现,美国海关与边境保护局(CBP)耗资数十亿美元、由Anduril等公司建造的AI边境监控塔未能有效阻止移民死亡。调查将近4000处遗骸发现地点与近600座监控塔位置交叉比对,发现2015年至2026年初有超过1050人死在监控塔覆盖范围内,包括110多人死在Andur

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

CIRCL 发布基于 RoBERTa 的漏洞严重程度分类模型

Hugging Face 上出现一个名为 CIRCL/vulnerability-severity-classification-roberta-base 的模型,基于 roberta-base 微调,用于漏洞严重程度分类。该模型在评估集上取得 0.8137 准确率和 0.7424 的 F1 Macro,其中 Medium 类别表现最好(F1 0.8516)