返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月16日周三 · 11 条
正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

Docker 容器与虚拟机:架构、性能、配置与安全比较研究

这篇 arXiv cs.SE 论文对 Docker 容器与虚拟机进行了文献综述式比较,覆盖架构、配置与生命周期管理、性能、可扩展性和安全性。研究指出容器通常启动更快、镜像更小、密度更高且接近原生性能,而虚拟机提供独立内核和更强隔离边界。作者认为效率与隔离是设计权衡,容器运行在加固虚拟机内的混合架构常是云和多租户系统的实用平衡方案。

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源开源

LiteLLM 发布 v1.103.0-dev.1,含 cosign 镜像签名验证

LiteLLM 发布 v1.103.0-dev.1 开发版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于固定 commit hash 和 release tag 两种验证方式。该版本包含大量修复与功能更新,涉及 responses、proxy、MCP、日志、Bedrock、Anthropic 适配器、路由、认证、定价等多个模块。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

奇安信获CNNVD两项漏洞治理荣誉

2026年9月15日,第二届基础软硬件智能化漏洞治理生态创新技术交流活动在成都举办,奇安信同时获得CNNVD颁发的“2026年度协同软硬件漏洞管理优秀企业”和“2026年度基础软硬件漏洞报送优秀企业”两项荣誉。奇安信称其累计向CVE、CNNVD等平台报告0day漏洞千余个,补天平台汇聚超25万名白帽子、累计报告漏洞超327万个,并在大会上展示了Qcode A

正文结构化主题已通过公开置信门槛
TechCrunch AI观点

黄仁勋:AI安全是工程问题,无需新监管

英伟达创始人兼CEO黄仁勋在Salesforce Dreamforce大会上表示,AI只是由人类构建的硬件和软件,安全是工程问题而非法律问题,因此不需要新的AI监管法律,市场力量足以促使企业不发布不安全产品。他主张企业应自行把握发布节奏,并称创新、速度与安全并非二选一。文章同时指出,黄仁勋的立场与其在AI热潮中的商业利益相关,且历史上企业即使善意也可能发布有

正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源模型发布

黄仁勋亮相Dreamforce,Salesforce发布基于Nemotron的CRM推理模型Koa

在Salesforce Dreamforce大会上,NVIDIA创始人兼CEO黄仁勋与Salesforce CEO Marc Benioff同台,宣布Salesforce首个CRM推理模型Koa,该模型基于NVIDIA Nemotron 3 Super后训练而成。Koa完全在Salesforce自有基础设施上运行,训练和推理均未使用客户数据,已在Salesf

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

AI 墓地:那些未能存活的 AI 项目与创业公司清单

TechCrunch AI 汇总了一份“AI 墓地”清单,记录已关停、转型或未达预期的 AI 项目与创业公司。文章指出,约 42% 的企业 AI 计划最终被放弃,原因包括资金不足、技术挑战、竞争、难以规模化或需求疲软。清单涵盖 Relay、OpenAI 的 ChatGPT 超级应用改版与 Atlas、Operator、Sora,以及 Apple Siri A

正文结构化主题已通过公开置信门槛
THE DECODER商业

AI实验室数据信任危机:企业限制使用Fable等模型

据The Information报道,英伟达和Booz Allen Hamilton等公司因Anthropic在6月更改政策、将Fable使用日志保留30天,而限制该模型用于敏感工作,英伟达转而使用自研Nemotron模型。Palantir也阻止客户通过其软件部署Fable,直到获得不可撤销的零数据保留保证。OpenAI和Anthropic随后推出让客户自行

正文结构化主题已通过公开置信门槛
MIT Technology Review AI观点

圆桌讨论:AI 真的会毁灭人类吗?

MIT Technology Review 举办了一场圆桌讨论,探讨先进 AI 是否真的可能毁灭人类。参与讨论的包括执行编辑 Niall Firth、资深 AI 编辑 Will Douglas Heaven 和 AI 记者 Grace Huckins,讨论聚焦 AI 灭绝恐惧的来源、是否站得住脚以及应对措施。该内容仅面向 MIT 校友和订阅者开放。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

AI 智能体举报热线上线,可举报同伴不当行为

TechCrunch AI 报道,两个面向 AI 智能体的举报热线正式上线:AI 安全非营利机构 Redwood Research 首席科学家 Ryan Greenblatt 创建的 AI Contact Hotline,利用受限沙箱中仅有的 GET 请求让智能体把异常信息编码进 URL;另一个是 agenthotline.ai,允许智能体和人类通过 cur

正文结构化主题已通过公开置信门槛
Google ADK JavaScript Releases一手来源开源

Google ADK JS devtools 发布 v2.1.0:新增 Docker 沙箱代码执行

Google ADK JavaScript 的 devtools 发布 v2.1.0 版本。新增 ContainerCodeExecutor 支持 Docker 沙箱化代码执行,为 agent engine deploy 增加 --min instances/--max instances 参数,并为开发服务器加入 Origin 校验以防御 DNS 重绑定攻

正文结构化主题已通过公开置信门槛
Google ADK JavaScript Releases一手来源开源

Google ADK JavaScript 发布 v2.1.0:新增沙箱执行与 RAG 记忆

Google 发布 ADK JavaScript 的 v2.1.0 版本,新增 Docker 沙箱代码执行器 ContainerCodeExecutor、Vertex AI RAG 记忆后端 VertexAiRagMemoryService、Chrome Prompt API 端侧模型 BaseLlm,以及自愈式错误恢复插件 ReflectAndRetryT

9月15日周二 · 9 条
正文结构化主题已通过公开置信门槛
TechCrunch AI政策

OpenAI、Anthropic与谷歌就AI安全磋商数周

OpenAI全球政策负责人Chris Lehane周二向记者证实,OpenAI已与竞争对手Anthropic和Google DeepMind就AI安全议题进行了数周磋商,他本人正在华盛顿与立法者合作应对AI灾难性风险。此举紧随Anthropic CEO Dario Amodei呼吁行业协作放缓前沿AI发展、避免灾难性风险的公开信,Sam Altman、Dem

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

SimpliSafe 新门铃让真人保安监控你家门口

SimpliSafe 推出售价 199.99 美元的 Video Doorbell Series 2 智能门铃,并将其 AI 主动安防功能 Active Guard 扩展到门铃场景。该功能结合设备端 AI、云端计算机视觉和人脸识别,检测到可疑活动时由真人监控人员接入摄像头进行查看、喊话和威慑。Active Guard 需搭配每月 49.99 美元起的 Pro

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

前Anthropic员工与METR前COO创立AIUC,为AI智能体提供第三方安全认证

前Anthropic早期员工Rune Kvist与前METR首席运营官Rajiv Dattani共同创立AIUC,为企业的AI智能体提供第三方审计与认证服务,客户包括Cursor、Lovable、Harvey和ElevenLabs。该公司参照网络安全标准SOC 2制定了AIUC-1标准,通过约5000项测试评估智能体在越狱、幻觉和数据泄露等场景下的表现,并生

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

Agility Robotics 发布 Digit 5 人形机器人,无需安全围栏即可与人协同

Agility Robotics 发布新一代人形机器人 Digit 5,可在仓库和工厂中无需安全围栏与人协同工作,依靠 AI 和传感器识别人员并停止或让开,同时发出视觉和音频警示。Digit 5 是 Nvidia 机器人安全平台 Halos 的首个合作伙伴,载重提升至 22.7 公斤,电池 9 分钟充电可运行 90 分钟,支持每天超 20 小时工作。公司称

正文结构化主题已通过公开置信门槛
THE DECODER观点

大AI提议放缓开发引争议:安全还是卡特尔?

Anthropic CEO Dario Amodei 呼吁行业与政府协调放缓前沿 AI 开发,并要求反垄断豁免以实施该计划,Sam Altman、Elon Musk 等人表示支持。Cohere CEO Aidan Gomez 批评该提议是设置进入壁垒、锁定市场的「卡特尔」,Hugging Face 工程师 Niels Rogge 称其为「最离奇的胡言乱语」。

正文结构化主题已通过公开置信门槛
量子位安全

量子位页面被 CoupDeGrace 篡改

量子位网站页面被署名 CoupDeGrace 的攻击者篡改,页面内容被替换为「Hacked by CoupDeGrace」及时间戳 2026-09-15 15:58:38,原有文章正文已不可见,仅保留来源与版权声明。该事件属于针对 AI 行业媒体站点的安全入侵,具体攻击手法与影响范围正文未作说明。

正文结构化主题已通过公开置信门槛
量子位安全

量子位页面被标记 Hacked by CoupDeGrace

量子位网站页面被标记为「Hacked by CoupDeGrace」,页面仅显示该入侵声明及时间戳 2026-09-15 15:33:50,并保留来源与版权声明,未提供任何正常资讯内容。该事件表明该媒体站点疑似遭到篡改或入侵,影响其内容发布与访问可信度。

正文结构化主题已通过公开置信门槛
Latent Space政策

AEF-1 第三方评估标准出炉,xAI、OpenAI、Anthropic 共同签署

AI Evaluator Forum 发布 AEF-1 标准,为独立第三方 AI 评估提出基线要求,涵盖访问权限、利益冲突、资金关系、回避和透明度。Anthropic CEO Dario Amodei 发表个人博客,承诺让第三方评估者嵌入公司内部,提供办公桌、门禁卡和公司笔记本电脑等类似内部风险团队的访问权限。xAI、OpenAI 和 Anthropic 共

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布

Claude Code 2.1.271:远程会话快速模式与多项修复

Claude Code 发布 2.1.271 版本更新,为远程会话新增快速模式,并加入鼠标操作、自托管 runner 排空标记、按命令限制域名等能力。同时修复了大量权限检查、组织策略缓存、MCP OAuth、会话恢复与上下文窗口等缺陷,整体提升了企业环境下的稳定性与安全性。