返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月3日周四 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

Google 发布 Gemini 3.8 Flash 及网络安全版模型

Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,基于六周内第三次 Flash 更新。3.8 Flash 在软件工程、智能体任务和多步推理上显著提升,定价与 3.7 Flash 相同;3.8 Flash Cyber 专攻网络安全,具备漏洞发现和自动修补能力,通过 Fairwind 计划提供

9月2日周三 · 19 条
正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

谷歌推出 Fairwind 计划,用 Gemini 3.8 强化网络防御

谷歌推出 Fairwind 计划,为政府和企业提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,以自主发现并修复漏洞。该计划面向政府、关键基础设施运营商和核心技术平台,已有超过 650 家合作伙伴参与。此举旨在通过早期访问和严格操作标准,帮助防御者在大规模网络威胁面前保持优势。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

亚马逊购物AI新增防诈骗功能,可识别虚假消息

亚马逊宣布其购物AI助手Alexa for Shopping新增功能,可帮助用户识别收到的消息是否为诈骗。该AI通过比对亚马逊全球发送的数十亿条消息,分析发件人、内容、时间等元数据来确认消息真实性,并会随着用户举报而改进。此举是亚马逊应对日益增长的诈骗问题的举措之一,此前已推出验证邮箱和在线表单。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER商业

美国军方将ChatGPT和Grok纳入GenAI.mil平台

美国国防部扩展其GenAI.mil平台,新增OpenAI的ChatGPT Mil和xAI的Grok for Government模型,此前该平台仅提供Google Gemini。该平台拥有超过170万用户,新模型将用于行政、物流、规划及采购分析等任务,并在安全环境中运行以防数据泄露。Anthropic的Claude因拒绝无限制使用而被排除,相关分类被法院裁定

正文结构化主题已通过公开置信门槛
The Verge AI商业

OpenAI因Tumbler Ridge枪击案面临30起新诉讼

OpenAI及其CEO Sam Altman面临30起新诉讼,指控其为加拿大Tumbler Ridge校园枪击案嫌疑人提供“实质性协助和鼓励”。诉讼称OpenAI的安全系统标记了嫌疑人与ChatGPT的暴力对话,但公司出于声誉和财务考虑未通知当局。OpenAI首席战略官Jason Kwon回应称诉讼包含“虚假指控”。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
The Verge AI政策

纽约市禁止低年级学生使用AI直至高中

纽约市市长 Zohran Mamdani 宣布新政策,禁止 2-K 至八年级约 60 万公立学校学生在课堂上使用 AI,禁令为期一年,自 2026-2027 学年生效。政策还禁止所有年级使用陪伴式聊天机器人,并限制教师使用 AI 评分。高中学生仅在特定情况下可使用 AI,并需参加 AI 素养课程。该政策被视为美国最严格的 AI 教育限制之一。

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

OpenAI 称 Astra 为最危险模型,安全监控面临挑战

OpenAI 将其即将推出的 Astra 模型评为首个具有“严重”网络攻击能力的系统,同时声称这是其构建的最安全模型。内部测试显示 Astra 在漏洞利用基准上表现优异,并发现了两个零日漏洞。为应对风险,OpenAI 计划推出新的安全措施,包括监控模型的思维链,但该技术可能因模型内部推理的不可见性而存在局限。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog产品发布

Claude 新系统提示词强化版权限制,禁止复制歌词与角色形象

Anthropic 更新了其消费级应用 Claude 的系统提示词,新增了禁止复制歌曲歌词、诗歌及受版权保护的视觉作品(如角色和标志)的条款,并调整了回答风格和应对辱骂对话的指南。这些变化可能与其面临的版权诉讼有关,并反映了对生成内容合规性的加强。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v3.225.7 发布:安全修复与稳定性增强

Langfuse 发布 v3.225.7 版本,包含多项修复和安全改进。主要修复了 OTel 原型链污染、blob 存储键冲突、ClickHouse 时间戳插入等问题,并增强了 API 密钥管理、JWT 会话时长和日志脱敏等安全措施。这些更新旨在提升系统稳定性和安全性。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

生产级 LLM 评估:用于安全模型替换的回放管道

Hugging Face 博客介绍了一个用于在对话代理中安全替换 LLM 的回放管道,该管道在生产环境下重放已批准的合成交互,仅将模型作为变量。评估了 8 个模型,其中 3 个获批,3 个因幻觉率超标被拒,但逐轮重新计算显示部分拒绝是统计平局或结构性问题。文章强调安全标准应作为独立过滤器,而非加权平均的一部分。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

OpenAI 再遭 30 起诉讼:被指协助教唆校园枪击案

Edelson PC 律所本周在加州法院对 OpenAI 提起 30 起新诉讼,涉及 Tumbler Ridge 校园枪击案,原告包括教师、校长和学生。新诉讼首次指控 OpenAI 协助和教唆大规模枪击,而非仅过失未能阻止,并点名首席全球事务官 Chris Lehane 阻止联系执法部门,但 OpenAI 否认其参与。OpenAI 面临多起安全事件诉讼,包括

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Cloudflare 新增可选 OAuth 作用域,优化代理授权粒度

Cloudflare 推出了可选 OAuth 作用域,允许用户在授权屏幕上取消选择单个权限,而开发者可标记哪些作用域可被放弃。此举主要针对 MCP 服务器等代理场景,避免代理请求过多权限。该功能不改变 OAuth 协议,但要求应用检查令牌中的实际作用域并优雅降级。

正文结构化主题已通过公开置信门槛
n8n Releases一手来源产品发布

n8n 发布 1.123.76 修复安全漏洞

n8n 发布了 1.123.76 版本,主要修复了核心依赖 browserslist 的安全漏洞(CVE-2026-73088/73089),将其升级至 4.28.7 版本。该修复旨在提升平台安全性,避免已知漏洞带来的风险。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

电路引导权重缩放:提升LLM安全性的新方法

该研究从机制可解释性角度揭示了LLM安全行为的电路级组织,包含有害检测头、安全神经元和拒绝头三个阶段。通过跨六种LLM的权重缩放干预,在攻击下安全率提升26.5%,同时标准基准准确率仅下降1.7%。研究提供了因果证据,表明安全行为由跨层组件协同实现,且该结构可迁移。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

轨迹裁判:仅看结果的 LLM 裁判在智能体轨迹上的盲区

本研究构建了一个确定性工具使用环境,通过脚本化 oracle 策略和故障注入器,对五种 LLM 裁判(包括仅看结果的裁判、步骤评分裁判等)在 400 条轨迹上的表现进行了评估。结果显示,仅看结果的裁判对静默故障的召回率仅为 45%,且会误报 33% 的正确轨迹;而步骤评分裁判在零误报的情况下达到了 77% 的静默召回率。研究还发现,自一致性集成成本增加三倍但

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

基于指令微调小语言模型的渐进式老年人金融诈骗增量风险评估

Kansas State University的研究人员提出了一种基于累积对话轮次的老年人金融诈骗风险评估框架,通过逐步聚合对话内容并重新评估风险,实现实时监控。他们构建了包含投资、慈善和技术支持诈骗场景的多轮对话数据集,并微调了Phi-4、LLaMA-3.2、DeepSeek-R1和Qwen3等小型语言模型。实验表明,Phi-4和LLaMA-3.2在参数规

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

分布式隐性危害:多模态大模型视频审核的组合安全盲点

该研究提出“分布式隐性危害”(DIH)概念,指多模态大模型在视频审核中无法识别由看似无害的片段组合而成的有害内容。作者构建了包含9000多个视频的DIH数据集和基准,测试30多个MLLM后发现即使最强模型检测率也低于45%,真实视频中同样失败。通过两阶段后训练,检测准确率提升超60个百分点,表明该缺陷可通过针对性训练缓解。

正文结构化主题已通过公开置信门槛
量子位模型发布

Claude Fable 5.1发布:8项基准第一,降价45%,反蒸馏机制上线

Anthropic发布了Claude Fable 5.1和Mythos 5.1模型,在8项基准测试中排名第一,价格最高降低45%。新模型在科学研究和代码任务上表现突出,并引入了反蒸馏机制,通过签名验证防止思维链被篡改。此外,Mythos 5.1在蛋白质设计、金星地形图生成和GPU加速等科研应用中展示了显著成果。

正文结构化主题已通过公开置信门槛
The Verge AI模型发布

Anthropic 发布 Claude Fable 5.1,代理任务成本降低 45%

Anthropic 发布了新一代 AI 模型 Fable 5.1 和 Mythos 5.1,其中 Fable 5.1 性能更强,价格比 Fable 5 降低约 25%,在复杂代理任务上最高可降低 45%。新模型改进了数据保留和防护机制,并已全面上线,而 Mythos 5.1 仅限 Project Glasswing 参与者使用。

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.101.0-dev.1 发布:镜像签名验证及多项功能更新

LiteLLM 发布 v1.101.0-dev.1 版本,该版本所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签进行验证的方法。更新内容涵盖代理性能改进、类型清理、Bedrock 和 Vertex AI 修复、OpenAI 工作负载身份联合支持、新增 /v1/responses/input tokens 端点、GigaCha