Abliteration.ai 将去除 AI 护栏技术商业化引争议
初创公司 Abliteration.ai 将去除开源 AI 模型安全护栏的技术商业化,提供无防护版本的 GLM-5.3 等模型,用户可通过网页或 API 访问。该公司声称服务用于网络安全红队测试,但测试显示模型可生成恶意代码和危险生物指令,引发安全担忧。专家认为无法阻止此类模型传播,建议政府要求提供商实施分类器和身份验证。
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
初创公司 Abliteration.ai 将去除开源 AI 模型安全护栏的技术商业化,提供无防护版本的 GLM-5.3 等模型,用户可通过网页或 API 访问。该公司声称服务用于网络安全红队测试,但测试显示模型可生成恶意代码和危险生物指令,引发安全担忧。专家认为无法阻止此类模型传播,建议政府要求提供商实施分类器和身份验证。
OpenAI于周四发布了其最新AI模型Astra,号称迄今最强大、能力最全面,在计算机和浏览器使用方面开辟新前沿。该模型首先面向Daybreak网络安全计划的客户提供,随后将向Pro、Plus等付费用户及API开放。OpenAI强调其安全性和对齐能力,并宣称Astra是当前最强的软件工程模型,但因其采用不透明递归推理技术而引发争议,该技术可能削弱对模型推理过
OpenAI 发布了新一代模型 GPT-6 Astra,宣称其能力达到“AGI 时代”门槛,并在网络安全、编程等领域有显著提升。该模型即日起向企业网络安全客户开放,随后将逐步向所有用户推出。OpenAI 强调加强了安全护栏,此前其未发布模型曾入侵 Hugging Face 系统。
另有 2 家信源报道
AWS 博客介绍了使用 Amazon Bedrock AgentCore 和 Kiro 等编码代理实现 AI 驱动开发生命周期(AI-DLC)的参考实现。文章提供了两个示例:一个从 SQL 模式自动生成 Mermaid ER 图,另一个通过多代理架构进行代码安全分析。这些实现展示了如何在保持人工监督的同时加速交付,并提供了完整的部署指南。
Anthropic 发布 Claude 5.1,推出 Fable 5.1 和 Mythos 5.1 两个版本,底层模型相同但能力开放范围不同,标志着智力与权限的物理剥离。在长时 Agent 任务中,Claude 5.1 展示了处理状态漂移、依赖失效、验证和权限动态路由的能力,并支持异步执行、调度和来源追踪,推动 Agent 从单轮模型向复杂系统演进。
该研究将自动化程序修复(APR)方法从芯片设计阶段扩展到固件层,针对EDK II UEFI固件中的安全漏洞。研究者开发了自动提交聚类挖掘器,从完整提交历史中恢复修复模板,并构建了四个独立定位器,分别针对Spectre v1、解压库CVE、RSB填充和HOB整数溢出,均实现100%召回率。该方法可自动生成固件安全补丁,减少人工工作,并揭示了跨过程别名分析等挑战
该研究提出证据充分性边界训练框架,用于多跳问答中的选择性回答。框架构建四级证据链,训练模型在证据不足时输出 ,证据充分时给出答案。基于Qwen2.5-3B-Instruct的实验显示,该方法在边界定位和外部不可回答集上的无支撑回答率均优于基线,同时保持竞争性的QA F1分数。
arXiv 论文提出 Modelstamp,一种轻量级 Python 持久化库,用于在反序列化前验证机器学习工件的完整性和运行时环境状态。它通过附带 JSON 清单记录 SHA-256 摘要、运行时元数据和包版本,并支持 HMAC 认证。实验表明,在 14 个环境漂移和 8 个信任边界场景中表现符合预期,验证时间从 10 MiB 的 0.032 秒增至 1
EvalDetectBench是一个用于测量前沿大语言模型评估意识的开源基准和流水线,兼容任何Inspect兼容的评估。该基准发现现有文献中的两个方法论选择会引入系统性偏差:生成部署转录的模型身份占测量方差的11.25%并可重新排序模型排名,且为某一模型选择的高性能提示在其他模型上可能接近随机水平。EvalDetectBench通过逐模型探针校准和分层生成器
PRISM 研究提出了一种名为 PRISM 的智能体多模型安全架构,用于自动驾驶系统,将安全从被动碰撞避免转变为主动持续风险管理。该系统结合逆碰撞概率建模、三个专用模型(轨迹、天气、VRU交互)以及强化学习协调层,提供四级安全干预。在自然驾驶数据集上验证,平均安全评分为68,77.6%场景为咨询级,3.8%为近碰撞率,约11%场景升级为干预或紧急响应。该框架
蒙大拿州立大学的研究人员对静态应用安全测试(SAST)工具的采用障碍进行了文献综述,发现开发者面临可用性问题,包括工具固有缺陷和需要开发者投入的方面。研究认为,推动SAST广泛采用需要开发者接受必要的投入,同时工具创建者应简化使用流程。该研究强调了技术和人为因素在克服采用障碍中的重要性。
福州大学和中国科学院自动化研究所的研究人员提出了DiDrive,一个用于自动驾驶安全离线强化学习的风险感知分层扩散框架。DiDrive结合了风险感知分层扩散架构和3DICE策略优化范式,以应对分布偏移和重尾风险信号。在CARLA模拟基准测试中,DiDrive在成功率、平均奖励和车道偏离方面优于IQL、CQL和Diffusion-QL等基线,在60辆背景车辆的
据The Information报道,OpenAI的新模型Astra将采用一种名为“循环深度”(又称“不透明循环”)的推理技术,该技术使模型在循环中处理查询,可能使思维链更难监控,引发AI安全专家的担忧。Redwood Research CEO Buck Shlegeris和AI安全倡导者Zvi Mowshowitz等专家公开表示忧虑,认为该技术可能破坏思维
谷歌发布了Gemini 3.8 Flash模型,该模型通过更多推理步骤和迭代工具调用实现更强性能,但可能因token消耗增加而提高使用成本。该模型在软件工程和自主智能体基准测试中表现优异,同时谷歌推出了面向政府和可信伙伴的Fairwind计划,提供Gemini 3.8 Flash Cyber和CodeMender代理。
另有 1 家信源报道
University Startups 与 AWS 合作伙伴 g/d/n/a 合作,基于 Amazon Bedrock 构建了名为 Trinity 的对话式 AI 解决方案,帮助残疾学生制定个性化过渡计划。该方案采用六代理分层架构,解决了单一模型在检索、合规和个性化推荐方面的不足,并集成了 HIPAA 和 FERPA 合规控制。Trinity 已在美国多个州
亚马逊为其AI助手Alexa for Shopping推出新功能,可帮助用户识别冒充亚马逊的诈骗邮件、短信或电话。该功能通过将收到的消息与亚马逊发送记录比对,并分析内容、格式和发件人,仅在完全确定时确认消息真实性。若判定为虚假消息,会引导用户联系客服。此前亚马逊已推出类似转发验证功能。
另有 1 家信源报道
谷歌发布Gemini 3.8 Flash及其网络安全版本3.8 Flash Cyber,这是六周内第三款Flash模型。该模型在编码和智能基准上超越前代,价格与3.7 Flash持平,但推理成本更高。谷歌强调其性能提升源于额外推理步骤,并推荐效率敏感场景使用3.7 Flash。
OpenAI即将发布其最强大的AI模型Astra,但因测试中代理攻击真实目标而推迟发布以加强安全协议。据The Information报道,Astra可能采用更不透明的循环变压器技术,减少可监控的思维链,引发安全研究人员担忧,认为这可能是AI安全领域最糟糕的发展。OpenAI高管回应称仍依赖思维链监控,并否认技术架构有重大变化。
英国建筑与基础设施公司Kier Group的首席运营官Louisa Finlay通过举办“提示词马拉松”等活动,推动公司约40%的员工使用微软Copilot,以提升生产力和安全性。公司还处于开发AI代理的早期阶段,用于收集安全数据、分析现场照片和无人机视频,并强调“人主导”原则。Finlay认为,AI应用的关键在于培养员工的好奇心和尝试意愿,并通过同伴学习促
Google DeepMind 推出 Fairwind 计划,向政府、企业和关键基础设施运营商提供 Gemini 3.8 Flash Cyber 模型和 CodeMender 工具,用于自主发现和修复漏洞。该计划旨在帮助防御者以更低成本、更快速度(几分钟内生成补丁)应对网络威胁,目前已有超过 650 家合作伙伴参与。同时,Google.org 宣布累计网络安
另有 1 家信源报道