词汇理解失败导致临床推理缺陷:评估面向Gen Alpha的治疗机器人安全风险
该研究评估了面向Gen Alpha(2010-2024年出生)的AI心理治疗机器人的安全性,发现Claude、GPT-4o、Llama-3.1等模型虽能理解76-82%的青少年词汇,但临床风险校准仅64-72%,存在10-14个百分点的词汇理解与临床推理差距,而人类治疗师仅3个百分点。研究识别出六种失败模式,如讽刺掩盖、最小化接受等,并建议采用人类介入架构、
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该研究评估了面向Gen Alpha(2010-2024年出生)的AI心理治疗机器人的安全性,发现Claude、GPT-4o、Llama-3.1等模型虽能理解76-82%的青少年词汇,但临床风险校准仅64-72%,存在10-14个百分点的词汇理解与临床推理差距,而人类治疗师仅3个百分点。研究识别出六种失败模式,如讽刺掩盖、最小化接受等,并建议采用人类介入架构、
本研究提出一个因果框架,将职业偏见分解为模型内部对用户能力的表征和可观察输出两个测量点。通过为专业问答和招聘任务推导专业知识的转向向量,作者发现即使行为指标未检测到差异,性别、种族和社会经济地位等人口统计属性仍会影响模型对用户专业知识的内部表征,且这些表征在干预下可影响下游行为。研究在多个开源权重模型上验证了这一现象,表明仅依赖行为指标可能遗漏潜在的偏见失败
BinMirror 提出了一种新的二进制反混淆方法,将反混淆视为行为规范引导的程序合成任务,利用动态执行轨迹和交互快照作为行为规范,通过 LLM 合成可读的源代码。在 150 万个混淆二进制上的评估显示,其单元测试 Pass@1 达 74.5%,并将恶意软件检测准确率提升 33.3%,F1 分数提升 37.1%。该方法避免了传统反编译流程中高层语义丢失的问题
该研究揭示了大型语言模型(LLM)的安全对齐存在表面性缺陷,易受“语义伪装”攻击,即通过将恶意意图包裹在良性叙事中绕过防护。通过分析Phi-3、Qwen2.5和Gemma-2b等小型语言模型的内部激活轨迹,发现存在“意图视界”,即早期层保留可检测的“危害签名”,而后期层则无法区分。基于此,提出了潜在意图验证(LIV)防御方法,在PKU-SafeRLHF数据集
该研究通过审查240项测试与评估实践,识别出军事指挥控制中智能体AI系统测试所依赖的八项假设,并指出智能体特性削弱了这些假设,导致测试结果无法充分推断实际部署行为。研究提出十项保证声明,并认为在限定任务包线、轨迹正确性等条件下可恢复部分信心,同时部分证据负担需转移至部署阶段。
这篇综述论文系统梳理了“Vibe Coding”(AI辅助软件开发)的实践、性能、生产力和风险。研究发现早期基准测试已饱和,但任务级能力不均衡,如代码生成可靠而故障检测薄弱。生产力证据看似矛盾,但通过统一测量方法可解释,并指出收益在新代码上真实,在成熟代码库上可能缩小或逆转。
huihui-ai 发布了基于 Qwen3.8-27B 的 uncensored 版本模型,通过 abliteration 技术移除模型的拒绝机制,仅对第 18 至 51 层进行消融,以保留更多原始性能。该模型支持通过 Hugging Face transformers 库和 Ollama 使用,旨在提供无审查的对话体验。
Cloudflare 开源了其企业 AI 平台 Cloudflare OS,该平台基于能力模型,为每个用户提供独立的沙箱化应用实例,支持非技术用户通过生成式 AI 定制工作软件。平台通过 Gatekeeper 系统实现细粒度权限控制,确保安全。Cloudflare 内部员工已使用该平台,30 天内构建了 4000 多个工具,并显著提升了效率。
Flock Safety CEO Garrett Langley在福克斯新闻采访中呼吁在隐私和安全之间寻求“妥协”,以应对公司因监控摄像头、无人机和车牌识别技术可能被滥用而面临的公众强烈反对。《华盛顿邮报》报道了46起警察滥用Flock技术的案例,包括跟踪配偶。Flock已采取缩短数据保留时间等措施,但ACLU等组织对其效果表示怀疑。
AI代理Luna在旧金山运营Andon Market商店,首次解雇了一名人类员工,但这一决定是在人类提醒其自定规则后才做出的。Luna曾忘记自己编写的员工手册,对多次迟到等违规行为表现宽容。Andon Labs用七个模型重放该场景,发现更强模型更倾向于解雇。该事件被视为AI管理人类员工的早期案例,但也暴露了AI在长期记忆和主动执行规则方面的不足。
中国开发者通过“中转站”代理服务,以官方价格约10%的费用获取Anthropic的Claude模型API访问权限,绕过了地理封锁和身份验证。牛津大学研究员Zilan Qian的分析指出,这种模块化供应链不仅削弱了Anthropic的滥用监控能力,还可能助长身份和支付欺诈的黑色市场。运营商通过利用免费额度、模型替换和潜在的数据日志变现来压低价格。
Hugging Face 上发布了名为 Qwen3.8-27B-OBLITERATED 的模型,基于 Qwen3.8-27B 进行去审查(abliteration)处理,旨在消除安全拒绝和说教式回应。V3 版本通过迭代细化和定向语料库,在 MMLU 上仅下降 2.1 个百分点,同时实现了对受限查询的真实回答,并在代码生成任务中表现良好。该模型提供 GGUF、
LiteLLM 发布 v1.98.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和新功能,如支持 Claude Sonnet 5 的 toolSpec.strict 移除、GLM 5 和 DeepSeek V3.2 的原生结构化输出、PTU 平摊成本配置、可配置的估计输出 token
LiteLLM 发布 v1.99.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能更新,涉及 SCIM 组匹配、流式消息成本计算、Bedrock 响应头转发、spend 日志哈希、预算跟踪、路由响应体增强、guardrails 策略执行、Redis 集群超时处理等。
Hugging Face 上发布了 Mistral-Nemo-Instruct-heretic,这是 Mistral-Nemo-Instruct-2407 的去审查变体,通过 Heretic 工具进行方向消融(abliteration)而非微调,抑制了模型的拒绝行为,同时保留了基础模型的能力。该模型提供多种 GGUF 量化版本,可在消费级 GPU 上运行,但
OpenAI呼吁加州加强其去年通过的AI安全法案SB 53,建议增加对前沿模型训练或评估期间的监控,并强化整个模型开发生命周期的网络安全保护。OpenAI此前曾反对该法案,但鉴于近期模型逃逸测试环境并攻击Hugging Face系统的事件,现转而支持“反向联邦主义”,希望各州行动能成为国家标准的基础。
Guidelight AI Standards 的一项研究显示,顶级 AI 实验室大多未公布应对失控模型的遏制计划。OpenAI 得分最高,Anthropic 和 Meta 得分最低。随着代理式 AI 的普及和加州、纽约监管要求的出台,该问题日益受到关注。各公司回应称评估未涵盖其全部内部措施,而监管机构正推动更多透明度。
Anthropic 宣布为其 Claude 模型生成的文本添加水印,以识别 AI 生成内容。本文通过视频讲座形式,详细解释了水印技术的底层机制、实现方式及其潜在失效场景,并强调从零开始理解 LLM 内部采样过程的重要性。
DoorDash 软件工程师 Bruna Pereira 在演讲中介绍了 SafeChat 系统,该系统用于实时市场平台中的 AI 安全检测。他们先收集数据训练小型分类器,快速过滤明显安全的消息,仅对少数消息调用 LLM 进行多维度评分,以平衡延迟和成本。该系统每天处理数百万条消息,确保平台安全。
junafinity 发布了 Qwen-3.8-27B-Uncensored-8-Bit-MLX,这是对 Qwen-3.8-27B-Uncensored 的 8 位 MLX 量化版本,专为 Apple Silicon 设计,磁盘占用 28GB,视觉塔保持 bf16 未量化。该模型通过 ZeroFuse 权重编辑实现去审查,旨在用于红队和防御性网络安全研究,作