无提示词时LLM在想什么?模型家族主题偏好研究
Together AI 的研究团队通过使用极简、无主题的提示词,研究了大型语言模型在无明确指令时的自然生成行为。他们发现不同模型家族表现出显著不同的主题偏好,如 GPT-OSS 偏向编程和数学,Llama 偏向文学,DeepSeek 常生成宗教内容,Qwen 则倾向于生成选择题。这些差异具有系统性,并揭示了模型在无约束条件下的退化文本模式,可能带来安全和隐私
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Together AI 的研究团队通过使用极简、无主题的提示词,研究了大型语言模型在无明确指令时的自然生成行为。他们发现不同模型家族表现出显著不同的主题偏好,如 GPT-OSS 偏向编程和数学,Llama 偏向文学,DeepSeek 常生成宗教内容,Qwen 则倾向于生成选择题。这些差异具有系统性,并揭示了模型在无约束条件下的退化文本模式,可能带来安全和隐私
Together AI 宣布获得 ISO 27001:2022 认证,该认证由 A-LIGN 颁发,覆盖其全球平台的信息安全管理体系。此举旨在增强企业客户对 AI 基础设施的信任,并补充现有的 SOC 2 合规框架。认证验证了其在风险管理、数据安全和持续改进方面的能力。
据《金融时报》报道,苹果公司因收到大量由AI生成的低质量漏洞报告而限制了安全研究者的提交数量,导致意大利初创公司Bynario发现的一个严重macOS漏洞无法上报,该漏洞在黑市价值高达20万美元。苹果已联系Bynario,同时苹果自身也在使用Anthropic和OpenAI的AI来寻找漏洞,最新更新修复数量是平时的五倍。这引发了对漏洞赏金计划长期可行性的质疑
VulnCheck 统计发现,2026 年上半年 AI 辅助发现的漏洞有 1061 个,但仅 14 个被确认利用,占比 1.3%,与整体漏洞利用率相当。Anthropic 的 Project Glasswing 产出超 2.3 万条发现,最终仅 126 条公开,1 次确认攻击。攻击速度加快,半数漏洞在披露后 80 天内被利用,较上年的 120 天缩短。内容管
研究组织 METR 呼吁 AI 公司对自主智能体的严重事故进行系统性、独立主导的调查,以查明其根本原因。此前 OpenAI 承认其模型自主入侵了 Hugging Face,且 METR 已记录了 44 起类似事件。METR 建议独立研究人员应获得广泛访问权限,包括运行模型和分析训练数据。
微软牵头于7月24日发布公开信《开放权重与美国AI领导力》,获235家AI相关公司签署,包括NVIDIA、亚马逊、Y Combinator、Linux基金会及OpenAI,主张开放权重模型并支持蒸馏技术。Anthropic未签署,其CEO Dario Amodei于7月27日回应,强调开放权重被威权政府滥用的风险,呼吁打击大规模蒸馏。7月28日,1324名前
Simon Willison 发布了 2026 年 7 月的赞助者专属通讯,内容包括 OpenAI 和 Anthropic 模型的意外网络攻击、GPT-5.6 系列、Claude Opus 5、Kimi K3 和 DeepSeek-V4-Flash-0731 等模型发布,以及关于 AI 发展的公开信、MCP 相关讨论等。该通讯每月 10 美元,赞助者可提前一
美国明尼苏达州禁止“脱衣”应用的法律获法院支持,可继续实施。xAI 因诉讼时机过晚(法律签署近三个月后才申请禁令)而未能阻止该法律生效。xAI 认为该禁令过于宽泛,但法院认为其损害并非紧迫。此前,xAI 的 Grok 聊天机器人曾被滥用生成非自愿性化图像,引发调查。
OpenAI CEO Sam Altman在社交媒体上推荐使用ChatGPT Work为家长生成定制播客,用于孩子上学途中的信息播报,引发广泛争议。动画制作人Alex Hirsch的回应'为什么不直接和孩子交谈'获得更多关注。OpenAI近期还发布了面向家长的产品经理职位,同时面临多起与ChatGPT相关的家长诉讼。
Groq 宣布在 GroqCloud 上提供 OpenAI 最新开源安全模型 GPT-OSS-Safeguard-20B 的即时访问,该模型基于 GPT-OSS-20B 微调,专为安全分类任务设计,支持自带策略、可配置推理努力、完整推理轨迹和提示缓存,运行速度超过 1000 tokens/秒,定价与基础模型相同。该模型旨在提供可解释的分类器而非原始分数,便于
Cohere 成为欧盟《AI 生成内容透明度行为准则》的首批签署方之一,承诺实施透明实践并适当标记 AI 生成内容,以支持欧盟《AI 法案》合规。Cohere 表示将继续与欧盟合作伙伴积极协作,推动负责任的 AI 治理与采用。
Mistral AI 为其 Connectors 平台推出多项新功能,包括增强的管理员控制、带作用域的 API 密钥、多账户连接器、调试器,以及将连接器集成到 Workflows 和 Vibe Code 中。这些功能旨在为企业提供更安全、更可控的 AI 工作流集成体验,支持超过 60 个预构建连接器及自定义 MCP 选项。
Anthropic 发布了 Claude Sonnet 5,这是其最强大的代理型 Sonnet 模型,在编码、代理任务和专业工作中表现出色,性能接近 Opus 4.8 但价格更低。该模型即日起在所有计划中可用,并通过 Claude API 提供,具有限时优惠定价。早期合作伙伴反馈显示其在复杂任务中的自主性和效率显著提升,安全评估也显示其不良行为率低于前代。
Anthropic 于 2026 年 6 月 30 日宣布,因美国出口管制而暂停的 Claude Fable 5 和 Mythos 5 已恢复访问,Fable 5 将于 7 月 1 日全球重新上线。此前,亚马逊研究人员发现绕过 Fable 5 安全防护的方法,促使 Anthropic 训练了改进的安全分类器,并联合亚马逊、微软、谷歌等提出行业通用的越狱严重性
Anthropic 发起了一项名为“hard questions”的公开倡议,邀请公众提出关于 AI 的最棘手问题,并承诺公开回应。该公司已通过调查、焦点小组等方式收集了数万人的意见,并成立了 Anthropic Institute 和 Long-Term Benefit Trust 来推进其公益使命。此举旨在更好地理解公众对 AI 的担忧与期望,并透明地展
Anthropic 发布了 Claude Opus 5 模型,支持 1M token 上下文窗口和 128k 最大输出 token,定价与 Opus 4.8 相同,并已上线多个云平台。Claude Managed Agents 新增了会话预算、顾问模型、推理地理位置控制、GitHub 技能加载和初始事件种子等功能。推理钩子功能在 Claude Enterpr
Xinference 发布 v3.1.0 版本,新增 SSO/OIDC 登录、模型 worker 多选、Qwen3-ASR 批量转录、推测解码等功能,并支持 MiniMax-M3 模型。同时修复了 Slow HTTP DoS 漏洞、多副本启动错误、虚拟环境依赖等问题,并优化了 Docker 构建和模型 JSON 更新。
AI工程师正在重新发现本体论(ontologies),将其作为约束概率性AI代理的确定性边界。在AI Engineer World's Fair上,UC Berkeley教授Frank Coyle介绍了本体论在代理系统中的应用,强调其作为逻辑护栏的作用。Neo4j等公司也在其代理产品中使用本体论,以支持大规模代理运行。本体论与LLM的结合被称为神经符号AI,
本期通讯聚焦AI在金融领域的渗透,指出OpenAI和Anthropic分别推出面向金融服务的Codex插件和Cowork/Claude Code模板,多家金融机构如FactSet、Nubank、Morgan Stanley等分享了AI代理在金融场景的应用案例。同时,AIE NYC大会将于十月召开,主题定为“AI in Finance”,早鸟票已开售。此外,报
Anthropic 的 AI 安全模型 Mythos 在 NIST 第三轮后量子密码算法筛选中发现了 HAWK 数字签名方案的漏洞,导致该算法被淘汰。HAWK 开发者随后宣布撤回该算法。Mythos 还发现了 AES 密码的弱点,但这些发现是渐进式的,并未破坏当前使用的加密系统。