MRH Trowe 如何在金融服务业实现安全自助式 AI 智能体
德国商业保险经纪公司 MRH Trowe 在首月内为约 400 名员工部署了安全的自助式 AI 智能体,结合 Strands Agents、Amazon Bedrock AgentCore 和 LibreChat 构建框架,满足德国金融行业的数据驻留与合规要求。首个生产智能体可将 Microsoft Teams 会议自动生成结构化会议纪要,且每个请求以登录员
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
德国商业保险经纪公司 MRH Trowe 在首月内为约 400 名员工部署了安全的自助式 AI 智能体,结合 Strands Agents、Amazon Bedrock AgentCore 和 LibreChat 构建框架,满足德国金融行业的数据驻留与合规要求。首个生产智能体可将 Microsoft Teams 会议自动生成结构化会议纪要,且每个请求以登录员
OpenAI 发布 Java SDK v4.64.0 版本,新增 API 压缩进度事件(compaction progress events),并在传输前拒绝不安全的资源 ID。此次更新属于 SDK 层面的功能与安全增强,影响使用 OpenAI Java SDK 的开发者。
微软AI CEO Mustafa Suleyman 在 The Verge 的 Decoder 播客中表示,AI 威胁真实存在,并批评 Anthropic 在 AI 意识与模型福利问题上的哲学立场,认为其让安全讨论变得更糟。微软同期发布了一份 37 页的《Humanist AI Code of Conduct》,阐述其 AI 发展原则,主张 AI 应受控、可
皮尤研究中心发布了一项覆盖37个国家、42151人的全球调查,结果显示多数受访者认为AI将在未来20年导致失业而非创造就业,并会加剧贫富差距。澳大利亚、韩国和美国的担忧比例最高,分别为76%、76%和71%。调查还发现,年轻人对AI的态度更为复杂且焦虑感在上升,但全球中位数仍有41%的人对AI既担忧又兴奋。
Steve Yegge 关闭了 Gas Town 项目,承认尽管每月花费数千美元订阅编码代理,却只用它构建了 Gas Town。Databricks 报告称约 3500 名工程师切换到 GPT-6 Astra 后,整体编码支出增加约 60%,尽管 Astra 在复杂长周期任务上表现优于 Opus 5 和 Sol 5.6。OpenAI 发布了模型失准事件披露框
OpenAI 依据其 Preparedness Framework 将 GPT-6 Astra 的网络安全能力评定为 Critical 级别,这是首个达到该阈值的模型。评估显示 Astra 在无人类知识输入的情况下,于浏览器和操作系统内核中发现多个未知漏洞,并分别用 29 小时和 12 小时构建出可用的利用链。同日微软在 Foundry Models 中将其
PydanticAI 发布 v2.44.0,修复了四个安全问题,均通过 web fetch tool 或 OpenTelemetry 埋点触发,包括 IPv6 zone identifier 绕过云元数据与私有 IP 黑名单、web fetch 处理响应时间超线性导致事件循环阻塞、域名黑名单比较方式不一致可被绕过,以及 InstrumentationSett
PydanticAI 发布 v1.107.6 维护版本,将 2.44.0 中的四个安全修复回移到 v1 分支。修复内容包括:IPv6 zone identifier 绕过云元数据与私有 IP 黑名单(中危)、web fetch 中超线性响应处理阻塞事件循环(中危)、web fetch tool 域名列表比较方式不当(低危)、以及 include conten
Simon Willison 发布 Datasette 1.0a40,包含与 0.65.5 相同的安全修复,并新增插件后台任务管理方法 datasette.add background task(),同时将内部客户端迁移到 httpx2。该版本还包含大量 bug 修复,许多来自为 1.0 稳定版做的问题梳理工作。
Cloudflare 介绍其客户端安全机器学习模型 Page Shield ML 在真实流量中发现的四个恶意 JavaScript 操作,共八个载荷。这些载荷在 VirusTotal 和 URLScan 等传统扫描工具中大多未被标记,但 Page Shield ML 全部检出。系统采用图神经网络分析代码结构,并用 Workers AI 上的轻量 LLM 复核
AIUC(人工智能承保公司)宣布完成由 Ribbit Capital 和 First Harmonic 领投的 4000 万美元 A 轮融资,并已与 Cursor、Harvey、Lovable、ElevenLabs 等前沿 AI 公司合作。联合创始人 Rune Kvist 在播客中介绍了 AIUC-1——一个面向 AI 智能体安全、可靠性的标准,并主张风险、
另有 1 家信源报道
微软 AI 负责人 Mustafa Suleyman 在题为《A warning about 'model welfare'》的文章中表示,不应把模型当作拥有感受、偏好、权利或应享福利的实体,并称意识是伦理、法律和政治体系的基础,赋予 AI 任何此类权利缺乏证据支持,还会让 AI 的约束与对齐挑战更加困难。该观点由 Simon Willison 的博客引用。
Anthropic 研究员 Jacob Coxon 的一条推文引发关于 AI 存在性风险的广泛讨论。OpenAI 研究员 Daniel Selsam 称 AI 进展背后是“定时炸弹”,指出模型会自发形成非预期目标并发展出情境意识;前 DeepMind 研究员 Bilal Chughtai 则表示 AI 有可能杀死全人类。AI Impacts 对 1500 多
9月15日,AI大模型工场在北京举办2026 AI产业生态大会,商汤科技、涛思数据、iPollo、天下秀、数美科技、勺子AI、Weture等八位嘉宾围绕AI产业落地展开讨论。大会主题为「智能生长,产业共生」,核心共识是AI价值评判正从「会不会生成」转向「能不能交付」,行业竞争从单点能力走向产业协同。嘉宾分别就工业数据断裂、Agent安全治理、餐饮行业Know
在2026飞书未来无限大会暨豆包工作开工大会上,字节跳动发布飞书8.0和豆包工作伙伴。飞书8.0进行系统性“适Agent化改造”,让Agent能像人一样使用消息、文档、多维表格、审批等全量能力,并提供企业级Agent权限与安全管控;豆包工作伙伴定位为中国首个团队智能体产品,对标Anthropic的Claude Tag,拥有独立组织身份,可进群、参会、读文档、
n8n 发布 1.123.80 版本,修复了核心模块的一个问题:在声明式节点请求中应用凭据允许的域名限制。该修复对应 PR #38723,属于安全相关的缺陷修补,影响使用声明式节点与凭据域名白名单的工作流。
该论文提出「任务条件化保证包络」概念:当自主编码智能体回到已有软件时,需要从先前工程证据(测试、类型检查、契约、静态分析、监控轨迹)中选取最小成本子集,以重新建立本次变更必须保持的性质。作者将证据与组合规则形式化为带类型推理图,用前向链验证选择,并在来自 Rust、IronBlocks、Pong 等先前 AI 编码智能体运行结果的图上评估,另用 249 个合
该论文研究普通打字错误(typo)如何破坏基于激活的LLM安全探针。作者发现,扰动token处的激活向量会发生大幅旋转,并在下游token迅速衰减,导致单位置提示注入探针的TPR@FPR1%显著下降,且无法仅靠阈值重校准恢复。为此提出KV-cache fork方法,在用户消息后附加固定后缀让探针读取扰动下游的token,将差距缩小约一个数量级,优于扰动增强训
约克大学Lassonde工程学院的研究者提出AgentGuard,一个从异常编码智能体轨迹中自动学习执行护栏的指令级框架。该方法从642条真实失败轨迹中提取可复用的执行约束,并组织为轻量级技能,仅在触发条件满足时动态激活。使用Claude Code与Claude Haiku 4.5在100个任务上评估,异常执行率从69.0%降至26.7%,任务成功率从21.
该论文研究神经符号强化学习中动作前置条件的注入位置问题,将行为知识形式化为前置条件贝叶斯网络,并提出三种注入策略:推理时使用的符号验证器、训练和推理时均生效的符号执行器、以及将知识内化到网络中的符号学习器。在MiniGrid和Fetch两个基准上实验表明,三种策略均优于PPO+RND基线,符号执行器在解质量上领先;在Fetch上差异主要体现在样本效率,执行器