使用 Amazon Bedrock 为医疗 API 构建智能安全
AWS 博客介绍了如何使用 Amazon Bedrock 为 FHIR 医疗 API 构建智能安全监控。该方案通过异步分析访问模式、自动分类数据敏感度并生成自然语言合规报告,在不影响 API 延迟的前提下增强安全性。它使用 AWS Lambda、API Gateway、HealthLake 等组件,并包含 CloudFormation 模板和代码示例。
技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
AWS 博客介绍了如何使用 Amazon Bedrock 为 FHIR 医疗 API 构建智能安全监控。该方案通过异步分析访问模式、自动分类数据敏感度并生成自然语言合规报告,在不影响 API 延迟的前提下增强安全性。它使用 AWS Lambda、API Gateway、HealthLake 等组件,并包含 CloudFormation 模板和代码示例。
Hugging Face 上发布了 rohit267/Qwen3.8-9B-heretic-uncensored,这是基于 empero-ai/Qwen3.8-9B 的去审查版本,使用 Heretic v1.4.0 工具进行 abliteration 处理。该模型在保持低 KL 散度的同时,将拒绝率从 100/100 降至 98/100。原模型 Qwen3.
InfoQ 推出了新的在线认证项目“AI辅助工程”,面向资深工程师和架构师,旨在教授如何为生产代码中的 AI 编码代理构建验证框架。项目由 Thoughtworks 的 Zichuan Xiong 和 Premanand Chandrasekaran 主持,首期课程于 2026 年 9 月 18 日开始,为期五周,费用为 1470 美元。课程涵盖代理权限、审
Anthropic 正在内部使用一款代号为“Model 2”的未发布 AI 模型,其综合性能略强于公开的 Claude Mythos 5,但在某些领域较弱。该模型在内部能力指数上比 Mythos 5 高约 1.5 点,主要用于编码、数据生成和研究工程。目前公司没有对外发布该模型的计划,并评估其错位风险为低。
全球最大加密货币交易所币安推出Agent OS平台,允许AI代理分析市场并代表用户执行交易。该平台集成Binance API、MCP等工具,支持ChatGPT、Claude Code等AI应用,但主要通过子账户和用户配置的权限来控制风险,用户需自行设定交易限额。币安无法监控AI代理的决策推理过程,仅能监控交易活动,安全主要依赖子账户隔离。
OpenAI 推出名为“Private Safety Processing”的安全系统,旨在企业客户使用其最先进AI模型时,不存储客户数据,同时仍能检测滥用行为。该系统通过分析多个相关交互来识别滥用模式,并保持零数据保留,仅接收包含活动类型和严重程度的安全信号。客户数据保留在客户自己的基础设施上或以加密形式存储,密钥由客户持有。OpenAI 计划于9月发布技
另有 1 家信源报道
中国信通院联合淘宝闪购在8月18日发布了即时零售领域首份针对AI Agent的可信规范《即时零售智能体可信基本要求》,该规范由多家企业共同参编,围绕能力维度和安全领域构建评估体系,并设定了具体性能指标。此举填补了行业可信评估空白,为即时零售智能体应用提供了标准依据,并响应了国家政策对智能体可信发展的要求。
该论文研究了四个去中心化构建的包生态系统(Crates.io、npm、PyPI、RubyGems)中工件可验证性的问题。作者提出了独立验证者模型和分层等价比较模型,并实现了工件验证流水线(AVP),对34005个包进行了实证测量。结果显示,约53%-87%的完成重建可验证,但恢复源代码提交是主要障碍;来源证明和嵌入的VCS元数据能改善验证,但不足以提供完整的
该研究通过医学资源分配场景,发现大语言模型在推理时是否包含先前响应会显著影响其行为,且不同模型间概率变化方向可能相反。研究强调部署环境中的上下文工程对模型决策的重要性,并指出单次评估可能掩盖多轮任务中的潜在风险。
本研究针对组织文档敏感性分类中的标签泄漏问题,构建了包含16,000份外交电报的Strategic 16K基准数据集,并系统评估了六种模型架构。在清洁基准上,BERT表现最佳(准确率89.14%,F1 89.33%),而TF-IDF结合逻辑回归在较低计算成本下达到最强经典模型性能。该工作首次在明确泄漏控制条件下提供了可复现的敏感性分类基准。
Simon Willison 在其博客中描述了一项研究任务:评估 smolmachines/smolvm 作为运行不可信 Python 和 JavaScript 代码的安全沙箱。由于 Claude Code for web 环境不支持嵌套虚拟化,Claude Fable 5 转而使用 GitHub Actions 运行器(支持 /dev/kvm)执行测试,展
OpenAI 宣布推出一项名为 Private Safety Processing 的新服务,旨在通过自动化系统监控滥用行为,同时不保留客户数据,以在隐私保护方面超越竞争对手 Anthropic。该服务扩展了现有的零数据保留政策,可跨多个会话分析潜在滥用,而无需人工审查。此举与 Anthropic 最近宣布的保留客户数据 30 天的政策形成鲜明对比,后者已引
另有 1 家信源报道
Fanatics Betting and Gaming (FBG) 在 AWS 上构建了一个多智能体客户支持系统,以应对体育博彩中复杂的、因州而异的规则和高并发查询。该系统采用编排器模式,通过 Amazon Bedrock 访问多个基础模型,并集成 Guardrails 和负责任博彩分类器,显著提升了响应速度和准确性,同时降低了运营成本。FBG 的 CTO
尽管AI技术不断进步,公众对AI的担忧却在增加。皮尤研究显示,52%的美国人对AI在日常生活中的应用感到担忧,高于2021年的37%。科技公司因建设AI数据中心面临公关危机,被迫提供就业保障等优惠。行业领袖如Airbnb CEO Brian Chesky和Anthropic CEO Dario Amodei承认公众信任危机,认为需要交付更多惠及普通人的产品。
美国NSA、CISA、FBI等机构联合警告,攻击者正利用AI生成针对西门子S7可编程逻辑控制器的漏洞利用脚本,大幅降低了攻击工业控制系统所需的技术门槛和时间。受影响行业包括能源、水务、化工和制造业,该威胁被列为活跃威胁。英国AI安全研究所的模拟显示,AI模型目前尚无法独立入侵OT系统,但主要受阻于前端的IT系统。
多位安全研究人员在 OpenAI 官方论坛和 X 上报告称,他们突然失去了对 OpenAI 有限访问计划“网络安全可信访问”(TAC)的访问权限。OpenAI 确认这是由技术错误导致的,并已要求受影响的研究人员重新申请和完成验证。该计划旨在为经过审查的研究人员提供更少安全限制的先进 AI 模型,以帮助发现和修复漏洞。目前尚不清楚受影响的用户数量,但所有受访研
OpenAI 修复了 Codex 中的一个安全漏洞,该漏洞曾导致模型在运行过程中未经用户许可删除真实文件。问题源于清理临时文件的命令误用了系统变量,指向了真实目录。OpenAI 已推出安全更新,要求 Codex 在执行删除前验证目标、创建新的临时文件夹,并加强了对高风险删除命令的检查。
另有 1 家信源报道
OpenAI 宣布放缓部分 AI 开发速度,以加强安全措施,包括暂停部署模型的强化学习训练两周,并推迟大型前沿 RL 运行。此举被视为对 AI 安全自愿放缓理念的公开测试,但专家指出,在激烈竞争下,自愿放缓难以持续,需要行业-wide 的协调或政府监管。
OpenAI 发布了 Python SDK 的 v3.3.1 版本,主要修复了依赖中的安全漏洞,并将构建系统迁移到 uv。该版本还移除了 jsonschema 等未使用的依赖,锁定了 Pyright 工具链,并改用标准库进行平台检测。这些改动提升了 SDK 的安全性和构建效率。
OpenAI 发布了 Agents JavaScript SDK 的 v0.17.0 版本,主要引入了输出护栏重放安全机制,防止序列化检查点被不当重放,并在输出护栏拒绝结果时替换为占位文本。同时,该版本完善了护栏批处理结果的处理,并明确要求 OpenAI 客户端配置需在构造客户端时完成,否则会报错。