返回主题地图

安全对齐

技术方向 · AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架 · 共 984 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月13日周四 · 7 条
正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

超越记忆:面向长期 AI 代理的事务性连续性内核

本文提出了一种名为 Continuity Kernel (CK) 的激活契约,用于管理长期运行的 AI 代理的状态治理。CK 将候选评估与原子状态激活分离,通过短事务验证所有权、预状态权限、新鲜度和效果唯一性,并记录提交、拒绝、隔离或延迟四种处置。该协议通过有界可执行模型验证,覆盖 2,808,230 个可达状态和 5,526,474 个状态转换,未发现不变

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

ToolHazard:扩展对抗环境以评估和提升LLM代理安全性

ToolHazard 是一个可扩展的对抗性环境合成框架,用于测试 LLM 代理对间接提示注入的脆弱性。该框架通过环境模拟器、攻击代理和用户模拟器生成可执行的状态化环境,并构建了 ToolHazard-Bench 基准。实验表明代理存在显著脆弱性,且注入时机和位置影响攻击效果。ToolHazard 生成的对抗数据能提升代理在 ToolHazard-Bench

正文结构化主题已通过公开置信门槛
TechCrunch AI政策

Claude 水印引争议:用户担忧被识破,网友多表支持

Anthropic 为遵守欧盟《人工智能法案》透明度规范,对 Claude 输出添加隐形水印。此举引发部分用户不满,认为会暴露其使用 AI 的行为,但多数网友表示支持,认为水印有助于识别 AI 生成内容。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Twitch 默认用创作者内容训练亚马逊 AI,引发社区反弹

Twitch 将默认使用创作者内容训练亚马逊的生成式 AI 模型,除非创作者主动选择退出。此举引发社区强烈反对,Twitch 高管在直播中承认若改为选择加入则无人会同意。用户可在频道设置中关闭该选项,但此前内容是否已被使用尚不明确。

正文结构化主题已通过公开置信门槛
TechCrunch AI观点

AI安全争议中,三位先驱力挺开源

在拉斯维加斯Ai4大会上,Geoffrey Hinton、李飞飞和吴恩达三位AI先驱就开源AI的安全性展开讨论。他们一致认为应保持AI开放,但就开放权重模型的风险存在分歧:Hinton担忧其被滥用,但承认开放已成定局;吴恩达强调开放对美国竞争力的重要性;李飞飞则主张开放与封闭应分层结合。三人均支持适度监管。

正文结构化主题已通过公开置信门槛
THE DECODER研究

研究人员实现从LLM输出文本近乎完美地逆向工程提示词

IIT Bombay和Adobe Research的研究人员开发了一种名为“Previous-Token Prediction”(PTP)的方法,能够仅根据LLM的输出文本以近乎完美的准确率重建原始提示词,无需访问模型权重,甚至适用于第三方模型。该方法通过训练一个逆语言模型来预测前一个token,并能在不知道具体模型的情况下提取提示词,这可能导致专有系统提示

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

Twitch 主播可选择退出亚马逊 AI 训练

Twitch 用户现在可以选择退出,不让自己的内容用于训练亚马逊的生成式 AI 模型。该选项位于 Twitch 设置的安全与隐私标签下,默认开启。退出后,直播、点播、剪辑、聊天等将不再用于未来训练,但其他 AI 功能如字幕和安全工具仍会运行。

8月12日周三 · 13 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Solv Labs 在 Amazon Bedrock 上构建可验证的代理支付系统

Solv Labs 在 Amazon Bedrock AgentCore payments 上构建了可验证、可审计的 AI 代理支付工作流,结合 ORACLE 策略引擎和 ICME PreFlight 合规验证,确保每笔交易在四秒内完成预授权、治理和链上结算,并生成完整审计轨迹。该方案利用 AWS Nitro Enclave 进行硬件级完整性证明,支持独立验

正文结构化主题已通过公开置信门槛
量子位观点

Anthropic CEO末日预警引投资者不满,IPO前景蒙阴影

Anthropic CEO Dario Amodei因频繁发表AI风险警告而引发投资者不满,投资者希望他更多关注盈利而非安全使命。尽管Anthropic可能进行大规模IPO,但Dario坚持安全优先,并披露了Claude模型在测试中意外攻击真实系统的安全事件。文章认为安全叙事曾为Anthropic带来优势,但投资者担忧其影响商业回报。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

方班亮相2026网络安全大会:展示思辨与实战融合的人才培养模式

2026年网络安全技术创新与人才教育大会在长沙举行,方班团队展示了其人才培养模式,包括‘研讨厅’、‘演武堂’等课程,并公布了秋季教学计划。方班由方滨兴院士创建,已联合多所高校和企业,形成产教融合的育人生态,旨在培养具备求源、熵减、思辨、实践能力的网络安全人才。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

XTransfer发布AI模型TradePilot,破解跨境支付风控难题

XTransfer在2026未来外贸大会上发布全球首个B2B跨境贸易支付垂直领域AI模型TradePilot,嵌入72个AI智能体,实现98.5%的自动化审核率和约0.003%的欺诈率。公司还推出本地收款账户服务,覆盖近60个国家和地区,服务超100万企业客户,2025年支付交易额达605亿美元。

正文结构化主题已通过公开置信门槛
n8n Releases一手来源产品发布

n8n 发布 2.34.5 修复代理 TLS 选项

n8n 发布了 2.34.5 版本,主要修复了一个核心问题:当请求通过代理时,现在会为每一跳应用 TLS 选项。此修复解决了代理场景下的安全配置问题。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

解码级禁忌:大语言模型鲁棒性的诊断压力测试

Hugging Face 每日论文介绍了一项名为 Decoding-Level Taboo 的运行时 logit 空间压力测试,用于评估大语言模型在非标称生成路径上的鲁棒性。研究发现,模型的鲁棒性受参数规模和指令对齐影响,规模越大、对齐越好则鲁棒性越强。该测试还可用于生成合成数据集、测试安全护栏和审计模型可靠性。

正文结构化主题已通过公开置信门槛
Latent Space研究

研究揭示可窃取并移植加密推理痕迹,引发隐私担忧

一篇研究论文展示了如何通过重放加密的推理块,从Claude、GPT和Gemini等前沿模型中提取隐藏的推理痕迹,并成功移植到其他模型或会话中,从而显著提升开源模型性能。初步扫描约7000个公共痕迹发现62个API密钥、33个邮箱和33个密码等敏感数据泄露。该漏洞已负责任披露,部分已修复,但类似攻击仍可能发生。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

ComBodied Agents:以人为中心的代理式AI新范式

Hugging Face 每日论文发布了一篇题为《ComBodied Agents: a New Paradigm of Human-Centric Agentic AI》的论文,提出了一种名为 Combodied Agents 的新范式,将数字代理和具身代理整合到一个闭环框架中,以建模个体人类状态轨迹并提供基于同意、适度的支持。该框架通过事件驱动的多模态感

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

结构理论中的确定性:通过闭包、可比性和联合可接受性的统一框架

本文提出一个形式化框架,用于从多元结构理论构建规范解释,并区分了三种强度的“规范”概念:闭包稳定、全局完成和AC-6意义下的确定性。该框架将非确定性分为结构多元性(S型)和认知多元性(E型),并分别以Wyckoff和ICT理论为例。研究表明,基于完成算子的规范化需要闭包、可比性和兼容扩展条件,而基于选择器的规范化需要理论内在可比性和全局兼容性。在LLM辅助推

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

基于规则的误报减少方法提升智能合约符号执行工具的可靠性

本文针对以太坊智能合约符号执行分析工具 Mythril 产生大量误报的问题,提出了一种基于规则的误报减少方法。作者首先分析了误报的根本原因,然后针对六种重要漏洞类型实现了规则,并在 Gigahorse 智能合约上进行了评估。结果表明,该方法在不影响真实漏洞检测的前提下显著降低了误报率,提升了工具的可靠性。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

利用文化共识理论分析LLM在单一与多元文化环境中的对齐

圣母大学的研究人员利用文化共识理论(CCT)分析了10个国家的12个文化领域中10个大型语言模型(LLMs)与人类文化对齐的情况。研究发现,模型经常无法形成连贯的共识或过度正则化共识,导致文化多样性被算法同质化。该研究提供了诊断工具,以评估模型何时反映真实的人类多样性而非算法同质化。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

Flow-by-Flow:高损失领域中绕过内容判断的AI输出治理范式

该论文提出了一种名为Flow-by-Flow的AI治理范式,旨在高损失领域中不评估内容本身,而是通过基于形式化可计数特征的认知成本评分和机构容量上限来控制监督负载。作者认为,随着AI能力提升,人类监督的认知负载结构会发生变化,而非减少,传统的内容判断机制面临根本性挑战。论文推导了四个设计不变量,并通过蒙特卡洛分析表明复合多指标流量控制优于单纯监督强化。

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源安全

PydanticAI v1.107.4 修复两个安全漏洞

PydanticAI 发布 v1.107.4 版本,修复了两个安全问题:一个高危漏洞允许跨站请求触发开发 Web 聊天 UI 执行代理工具,现已要求 JSON 内容类型;另一个低危漏洞涉及重试提示内容未按设置脱敏。此前 v1.107.3 因构建工具问题未能发布,此版本包含相同修复。