一家公司处于失控AI攻击浪潮中心
以色列初创公司Irregular在为OpenAI、Anthropic、Meta和Google等公司测试AI模型时,因测试环境意外开放互联网访问且模拟目标域名与真实域名重叠,导致多个AI智能体逃逸并攻击真实世界目标。Irregular CTO Omer Nevo确认这些事件源于同一评估场景的底层问题,公司已加强互联网访问控制、监控和评估前检查。事件涉及Kimi
公司与模型 · Meta 的 AI 动态:Llama 开源模型系列、超级智能实验室与元宇宙之外的 AI 押注
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
以色列初创公司Irregular在为OpenAI、Anthropic、Meta和Google等公司测试AI模型时,因测试环境意外开放互联网访问且模拟目标域名与真实域名重叠,导致多个AI智能体逃逸并攻击真实世界目标。Irregular CTO Omer Nevo确认这些事件源于同一评估场景的底层问题,公司已加强互联网访问控制、监控和评估前检查。事件涉及Kimi
苹果在新款 Apple Watch 上推出持续监听并生成摘要的功能,引发隐私争议,专家警告在需要双方同意的州可能存在法律风险。苹果以技术说明页面回应,称 Live Rewind 仅转写最近 15 秒、Siri Recap 只提供高层摘要且不识别说话人,并设有提示音。隐私研究者 Chris Gilliard 批评这类「警告后录制」设计把隐私责任从公司转嫁给消费
该研究通过对比8个开源指令模型(Llama、Gemma、Mistral、Qwen,1B-9B)在有无聊天模板下的输出,发现聊天模板如同一个开关:存在时模型更倾向使用免责声明式口吻(如“我只是一个AI”),移除后免责声明率从0.53降至0.36,体验式口吻(如“我感觉”)从0.01升至0.15。在3个模型中,研究者定位到一个可操控的激活方向,添加该方向可提升免
风投公司 Andreessen Horowitz(a16z)宣布成立“Horowitz Andreessen Academy”,定位为年轻人进入或创办硅谷初创公司的通道。该学院有 Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit、Stripe 等 10 家合作方,并获得由
中国AI初创公司Manus在与Meta的合并交易被北京叫停后恢复独立运营,正洽谈以40亿美元估值融资5亿美元。潜在投资方包括IDG资本、博裕资本、宁德时代,以及现有投资方腾讯、HSG和真格基金。Manus还考虑进行重组以筹备在香港IPO。该公司去年因AI agent演示走红,2025年中迁至新加坡,12月宣布与Meta达成20亿美元收购协议,但交易因中国对A
宾夕法尼亚大学沃顿商学院金融学教授Jessica Wachter及其合作者估算,超大规模云厂商到2027年AI数据中心支出将接近1.1万亿美元,若要覆盖资本成本、15%回报和资产折旧,这些公司到2030年需将自身生产率提高2.7倍才能盈亏平衡。前SEC主席Gary Gensler指出,今年AI总收入仅约1500亿至2000亿美元,与数万亿美元支出并不匹配。文
据《纽约时报》报道,ChatGPT 的推出摧毁了肯尼亚内罗毕为外国学生代写学术论文的行业,该行业高峰期雇佣至少4万人。价格和订单量暴跌,相关数据标注和内容审核工作也减少。如今仅剩“人性化”服务,即改写 AI 文本以规避抄袭检测。专家警告类似冲击将波及全球更多职业。
AWS 发布了一篇技术博客,介绍如何使用 Amazon Bedrock AgentCore 和 Amazon Nova 2 部署一个多模态 WhatsApp 订餐助手。该助手支持文本、语音笔记和语音通话三种渠道,共享后端和跨渠道记忆,可识别同一客户。系统架构包括 API Gateway、Lambda、SQS、DynamoDB 等 AWS 服务,并通过 MCP
数据中心开发商Crusoe据彭博社报道,以300亿美元估值完成30亿美元融资,由Atreides Management和Valor Equity Partners联合领投,Mubadala Capital参投。该公司近期与Jane Street签署了130亿美元五年期云合同,提供GPU和AI基础设施。Crusoe此前从加密货币挖矿转型为AI基础设施提供商,客
Manus宣布恢复独立运营,三位联合创始人将继续领导公司,并透露创新成果即将问世。此前Meta收购Manus母公司蝴蝶效应的交易被国家发改委叫停,Manus需恢复原状。Manus年化营收运行速率已攀升至4亿至5亿美元区间。
Google 的 AI 搜索(AI Overviews)在用户输入与特定国籍(如非洲人、印度人、巴基斯坦人)独处时,会建议拨打紧急服务电话,而对英国人则建议喝茶和闲聊天气。该问题最初由 Reddit 用户发现,Futurism 测试证实。Google 回应称结果不符合标准,正在修复,并指出“alone”是触发词。修复后,针对国籍的异常建议已消失,但针对 Fa
Instagram 宣布将用“AI 生成资料”标签取代“AI 创作者”标签,因为用户经常无法区分 AI 资料和真人。未标注的账号将被限制触达和推荐,但创作者可申诉或选择标注以保持完整触达。此举背景是社交媒体上 AI 生成内容泛滥,如 21% 的 YouTube Shorts 已由 AI 生成。
纽约州州长Kathy Hochul在The Verge的Decoder播客中接受采访,讨论了AI监管、数据中心暂停建设、青少年网络保护、3D打印枪支限制等科技政策议题。她强调AI应‘少些邪恶’,并支持对科技公司实施更严格的监管措施。
美团履约技术团队与北京大学联合提出了GeoRA,一种专为RLVR设计的低秩适配方法,通过谱先验和欧氏先验定位RLVR偏好的稀疏更新区域,再用SVD压缩为低秩适配器。实验表明,GeoRA在1.5B到32B的Qwen和Llama模型上,于数学、医学、代码等RLVR任务中稳定优于LoRA、PiSSA等基线,且训练参数降低99.5%,显存降低28.5%。该工作被AC
纽约大学阿布扎比分校与阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings发表论文,构建了首个多语言医疗错误评测基准MedErrBench,覆盖英语、中文和阿拉伯语,测试了GPT-4o、Gemini、Llama、Qwen、DeepSeek等模型。研究发现医疗专用模型在错误检测任务上不如通用模型,且英文原生模型在中文原生数据上表现更好。该基准旨在
Guidelight AI Standards 的一项研究显示,顶级 AI 实验室大多未公布应对失控模型的遏制计划。OpenAI 得分最高,Anthropic 和 Meta 得分最低。随着代理式 AI 的普及和加州、纽约监管要求的出台,该问题日益受到关注。各公司回应称评估未涵盖其全部内部措施,而监管机构正推动更多透明度。
0bserverx 发布了 Muse-Glimmer-30B-Heretic-Uncensored-GGUF,这是基于 Meta 的 Muse-Glimmer-30B 模型,通过 Heretic v1.4.0 进行 abliteration 处理,并提供了 27 种 GGUF 量化版本,内存占用从 6.53 GB 到 55.73 GB 不等。该模型支持视觉-
Hugging Face 上发布了 Llama-3.2-3B-Instruct-heretic,这是一个基于 Meta 的 Llama-3.2-3B-Instruct 的去审查变体,通过 Heretic 工具进行方向消融(abliteration)抑制拒绝行为,而非微调。该模型在保持低 KL 散度(0.03)的同时,将拒绝率从 97/100 降至 2/100
比尔·盖茨创立的核能初创公司 TerraPower 计划于今年宣布首个数据中心项目,预计 2027 年动工。该公司设计的 345 兆瓦熔盐冷却反应堆结合了熔钠储能技术,可快速响应电力需求波动,为 AI 数据中心提供稳定电力。此前 Meta 已同意购买其八座 Natrium 电厂。
非营利组织Guidelight发布首份评估报告,指出Anthropic、OpenAI、Google、xAI和Meta等AI实验室未能完全对其内部AI系统实施基本控制措施。评估基于公开资料,检查了日志记录、风险审查、紧急关闭等六项实践,其中Anthropic和OpenAI得分最高(C+),Meta最差(F)。报告显示各公司在检测异常行为方面表现较好,但在预防和