AWS 在 SageMaker AI 上推出 WhisperX 说话人标注转写容器
AWS 发布 WhisperX 深度学习容器(DLC),在 SageMaker AI 上提供带说话人标注的语音转写能力。该容器封装了 OpenAI Whisper,并加入 wav2vec2 强制对齐实现逐词时间戳,以及说话人分离(diarization)功能,无需 Hugging Face token 即可部署。用户可将其部署到 SageMaker AI 实
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 01:14
AWS 发布 WhisperX 深度学习容器(DLC),在 SageMaker AI 上提供带说话人标注的语音转写能力。该容器封装了 OpenAI Whisper,并加入 wav2vec2 强制对齐实现逐词时间戳,以及说话人分离(diarization)功能,无需 Hugging Face token 即可部署。用户可将其部署到 SageMaker AI 实
Cerebras 博客文章指出,AI 智能体正以更快的速度和规模发动网络攻击,CrowdStrike 报告显示 AI 驱动的攻击操作同比增长 89%,最快突破时间仅 27 秒。OpenAI 的 Greg Brockman 透露已将 25% 的生产工程师调去构建「防御工厂」。Cerebras 借此宣传其推理速度优势,称运行 GPT-5.6 Sol Ultraf
Lovable 联合创始人 Fabian Hedin 在阿姆斯特丹 HumanX 峰会上表示,公司年度经常性收入已突破 6 亿美元,高于 6 月时约 5 亿美元的水平。公司重点发展企业业务,声称财富 500 强中三分之二的企业已在使用其产品,客户包括微软、英伟达和德国电信。Hedin 还称用户在该平台创建的应用每月合计获得近 10 亿次浏览,并强调 Lova
文章探讨为何不能简单地将失控AI与互联网隔离(air gap)。研究者指出,严格气隙虽能提升测试安全性,却会降低真实性和实用性,因为现实评估常需访问外部API和服务。气隙成本高、拖慢研究,且无法消除模型内部潜在风险,还可能被USB等方式突破。专家主张采用分层隔离而非一刀切方案。
TechCrunch 发布文章推广其 Disrupt 2026 大会门票,称距 9 月 25 日优惠截止仅剩两天,可节省最高 200 美元。文章列出参会理由之四:大会提供实用答案,围绕 AI 平台竞争、融资、AI 人才争夺、AI 产品定价、并购等创始人关心的问题展开讨论。大会将于 10 月 13-15 日在旧金山 Moscone West 举行,设 200
Strands Agents SDK 发布 mcp/v0.3.0 版本,包含大量功能更新。主要变更包括:MCP 客户端切换到 @modelcontextprotocol/client 2.0、新增 Agent.shutdown() 清理机制、默认使用 opus 5 和高思考模式、合并 Strands harness、新增 bm25 搜索策略、支持 MCP S
亚马逊高级软件工程师 Bala Ramdoss 在 InfoQ 分享为移动前端设计快速、愉悦 LLM 用户体验的经验。他基于构建 Amazon Lens 和 Lens Live 的实践,指出约 90% 的头部应用已集成 AI,其中 36 个含聊天机器人,但即插即用的聊天机器人服务难以与移动应用深度集成。他分析了对话式前端如何应对 LLM 流式响应带来的延迟与
Google DeepMind 新任负责人 Koray Kavukcuoglu 首次以该部门领导身份接受媒体采访时表示,Gemini 4 已进入精修阶段,公司计划远早于年底发布该模型。自 2025 年 11 月 Gemini 3 系列后,Google 未再推出旗舰模型,而 OpenAI 的 GPT-6 和 Anthropic 的 Mythos 系列已相继发布
Meta在Connect 2026上发布Muse个人智能体,支持语音、实时视频和邮件功能,并推出多款AI眼镜硬件,包括Ray-Ban Meta Gen 3、VR眼镜和Muse Charm钥匙扣设备。Muse已超越ChatGPT登上App Store榜首,但Meta仅预告未发布新前沿模型。此外,Meta收购了语音初创公司WaveForms AI,并发布Muse
该研究提出一个面向文化特定亲属称谓的生成基准,用印地语、泰米尔语和韩语测试五个开源权重模型(GPT-OSS-120B、Sarvam-M、Llama-3.3-70B、GLM-5.1、Kimi-K2.6)在生日祝福和婚礼邀请中生成亲属称谓的能力,并与同一关系-语言单元的四选一选择基线对比。结果显示模型选择正确称谓的比例远高于生成比例,例如GPT-OSS-120B
该研究利用 Upworthy Research Archive 的真实标题 A/B 测试数据,检验 LLM 合成人物(synthetic personas)能否预测真实受众点击行为。结果发现,大多数 A/B 测试本身没有统计上可区分的胜者,而基于人物条件的预测反而比无人物零样本基线更差:无人物基线排名更准(top-1 准确率 49.2% vs 34.6%),
Meta在年度Connect大会上宣布为其个人AI代理Muse推出一系列新功能与集成,包括可实时视频对话的数字虚拟形象(由新模型Muse Realtime Avatar驱动)、接入Meta智能眼镜、支持Mac桌面操作、专属邮箱地址,以及与Stripe、Shopify、PayPal、Best Buy、Walmart等零售和支付伙伴的合作。Muse由多模态模型M
Meta 宣布为其新推出的 Muse AI 智能体进行多项更新:Muse 将获得专属电子邮件地址用于执行任务,用户也可通过该邮箱与智能体沟通;新上线的 Muse Mac 应用将获得操作电脑的能力。Meta 还将为 Muse 增加视频通话功能,用户可与 Muse 虚拟形象进行实时视频对话,并可调整其声音,新的 Muse Realtime Avatar 模型将驱
另有 1 家信源报道
Anthropic 宣布其 AI Claude 在新建湿实验室中「自主发现」了一种类似 Crispr 基因编辑机制的新型酶系统。近 950 个 Claude 智能体在 21 小时内处理 2.1 亿 token,从 DNA 序列数据库中识别出噬菌体中的重复模式,随后经人工分析与实验室验证确认。Anthropic 承认该发现的实际应用尚不明确,此举旨在展示 Cl
另有 2 家信源报道
NVIDIA 技术博客介绍 SWE-Serve,一个与 SGLang 团队合作开发的基准,用 53 个来自 SGLang 已合并 PR 的任务评估 AI 编码代理对推理服务软件的修改。在 19 个含实时服务检查的任务中,同一批补丁排除实时检查时通过率为 69.4%,加入完整验证器后降至 45.9%,约三分之一补丁在真实服务器加载模型后失败。该基准还显示跨多个
Meta 于 9 月 8 日在美国推出个人 AI 智能体 Muse,首周吸引超过 50 万用户,其中日活超 25 万,累计输入超 200 万条提示,并登顶苹果 App Store。Meta 产品负责人 Nat Friedman 承认 Muse 在产品上「深受开源项目 OpenClaw 启发」,用户发现两者部分文件名与内容几乎一致。报道指出,Muse 能否持续
另有 1 家信源报道
llama.cpp 发布 b11136 版本,其 llama-server 现在接受 OpenAI 兼容的 video url 内容类型,并支持 data:video/ 的 base64 URI。此前服务端只接受非标准的 input video 类型且拒绝视频 data URI,导致符合 OpenAI 规范的客户端报错。该改动使 llama-server 能
Radical Numerics 联合创始人兼 CEO Eric Nguyen 在 Latent Space 播客中讨论了生物安全作为 AI 军备竞赛的问题。他指出,Anthropic 的过滤器将网络安全和生物学列为两大风险领域,而能够提升生物能力的模型同样可以帮助防御方跟上步伐。Eric 曾在斯坦福参与开发 Evo 和 Evo 2 基因组语言模型,这些模型
llama.cpp 发布 b11132 版本,新增对 Gemma 4 DSpark 草稿骨干(draft backbone)的支持,包括 GGUF 转换与运行时支持,覆盖全注意力与 SWA 两种 Gemma 4 DSpark 草稿,并支持绑定输出权重与布尔型骨干元数据。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预
Agno 发布 v3.0.11 版本,新增知识检索流水线、MMR 重排序器、Recency 重排序器、页面源迁移工具、Y-API 作为 OpenAI 兼容模型提供商,以及运行输出中的取消阶段字段。同时改进 MCP 工具模式与推理检测,修复工具钩子、MCP 服务器路由、AG-UI 协议支持、WebSocket 工作流等多项问题,并弃用向量数据库级别的 rera