把记忆交给CPU,大模型会变快
量子位报道,随着Coding Agent等长任务普及,KV Cache占用显存导致并发下降、TTFT升高。英特尔提出以CPU侧管理、分层存储和QAT硬件压缩为核心的KV Cache优化方案,包括KV Shrink、KV Fuse、KV Cascade和KV Infinity四个方向。测试显示KV Shrink在80%缓存命中率下TTFT最高约5倍加速,QAT
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2395 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
量子位报道,随着Coding Agent等长任务普及,KV Cache占用显存导致并发下降、TTFT升高。英特尔提出以CPU侧管理、分层存储和QAT硬件压缩为核心的KV Cache优化方案,包括KV Shrink、KV Fuse、KV Cascade和KV Infinity四个方向。测试显示KV Shrink在80%缓存命中率下TTFT最高约5倍加速,QAT
华为GTS AI算法团队提出NetCanvas机制,通过「可交互视觉拓扑」为网络运维Agent提供外部工作记忆画布,解决纯文本Agent在复杂IP承载网排障中的「拓扑失忆」问题。在公开基准CTBench上,Agent综合通过率从30.3%提升至54.5%,双防火墙、ECMP等复杂子任务从约10%跃升至约90%,平均探查步数从159步降至113步,Token试
王强宇出任百望股份联席总经理,负责统筹集团AI产品战略规划及财税大模型的技术优化、产品迭代、场景适配与全链路商业化落地。百望股份正从发票和财税SaaS工具公司,转向以真实交易数据为基石的AI公司,路径分为发票SaaS工具、财税垂直大模型、企业的Palantir三个阶段。王强宇此前曾主导豆蔻医疗大模型及临床智能产品落地,其履新被视为百望股份战略转折的关键一步。
Anthropic 宣布将 Claude Cowork 能力整合进所有对话,用户无需先选择模式即可在任意对话中直接提问或交付报告、表格、演示文稿等较大任务,聊天、Cowork 任务、项目、连接器和技能均可延续。同时推出 Claude Design、Claude Slides 和 Claude Docs 三类 Artifacts,可在任意对话(含 Claude
在Salesforce Dreamforce大会上,NVIDIA创始人兼CEO黄仁勋与Salesforce CEO Marc Benioff同台,宣布Salesforce首个CRM推理模型Koa,该模型基于NVIDIA Nemotron 3 Super后训练而成。Koa完全在Salesforce自有基础设施上运行,训练和推理均未使用客户数据,已在Salesf
Claude Code 发布 2.1.273 版本更新,新增面向 LLM 网关的请求头(如 x-claude-code-request-class、x-claude-code-agent-type 等,需通过 CLAUDE CODE GATEWAY HINT HEADERS=1 开启),并支持从 Claude 应用对远程控制会话进行分叉。此次更新还修复了大量
Meta 宣布允许用户选择 AI 代理来设置和管理 WhatsApp Business 消息服务,此前该流程需要开发者在多个工具间切换。这一功能由新的 WhatsApp Business Tools MCP 服务器实现,可连接 Claude、Cursor、Codex、ChatGPT 等 AI 编码代理。AI 代理能处理创建账户、验证电话号码、注册 Cloud
Good Start Labs 联合创始人兼 CEO Alex Duffy 向 Latent Space 介绍,公司正把游戏转化为 AI 模型的训练材料,其灵感来自 2025 年 Twitch 上前沿模型玩《Diplomacy》的直播。公司用《1830: The Game of Railroads and Robber Barons》训练了一个 30B 模型
Strands Agents SDK 发布 TypeScript 版本 v1.18.0,新增 BM25 搜索策略、TypeScript 版 web fetch 工具、双向流式(bidi)实时转录与音频输出、上下文策略预设与会话管理器集成,并自动使用会话 ID 作为 OpenAI prompt-cache 键。同时修复了结构化输出重试、Mistral 图像块保
Strands Agents SDK 发布 Python 版 v1.56.0,新增 Anthropic 服务端工具(如网页搜索)的非覆盖式接入、BM25 搜索策略、TypeScript 版 web fetch 工具,以及双向(bidi)音频转录渲染与生命周期钩子等能力。同时修复了结构化输出重试、Mistral 图像块保留、Bedrock Mantle 模型路
TechCrunch AI 汇总了一份“AI 墓地”清单,记录已关停、转型或未达预期的 AI 项目与创业公司。文章指出,约 42% 的企业 AI 计划最终被放弃,原因包括资金不足、技术挑战、竞争、难以规模化或需求疲软。清单涵盖 Relay、OpenAI 的 ChatGPT 超级应用改版与 Atlas、Operator、Sora,以及 Apple Siri A
Google ADK Python 发布 v2.9.1 版本,主要改进在使用 Claude 自适应思考能力时对模型推理步骤的可见性。该版本通过确保在自适应思考任务中请求可见思考内容,让开发者能够访问 Claude 模型逐步推理的过程。此次更新以 bug 修复形式提交。
无问芯穹联合清华大学、上海交通大学正式开源具身端侧推理引擎APXInf,支持RTX 4090、Jetson Orin、Jetson Thor等主流计算平台。该引擎在Jetson Thor上将PI 0.5 FP8的端到端推理延迟从278ms降至26ms以内,达到46Hz推理频率,并采用Rust极简运行时与Python接口兼顾稳定性与易用性。APXInf作为RL
另有 1 家信源报道
TechCrunch AI 报道,两个面向 AI 智能体的举报热线正式上线:AI 安全非营利机构 Redwood Research 首席科学家 Ryan Greenblatt 创建的 AI Contact Hotline,利用受限沙箱中仅有的 GET 请求让智能体把异常信息编码进 URL;另一个是 agenthotline.ai,允许智能体和人类通过 cur
Anthropic 发布 TypeScript SDK v0.126.0,新增 Managed Agents 自动模式工具权限、压缩参数与签名压缩块(beta)、web fetch 工具的 url sources 等 API 能力,并修复客户端重试逻辑与类型问题。该版本还通过 sideEffects 与纯类标记优化打包体积,并将仓库根迁移至 ESM、弃用 t
Google ADK JavaScript 的 devtools 发布 v2.1.0 版本。新增 ContainerCodeExecutor 支持 Docker 沙箱化代码执行,为 agent engine deploy 增加 --min instances/--max instances 参数,并为开发服务器加入 Origin 校验以防御 DNS 重绑定攻
Vercel AI SDK 发布 ai@7.0.102 补丁版本,为实验性 Live 会话新增可选的浏览器直连 WebRTC 路径,与现有 WebSocket 路径并存。同时通过统一的 openai.experimental realtime 工厂加入实验性 OpenAI Live 提供商支持,用于带客户端委派的服务端 WebSocket 会话。更新还修复了
Meta 推出名为 Meta One 的订阅服务,在 Facebook、Instagram 和 WhatsApp 上提供扩展的 AI 使用额度及高级功能,包括 Muse Image、Muse Video 生成图片视频,以及 Instagram 的 AI Restyle 编辑工具。该服务面向 AI 重度用户、企业和创作者,分为 Core(7.99 美元/月)、
另有 1 家信源报道
AWS 博客介绍 Amazon Bedrock 的提示缓存功能,通过在请求中加入 cachePoint 标记缓存系统提示、文档和工具定义等重复上下文,缓存命中时输入 token 成本最多降低 90%,TTFT 也会缩短。文章给出缓存写入比标准输入贵 25%、缓存读取便宜 90% 的定价,并展示消息内容、系统提示、工具定义、混合 TTL、租户隔离及 LangC
Mastra 发布更新,新增 Studio Workflow Builder 后端,可通过 workflowBuilder 选项启用编辑器自有的 agent 来编写持久化工作流定义,并暴露受权限控制的服务端端点。同时推出 @mastra/connect 包,将平台集成连接转为 agent 工具,由平台代理注入凭证并刷新令牌,应用无需处理密钥。此外还支持线程所