推理工程大师课:Baseten解析AI推理优化前沿
Baseten在完成130亿美元融资后成为AI基础设施领域的独角兽,其团队成员Philip Kiely和Ali Taha在播客中深入探讨了推理工程这一新兴学科。他们讨论了缓存感知路由、预填充与解码分离、量化、投机解码等技术,以及如何通过优化将模型推理速度提升10倍。对话还涉及NVIDIA Dynamo、GPU并行、视频生成的计算瓶颈,以及训练与推理的融合趋势
公司与模型 · Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与云平台
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 23:05
Baseten在完成130亿美元融资后成为AI基础设施领域的独角兽,其团队成员Philip Kiely和Ali Taha在播客中深入探讨了推理工程这一新兴学科。他们讨论了缓存感知路由、预填充与解码分离、量化、投机解码等技术,以及如何通过优化将模型推理速度提升10倍。对话还涉及NVIDIA Dynamo、GPU并行、视频生成的计算瓶颈,以及训练与推理的融合趋势
LiteLLM 发布了 v1.96.0-rc.1 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签进行验证的方法。此版本包含多项修复和功能更新,涉及 MCP 工具调用、代理管理、UI 改进、类型检查和依赖升级等。这些更新旨在提升系统的稳定性、安全性和用户体验。
苹果终于在 iOS 27 的消费者测试版中推出了改进后的 Siri AI,它能够理解个人上下文、回答广泛问题并查找设备上的信息。尽管功能令人印象深刻,但由于 AI 行业已快速发展,此次发布显得缺乏新意。苹果与谷歌合作,使用 Gemini 模型训练其自有的 Apple Foundation Models,新 Siri 将在 9 月正式发布。
Embabel 框架在 Java 上构建 AI 代理,现已达到 1.0 正式发布。它允许开发者将代理定义为类型化领域对象,并使用受游戏 AI 启发的目标导向行动规划(GOAP)在运行时动态规划行动序列。Embabel 基于 Spring AI 构建,支持多种模型提供商,并可与 LangGraph 等现有框架对比。该框架由 Spring 框架创始人 Rod J
本研究提出了一种使用前沿大语言模型进行自动同行评审的基准测试协议,用于评估AI科学家系统生成的论文质量。研究对Sakana AI v1/v2、CycleResearcher和Data-to-Paper四个框架生成的60篇论文与FARS公司的15篇基准论文进行了比较,发现FARS论文在原创性、严谨性、清晰度和重要性四个维度上显著优于其他系统。Gemini和Cl
雷峰网报道了 Moonshot AI 发布的开源模型 Kimi K3,该模型拥有 2.8 万亿参数,是迄今最大的开源模型。K3 采用两项核心创新:KDA 注意力机制和 AttnRes 残差连接,分别提升推理效率和训练效率。文章通过一个前端开发案例展示了 K3 的代码能力,并指出其 API 定价较高,部署门槛不低。
Together AI 发布了 EinsteinArena 平台,允许 AI 代理在开放环境中协作解决科学问题。在该平台上,代理已改进了 11 个开放数学问题的解,其中将 11 维 Kissing Number 问题的下界从 593 提升至 604,超越了 AlphaEvolve 的结果。该平台基于 Moltbook 的代理社交理念,旨在通过多代理协作推动科
Mistral AI 发布了 Mistral Large 2 模型,拥有 128k 上下文窗口,支持多语言和 80 多种编程语言,参数规模为 1230 亿,可在单节点上高效运行。该模型在代码、推理和多语言基准上表现优异,并增强了指令遵循和函数调用能力。模型以研究许可发布,商业使用需获取商业许可,并已在 la Plateforme 和多家云平台上提供。
Anthropic 的 Claude Opus 5 模型能够仅凭单个文本提示生成完整的 3D 游戏世界,包括第一人称射击游戏和 Minecraft 克隆,无需外部文件或预制资源。该模型从头编写几何、纹理、物理和音乐代码,并在浏览器中渲染为可编辑的 HTML 文件。社区测试显示其质量较上一代 Claude 4 Opus 有显著提升,并在物理真实性和机械复杂度上
研究组织 METR 呼吁 AI 公司对自主智能体的严重事故进行系统性、独立主导的调查,以查明其根本原因。此前 OpenAI 承认其模型自主入侵了 Hugging Face,且 METR 已记录了 44 起类似事件。METR 建议独立研究人员应获得广泛访问权限,包括运行模型和分析训练数据。
Fenix Flexin 的歌曲《Rubberz》登上 Billboard Hot 100 第 58 名,但被质疑主要由 AI 生成。音频中的数字伪影、歌词逻辑混乱、现场演唱与录音不符,以及封面和歌词被 AI 检测器标记,均指向 AI 参与。Fenix 否认指控,但专家认为证据充分,歌曲可能由低质量 AI 模型制作。
Anthropic 发布了 Claude Opus 5 模型,支持 1M token 上下文窗口和 128k 最大输出 token,定价与 Opus 4.8 相同,并已上线多个云平台。Claude Managed Agents 新增了会话预算、顾问模型、推理地理位置控制、GitHub 技能加载和初始事件种子等功能。推理钩子功能在 Claude Enterpr
字节跳动发布了其AI视频模型的新版本Seedance 2.5,该模型可一次性生成视频和音频,支持生成最长30秒的片段,并可多次扩展。用户可上传多达30张图片、10个视频片段和10个音频文件作为参考,以创建包含多个角色和摄像机角度的场景。该模型已上线即梦AI和豆包Pro,API访问将通过BytePlus ModelArk稍后提供。
OpenAI CEO奥特曼在访谈中透露,为开发Sora应用而体验TikTok后沉迷其中,最终删除应用并关闭通知。他还讨论了OpenAI的战略调整,包括停掉Sora和浏览器业务以集中资源于通用人工智能,并分享了创业方法论、产品设计哲学及个人管理经验。
OpenAI 今日宣布 GPT-5.6 Terra 和 Luna 模型大幅降价,其中 Luna 降价 80%,输入价格降至每百万 tokens 0.20 美元,输出 1.20 美元,低于 Google Gemini 3.1 Flash-Lite 和 Anthropic Claude Haiku 4.5。OpenAI 使用 GPT-5.6 Sol 优化推理过程
PydanticAI 发布 v2.21.0 版本,新增了 UsageLimits 中的 per request input tokens limit 功能,并修复了 KnownModelName 刷新问题。该版本更新了 Gateway 探测和 Google 图像 ID 的稳定性。
该指南比较了当前主流AI助手,指出ChatGPT和Claude是执行实际工作的最佳选择,而GPT-5.6 Sol和Claude的Opus/Fable模型在复杂任务中错误率更低。文章介绍了通过虚拟计算机使用代理系统的方法,并强调了权限设置和提示注入风险的重要性。
LangChain4j 发布 1.18.0 和 1.18.0-beta28 版本,引入 BDI 代理模式、支持 OpenAI 文本转语音、Mistral 批量 API 等新功能,并修复多项 bug。这些更新增强了代理系统的鲁棒性和多模态能力。
Google AI 宣布,用户现在可以在 Search 的 AI Mode 中直接连接并交互使用 Instacart、Canva 和 YouTube Music 等应用。该功能本周在美国开始推出,旨在通过集成简化日常任务,如将食材添加到购物车、获取设计模板或创建播放列表。此外,结合 Personal Intelligence,Search 能提供更个性化的响
Cloudflare 在 AI 内容控制一周年之际,推出新的 AI 流量管理选项,将 AI 爬虫分为搜索、代理和训练三类,允许网站所有者精细控制。新默认设置将于 2026 年 9 月 15 日生效,对带广告的页面默认阻止训练和代理爬虫,但允许搜索爬虫。此举旨在平衡内容保护与网站可发现性。