Langfuse v4.31.0 发布:改进实验 UI 与消息渲染
Langfuse 发布 v4.31.0 版本,主要包含多项功能改进和错误修复。新功能包括对重建的实验 UI 进行埋点、在 trace 中显示成本来源、引入改进的消息渲染功能,并移除了不稳定的评估 API 端点。此外,还修复了认证、CI、定价等多个问题,并优化了代理相关功能。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2397 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Langfuse 发布 v4.31.0 版本,主要包含多项功能改进和错误修复。新功能包括对重建的实验 UI 进行埋点、在 trace 中显示成本来源、引入改进的消息渲染功能,并移除了不稳定的评估 API 端点。此外,还修复了认证、CI、定价等多个问题,并优化了代理相关功能。
Agno 发布了 v3.0.7 版本,新增了页面存储、公共表面(PublicSurface)和页面文件系统等特性,并改进了工作流错误报告。修复了 Meta Llama 和 AIMLAPI 提供商的崩溃问题、Anthropic 空工具参数丢失问题以及缓存工具包装器导致的内存泄漏。同时引入了破坏性变更,如 Knowledge 构造函数参数改为仅限关键字,并调整了
Danijar Hafner 在旧金山创立了一家隐身模式的机器人初创公司,延续其在 Google DeepMind 期间开发的世界模型技术。他利用基于模型的强化学习训练智能体在模拟环境中预测和适应未知场景,并将其部署到人形机器人上。Hafner 曾开发 PlaNet 和 Dreamer 系列模型,在 Atari 和 Minecraft 等任务中取得突破,目前
OpenAI 发布了 Agents JavaScript SDK 的 v0.17.1 版本,主要包含多项功能增强和错误修复。新增了服务器级 MCP 工具护栏、自定义输出护栏消息、Docker 沙箱容器标签以及 Web 搜索工具中的图像结果支持。同时修复了多个核心问题,包括会话写入恢复、工具调用归属保留、沙箱 Git 仓库参数注入防护等,并更新了相关文档。
OpenAI Agents Python 库发布 v0.22.1 版本,包含多项功能增强和错误修复。新功能包括在 web 搜索工具中支持图像结果、自定义输出护栏消息、为 MCP 工具添加服务器级护栏、可配置的 Unix 本地环境隔离、Docker 沙箱容器标签以及流式转录选项。修复涉及核心、聊天补全、MCP、实时、沙箱和会话等多个模块,提升了工具的稳定性和正
百度在AI Day小度新品发布会上宣布,超能小度完成智能体化升级,百度搭子作为底座全面接入小度智能屏、闺蜜机等硬件,推动智能体进入家庭场景。升级后的小度能自主拆解任务、调度工具,覆盖家庭日程管理、儿童陪学、智能看护等场景,并发布四款硬件新品。此举是百度全栈AI能力落地物理世界的最新动作,依托其港股上市和文心大模型等布局。
Hugging Face 论文页面介绍了一种名为 Uno 的新型扩散增强自回归语言模型,通过扩散蒸馏和 Ψ-Spec 采样器实现无损并行解码,无需草稿模型即可加速推理。Uno 在多个基准上超越现有扩散模型,最高可提升 3 倍速度,并已发布代码和检查点。社区讨论中,作者回应了与 Orthrus 等方法的相似性争议,强调架构差异。
基元律动联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布Agent-Native模型NeoHorse-1,包含4B和9B两个版本,基于Qwen3.5后训练,利用Routing Harness系统OpenSquilla产生的执行轨迹作为训练语料,通过路由信号、Agent执行监督和在策略蒸馏等方法提升模型能力。评测显示NeoHorse 4B在11项基准中未加
OpenAI的GPT-6 Astra因用户大量用于3D建模而额度耗尽,OpenAI高管Tibo宣布为所有付费订阅用户重置额度。用户展示了多种3D应用,包括从照片建模、生成城市模型、制作3D游戏和教育可视化,效果惊艳。此举被视为推动AI在3D创作领域应用的重要事件。
硅谷AI独角兽Perplexity推出本地Agent产品Portable Computer,采用阿里开源模型Qwen3.8-27B,并在英伟达DGX Spark硬件上优化算法。Perplexity估值超300亿美元,其大模型选择从Claude、GPT转向阿里Qwen,此前已基于Qwen3研发嵌入模型。阿里近期开源多个Qwen3.8系列模型,成为全球开源AI基
AFAC2026金融智能创新大赛总决赛在上海举行,吸引5000多支队伍、近2万名选手参赛。大赛通过真实业务赛题选拔复合型金融AI人才,优胜者可获百万奖金、大厂直聘和VC投资。评委和专家指出,AI时代人才价值转向问题理解和业务落地能力,大赛生态链帮助人才从技术走向商业。
PydanticAI 发布 v2.41.0 版本,新增了 openai-codex 提供商以支持 ChatGPT/Codex 订阅认证,并引入了直接的图像生成 API(ImageGenerator)。同时,弃用了 ImageGeneration 和 XSearch 上的 fallback model,改为 fallback subagent model。此外
WAIC CONNECT MALAYSIA 活动于9月7日在吉隆坡开幕,由WAIC CONNECT主办,华为赞助,聚焦马来西亚AI产业。首日包括City Walk参访MRANTI和华为AI实验室,以及华为云AI Boost Day工作坊,宣布华为云码道代码智能体正式商用。活动旨在连接中国AI企业与马来西亚市场,推动智能体技术落地,预计亚太智能经济到2030年
华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动公司发布了首个Agent-Native模型NeoHorse,包含4B和9B两个版本。该模型利用其Routing Harness系统积累的多模型执行轨迹数据进行后训练,在Agent相关评测中4B模型表现达到或略超9B基础模型。公司旨在通过将执行经验转化为模型能力,构建从模型路由到训练改进的闭环,并探
Simon Willison 发布了 llm 0.35 版本,这是一个命令行工具更新。该版本可能包含新功能或改进,但具体细节未在正文中提及。此外,博客还提到了 Astra 的 Pelican 对比网格、OpenAI 的 rogue agents 通过公共 wiki 通信,以及 Claude 新系统提示限制歌词复制等近期文章。
OpenAI首席科学家Jakub Pachocki表示,继续快速训练更智能模型的关键理由是需要构建防御系统以应对其他AI带来的危险。他强调需要强大且对齐的AI来保护基础设施、实时防御 rogue agents 并发明新的防护措施,这将是OpenAI部署工作的重点。同时他也警告,不能以防御需求为借口鲁莽推进,必须认真对待风险。
Latent Space 发布了一个前沿 AEO(AI 引擎优化)追踪器,基于 7 个前沿模型在 161 个类别中的推荐结果,分析各产品在 AI 推荐中的主导地位。报告发现模型存在偏好偏差(如 Claude 推荐自家产品),但也观察到跨模型推荐案例。此外,Anthropic 的新模型 Astra 比 Sol 更自信且搜索来源更少,影响了 AEO 策略的有效性
TechCrunch 发布了一份 AI 术语表,用通俗语言解释 AGI、AI agent、API 端点、思维链、计算、深度学习、扩散模型等常见术语,并提及 OpenAI 新模型 Astra 的“不透明递归”推理技术引发安全担忧。该术语表旨在帮助从业者、投资者和普通读者跟上快速演进的 AI 词汇,并会定期更新。
千问办公近日推出行业首个“多人工作台”,用户通过一句话描述需求即可生成并发布支持最多百人在线协作的网页应用。实测显示,该功能可在约16分钟内完成如相亲角或编辑部选题系统等定制化多人协作工具,并支持权限管理、云端数据库存储及跨端访问。此举旨在解决办公“最后一公里”需求,可能对传统SaaS模式构成挑战。
OpenAI 的 GPT-6 Astra 模型在无人协助的情况下,从开始到结束自主通关了游戏《传送门》,耗时约 23 小时 43 分钟。开发者 cozyblaze 通过 MCP 和修改后的 SourcePauseTool 控制游戏,模型在暂停期间观察截图和位置信息并选择输入。此次运行消耗的 token 按列表价计算至少 570 美元,但实际使用了 200 美