Langfuse v4.14.0 发布:新增图表视图与时间线渲染优化
Langfuse 发布 v4.14.0 版本,新增了分数表图表视图、时间线密集渲染器等功能,并修复了 RBAC、OTel 映射、Stripe 计量事件等问题。该版本还进行了后台执行重构,将运行时所有权移至 worker,并更新了 Docker 镜像源。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Langfuse 发布 v4.14.0 版本,新增了分数表图表视图、时间线密集渲染器等功能,并修复了 RBAC、OTel 映射、Stripe 计量事件等问题。该版本还进行了后台执行重构,将运行时所有权移至 worker,并更新了 Docker 镜像源。
支付宝政务AI助手“晓政”联合民政部民政通推出七夕婚姻登记专项服务,通过MCP接入十省官方通道,提供预约、政策咨询和网点查询等功能。该服务旨在将婚姻登记从“找服务”转变为“对话办”,提升线上服务效率。晓政自2025年9月上线以来,已服务100余家政务机构,覆盖16000项事项,累计服务超1亿次。未来将扩展更多便民场景。
RAGFlow 发布 v0.27.0 版本,主要更新包括模型提供者功能、聊天和搜索页面的过滤器、任务执行器迁移到 Go、以及多个 Go 代理组件的修复和增强。此外,该版本修复了多个 bug,如内存错误信息显示、内置元数据问题、以及安全漏洞(CVE-2026-9256)。
豆包产品近期升级了“工作任务”功能,新增支持本地电脑和云电脑双模式。用户可根据任务需求选择运行环境,云电脑模式支持手机远程控制,适用于长时间、高资源消耗的任务,如数据采集、批量文件处理和定时监测。此前本地电脑模式已支持手机远程操作和Windows虚拟桌面功能。
IDC发布2026中国AI50强榜单,360集团因企业级智能体与AI安全双轮驱动入选。360推出纳米Work智能体办公平台,并打造AI安全攻防系统图龙锋与倚天阵,已发现近9000个漏洞。业内认为2026年AI产业从技术竞赛转向产业竞赛,安全与落地能力成为关键。
MiniMax核心工程负责人阿岛(缪宇航)已离职,其飞书状态显示离职,下一站未公开。阿岛曾负责M3.x、Agent、Audio及海螺AI等关键业务,并多次代表团队对外解释技术路线。他的离职发生在MiniMax重押Coding和Agent的关键时期,其职责交接情况尚不明确。
本文以GLM-5为例,探讨九章智算云如何通过强化学习系统实现训推一致。文章指出,随着预训练边际收益递减,模型能力Scaling正转向后训练强化学习,RL成为模型能力持续提升的关键。九章智算云通过将Generator、Environment和Trainer纳入统一工作流,实现动态调度和状态资源化,提升有效Token产出率,并与模型厂商形成算法与基础设施双向RL
Hugging Face 博客发布了 bedrock-rl,一个用于训练和评估视觉语言智能体(VLM agents)的确定性 Minecraft 框架。它结合了 Netherite(Minecraft 模拟的确定性 C/CUDA 重实现)和 verl(分布式强化学习库),支持多种训练方法(如 GRPO、SFT 等),并采用可替换组件的设计,通过 YAML 配
华尔街投行杰富瑞实测八款全球主流AI Agent,结果显示阿里千问办公综合得分第一,超越Claude Cowork和Codex。测试涵盖五项真实办公任务,千问办公在复杂任务、浏览器控制及多模态生成中表现突出,且隐含Harness分居首。报告指出,Agent竞争正转向企业级场景,成本与生态协同成为关键。
另有 1 家信源报道
源络科技与国家级科研实验室联合研发了人形机器人Monte2,已在该实验室落地,可自主完成细胞毒性检测等复杂实验流程,计划到2027年底扩展至约百台规模。源络科技还发起了“原点计划”,招募100位合作伙伴,推动AI for Science从计算走向实验执行,实现实验室3.0。
n8n 发布 2.35.4 版本,修复了 API 路由请求模式返回和 Google Ads 节点指标选择问题,并新增 AI Assistant 设置漏斗遥测功能及托管 OAuth 凭据作用域显示选项。
IJCAI 2026 在德国不来梅召开,聚焦 Agent、多智能体、机器人和强化学习。中国厂商如阿里、字节、百度、腾讯、华为等正将大模型融入复杂系统,补齐 Agent 能力缺口,竞争从模型能力转向系统能力。
CARA 是一个受认知决策过程启发的推荐智能体框架,将推荐建模为结构化决策过程,包含候选过滤和情感/理性双视角决策建模,并引入边界感知 KTO 策略优化训练。在 Amazon Reviews 三个领域上的实验表明,CARA 在多数指标上优于基线,相对提升最高达 10.15%。
arXiv 论文提出 ICD-Deepresearch,一种结合结构化 EHR 基础模型(SparseEHR)与语言模型(GPT-5)的深度研究流程,用于预测下一次就诊的 ICD 诊断代码。该方法通过候选生成、研究扩展和最终选择,在 MIMIC-III 和 MIMIC-IV 数据集上取得了优于基线(如 GPT-5 网页搜索和 Medical Deep Res
Graphectory Viewer 是一个基于 Web 的交互式工具,用于对软件代理轨迹进行过程中心分析。它基于 Graphectory 表示,将异构原始轨迹转换为阶段感知图,支持节点级检查、搜索过滤和桑基图摘要。该工具支持多种代理框架,并已开源,附带文档、预计算图和大型轨迹语料库。初步用户评估显示,与 SWE-agent 命令行查看器相比,任务准确率从
ORCA是一个面向微服务事故的、基于可观测性的自动程序修复流水线。它通过对比故障与参考遥测数据生成故障签名,定位候选代码和配置位置,并利用修复图代理生成补丁,最后由遥测验证器评估。在575个案例的基准测试中,ORCA在成本效益上优于所有基线,表明遥测数据可转化为可操作的修复上下文。
SPQR Technologies 提出 Aegis 运行时治理系统,将模型输出视为行动提案,在工具执行前通过可信决策层进行调解,实现行动边界控制。在包含 6300 行的沙盒语料库评估中,Aegis 治理的 2100 行记录显示零治理风险副作用完成,而提示策略条件化产生 79 行风险泄漏。该系统采用服务器端溯源解析、失败关闭机制和基于法定人数的 Senate
MITRE-SAGE 是一个多智能体检索增强生成框架,用于网络安全问答,通过整合语义和结构知识提升 LLM 的可靠性和可解释性。该框架在八个基准任务中的五个上优于独立 LLM 和传统 RAG 方法,并发布了包含 3000 个问答对的 MITRE-QA 基准。
该研究提出了一种名为Spec-Driven Test Generation的测试生成方法,通过让AI代理在生成测试前先提取并记录代码的前置条件、后置条件和未定义行为,形成半形式化规范作为引导。在Google的90个历史生产bug上的评估显示,该方法相比传统基线在bug检测率上提升了9.8个百分点,分支覆盖率提升了2.5个百分点。LLM-as-a-Judge评
GxP-Agent 是一个多智能体系统,将临床试验编程的监管流程编码为有向无环图(DAG),分解为15个领域特定节点,由具备pharmaverse技能上下文的工人代理执行,并包含验证门和条件重试。在CDISC-Bench基准测试中,GxP-Agent使用Claude Sonnet 4.6实现了100%的结构匹配,而所有单代理和扁平多代理方法均为0%,表明编码