企业AI架构:为何代理计算是缺失的一层
Arun Joseph 在演讲中分享了他在 Deutsche Telekom 构建 LMOS 平台的经验,该平台是欧洲首个大型企业级代理平台,现已移交 Eclipse 基金会。他随后创立了 Masaic 公司,专注于为大型企业构建多代理系统,并提出了“结果系统”的概念,强调在现有系统之上增加代理计算层以处理企业复杂性。演讲还展示了 Atlas 产品在重型机械
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2503 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Arun Joseph 在演讲中分享了他在 Deutsche Telekom 构建 LMOS 平台的经验,该平台是欧洲首个大型企业级代理平台,现已移交 Eclipse 基金会。他随后创立了 Masaic 公司,专注于为大型企业构建多代理系统,并提出了“结果系统”的概念,强调在现有系统之上增加代理计算层以处理企业复杂性。演讲还展示了 Atlas 产品在重型机械
ManniX-ITA 发布了 gemma-4-A4B-98e-v6-coder-it-GGUF,这是 Gemma 4 26B-A4B 的代码剪枝版本的 GGUF 量化系列。该版本修复了聊天模板中导致多轮智能体循环的 bug,将循环率从 33% 降至 0%,同时保持 HumanEval+ 92.07% 的性能。所有量化均使用 imatrix 校准,推荐使用 I
阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,在编程、专业工作、长程任务和多模态分析等场景表现突出,在第三方榜单Arena中进入全球第一梯队,直逼Claude系列。该模型定价低廉,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,国际价格仅为Opus 5的40%和24%。实测显示其能端到端交付编程项目、进行长文
Embabel 框架在 Java 上构建 AI 代理,现已达到 1.0 正式发布。它允许开发者将代理定义为类型化领域对象,并使用受游戏 AI 启发的目标导向行动规划(GOAP)在运行时动态规划行动序列。Embabel 基于 Spring AI 构建,支持多种模型提供商,并可与 LangGraph 等现有框架对比。该框架由 Spring 框架创始人 Rod J
arXiv 论文介绍了 CyberNeuro,一个用于大规模神经影像和临床数据分析的隐私保护智能体工作台。它通过四个专用智能体(Planner、Validator、Dispatcher、Reporter)和本地 LLM 模型 WandaMind,支持自然语言执行复杂工作流,同时保持临床级数据隐私。在 NeuroBench 基准上,CyberNeuro 将保留
该论文提出了一种用于Agentic AI的分层架构,将推理、编排和执行层分离,并以OpenClaw和Ollama作为全栈系统进行验证。实验表明,持久记忆、工具使用和自适应决策等能力源于系统级集成,而非单一模型。研究还讨论了可扩展性、安全性和治理等挑战,并公开了所有模型、代码和数据集。
TransMem 是一种轻量级推理时参数记忆模块,可将冻结的大语言模型(LLM)的稀疏历史隐藏状态转换为可复用的记忆表示,通过门控网络动态干预当前隐藏状态,无需重复编码先前上下文。实验表明,TransMem 在 LoCoMo、HotpotQA 和 MemoryAgentBench 上均取得显著性能提升,验证了稀疏历史隐藏状态作为长上下文 LLM 智能体有效记
arXiv 论文提出 OurArk 架构,为个性化 AI 智能体提供可拥有、可治理的软件体,包含代码、提示、工具等,并支持人类控制下的自我进化与递归派生。该架构在开源 Genesis 引擎和 Enoch 参考智能体中实现,通过四智能体三代系谱验证了递归创建、继承验证、隔离变更和失败恢复。该研究旨在让用户真正掌控智能体的行为定义,促进人机协同演化。
该论文提出状态知识学习(SKL)方法,使大语言模型代理从轨迹级反思转向维护显式的、基于状态的预测性知识。通过自蒸馏(SKL-SD)和强化学习(SKL-RL)两种算法,训练代理自主提取状态基础预测知识并用于决策。在WebShop、ScienceWorld和ChessPuzzles等交互环境中的实验表明,该方法显著优于当前基于反思的训练范式。
本文介绍了 AnyLog Edge Data Fabric,一个基于代理和边缘计算的平台,用于在数据源头管理运营数据,同时将分布式数据、资产、计算资源和服务呈现为单一逻辑系统。该平台通过分布式元数据层、虚拟数据湖、统一命名空间、单系统映像和模型上下文协议,使授权用户、应用、自动化服务和 AI 代理能够发现、查询、处理分布式资源,而无需知道其托管位置。查询和计
本研究提出了一种使用前沿大语言模型进行自动同行评审的基准测试协议,用于评估AI科学家系统生成的论文质量。研究对Sakana AI v1/v2、CycleResearcher和Data-to-Paper四个框架生成的60篇论文与FARS公司的15篇基准论文进行了比较,发现FARS论文在原创性、严谨性、清晰度和重要性四个维度上显著优于其他系统。Gemini和Cl
arXiv 论文介绍了 SeekBrain,一个自主多智能体框架,旨在通过领域基础的层次规划和跨模态数据分析加速神经科学发现。该框架从代码-论文对中动态构建分析配方库,并耦合智能体规划与执行引擎,按需生成假设和分析流程。在 BrainArena 基准上的评估显示其性能优于现有智能体基线,并在斑马鱼和小鼠真实数据中揭示了神经表征结构。
智象未来在2026年WAIC大会上发布全球首个无限时长多模态创作智能体vivago R1,并宣布完成C轮融资,近三个月累计融资超20亿元。该产品通过自研模型与聚合第三方模型(如Sora 2、可灵、Veo)结合,采用Agent编排实现长视频生成,实测显示其在叙事一致性、风格保持方面表现优异,但底层仍为分段拼接。
阿里巴巴于8月3日公测企业级Agent产品“千问办公”(QwenWork),整合了QoderWork、MuleRun、悟空三款产品,支持桌面端、云端和企业协同Agent,并内置最新旗舰模型Qwen3.8。该产品面向企业市场,已打通钉钉IM,未来将连接企业数据库和工作流,帮助提升办公效率。公测期间新用户可获积分奖励。
OpenAI CEO Sam Altman近期表示,可能应‘调整AI发展速度’以便社会适应新能力水平,但未呼吁暂停。TechCrunch播客讨论了此言论,认为其受OpenAI模型入侵Hugging Face事件影响,该黑客行为并非高级技术,而是因测试站点安全措施不当所致。主持人质疑加速与减速的二元框架,认为应关注更广泛的安全与责任问题。
Hugging Face 披露了一起由自主 AI 代理系统驱动的安全事件,攻击者以机器速度执行了数万次自动化操作。在分析过程中,商业 API 的前沿模型因安全护栏阻止了恶意负载分析而失败,最终 Hugging Face 使用自托管的开源模型 GLM 5.2 完成了取证分析,并避免了数据外泄。文章建议企业安全团队预先部署自托管模型作为后备,并介绍了通过戴尔、微
Together AI 发布了 Open Deep Research,一个开源的 LLM 工作流,用于回答需要多跳推理的复杂问题并生成研究报告。该工作流模拟人类研究过程,包括规划、搜索、自我反思和写作,并集成了 Together AI 云平台上的多种模型。其目标是提供灵活、可扩展的架构,供开发者社区使用和扩展,同时发布了数据集和代码。
Together AI 与 Agentica 团队合作推出 DeepSWE-Preview,这是一个基于 Qwen3-32B 并通过纯强化学习训练的开源编码智能体,在 SWE-Bench-Verified 上达到 59% 的准确率,创下开源权重编码智能体的新纪录。该模型使用 Agentica 的 rLLM 框架训练,并开源了数据集、代码、训练和评估日志。训练
Together AI 发布 FutureBench,一个用于评估 AI 智能体预测未来事件能力的基准。该基准通过新闻生成和 Polymarket 整合两种方式构建问题,并采用智能体方法进行评测,旨在避免数据污染并提供可验证的客观结果。
Together AI 通过博客分享了使用 AI 代理自动化复杂工程任务的经验,重点介绍了开发高效 LLM 推理系统(如推测解码)的案例。他们提出了六个构建自动化代理的模式,分为基础设施模式和行为模式,强调工具质量、文档完善、任务可验证性等原则。该代理系统显著减少了人工干预,提高了工程效率。