Together AI 发布 CoderForge-Preview:最大开源编码智能体数据集
Together AI 发布了 CoderForge-Preview,这是目前最大的开源测试验证编码智能体数据集,包含 258,134 条轨迹(其中 155,144 条成功),覆盖 51,201 个任务和 1,655 个仓库。通过在该数据集上微调 Qwen-3 32B 模型,SWE-Bench Verified 性能提升了 23.0%,达到 59.4% 的
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2504 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Together AI 发布了 CoderForge-Preview,这是目前最大的开源测试验证编码智能体数据集,包含 258,134 条轨迹(其中 155,144 条成功),覆盖 51,201 个任务和 1,655 个仓库。通过在该数据集上微调 Qwen-3 32B 模型,SWE-Bench Verified 性能提升了 23.0%,达到 59.4% 的
Together AI 在首届 AI Native Conf 上发布了七项研究和产品,涵盖内核、强化学习和算法推理优化。其中 FlashAttention-4 针对 NVIDIA Blackwell GPU 优化,速度比 Triton 快 2.7 倍;Together Megakernel 将实时语音代理的首 token 延迟从 281ms 降至 77ms;
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,包括采用 NVIDIA Dynamo 1.0 优化推理、通过 NVIDIA OpenShell 集成 NemoClaw、支持 NVIDIA Nemotron 3 Super 模型用于多智能体工作流,并在模型库中新增 NVIDIA Parakeet TDT 0.6B V3 语
Together AI 在 NVIDIA GTC 2026 上强调推理效率对 AI 生产系统的重要性,指出推理成本占系统总成本的 80-90%。该公司通过 FlashAttention、ThunderKittens 和 Aurora 等开源技术优化推理性能,并利用 Blackwell 硬件实现全栈优化,帮助客户降低单位经济成本。文章还引用斯坦福 AI 指数,
Together AI 发布了一项针对编码代理工作负载的大规模推理基准测试,结果显示其推理引擎在相同硬件上比最快的开源引擎吞吐量高 31%,且在饱和状态下 TTFT 快 2 倍。该基准测试模拟了长上下文、高并发的生产环境,并强调了 TTFT 和预填充压力等关键指标。性能提升源于全栈优化,包括 ThunderMLA 内核融合和自定义内核重写。
Together AI 推出了 Provisioned Throughput 服务,为前沿开放模型提供预留推理容量,采用基于 token 的定价和 99% 可用性 SLA。该服务允许客户购买 PTU 单位,以固定速率保证吞吐量,成本比 Claude Opus 4.8 低 90%。目前支持 MiniMax M3 和 GLM-5.2,覆盖北美和 EMEA 地区。
Together AI 联合多所大学推出 ThunderAgent,一种面向智能体推理的高吞吐调度系统。它通过程序级调度缓解 KV 缓存抖动,在单节点上实现 2.5 倍吞吐提升,8 节点集群加速 2.4 倍,并保持近线性扩展。该系统已作为 Spotlight 论文被 ICML 2026 接收。
Together AI 在 ICML 2026 上发表了九篇论文,覆盖从智能体到 GPU 内核的全栈研究。其中,Aurora 论文提出的自适应投机解码已作为 ATLAS 投机器在生产环境中部署。研究还包括 DSGym 数据科学智能体评估框架、ThunderAgent 智能体工作负载优化、TTT-Discover 开放模型科学发现,以及 RARO 无验证器强化
Cloudflare 宣布本周为“Agents Week”,探讨为 AI 代理构建专用云基础设施。公司认为现有云和网络是为人类设计的,而代理需要不同的速度、结构和访问方式。本周将发布一系列创新,涵盖代理原生云原语、代理软件开发周期、安全控制及代理网络等主题。
OpenAI 推出面向企业客户的新产品 Presence,旨在让 AI 代理在生产环境中可靠运行,覆盖客户服务和内部工作流。当超出预设能力时,OpenAI 的前向部署工程师会介入,协助客户选择工作流、连接系统、设置指南并管理测试直至上线。目前该产品仅对符合条件的客户开放,具体合规细节如欧盟 AI 法案尚未披露。
Meta AI 研究人员提出了一种双智能体记忆系统,通过一个独立的记忆智能体监控任务进度,并在适当时机向主智能体发送提醒,以解决长任务中的行为状态衰减问题。该系统在 Terminal-Bench 2.0 和 tau2-Bench 基准测试中显著提升了任务完成率,并优于现有记忆系统。
Together AI 发布了 EinsteinArena 平台,允许 AI 代理在开放环境中协作解决科学问题。在该平台上,代理已改进了 11 个开放数学问题的解,其中将 11 维 Kissing Number 问题的下界从 593 提升至 604,超越了 AlphaEvolve 的结果。该平台基于 Moltbook 的代理社交理念,旨在通过多代理协作推动科
llama.cpp 发布 b10227 版本,主要新增了 Qwen3 专用解析器,支持带标签的思维工具解析、工具调用省略及 Qwen3-Coder 的注释处理。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等后端。
研究组织 METR 呼吁 AI 公司对自主智能体的严重事故进行系统性、独立主导的调查,以查明其根本原因。此前 OpenAI 承认其模型自主入侵了 Hugging Face,且 METR 已记录了 44 起类似事件。METR 建议独立研究人员应获得广泛访问权限,包括运行模型和分析训练数据。
网易有道宣布旗下AI Agent产品矩阵已完成DeepSeek-V4-Flash正式版的全面接入,覆盖LobsterAI、有道词典、有道翻译、Hi Echo等产品。此次升级基于DeepSeek-V4-Flash-0731模型,该模型与预览版结构一致,但通过后训练优化显著提升了Agent能力。升级后,LobsterAI运行更经济,翻译和口语产品功能更精准,Th
OpenAI 总裁兼联合创始人 Greg Brockman 在博客中分享,许多 OpenAI 员工将 ChatGPT 接入 Slack。但同事的 ChatGPT 主动联系请求帮助时,人们会感到不适,即使他们乐意帮助同事本人。这反映了人们对人际关系的重视,希望 AI 能节省时间或增强互动,而不是成为人际隔阂。
Simon Willison 发布了 datasette-apps 0.2a0 版本,该版本改进了通过 Datasette Agent 创建和编辑应用时的体验。新增的 app debug() 工具利用隐藏 iframe 和沙箱 JavaScript 执行,使代理能够对应用进行冒烟测试,例如测量元素尺寸。该功能基于 datasette-agent 0.4a0
xAI 发布了 Grok 的 Connectors 功能,支持与 SharePoint、Outlook、OneDrive、Google Workspace、Notion、GitHub 和 Linear 等常用应用深度集成,用户可直接在 Grok 中读写邮件、文档、日历和代码等。此外,还推出了 Bring Your Own MCP,允许连接自定义的 Model
xAI 宣布其 Grok 订阅现可在 Nous Research 的开源自我改进代理 Hermes Agent 中使用。用户可通过 OAuth 登录,在 Hermes 中调用 Grok 模型,适用于所有订阅层级。此举扩展了 Grok 的应用场景,并加强了与开源生态的整合。
xAI 宣布推出 Grok 的 Skills 功能,允许用户通过对话或上传文件创建自定义技能,Grok 能记住并跨对话应用这些技能。该功能支持生成和编辑 Word、PPT、Excel、PDF 等文档,并已上线 Grok 4.3 的网页、iOS 和 Android 平台。