Together AI 推出 FutureBench 基准,评估 AI 智能体预测未来事件能力
Together AI 发布 FutureBench,一个用于评估 AI 智能体预测未来事件能力的基准。该基准通过新闻生成和 Polymarket 整合两种方式构建问题,并采用智能体方法进行评测,旨在避免数据污染并提供可验证的客观结果。
公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
Together AI 发布 FutureBench,一个用于评估 AI 智能体预测未来事件能力的基准。该基准通过新闻生成和 Polymarket 整合两种方式构建问题,并采用智能体方法进行评测,旨在避免数据污染并提供可验证的客观结果。
Together AI 的 Dan Fu 发表新文章,反驳 AI 发展遇到硬件瓶颈的观点。他认为当前芯片利用率极低,通过软硬件协同设计和 FP4 训练等创新可大幅提升性能。他还指出模型训练滞后于硬件发展,且现有模型已能改变复杂工作流。
Together AI 推出了完全开源的视频翻译工具 Violin,基于 Together API,结合语音识别、大语言模型和语音合成技术,实现高质量视频翻译。Violin 提供 Web 应用、CLI 和代理技能三种使用方式,并内置视频内容感知的聊天助手和自然语言语音选择器。该工具采用 MIT 许可证发布,旨在打破语言障碍,使视频内容更易于全球观众访问。
Simon Willison 发布了 2026 年 7 月的赞助者专属通讯,内容包括 OpenAI 和 Anthropic 模型的意外网络攻击、GPT-5.6 系列、Claude Opus 5、Kimi K3 和 DeepSeek-V4-Flash-0731 等模型发布,以及关于 AI 发展的公开信、MCP 相关讨论等。该通讯每月 10 美元,赞助者可提前一
Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Salesforce Ventures 等,并额外获得超过 500 兆瓦计算能力承诺。该公司提供开源 AI 全栈平台,客户包括 Cognition、Cursor 等,其平台通过优化推理栈帮助客户降低 6 至 20 倍成本。CEO 表示将继续推动开源 AI 的普及和高效推理。
Simon Willison 参加了 Oxide and Friends 播客,讨论开放权重模型的革命性进展,包括 Kimi K3 与专有前沿模型的竞争、网络安全事件以及关于开放权重和美国 AI 领导力的公开信。对话还涉及 Golden Gate Claude 等话题,并更新了年初的预测,新增了关于教皇对开放模型表态的预测。
OpenAI 宣布大幅下调 GPT-5.6 系列模型价格,其中 Luna 降价 80%,Terra 降价 20%,并推出延迟降低 2.5 倍的 Sol Fast 模式。降价得益于 GPT-5.6 的递归自我优化,包括自主内核优化、推测解码和 KV 缓存等推理加速技术,以及智能体框架的改进。相比四个月前,GPT-5.4 级别的智能成本下降了约 13 倍,年化降
在 Interconnects 播客中,Nathan Lambert 和 Florian Brand 讨论了开放模型的近期进展,包括 Kimi K3 的发布、Qwen 3.8 的开放权重计划、中国领导人的开源承诺,以及中美模型差距和蒸馏技术的争议。他们指出,开放模型在特定任务上可能接近前沿,但后训练和微调仍面临挑战。
月之暗面于7月16日发布旗舰模型Kimi K3,这是一个2.8T参数的MoE模型,权重将于7月27日开源。K3在多个基准测试中排名前列,被认为是迄今最强的开源模型,标志着中国开源模型与前沿闭源模型的差距缩小至3-5个月。文章认为,中国AI实验室在模型构建上具备与美国顶尖实验室相当的能力,且中国高层在WAIC上承诺开源AI战略,这将对全球AI生态产生深远影响。
LangChain4j 发布 1.18.0 和 1.18.0-beta28 版本,引入 BDI 代理模式、支持 OpenAI 文本转语音、Mistral 批量 API 等新功能,并修复多项 bug。这些更新增强了代理系统的鲁棒性和多模态能力。
本文警告开放权重模型面临严峻政策风险,美国白宫可能通过行政命令限制或禁止能力接近GPT-5.5、Claude Opus 4.8等前沿水平的开源模型,预计6个月内可能实施。文章指出Anthropic主导的反华模型运动实为监管捕获,其建议的禁令将摧毁美国新兴的开源模型生态。作者呼吁社区抵制此类政策,认为当前蒸馏辩论缺乏技术证据,且开放模型缺乏经济代言人。
Ollama 发布 v0.32.0 版本,引入全新的交互式代理体验,运行 ollama 命令即可启动代理,帮助用户编码和委派工作。该版本将 Codex App 集成更名为 ChatGPT,并简化了集成选择菜单,仅保留最受欢迎的集成。此外,对于较旧的代理模型(如 CodeLlama、Qwen2.5、Llama 3.x 等),启动前会显示弃用警告。
Interconnects AI 的最新开源模型报告指出,开源生态系统正变得更加多元化,参与者包括纯模型制造商、大科技公司和产品公司。报告重点推荐了 NVIDIA 的 Nemotron 系列、Cohere 的 Command A+、GLM-5.2、Zyphra 的 ZAYA1 和 Poolside 的 Laguna-M.1 等模型,并讨论了开源模型发布的动机
Z.ai 于 2026 年 6 月发布了开源模型 GLM-5.2,该模型在编码代理任务中表现出色,被社区视为开源代理的转折点。其性能在多个基准测试中与 OpenAI 和 Anthropic 的闭源模型相当,甚至超越,引发了广泛关注。作者认为 GLM-5.2 缩小了开源与闭源模型的能力差距,并可能对 Anthropic 等闭源实验室构成竞争压力。
vLLM 发布 v0.21.0 版本,包含 367 个提交,来自 202 位贡献者。该版本正式弃用 transformers v4,要求 C++20 编译器,并引入 KV 卸载与混合内存分配器集成、推理预算感知的投机解码、Blackwell 上的 TOKENSPEED MLA 后端等新特性。同时新增多种模型架构支持,并在性能、硬件支持(如 AMD ROCm、
Sebastian Raschka 发布了一篇关于现代 LLM 中注意力机制变体的视觉指南,涵盖 MHA、GQA、MLA、稀疏注意力和混合架构等。他同时推出了包含 45 个条目的 LLM 架构画廊,并提供海报版本。文章旨在作为参考和学习资源,帮助读者理解不同注意力变体的原理和应用。
本文回顾了2026年1月至2月期间发布的10个开源权重LLM,重点比较了它们的架构异同。主要发布包括Arcee AI的Trinity Large、Moonshot AI的Kimi K2.5、StepFun Step 3.5 Flash、Qwen3-Coder-Next、z.AI的GLM-5、MiniMax M2.5、Nanbeige 4.1 3B、Qwen
智谱AI于2025年4月14日发布多个新模型,包括两个基座模型GLM-4-Air-250414和GLM-4-Flash-250414,以及三个推理模型GLM-Z1-AirX、GLM-Z1-Air和GLM-Z1-Flash。其中GLM-4-Air性能比肩GPT-4o和DeepSeek-V3-0324,GLM-Z1-AirX速度最快可达200 tokens/秒,