Claude Fable/Mythos 5.1 发布:缓存降价但成本上升
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,定位为编码和知识工作的新旗舰模型,宣称在多项基准上达到 SOTA。缓存读取价格下调 75%,但输出 token 使用量增加约 1.7 倍,导致单任务成本上升 20%。社区分析认为两个模型可能共享权重,仅安全策略不同。
另有 1 家信源报道
技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,定位为编码和知识工作的新旗舰模型,宣称在多项基准上达到 SOTA。缓存读取价格下调 75%,但输出 token 使用量增加约 1.7 倍,导致单任务成本上升 20%。社区分析认为两个模型可能共享权重,仅安全策略不同。
另有 1 家信源报道
Paint.NET 作者 Rick Brewster 表示,由于 Direct2D 在 WINE 上无法完整实现,他利用 AI 助手 Claude 从零开始逆向重写了 Direct2D,代码约 18 万行,存放在 PaintDotNet.Windows.Direct2D1.Managed.dll 中,通过 /wine 参数触发。Brewster 称大部分代码
Anthropic 发布了 Claude Fable 5.1 模型,声称在编码、知识工作和长期问题解决方面树立了新标准,并在新的 Terminal-Bench-Science 基准上取得 52.6% 的分数。作者 Simon Willison 测试了该模型生成鹈鹕骑自行车 SVG 的能力,发现低和中等推理级别下模型几乎不进行推理,而高和最高级别则产生更详细和
Anthropic 发布了新一代 AI 模型 Fable 5.1 和 Mythos 5.1,其中 Fable 5.1 性能更强,价格比 Fable 5 降低约 25%,在复杂代理任务上最高可降低 45%。新模型改进了数据保留和防护机制,并已全面上线,而 Mythos 5.1 仅限 Project Glasswing 参与者使用。
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1 两款新模型,在编码和智能体基准测试上表现优异,同时通过降低缓存读取成本使典型任务成本降低约 25%,复杂智能体工作流成本降低高达 45%。然而,Artificial Analysis 指出,在最大努力模式下,Fable 5.1 因输出 token 更多,实际每任务成本比
另有 1 家信源报道
Hugging Face 上发布了 Qwen3.6-27B 的架构感知混合精度量化版本,由 zerodigest 使用 YMQ-Compiler v2.0 框架从原始 BF16 权重转换而来。该版本支持多 token 预测(MTP)和长上下文优化,提供从 XXS 到 XL 多个预设档位,其中 M 档在 WikiText-2 上困惑度最低(7.5295),被推
ZeroDigest 实验室发布了基于 Qwen3.8-27B Cold-Fusion GAIN V1.1 的架构感知量化模型系列,采用自定义 YMQ-Compiler 框架进行混合精度量化,支持多 token 预测(MTP)和长上下文优化。该系列提供多个预设档位,覆盖 9.1GB 至 14.5GB 的模型大小,并报告了 WikiText-2 困惑度指标,旨
Google DeepMind 新任负责人 Koray Kavukcuoglu 表示,前沿 AI 领导力是公司唯一重要的事,并坚信谷歌将重回前沿。他承认当前模型略低于前沿水平,但强调团队和资源足以缩小差距。他未透露 Gemini 4 和 Gemini 3.5 Pro 的具体进展,但指出 Flash 系列正从语言模型向编码智能体转变。
雷峰网对智谱最新旗舰模型GLM 5.3进行了实测,通过让其与GLM 5.2开发同一款基于OpenStreetMap数据的北京驾驶游戏,发现GLM 5.3在开发效率、真实感和工程组织能力上更优,但因其更强的安全策略,在自动化工具链中更易触发拒绝判断,导致流程卡顿。
该研究通过构建一个工具列表为唯一变量的最小化编码智能体,在六个模型和八种工具配置下实现了1116个Web应用,以探究验证工具覆盖面(如linter、启动探针、shell、截图)对AI编码智能体输出软件质量的影响。研究发现,验证工具的最廉价收益是确保应用能启动,仅一个启动探针即可消除大部分启动失败,且成本仅为完整shell的35%;完整shell将无工具成本提
Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1 模型,称其为全球最先进的编程和知识工作模型。此次发布旨在提升编码和知识处理能力,相关详细信息已通过官方博客公布。
特斯拉在中国香港和澳门推出配置简化、售价更低的Model 3,起售价分别约17.59万元和20.98万元人民币。字节跳动原计划8月推出的豆包大模型2.2将推迟发布,以提升编程、工具调用和Agent能力。腾讯混元发布Hy4 preview,总参数770B,激活参数49B,上下文长度1M,已开源。壁仞科技上半年收入同比增长近20倍,下一代产品即将推出。
Mistral 发布了 Mistral Small 4,这是一个统一指令、推理和编码的多模态混合模型,支持 256k 上下文窗口。同时,Mistral 还发布了 Leanstral,这是其首个面向 Lean 4 形式化证明工程的开源代码智能体。
Mistral 发布了 Mistral Medium 3.5,这是一个面向智能体和编码用例的前沿多模态模型,支持通过 reasoning effort 参数调节推理强度,并以修改版 MIT 许可证开放权重。
DeepSeek 将 DeepSeek V2 Chat 和 DeepSeek Coder V2 合并升级为 DeepSeek V2.5,API 用户可通过 deepseek-coder 或 deepseek-chat 访问新模型。新模型在通用能力和代码能力上显著提升,多项基准测试成绩均有提高,包括 ArenaHard、AlpacaEval 2.0、MT-Be
Anthropic 宣布自9月14日起,将 Claude Code 的周使用限额永久提高25%,但同时取消当前50%的临时提升,实际可用容量将减少17%。官方确认了这一变更,并承诺改进用户体验和透明度。此外,Anthropic 近期为 Claude Code 增加了性能优化和自动反馈工具。
另有 1 家信源报道
阿里发布Qoder桌面端,新增桌宠形态,支持语音交互和自动执行编码任务,将Coding能力从IDE扩展到桌面环境。该产品基于Agentic Coding技术,已服务全球600万用户和10万家企业客户,旨在让非程序员也能通过自然语言实现软件开发。
该研究比较了多智能体LLM系统与单模型基线在编码任务上的表现,发现引入管理器-工人脚手架的效果因模型而异:对部分模型(如Qwen3.8-27B、GPT-5.6-Luna等)有显著提升,对另一些模型(如Qwen3.6-35B)则无益或负面。管理器机制虽使token消耗增加约三倍,但相比升级更大模型,能以更低成本获得相近精度。研究还分析了增益机制,包括上下文管理
EVE Online 宣布开始向 Python 3 迁移,这是其自 2003 年使用 Stackless Python 以来的重大升级。他们将使用 futurize 脚本处理 240 万行代码,并手动审查约 2 万个行为差异点。公告未提及 Stackless 的替代方案,但去年会议已展示在 Carbon 引擎中用开源调度库替代 Stackless 的方案。
NVIDIA 发布 CUDA Python 1.0,提供从 Python 访问完整 CUDA 平台的官方支持,包括 cuda.core、cuda.compute、cuda.bindings 等组件。该版本引入语义化版本控制,确保 API 稳定性,并统一了 Python GPU 生态的基础层,使不同库(如 Numba、cuda.compute)能在同一 GPU