Meta 发布 Muse Code 和 Muse Spark 1.2 编码模型
Meta 发布了 Muse Code 和 Muse Spark 1.2,后者是面向编码的模型更新,提升了代码生成、调试和代码库理解能力,并支持长序列智能体工具调用。模型提供两种定价选项,其中 contributor 版本通过允许数据使用大幅降价。
另有 1 家信源报道
技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Meta 发布了 Muse Code 和 Muse Spark 1.2,后者是面向编码的模型更新,提升了代码生成、调试和代码库理解能力,并支持长序列智能体工具调用。模型提供两种定价选项,其中 contributor 版本通过允许数据使用大幅降价。
另有 1 家信源报道
Meta 发布了终端编码代理 Muse Code,旨在帮助程序员处理大型代码库中的复杂任务。该工具基于 Meta 的编码模型 Muse Spark,可并行运行子代理,目前处于测试阶段。此举旨在与 OpenAI 的 Codex 和 Anthropic 的 Claude Code 竞争,并强调成本优势。
开源技能 Ponytail 通过注入规则集,指导 AI 编码代理遵循 YAGNI 原则,避免过度工程化,自发布以来已获超 8.2 万 GitHub 星标。其原始基准声称减少 80-94% 代码,但遭质疑后作者重建基准,公开修正为平均减少约 54% 代码,并补充了行为测试框架。该事件凸显了 AI 技能缺乏评估标准的问题,Ponytail 的回应被视为更持久的贡
阿里巴巴于8月3日发布新一代基座大模型Qwen3.8,编程与Agent能力大幅提升,性能位居全球第一梯队。发布当日,OpenRouter、OpenCode、Hermes Agent等多家海外主流平台纷纷接入Qwen3.8-Max,形成接入潮。该模型总参数2.4万亿,激活95B,支持长上下文与视觉理解,在多个评测榜单中名列前茅。Qwen3.8-Max预计下周开
阿里巴巴发布Qwen3.8-Max,一个2.4T参数的MoE模型,专注于编码、长程智能体任务和多模态推理,并承诺下周开源权重。该模型在多个基准测试中表现优异,如Frontend Code Arena排名第四,并展示了自主编码、芯片设计和电商策略等能力。API定价为每百万输入token 2美元,输出6美元。
阿里巴巴发布了旗舰模型 Qwen3.8-Max,拥有 2.4 万亿参数,专注于自主完成长期复杂任务。在测试中,该模型自主构建软件、复现并改进研究论文结果、运行模拟电商业务,并在芯片设计中大幅优化电路。模型现已可用,权重将于下周发布。
xAI 发布了其最先进的模型 Grok 4.5,专为编码、智能体任务和知识工作设计。该模型在数万块 NVIDIA GB300 GPU 上训练,强调数据过滤和强化学习,以提升推理效率和编码能力。Grok 4.5 已集成到 Grok Build、Cursor 和 SpaceXAI 控制台,定价为每百万输入 token 2 美元、输出 token 6 美元,并宣称
ManniX-ITA 发布了 gemma-4-A4B-98e-v7-coderx-it 模型的 GGUF 量化版本,提供了多种量化等级,并附有详细的基准测试结果。该模型在 HumanEval+ 和 MultiPL-E-100 上表现优异,尤其在低比特量化下仍保持高代码生成能力。与 Qwen2.5-Coder-14B 相比,在相同磁盘空间下,该模型以更低的比特
阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,在编程、专业工作、长程任务和多模态分析等场景表现突出,在第三方榜单Arena中进入全球第一梯队,直逼Claude系列。该模型定价低廉,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,国际价格仅为Opus 5的40%和24%。实测显示其能端到端交付编程项目、进行长文
Embabel 框架在 Java 上构建 AI 代理,现已达到 1.0 正式发布。它允许开发者将代理定义为类型化领域对象,并使用受游戏 AI 启发的目标导向行动规划(GOAP)在运行时动态规划行动序列。Embabel 基于 Spring AI 构建,支持多种模型提供商,并可与 LangGraph 等现有框架对比。该框架由 Spring 框架创始人 Rod J
该研究探讨了大型语言模型在代码生成中受隐喻指令影响的现象,发现隐喻可能引发跨领域程序性迁移,导致模型生成低效算法。研究者开发了MASC框架来诱发和检测这种“隐喻算法引导”效应,并通过行为评估和表征分析验证了其机制。结果表明,隐喻技能通过转移源领域的程序模式而非表面语言影响模型输出。
雷峰网报道了 Moonshot AI 发布的开源模型 Kimi K3,该模型拥有 2.8 万亿参数,是迄今最大的开源模型。K3 采用两项核心创新:KDA 注意力机制和 AttnRes 残差连接,分别提升推理效率和训练效率。文章通过一个前端开发案例展示了 K3 的代码能力,并指出其 API 定价较高,部署门槛不低。
Together AI与Agentica团队联合发布了DeepCoder-14B-Preview,这是一个基于DeepSeek-R1-Distilled-Qwen-14B通过分布式强化学习微调的开源代码推理模型。该模型在LiveCodeBench上达到60.6%的Pass@1准确率,与o3-mini相当,并开源了数据集、代码、训练日志和系统优化。训练使用了2
Together AI 与 Agentica 团队合作推出 DeepSWE-Preview,这是一个基于 Qwen3-32B 并通过纯强化学习训练的开源编码智能体,在 SWE-Bench-Verified 上达到 59% 的准确率,创下开源权重编码智能体的新纪录。该模型使用 Agentica 的 rLLM 框架训练,并开源了数据集、代码、训练和评估日志。训练
Together AI 发布了对 Kimi K3 与 Claude Fable 5 在 DeepSWE 基准上的对比分析。结果显示,Kimi K3 在 pass@1 上以 68.5% 略低于 Fable 的 69.9%,但在 pass@2 和 pass@4 上反超,且每次运行成本仅为 4.65 美元,远低于 Fable 的 13.41 美元,每美元解决任务数
Together AI 在 DeepSWE 基准上对比了 Kimi K3 与 GPT-5.6 Sol。GPT-5.6 Sol 在单次尝试(pass@1)上领先,但 Kimi K3 在多次尝试(pass@k)上胜出,且成本低 64%。两者失败模式不同,路由结合可覆盖 95.6% 任务,Kimi 优先级联可达到 85.6% 准确率。Kimi K3 为开源模型,可
Mistral AI 发布了 Mistral Large 2 模型,拥有 128k 上下文窗口,支持多语言和 80 多种编程语言,参数规模为 1230 亿,可在单节点上高效运行。该模型在代码、推理和多语言基准上表现优异,并增强了指令遵循和函数调用能力。模型以研究许可发布,商业使用需获取商业许可,并已在 la Plateforme 和多家云平台上提供。
Anthropic 的 Claude Opus 5 模型能够仅凭单个文本提示生成完整的 3D 游戏世界,包括第一人称射击游戏和 Minecraft 克隆,无需外部文件或预制资源。该模型从头编写几何、纹理、物理和音乐代码,并在浏览器中渲染为可编辑的 HTML 文件。社区测试显示其质量较上一代 Claude 4 Opus 有显著提升,并在物理真实性和机械复杂度上
xAI 宣布,从即日起,SuperGrok 或 X Premium+ 订阅用户可直接在开源智能体编码平台 Kilo Code 中使用 Grok 模型,包括用于智能体编码的 Grok Build,无需单独的 API 密钥。Kilo Code 支持 VS Code、JetBrains IDE 和终端,提供规划、编码、调试等专用模式,并支持 500 多种模型。用户
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 和升级版 Devstral Small 1.1,前者在 SWE-Bench Verified 上得分 61.6%,后者得分 53.6% 且为开源模型中的新 SOTA。Devstral Small 1.1 以 Apache 2.0 协议发布,Devstral Medi