NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可
技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 40 条
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可
NVIDIA 在八月庆祝本地 AI 生态,发布多款新模型和工具,包括 Cosmos 3 Edge、MiniMax-H3、Laguna S 2.1、DeepSeek-V4-Flash、Inkling-Small、Wan-Animate-2 和 LTX-2.5,并支持 Meta 的 Muse Glimmer 模型。这些模型和工具旨在推动本地 AI 和智能代理的发
arXiv 论文提出 DevIntent 基准,通过意图违反率(IVR)衡量 LLM 生成代码是否违背开发者隐含意图。在 49 个问题上,Claude Sonnet 4.6 和 GPT 4.1 虽通过 92% 的显式测试,但分别有 54.5% 和 63.5% 的问题违反隐含约束,表明通过率高估了代码与开发者意图的一致性。
Anthropic宣布5天后所有Claude Code将默认启用自动模式,该模式通过分类器自动审批工具调用,额外token开销由Anthropic承担。数据显示人工审批的权限请求中97%被同意,而自动模式在对抗测试中拦截率更高,且不随会话长度下降。Anthropic还委托Apollo Research和Trajectory Labs进行安全测试,并公开了拦截
另有 2 家信源报道
一项针对大型企业生产环境中AI生成C++代码的大规模实证研究显示,AI生成的代码在接口耦合、拷贝分配开销和显式循环使用方面存在独特质量特征,导致审查工作量增加和5-8%的计算资源消耗上升。通过提供针对性的分类反馈,可减少11.1%的静态分析警告并提升计算效率。该研究基于2025年4月至2026年4月间352万次代码变更。
Anthropic 宣布从 8 月 14 日起,Claude Code 将默认启用 Auto Mode,该模式允许 AI 自主执行开发任务,仅在检测到危险或不可逆操作时请求人工确认。测试显示,Auto Mode 在安全性上不逊于手动审批,并能使团队生成的 pull request 数量增加约 25%。此外,该模式还能抵御提示注入攻击,独立审计显示 720 次
另有 2 家信源报道
谷歌将Gemini后训练核心团队及DeepMind运营负责人Koray Kavukcuoglu迁至加州总部,以解决跨时区协作问题,并计划以超15亿美元收购AI编程初创公司Mechanize的技术与人才。此举旨在加速AI研发与产品整合,应对竞争压力。哈萨比斯卸任Google DeepMind日常管理,转任董事长及Alphabet首席科学家。
Simon Willison 使用 Codex Desktop 运行 GPT-5.6 Sol Ultra,将之前用 Claude Fable 5 生成游戏《Raccoon Heist》的相同提示词重新生成,得到了更好的游戏《Moonlight & Mayhem》。新版本包含博物馆场景、营救同伴等更丰富的玩法,但存在眼睛渲染为巨大球体的 bug,通过额外提示修
Spotify 的工程师 Aleksandar Mitic 和 Jo 在演讲中介绍了他们开发的编码代理 Honk,用于持续重写 Spotify 的全部代码库,以解决维护问题。Honk 取代了传统的脚本化迁移工具,利用 LLM 处理长尾复杂情况,使内部服务框架的采用时间从近一年缩短至不到一周。该演讲分享了 Honk 的开发历程、经验教训和当前状态。
Together AI 对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 在 DeepSWE 基准上进行了 900 次测试。Luna 在 pass@1 上领先 14 个百分点(67.2% vs 53.3%),但 DeepSeek 成本仅为 Luna 的六分之一,每美元解决任务数是 Luna 的 4.8 倍。采用 DeepSeek
Meta 发布了 Muse Spark 1.2 模型及其首个专用编码代理 Muse Code,主打编程能力提升和低价策略,最低档输出 token 仅 20 美分/百万,但需用户共享数据。Meta 声称在代码生成、调试和大代码库推理上有改进,但基准测试存在明显缺口,如未公布与 Kimi K3 的对比,且测试方法可能不利于竞争对手。Muse Code 具有独特的
另有 1 家信源报道
该论文提出了一种面向嵌入式C软件的函数复用检测方法,通过领域感知的检索增强生成(RAG)流水线,结合注释、调用图和README等上下文信息,使用八种嵌入模型提取特征,并设计四种硬件兼容性验证器过滤候选函数。在六个公共嵌入式项目上的评估显示,SonarQube作为复用过滤器存在93.6%的误报率,而该方法验证器准确率达97.5%,有效弥补了静态分析在硬件兼容性
Meta 发布了 Muse Code 和 Muse Spark 1.2,后者是面向编码的模型更新,提升了代码生成、调试和代码库理解能力,并支持长序列智能体工具调用。模型提供两种定价选项,其中 contributor 版本通过允许数据使用大幅降价。
另有 1 家信源报道
Meta 发布了终端编码代理 Muse Code,旨在帮助程序员处理大型代码库中的复杂任务。该工具基于 Meta 的编码模型 Muse Spark,可并行运行子代理,目前处于测试阶段。此举旨在与 OpenAI 的 Codex 和 Anthropic 的 Claude Code 竞争,并强调成本优势。
开源技能 Ponytail 通过注入规则集,指导 AI 编码代理遵循 YAGNI 原则,避免过度工程化,自发布以来已获超 8.2 万 GitHub 星标。其原始基准声称减少 80-94% 代码,但遭质疑后作者重建基准,公开修正为平均减少约 54% 代码,并补充了行为测试框架。该事件凸显了 AI 技能缺乏评估标准的问题,Ponytail 的回应被视为更持久的贡
阿里巴巴于8月3日发布新一代基座大模型Qwen3.8,编程与Agent能力大幅提升,性能位居全球第一梯队。发布当日,OpenRouter、OpenCode、Hermes Agent等多家海外主流平台纷纷接入Qwen3.8-Max,形成接入潮。该模型总参数2.4万亿,激活95B,支持长上下文与视觉理解,在多个评测榜单中名列前茅。Qwen3.8-Max预计下周开
阿里巴巴发布Qwen3.8-Max,一个2.4T参数的MoE模型,专注于编码、长程智能体任务和多模态推理,并承诺下周开源权重。该模型在多个基准测试中表现优异,如Frontend Code Arena排名第四,并展示了自主编码、芯片设计和电商策略等能力。API定价为每百万输入token 2美元,输出6美元。
阿里巴巴发布了旗舰模型 Qwen3.8-Max,拥有 2.4 万亿参数,专注于自主完成长期复杂任务。在测试中,该模型自主构建软件、复现并改进研究论文结果、运行模拟电商业务,并在芯片设计中大幅优化电路。模型现已可用,权重将于下周发布。
ManniX-ITA 发布了 gemma-4-A4B-98e-v7-coderx-it 模型的 GGUF 量化版本,提供了多种量化等级,并附有详细的基准测试结果。该模型在 HumanEval+ 和 MultiPL-E-100 上表现优异,尤其在低比特量化下仍保持高代码生成能力。与 Qwen2.5-Coder-14B 相比,在相同磁盘空间下,该模型以更低的比特
阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,在编程、专业工作、长程任务和多模态分析等场景表现突出,在第三方榜单Arena中进入全球第一梯队,直逼Claude系列。该模型定价低廉,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,国际价格仅为Opus 5的40%和24%。实测显示其能端到端交付编程项目、进行长文
Embabel 框架在 Java 上构建 AI 代理,现已达到 1.0 正式发布。它允许开发者将代理定义为类型化领域对象,并使用受游戏 AI 启发的目标导向行动规划(GOAP)在运行时动态规划行动序列。Embabel 基于 Spring AI 构建,支持多种模型提供商,并可与 LangGraph 等现有框架对比。该框架由 Spring 框架创始人 Rod J
该研究探讨了大型语言模型在代码生成中受隐喻指令影响的现象,发现隐喻可能引发跨领域程序性迁移,导致模型生成低效算法。研究者开发了MASC框架来诱发和检测这种“隐喻算法引导”效应,并通过行为评估和表征分析验证了其机制。结果表明,隐喻技能通过转移源领域的程序模式而非表面语言影响模型输出。
雷峰网报道了 Moonshot AI 发布的开源模型 Kimi K3,该模型拥有 2.8 万亿参数,是迄今最大的开源模型。K3 采用两项核心创新:KDA 注意力机制和 AttnRes 残差连接,分别提升推理效率和训练效率。文章通过一个前端开发案例展示了 K3 的代码能力,并指出其 API 定价较高,部署门槛不低。
Together AI 与 Agentica 团队合作推出 DeepSWE-Preview,这是一个基于 Qwen3-32B 并通过纯强化学习训练的开源编码智能体,在 SWE-Bench-Verified 上达到 59% 的准确率,创下开源权重编码智能体的新纪录。该模型使用 Agentica 的 rLLM 框架训练,并开源了数据集、代码、训练和评估日志。训练
Anthropic 的 Claude Opus 5 模型能够仅凭单个文本提示生成完整的 3D 游戏世界,包括第一人称射击游戏和 Minecraft 克隆,无需外部文件或预制资源。该模型从头编写几何、纹理、物理和音乐代码,并在浏览器中渲染为可编辑的 HTML 文件。社区测试显示其质量较上一代 Claude 4 Opus 有显著提升,并在物理真实性和机械复杂度上
xAI 宣布,从即日起,SuperGrok 或 X Premium+ 订阅用户可直接在开源智能体编码平台 Kilo Code 中使用 Grok 模型,包括用于智能体编码的 Grok Build,无需单独的 API 密钥。Kilo Code 支持 VS Code、JetBrains IDE 和终端,提供规划、编码、调试等专用模式,并支持 500 多种模型。用户
Meta 推出 Muse Spark 1.1 多模态推理模型,显著提升智能体任务、工具使用、编码和多模态理解能力,并首次通过 Meta Model API 公开预览提供。该模型支持百万 token 上下文,可编排多智能体系统,在计算机使用和编码方面表现优异,同时通过安全评估。
Mistral AI 发布了 Mistral Large 2 模型,拥有 128k 上下文窗口,支持多语言和 80 多种编程语言,参数规模为 1230 亿,可在单节点上高效运行。该模型在代码、推理和多语言基准上表现优异,并增强了指令遵循和函数调用能力。模型以研究许可发布,商业使用需获取商业许可,并已在 la Plateforme 和多家云平台上提供。
Anthropic 发布了 Claude Sonnet 5,这是其最强大的代理型 Sonnet 模型,在编码、代理任务和专业工作中表现出色,性能接近 Opus 4.8 但价格更低。该模型即日起在所有计划中可用,并通过 Claude API 提供,具有限时优惠定价。早期合作伙伴反馈显示其在复杂任务中的自主性和效率显著提升,安全评估也显示其不良行为率低于前代。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 和升级版 Devstral Small 1.1,前者在 SWE-Bench Verified 上得分 61.6%,后者得分 53.6% 且为开源模型中的新 SOTA。Devstral Small 1.1 以 Apache 2.0 协议发布,Devstral Medi
Daniel Doubrovkine在演讲中分享了他对LeetCode式编程面试的反对观点,并讲述了自己在FAANG公司面试中失败的经历。他展示了如何利用AI工具如Claude完成代码任务,并强调在AI时代应摒弃传统面试方式。他拥有丰富的编程经验,包括开发搜索引擎Alkaline,并认为AI工具为开发者提供了平等机会。
Google AI 宣布 Gemini API 的 Managed Agents 新增环境钩子、模型选择和免费层访问功能。该功能基于 Interactions API,在隔离云沙箱中协调推理、代码执行等任务。Gemini 3.6 Flash 现为默认模型,支持通过配置选择其他模型。环境钩子允许在工具调用前后运行自定义脚本,用于安全检查和代码格式化。此外,还引
Import AI 466 报道了 Epoch 和 METR 发布的 MirrorCode 基准测试,用于评估 AI 系统完成长期编程任务的能力,结果显示 Opus 4.7 等模型能在 14 小时内完成人类需 2-17 周的任务,但仍有部分任务无法解决。同时,Anthropic 展示了 Claude Opus 4.7 在机器人任务中自主完成速度比人类快 20
Anthropic 于周五发布了 Claude Opus 5 模型,官方基准显示其性能接近 Fable 5,但独立评估认为其实际表现更优。Epoch 的 ECI 指数显示 Opus 5 得分为 159,略低于 Fable 5 的 161,但在软件工程基准上持平。社区反馈强调其在编码和浏览器自动化等实际任务中的出色表现,同时也有对基准测试有效性的质疑。
另有 1 家信源报道
Ollama 发布 v0.32.0 版本,引入全新的交互式代理体验,运行 `ollama` 命令即可启动代理,帮助用户编码和委派工作。该版本将 Codex App 集成更名为 ChatGPT,并简化了集成选择菜单,仅保留最受欢迎的集成。此外,对于较旧的代理模型(如 CodeLlama、Qwen2.5、Llama 3.x 等),启动前会显示弃用警告。
Z.ai 于 2026 年 6 月发布了开源模型 GLM-5.2,该模型在编码代理任务中表现出色,被社区视为开源代理的转折点。其性能在多个基准测试中与 OpenAI 和 Anthropic 的闭源模型相当,甚至超越,引发了广泛关注。作者认为 GLM-5.2 缩小了开源与闭源模型的能力差距,并可能对 Anthropic 等闭源实验室构成竞争压力。
斯洛文尼亚保险公司 Triglav 通过部署微软 Copilot 和培养 40 名数字导师,推动 AI 在内部流程中的应用,如法律文件起草和员工入职支持。公司强调治理和以人为本,将 AI 视为提升效率的文化转型工具。
作者Ethan Mollick提前体验了GPT-5.5,认为其性能显著提升,尤其在编码和图像生成方面,并展示了模型、应用和工具链的进步。他用GPT-5.5 Codex处理自己的学术数据,生成了接近博士二年级水平的论文,表明AI能力仍在快速提升,但前沿能力仍不均衡。
本文由 Ahead of AI 发布,作者 Sebastian Raschka 探讨了编码代理(coding agents)的设计与组件,强调代理系统(如 Claude Code、Codex CLI)通过工具使用、内存和仓库上下文管理,使 LLM 在实际编码任务中表现更佳。文章区分了 LLM、推理模型、代理和代理框架(harness)的概念,并指出编码框架(
Moonshot AI 发布了 Kimi K2,这是一个具有 1 万亿总参数和 320 亿激活参数的混合专家(MoE)语言模型,专注于智能体能力。该模型在多个基准测试中表现出色,尤其在编码任务上,并提供了基础版和指令版两种变体。Kimi K2 采用 Muon 优化器进行训练,支持 128K 上下文长度,并已在 Hugging Face 上开源。