返回主题地图

AI 编码

技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月6日周四 · 2 条
正文结构化主题已通过公开置信门槛
Simon Willison's Weblog模型发布

Meta 发布 Muse Code 和 Muse Spark 1.2 编码模型

Meta 发布了 Muse Code 和 Muse Spark 1.2,后者是面向编码的模型更新,提升了代码生成、调试和代码库理解能力,并支持长序列智能体工具调用。模型提供两种定价选项,其中 contributor 版本通过允许数据使用大幅降价。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

Meta 发布 Muse Code 编码代理,面向大型代码库

Meta 发布了终端编码代理 Muse Code,旨在帮助程序员处理大型代码库中的复杂任务。该工具基于 Meta 的编码模型 Muse Spark,可并行运行子代理,目前处于测试阶段。此举旨在与 OpenAI 的 Codex 和 Anthropic 的 Claude Code 竞争,并强调成本优势。

8月5日周三 · 1 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering开源

Ponytail 技能修正自身基准,回应质疑并推动技能评估标准

开源技能 Ponytail 通过注入规则集,指导 AI 编码代理遵循 YAGNI 原则,避免过度工程化,自发布以来已获超 8.2 万 GitHub 星标。其原始基准声称减少 80-94% 代码,但遭质疑后作者重建基准,公开修正为平均减少约 54% 代码,并补充了行为测试框架。该事件凸显了 AI 技能缺乏评估标准的问题,Ponytail 的回应被视为更持久的贡

8月4日周二 · 2 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

阿里发布Qwen3.8,海外平台当日接入潮

阿里巴巴于8月3日发布新一代基座大模型Qwen3.8,编程与Agent能力大幅提升,性能位居全球第一梯队。发布当日,OpenRouter、OpenCode、Hermes Agent等多家海外主流平台纷纷接入Qwen3.8-Max,形成接入潮。该模型总参数2.4万亿,激活95B,支持长上下文与视觉理解,在多个评测榜单中名列前茅。Qwen3.8-Max预计下周开

正文结构化主题已通过公开置信门槛
Latent Space模型发布

Qwen3.8-Max发布:2.4T参数开源模型,主打编码与多模态智能体

阿里巴巴发布Qwen3.8-Max,一个2.4T参数的MoE模型,专注于编码、长程智能体任务和多模态推理,并承诺下周开源权重。该模型在多个基准测试中表现优异,如Frontend Code Arena排名第四,并展示了自主编码、芯片设计和电商策略等能力。API定价为每百万输入token 2美元,输出6美元。

8月3日周一 · 11 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

阿里发布2.4万亿参数Qwen3.8-Max,主打长期自主任务

阿里巴巴发布了旗舰模型 Qwen3.8-Max,拥有 2.4 万亿参数,专注于自主完成长期复杂任务。在测试中,该模型自主构建软件、复现并改进研究论文结果、运行模拟电商业务,并在芯片设计中大幅优化电路。模型现已可用,权重将于下周发布。

正文结构化主题已通过公开置信门槛
xAI News一手来源模型发布

xAI 发布 Grok 4.5:最强编码与智能体模型

xAI 发布了其最先进的模型 Grok 4.5,专为编码、智能体任务和知识工作设计。该模型在数万块 NVIDIA GB300 GPU 上训练,强调数据过滤和强化学习,以提升推理效率和编码能力。Grok 4.5 已集成到 Grok Build、Cursor 和 SpaceXAI 控制台,定价为每百万输入 token 2 美元、输出 token 6 美元,并宣称

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

gemma-4-A4B-98e-v7-coderx-it GGUF 量化发布,性能超越 Qwen2.5-Coder-14B

ManniX-ITA 发布了 gemma-4-A4B-98e-v7-coderx-it 模型的 GGUF 量化版本,提供了多种量化等级,并附有详细的基准测试结果。该模型在 HumanEval+ 和 MultiPL-E-100 上表现优异,尤其在低比特量化下仍保持高代码生成能力。与 Qwen2.5-Coder-14B 相比,在相同磁盘空间下,该模型以更低的比特

正文结构化主题已通过公开置信门槛
量子位模型发布

阿里发布Qwen3.8-Max,性能直逼Claude且价格低廉

阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,在编程、专业工作、长程任务和多模态分析等场景表现突出,在第三方榜单Arena中进入全球第一梯队,直逼Claude系列。该模型定价低廉,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,国际价格仅为Opus 5的40%和24%。实测显示其能端到端交付编程项目、进行长文

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Embabel 代理框架发布 1.0 正式版

Embabel 框架在 Java 上构建 AI 代理,现已达到 1.0 正式发布。它允许开发者将代理定义为类型化领域对象,并使用受游戏 AI 启发的目标导向行动规划(GOAP)在运行时动态规划行动序列。Embabel 基于 Spring AI 构建,支持多种模型提供商,并可与 LangGraph 等现有框架对比。该框架由 Spring 框架创始人 Rod J

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

隐喻诱导的算法引导:LLM代码生成中的跨领域程序迁移

该研究探讨了大型语言模型在代码生成中受隐喻指令影响的现象,发现隐喻可能引发跨领域程序性迁移,导致模型生成低效算法。研究者开发了MASC框架来诱发和检测这种“隐喻算法引导”效应,并通过行为评估和表征分析验证了其机制。结果表明,隐喻技能通过转移源领域的程序模式而非表面语言影响模型输出。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

Kimi K3 开源 2.8T 参数模型,技术创新与前端能力实测

雷峰网报道了 Moonshot AI 发布的开源模型 Kimi K3,该模型拥有 2.8 万亿参数,是迄今最大的开源模型。K3 采用两项核心创新:KDA 注意力机制和 AttnRes 残差连接,分别提升推理效率和训练效率。文章通过一个前端开发案例展示了 K3 的代码能力,并指出其 API 定价较高,部署门槛不低。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源模型发布

DeepCoder-14B开源模型发布,性能媲美o3-mini

Together AI与Agentica团队联合发布了DeepCoder-14B-Preview,这是一个基于DeepSeek-R1-Distilled-Qwen-14B通过分布式强化学习微调的开源代码推理模型。该模型在LiveCodeBench上达到60.6%的Pass@1准确率,与o3-mini相当,并开源了数据集、代码、训练日志和系统优化。训练使用了2

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源开源

DeepSWE-Preview:开源编码智能体通过强化学习达到 SOTA

Together AI 与 Agentica 团队合作推出 DeepSWE-Preview,这是一个基于 Qwen3-32B 并通过纯强化学习训练的开源编码智能体,在 SWE-Bench-Verified 上达到 59% 的准确率,创下开源权重编码智能体的新纪录。该模型使用 Agentica 的 rLLM 框架训练,并开源了数据集、代码、训练和评估日志。训练

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Kimi K3 对比 Claude Fable 5:成本与编码能力分析

Together AI 发布了对 Kimi K3 与 Claude Fable 5 在 DeepSWE 基准上的对比分析。结果显示,Kimi K3 在 pass@1 上以 68.5% 略低于 Fable 的 69.9%,但在 pass@2 和 pass@4 上反超,且每次运行成本仅为 4.65 美元,远低于 Fable 的 13.41 美元,每美元解决任务数

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Kimi K3 与 GPT-5.6 Sol 对比:成本、编码能力与路由策略

Together AI 在 DeepSWE 基准上对比了 Kimi K3 与 GPT-5.6 Sol。GPT-5.6 Sol 在单次尝试(pass@1)上领先,但 Kimi K3 在多次尝试(pass@k)上胜出,且成本低 64%。两者失败模式不同,路由结合可覆盖 95.6% 任务,Kimi 优先级联可达到 85.6% 准确率。Kimi K3 为开源模型,可

8月2日周日 · 4 条
正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral AI 发布 Mistral Large 2 模型,支持多语言与代码生成

Mistral AI 发布了 Mistral Large 2 模型,拥有 128k 上下文窗口,支持多语言和 80 多种编程语言,参数规模为 1230 亿,可在单节点上高效运行。该模型在代码、推理和多语言基准上表现优异,并增强了指令遵循和函数调用能力。模型以研究许可发布,商业使用需获取商业许可,并已在 la Plateforme 和多家云平台上提供。

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Claude Opus 5 实现单提示生成完整 3D 游戏原型

Anthropic 的 Claude Opus 5 模型能够仅凭单个文本提示生成完整的 3D 游戏世界,包括第一人称射击游戏和 Minecraft 克隆,无需外部文件或预制资源。该模型从头编写几何、纹理、物理和音乐代码,并在浏览器中渲染为可编辑的 HTML 文件。社区测试显示其质量较上一代 Claude 4 Opus 有显著提升,并在物理真实性和机械复杂度上

正文结构化主题已通过公开置信门槛
xAI News一手来源产品发布

xAI 与 Kilo Code 集成,订阅用户可直接使用 Grok 模型

xAI 宣布,从即日起,SuperGrok 或 X Premium+ 订阅用户可直接在开源智能体编码平台 Kilo Code 中使用 Grok 模型,包括用于智能体编码的 Grok Build,无需单独的 API 密钥。Kilo Code 支持 VS Code、JetBrains IDE 和终端,提供规划、编码、调试等专用模式,并支持 500 多种模型。用户

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral AI 发布 Devstral 新模型,提升代码智能体能力

Mistral AI 与 All Hands AI 合作推出 Devstral Medium 和升级版 Devstral Small 1.1,前者在 SWE-Bench Verified 上得分 61.6%,后者得分 53.6% 且为开源模型中的新 SOTA。Devstral Small 1.1 以 Apache 2.0 协议发布,Devstral Medi