返回主题地图

AI 编码

技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月19日周三 · 2 条
正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

DeepSeek V4 Pro 与 GPT-5.6 Sol 对比:级联策略以更低成本提升编码准确率

Together AI 在 DeepSWE 基准上对比了 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol,发现 Sol 在单次尝试中准确率更高(72.7% vs 62.8%),但 Pro 成本仅为 Sol 的 1/35,且在多次尝试后覆盖率反超。通过先运行 Pro、失败时升级到 Sol 的级联策略,可解决 83.0% 的任务,每任务成本

正文结构化主题已通过公开置信门槛
GLM New Releases一手来源模型发布

智谱发布GLM-5.3旗舰模型,编程与安全能力显著提升

智谱AI发布了新一代旗舰模型GLM-5.3,其编程能力大幅提升,在内部基准上较GLM-5.2提升50%,并在公开测试中达到开源模型SOTA水平。该模型还展现出网络安全能力,在漏洞发现方面与Mythos 5持平,已联合多个中国安全团队测试并发现2436个漏洞。

8月18日周二 · 2 条
正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

Warp 推出软件工厂系统,简化 AI 开发流程

Warp 公司推出了 Warp Factories,这是一个用于构建和运营 AI 软件工厂的基础设施层系统,旨在简化 AI 开发流程。该系统基于软件开发的传统阶段,支持自动化,并可与 Codex、Claude Code 等模型及 Linear、Jira 等工具集成。Warp 首席执行官 Zack Lloyd 表示,该系统主要面向缺乏资源自建系统的中小公司,目

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

Claude AI生成的Python测试质量不弱于人类测试

一项研究评估了Claude AI生成的Python测试与人类编写的测试质量,发现Claude Sonnet/Opus 4.6及更新模型生成的测试在多个评估协议下不弱于人类编写的测试。该研究使用真实工具Extractor的测试套件,并采用四种独立评估方法,包括历史回退测试、AST变异测试、覆盖引导变异测试和定性评分。结果表明AI生成的测试质量与人类相当,但研究

8月17日周一 · 5 条
正文结构化主题已通过公开置信门槛
Qwen Model Repository Activity一手来源模型发布

Qwen3.8开源:首次推出Qwen-Max级模型,强化智能体与编码能力

Qwen团队在GitHub上发布了Qwen3.8系列模型,包括Qwen3.8-27B和Qwen3.8-2.4T-A95B,首次将Qwen-Max级模型开源。该系列在编码、专业工作、研究和长程智能体任务上性能显著提升,并支持推理深度调节和思考上下文保留。同时,Qwen3.6和Qwen3.5的更新也增强了智能体编码和全球语言覆盖。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

ISO接地NFR规范能否提升LLM代码生成质量?

该研究比较了在LLM代码生成中,基于ISO/IEC 25010:2023的丰富自然语言和结构化JSON两种NFR规范方式,与RobuNFR风格的单行基线。研究发现,ISO接地增强能改善静态质量代理指标并降低对提示措辞的敏感性,但不能可靠提升功能正确性;当ISO内容固定时,散文和JSON格式差异不大。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

基准优化不等于通用编码能力:需多样化评估

该论文指出,将SWE-bench等少数编码基准的分数视为通用编码能力的证据存在意义差距,因为针对基准的优化可能只提升任务特定性能。作者通过Django案例研究基准评估了后训练模型,发现SWE-bench优化带来的提升无法泛化到其他编码任务,甚至在同一仓库内也如此。论文呼吁采用多样化评估方法,并建立能力分类法和持续基准维护,以避免误导性的研究结论和部署决策。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

BatiAI 发布 Qwen3.6-27B GGUF 量化版,主打端侧智能体编码

BatiAI 发布了 Qwen3.6-27B 的 GGUF 量化版本,该模型基于阿里巴巴 2026 年 4 月 22 日开源的 Qwen3.6-27B 稠密模型,支持多语言、多模态和 262K 上下文。量化版本针对苹果芯片优化,提供多种量化等级,可在 Ollama 上运行,并宣称在智能体编码基准上媲美或超越 Qwen 3.5-397B-A17B MoE 模型

正文结构化主题已通过公开置信门槛
智东西模型发布

谷歌发布Gemini 3.7 Flash,编程能力大幅提升并限时半价

谷歌于8月14日发布Gemini 3.7 Flash,这是其面向编程和Agent场景的最强Flash系列模型,在编程、网页开发、复杂文档处理和企业自动化等任务上均有提升,其中DeepSWE v1.1成绩从49.0%升至65.3%。该模型在2026年底前提供半价优惠,每百万输入Token价格为0.75美元,输出Token价格为3.75美元。Gemini 3.7

8月15日周六 · 2 条
正文结构化主题已通过公开置信门槛
量子位模型发布

Qwen3.8-27B开源:消费级显卡跑Opus级Agent,多项评测超Claude

阿里开源了Qwen3.8-27B模型,总参数270亿,支持原生多模态、262K上下文,在SWE-bench Pro等多项代码和Agent评测中超越Claude Opus 4.6 Max。模型内置可调节的推理档位和preserve thinking功能,并支持通过Transformers、vLLM等框架部署,可在消费级显卡上运行。

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.32.12 发布,支持 Qwen 3.8 27B 模型

Ollama 发布 v0.32.12 版本,新增对 Qwen 3.8 27B 模型的支持。该版本针对 Apple Silicon 设备进行了优化,以提升性能和输出质量,特别适用于重复任务和编码代理场景。Qwen 3.8 在编码、专业工作、研究及长周期代理任务中表现出显著提升。

8月14日周五 · 7 条
正文结构化主题已通过公开置信门槛
THE DECODER产品发布

Claude Code 自主维护 Anthropic 软件,合并率 46%

Anthropic 正在测试其 AI 编程工具 Claude Code 自主维护公司内部软件的能力。在最近几周内,Claude 创建了 388 个拉取请求,其中 180 个在人工审核后被合并,合并率约 46%。Claude 通过 Slack 频道运行 12 种日常维护例程,涵盖崩溃模糊测试、重复代码合并、死代码移除等任务。Anthropic 工程师 Bori

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

GLM-5.3发布:编程能力暴涨50%,安全性能对标顶尖模型

智谱发布GLM-5.3模型,在基座不变的情况下,通过后训练技术使编程能力提升50%,并宣称在安全领域发现2436个漏洞,包括潜伏40年的DNS协议漏洞。该模型在多个评测中逼近或超越Claude Fable 5,并开源,同时推出编程工具ZCode和AutoClaw。

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

智谱AI发布GLM-5.3,称最强开源编码模型

中国AI初创公司智谱AI发布了GLM-5.3模型,声称其是最强大的开源权重编码模型,所有改进均来自扩展的后训练。该模型在基于代理的任务上表现突出,并在网络安全方面通过训练发现软件漏洞,共发现2436个漏洞。GLM-5.3现已通过GLM编码计划提供,权重将在两周后开源。

正文结构化主题已通过公开置信门槛
量子位模型发布

GLM-5.3发布:Coding接近Fable 5,安全能力登顶开源

智谱今日发布GLM-5.3模型,在Coding能力上接近Claude Fable 5,并成为最强开源安全模型。该模型在CyberGym白盒代码审查中得分84.5%,高于前代及GPT-5.6 Sol。智谱联合清华、南开等机构进行了密集红队测试,累计发现2404个漏洞,其中1088个为中高危。实测显示GLM-5.3能完成可交付的模拟游戏开发,并能自主发现、修复安

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

代码LLM记忆化诊断需考虑模型规模

该研究针对代码大语言模型(LLM)的记忆化诊断方法在模型规模扩大时失效的问题,提出传统探针(如同义词模糊测试、死代码插入)在大型模型上无法有效暴露记忆化现象。通过应用可逆数学变换分离表示负载与记忆化,发现大型编码器能吸收表示负载并保持正确求解,表明评估应关注模型对表面形式变化的适应性,而非单纯依赖记忆化检测。

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

谷歌发布Gemini 3.7 Flash,编码性能提升且价格减半

谷歌发布了Gemini 3.7 Flash模型,距离上一代Gemini 3.6 Flash仅三周。该模型在编码和AI代理方面性能显著提升,在FrontierCode和DeepSWE基准上分别达到43.6%和65.3%,超越Claude Sonnet 5和GPT-5.6 Terra。API定价为每百万输入token 0.75美元,输出token 3.75美元,

正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

Google 发布 Gemini 3.7 Flash:更智能、更便宜的编码与智能体模型

Google DeepMind 发布 Gemini 3.7 Flash,这是其 Flash 系列中最智能的模型,专为编码和智能体任务设计。该模型在软件工程、知识工作和网页开发方面显著改进,例如在 FrontierCode 1.1 和 DeepSWE v1.1 基准上得分大幅提升,并以半价(每百万 tokens 输入 $0.75,输出 $3.75)提供。Gem

8月13日周四 · 2 条
正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

工具架构如何塑造编码智能体行为:接口设计的关键作用

该研究通过控制实验比较了六种工具架构对编码智能体行为的影响,涉及三个模型和11,700条轨迹。结果显示,即使工具能力相似,架构也会改变智能体行为:结构化低级接口提高一致性,自然语言搜索扩大探索范围,Python CodeAct风格接口减少41.6%步骤和56.3%令牌使用,而轻量级认知脚手架工具影响有限。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

自进化代码图像推理:通过可执行反思提升视觉计算能力

该研究提出Code-with-Image范式,将视觉推理从语言链转移到Python程序执行,并构建CwI-Bench基准测试。作者提出Self-Reflection over Executable Reasoning,一种无需训练的自我进化循环,通过观察和可执行反射改进技能库,显著提升GPT-5.6-luna和Qwen3.5-27B在基准上的准确率,且技能可