返回主题地图

AI 编码

技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月14日周一 · 5 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

蚂蚁百宝箱推出商圈智能体模板,万达率先落地逛街Agent

蚂蚁百宝箱推出全新商圈智能体模板,集成美食推荐、店铺导览、营销活动推送及客服咨询等能力,并接入支付宝“碰一下”线下AI经营网络。万达等头部商圈综合体已率先落地,基于该平台搭建商圈搭子智能体,用户“碰一下”即可直达会员积分、停车缴费、店铺导览等高频服务。该模板将于9月下旬全面开放,支持商场在不改动原有系统架构的前提下对接全周期服务能力。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

三思而后行:LLM智能体的行动前验证

该论文提出在LLM智能体执行动作前进行廉价确定性验证,以捕获静默失败。针对shell命令和代码编辑两种动作模态,构建了包含9,930条命令和640次编辑的基准,并发布验证器与防护机制。结果显示,静态验证器可捕获95.8%的无效命令,而基于锚点的应用器将静默错误降至0.01%。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

LLM 软件工程中的测试驱动方法:阶段、任务与智能体技能综述

一篇 arXiv 综述论文系统梳理了大语言模型驱动软件工程中的测试驱动方法,围绕「测试改变了什么决策」这一核心问题,整合了 87 条研究记录(其中 83 条做了方法或协议级提取)及 5 项实践资源。论文区分了 Red–Green–Refactor 循环与测试条件生成、执行引导精炼、测试中介分析和仅评估测试等不同机制,并跨代码生成、修复、翻译、重构、克隆检测、

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

代码LLM离线后训练:性能、效率与崩溃

该研究探讨代码大语言模型能否完全离线进行强化学习后训练,而不依赖在线采样。作者在Qwen Coder、DeepSeek Coder和CodeLLaMa等0.5B至7B参数模型上,使用CodeNet数据集进行实验,发现仅需数小时训练即可显著提升零样本代码生成性能。研究还发现离线RL对学习率和训练轮数高度敏感,长时间训练会导致模型崩溃,其主因是logit方差而非

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向 OpenFOAM CFD 编码代理的案例包操作模型

该论文提出一种面向 OpenFOAM CFD 的「案例包(case-bundle)」操作模型,包含 Build 与 Replay 两种模式:Build 由工程师审查、编码代理协助开发案例,Replay 将已审查案例复用于新变体。研究用 GPT-5.5 在 Codex 中构建了一个 interFoam 案例包,并在远程 HPC 上回放执行 140 个 STL

9月13日周日 · 1 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

GitHub 推出 HydraFusion:Copilot 多模型路由实现前沿级性能

GitHub 推出 Project HydraFusion 研究预览,为 GitHub Copilot 提供运行时多模型编排能力,通过 Single、Cascade、Critique 三种执行模式动态路由请求。该系统在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点任务质量并降低 67% 预估成本,在内部 Ch

9月12日周六 · 4 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

外滩大会聚焦AI原住民:0团队1台电脑的超级个体崛起

2026年外滩大会在上海举行,主论坛和见解论坛的焦点转向年轻一代的AI原住民。22岁的陈博远创立逆矩阵科技,半年内获得超亿美元种子++轮融资;9岁选手罗安歌不懂编程,仅靠自然语言与AI协作开发出《泥土实验室》并获得黑客松一等奖。大会特设超级个体日,17位独立开发者展示了一人公司模式,如赵纯想借助AI打造《胃之书》并服务70国编剧。

正文结构化主题已通过公开置信门槛
量子位模型发布

Kimi突发K2.8:性能逼近K3,百万上下文全员开放

月之暗面于9月11日在Kimi Code和Kimi Work全量上线Kimi K2.8 Preview,官方称综合性能接近旗舰K3,Coding和Agent能力提升,并首次向所有会员档位开放1M上下文。该模型被定位为更适合代码补全和常规开发任务的低成本主力模型,以承接K3的高成本压力。背景是月之暗面ARR从6月的3亿美元增至8月的10亿美元,公司目标年底达2

正文结构化主题已通过公开置信门槛
量子位产品发布

网商银行百灵2.0上岗:4200万小微商家可用,信贷办理缩至10分钟

网商银行在2026外滩大会首次披露AI银行落地进展,推出面向4200万小微商家的普惠金融Agent「百灵2.0」,用户仅需在聊天框提出需求即可获得个性化信贷方案,复杂需求办理时间从3天缩短至10分钟。后台方面,网商银行建成八大AI工作台,其中千里眼、定海针、宝莲灯、筋斗云分别覆盖风控、人审、营销响应和研发提效,并披露Harness工程、评测、知识库、人机共生

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog观点

Anthropic 的 Boris Cherny:Claude 编写的生产代码应有更高标准

Anthropic 的 Boris Cherny 表示,由 Claude 编写的生产代码应当比人类编写的代码接受更高的标准。他介绍 Anthropic 内部设置了大量防护措施,包括大量 lint 规则、测试、Claude 驱动的端到端测试、每日运行的 Claude 模糊测试器、自动化代码审查与安全审查以及自动化代码重构等。若缺少这些措施,代码库可能变得难以维

9月11日周五 · 8 条
正文结构化主题已通过公开置信门槛
Simon Willison's WeblogAPI 更新

Python 3.15 软弃用 re.match(),新增 re.prefixmatch()

Python 3.15 发布经理 Hugo van Kemenade 介绍,即将发布的 3.15 版本对长期存在但容易混淆的 re.match() 函数进行软弃用,新增更清晰的替代名称 re.prefixmatch(),以反映其只锚定字符串开头而非结尾的行为。软弃用意味着该 API 被标记为不应再用于编写新代码,但不会承诺或威胁在未来移除。文章建议多数场景应

正文结构化主题已通过公开置信门槛
量子位产品发布

百度秒哒升级企业版并上线AI Coding商单平台

百度秒哒宣布升级,推出企业版与AI Coding商单平台。企业版强化组织协作、权限管理与运行保障,支持源码下载、本地部署和资源扩容;商单平台连接企业需求方与专业创作者,提供撮合、签约、支付宝托管结算与履约保障。官方称秒哒用户一年增长200倍,创造500万个应用,87%的创造者此前不会写代码,并以33.4%份额居中国AI原生无代码应用生成平台第一。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog开源

不要忽视 wrapture:Python monkey patching 新库

Simon Willison 在其博客中推荐了 Graham Dumpleton 于 2026 年 8 月 31 日发布的新 Python monkey patching 库 wrapture,认为它有望成为 Python 开发者的必备工具。wrapture 同时服务于测试和可观测性(类似 New Relic 风格的追踪),支持单元测试、调用记录、分阶段行为

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Solstice-AI 发布 Qwen3.8-27B NVFP4 量化模型

Solstice-AI 在 Hugging Face 发布了 Qwen3.8-27B-TURBO-Fable-Cold-Fusion 的 NVFP4 量化版本,基于 DavidAU 的 Cold Fusion 合并模型进行下游量化与打包。该模型宣称在 Claude Code 评测框架下于 9 项基准中全面超越 Claude Opus 4.6 Max,并支持

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

ReqEvolve:通过自动需求解释实现用户导向的软件自演化

研究者提出 ReqEvolve,一个面向用户驱动软件自演化的运行时代码生成系统,通过自动需求工程与测试驱动开发,将用户的高层自然语言请求转化为可执行功能。在 18 个项目、72 个软件演化案例上,ReqEvolve 达到 89.2% Pass@1,分别比 SpecFix 和消融基线高出 18.8% 和 32.6%。根因分析显示 64.5% 的失败案例源于代码

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Tiel-Coder-35B-A3B-GGUF:面向编程的量化 MoE 模型发布

Hugging Face 用户 peculiar-ragdoll 发布了 Tiel-Coder-35B-A3B-GGUF,这是对 ornith-ai/Ornith-1.5-35B-A3B 进行动态 imatrix 量化并内置 Sharp 聊天模板的 GGUF 版本,面向 agentic coding 与多轮对话。在 SWE-bench-Live 上 25 题

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Tiel-Coder-35B-A3B GGUF 量化版发布,主打本地智能体编程

Hugging Face 用户 peculiar-ragdoll 发布了 Tiel-Coder-35B-A3B-GGUF-MTP,这是对 ornith-ai/Ornith-1.5-35B-A3B 进行动态 imatrix 量化并内置 Sharp 聊天模板的 GGUF 版本,支持 MTP 投机解码。在 SWE-bench-Live 的 25 道题中修复 12

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering模型发布

OpenAI 发布 GPT-6 Astra,聚焦编程与计算机操作

OpenAI 发布 GPT-6 Astra,面向计算机操作、编程、专业工作流、科学和网络安全场景,初期向有限机构开放,并逐步上线 ChatGPT Plus、Pro、Business、Enterprise 及 OpenAI API、Microsoft Azure 和 AWS Bedrock。Astra 可操作图形界面完成填表、更新 CRM、建站、数据分析等任务

9月10日周四 · 2 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

规范驱动开发何时值得:AI 代码审查的治理基线研究

作者在 GAISS 2026 发表的研究中,围绕「人类对照规范基线审查 AI 生成代码」这一核心行为展开实验。结果显示,规范基线并未让审查者发现更多 bug,而是让已发现的 bug 变得可归因、可追溯,但代价是额外的时间和成本。作者指出,在简单任务上「先写规范」带来的显著收益很大程度上是推理效应的伪装,规范治理真正值得投入的场景是能力尚可但不完美的模型处理高

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

基于可验证代码世界模型的世界时间计算

该论文提出「世界时间计算」(world-time compute)方法,通过让语言模型编写可验证的代码世界模型(Code World Models),为符号化领域自动生成大量带精确标签的训练轨迹,从而提升模型对未见世界的泛化能力。作者同时发布零依赖框架 OpenWorld,将经过验证的世界模型编写流程压缩到分钟级,使批量制造训练经验变得可行。该方法与依赖海量