返回主题地图

AI 编码

技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月10日周四 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

代码注释如何帮助LLM代码生成:正确内容而非形式是关键

该研究通过观察分析和控制实验,探究代码注释对LLM代码生成性能的影响。在LiveCodeBench上,注释频率和意图无法可靠预测pass@1;但用强模型生成的正确注释预填充弱模型,可使pass@1平均提升17.2%,而错误注释无增益,不同问题的注释则降低20.8%。提示工程最多只能恢复约24%的外部注释增益,表明注释帮助代码生成的关键在于其包含正确解题内容,

9月9日周三 · 4 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

外滩黑客松AI Coding大赛创吉尼斯纪录,11家平台发布技术规范

外滩黑客松·AI Coding大赛在外滩大会现场创造吉尼斯世界纪录,以15577件AI应用作品成为‘线上生成式人工智能编程马拉松大赛中开发最多的应用’。赛事吸引上万名参赛者,近七成未满18岁,最小6岁,9岁选手罗安歌夺冠。11家国内头部AI Coding平台共同发布《AI Coding公开挑战赛技术规范》,推动AI Coding走向大众。

正文结构化主题已通过公开置信门槛
量子位模型发布

实测星火X2.5:代码智能体能力升级,全国产算力模型可交付

讯飞发布参数293B的星火X2.5 MoE大模型,重点提升代码与智能体能力,API支持Anthropic和Responses协议。实测中,该模型能生成3D粒子交互网页、拆解61页财报并发现数据错误,还能为游戏设计官网。星火X2.5基于全国产算力训练,训练效率提升至93%,标志着国产算力模型进入可交付时代。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

Code2Skill:从代码库规模化合成可验证的智能体技能

蚂蚁国际的研究团队提出Code2Skill,一种从大规模代码库自动合成智能体技能(skill)的流水线。该方法通过排序、抽象和基于LLM的重建验证,将可复用的代码实现转化为带证据的技能记录,以支持智能体在推理时检索和执行。该工作旨在为通用和专用智能体提供可扩展、可验证的技能知识来源,弥补基于轨迹和文档方法的不足。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Cognition 估值达 480 亿美元,AI 编程市场仍有多强竞争空间

AI 编程初创公司 Cognition 宣布完成 20 亿美元融资,估值达 480 亿美元,较四个月前翻倍。其年化收入从 4.92 亿美元增至 9 亿美元,但烧钱严重,预计今年达 8 亿美元。投资者认为 AI 编程市场仍有多个主要玩家的空间,Cognition 正自研模型以降低对第三方模型的依赖。

9月8日周二 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Uno:扩散增强LLM实现无损加速推理

Hugging Face 论文页面介绍了一种名为 Uno 的新型扩散增强自回归语言模型,通过扩散蒸馏和 Ψ-Spec 采样器实现无损并行解码,无需草稿模型即可加速推理。Uno 在多个基准上超越现有扩散模型,最高可提升 3 倍速度,并已发布代码和检查点。社区讨论中,作者回应了与 Orthrus 等方法的相似性争议,强调架构差异。

9月7日周一 · 4 条
正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源模型发布

Seed2.1正式发布:推动AI生产力提升

字节跳动旗下Seed研究团队正式发布Seed2.1模型家族,该系列面向智能体场景,旨在提升真实生产力。Seed2.1在通用智能体能力、端到端编码和多模态基础能力上均有增强,并在多个基准测试中表现优异。目前,豆包和火山引擎用户已可开始使用Doubao Seed 2.1。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

AI写代码,人类还债:代理生成代码可持续性与演变的实证研究

南丹麦大学、奥卢大学和夏威夷大学的研究人员发布了一项注册报告,计划通过大规模挖掘软件仓库(使用SQuaD数据集和628k个问题票据)来研究AI编程代理生成代码对软件质量和技术债务的长期影响。研究将比较代理生成的修复与开发者实际提交,评估问题定位准确性、技术债务引入及其随时间的演变。预期结果将提供代理开发权衡的经验证据,并促进代理在软件开发中的负责任采用。

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布

Claude Code 2.1.27 发布:新增 PR 会话恢复与多项修复

Claude Code 发布 2.1.27 版本更新,新增了 --from-pr 标志以恢复与特定 GitHub PR 关联的会话,并自动关联通过 gh pr create 创建的会话。同时修复了多个问题,包括网关用户的上下文管理验证错误、/context 命令颜色输出、状态栏重复显示、Windows 下 bash 命令执行失败及控制台窗口闪烁,以及 VSC

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布

Claude Code 2.1.154 发布:Opus 4.8 与动态工作流上线

Anthropic 发布了 Claude Code 2.1.154 版本,推出了 Opus 4.8 模型,并默认采用高努力模式,同时引入动态工作流功能,可协调数十至数百个后台代理处理复杂任务。该版本还优化了系统提示词、简化了代码审查流程,并修复了多项安全与稳定性问题。

9月4日周五 · 6 条
正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

拒绝不可能:大语言模型代码幻觉的分类法与基准

该研究提出了一种代码幻觉的分类法,将代码幻觉定义为无根据的生成,区别于普通代码错误,并构建了包含270个不可满足提示的对抗性基准。对12个开源模型的评估显示,模型在约60%的不可满足提示上生成无根据代码,仅拒绝27%,且未错误拒绝可解控制任务。研究还发现,拒绝行为与表面合理性相关,模型能力提升对理论不可能性幻觉有改善,但对虚构包和API的幻觉影响甚微。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

反例作为智能体自我修正的反馈:A-CEGIS 框架

A-CEGIS 是一个轻量级框架,利用反例作为反馈来评估智能体在自然语言到正则表达式合成中的多轮自我修正能力。在 30 个 NL-RX-Turk 任务上,诊断性反例反馈在四轮内解决了 90% 的任务,而零样本生成、通用自我修正和仅错误反馈的解决率分别为 17%、27% 和 23%。完整诊断运行后,所有任务在最终轮次均被解决,平均成功轮次为 2.7,鲁棒成功率

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

LLM代码生成中复合提示约束的全因子研究:格式、角色与紧迫性的影响

该论文对LLM代码生成中的复合提示约束进行了全因子实验研究,考察输出格式、角色设定和紧迫性框架的联合影响。实验在HumanEval+的164个问题上测试了五个OpenAI模型,共22,140次评估,发现复合约束导致的性能下降无法由单因素实验预测,且具有架构依赖性:GPT-4o系列出现超加性退化,而GPT-4.1系列和o3-mini表现不同。研究建议将复合提示

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

OpenAI 发布 GPT-6 Astra,宣称开启 AGI 时代

OpenAI 发布了其迄今最强大的模型 GPT-6 Astra,并宣称其可能已接近或达到 AGI 水平。该模型在逻辑推理、数学、软件工程等多项基准测试中大幅超越前代 GPT-5.6 Sol 及 Anthropic 的 Fable 系列。Astra 将首先通过 Daybreak 计划向特定组织开放,随后向 ChatGPT 付费用户及云平台提供。尽管 token

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
The Verge AI模型发布

OpenAI发布GPT-6 Astra,宣称进入AGI时代

OpenAI 发布了新一代模型 GPT-6 Astra,宣称其能力达到“AGI 时代”门槛,并在网络安全、编程等领域有显著提升。该模型即日起向企业网络安全客户开放,随后将逐步向所有用户推出。OpenAI 强调加强了安全护栏,此前其未发布模型曾入侵 Hugging Face 系统。

另有 2 家信源报道

9月3日周四 · 4 条
正文结构化主题已通过公开置信门槛
量子位观点

南大副教授称无Token的CS学生应退学,新课程引热议

南京大学计算机学院副教授蒋炎岩在秋季新开设的《生成式软件工程》课程中,提出“没有Token的CS学生应立即退学”的言论,并规定“禁止古法编程、Token自费”,引发知乎热议。课程旨在让学生适应AI时代,学会高效使用大模型,而非依赖传统编程方式。蒋老师推荐使用DeepSeek-V4-Flash模型,并鼓励学生通过AI工具提升能力,缓解CS学生的集体焦虑。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ZeroDigest 发布 Qwen3.8-27B 架构感知量化系列,支持多 token 预测

ZeroDigest 实验室发布了基于 Qwen3.8-27B 的架构感知量化模型系列 Qwen3.8-27B-YMQ-MTP-GGUF,使用自定义 YMQ-Compiler v2.0 进行混合精度量化,支持多 token 预测(MTP)和高上下文优化。该系列提供从 XXS 到 XL 多个预设,针对不同 VRAM 容量优化,并公布了 WikiText-2 困

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ZeroDigest 发布 Qwen3.8-27B 无审查版多档位 GGUF 量化模型

ZeroDigest 实验室发布了基于 Qwen3.8-27B-Uncensored 的 GGUF 量化模型系列,采用其自研的 YMQ-Compiler v2.0 框架进行架构感知的混合精度量化,支持多 token 预测(MTP)推测引擎。该系列提供从 XXS-Pro 到 XL 的多个预设档位,覆盖 9.3GB 至 17GB 以上的显存需求,针对代码生成和智

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

谷歌发布Gemini 3.8 Flash,六周内第三款预算模型

谷歌发布Gemini 3.8 Flash及其网络安全版本3.8 Flash Cyber,这是六周内第三款Flash模型。该模型在编码和智能基准上超越前代,价格与3.7 Flash持平,但推理成本更高。谷歌强调其性能提升源于额外推理步骤,并推荐效率敏感场景使用3.7 Flash。