返回主题地图

AI 编码

技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月25日周五 · 4 条
正文结构化主题已通过公开置信门槛
The Verge AI产品发布9

微软发布 Copilot 超级应用,整合聊天、编码与代理

微软正式发布重新设计的 Copilot「超级应用」,将聊天、编码和代理三类 AI 能力整合进单一界面,分为 Home、Code、Autopilot 三个标签页。其中原名为 Scout 的个人 AI 助手被更名为 Autopilot,定位为企业级「数字队友」,拥有独立身份、记忆、计算机和工作区。微软对 Cowork、Code、Autopilot 采用按用量计费

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER观点1

Rails 创始人 DHH 宣布不再手写代码

Ruby on Rails 创始人、Basecamp 联合创始人 DHH 在 Rails World 2026 主题演讲中宣布,自己已不再手写代码,自 2026 年 3 月左右起未手写过一行代码。他认为对大多数程序员和公司而言,手工编程已不再具有经济意义,到年底这一判断将适用于几乎所有领域,并称「英语是比 Ruby 更好的编程语言」。DHH 将这一转变视为新

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究4

IaC-Guard-V:LLM 生成基础设施代码修复的验证框架

研究者提出 IaC-Guard-V 验证框架,通过语法有效性、目标问题解决、回归安全、补丁最小性四道验证关卡评估 LLM 生成的 IaC 修复。基于 70 个真实 Terraform 与 Kubernetes 错误配置样本、三种修复策略和三个 LLM 系列共 630 次实验,发现单次提示下仅 32-50% 修复通过完整验证,而验证引导的迭代修复可将通过率提升

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog观点1

Simon Willison:编码智能体让软件工程更难

Simon Willison 在其博客中表示,随着与编码智能体(coding agents)协作时间的增加,他越发认为这些工具反而让软件工程变得更难。他指出,虽然借助它们能完成惊人的工作,但要释放其全部潜力需要极高的纪律性和知识储备。

9月24日周四 · 5 条
正文结构化主题已通过公开置信门槛
Latent Space观点1

铸造厂与导航者:降低科学研究的成本

Latent Space 客座文章讨论 AI 如何改变科学研究。作者 Adrian Sanborn 以 Endura Therapeutics 为例,提出生物技术公司分化为两类:Foundries 通过新一代测序、多重检测、高通量显微和物理自动化降低实验成本、加速数据生成;Navigators 则把 AI 嵌入公司日常流程,加快决策与迭代。文章认为,代码生成

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究1

阶段监督潜在推理实现单次JavaScript反混淆

该论文提出一种阶段感知的潜在推理框架,用于JavaScript反混淆。方法将确定性反混淆工具产生的中间输出转化为监督信号,基于Coconut(连续思维链)范式训练模型,使其在训练时学习多阶段重写过程,但在推理时仅接收混淆代码并一次性生成清理后的程序。在JsDeObsBench上的初步结果显示,基于Coconut的模型将语法有效性提升至50%(直接微调为15%

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究1

Spec2COBOLRot:面向真实 COBOL 语料生成的智能体 AI 退化循环

该论文提出 Spec2COBOLRot,一个基于智能体 AI 的流水线,用于生成具有真实感的 COBOL 程序语料。方法结合规范驱动的生成与迭代退化,退化过程由从真实生产代码中提取的模式和复杂度目标引导,其中真实性被定义为结构上对生产代码的保真度。在三个不同业务领域的程序上评估显示,该流水线能可靠生成语法有效的程序并提升结构复杂度,但并非总能保持业务行为,且

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程1

用 Amazon Bedrock 开源权重模型驱动 AI 编码代理

AWS Machine Learning Blog 介绍如何将开源权重模型与开源终端 AI 编码代理 OpenCode 结合,通过 Amazon Bedrock 在自有 AWS 账户内运行推理,避免数据外发、供应商锁定和按席位收费。文章给出配置方法、多模型工作流,并以 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B、NVIDI

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog教程

用实时示例解释 Shadow Roots

Simon Willison 在博客中展示了一个由 Fable 5.1 Medium 生成的交互式 artifact,用于解释 CSS 的 shadow roots 概念。文章本身聚焦前端技术教学,但页面同时列出了近期 AI 相关文章标题,包括 Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 及新一轮价格战,以及 Jev 提出的 S

9月23日周三 · 8 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering开源1

Graphify:统一代码库上下文,简化智能体软件工程

Graphify 是一款开源工具,可将代码库、文档和非结构化数据转换为可查询的多模态知识图谱,以优化 AI 编码工作流。该项目于 2026 年 4 月发布,采用每周多次更新的快速迭代节奏,近期改进了 Terraform 块属性保留、跨文件方法解析等解析器能力。它通过 tree-sitter 提取 AST 并结合文档语义线索构建统一图谱,可经 MCP 服务器接

正文结构化主题已通过公开置信门槛
Latent Space模型发布1

Claude Opus 5.5 发布并成 AINews 默认模型,多家厂商降价 40-50%

Anthropic 发布 Claude Opus 5.5,作为新 Claude 5.5 家族首个模型,宣称在多数任务上达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并改善写作与指令遵循。OpenAI 约一小时后发布 GPT-6 Sol 和 Luna,定价比 GPT-5.6 低 50%。Opus 5.5 成为 Clau

正文结构化主题已通过公开置信门槛
量子位模型发布1

Claude Opus 5.5 突袭:跑分登顶,API 价格打 8 折

Anthropic 发布旗舰模型 Claude Opus 5.5,在 Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0 等编程与知识工作基准上登顶,输出速度比 Opus 5 快 30% 以上。API 输入输出价格下降 20%,缓存读取价从每百万 Token 0.50 美元降至 0.20 美元,Anthr

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究1

Shaker 在 Python 项目 flaky 测试检测中的评估

该研究首次针对 Python 项目评估 Shaker 的 flaky test 检测能力。研究者从 Gruber 等人的真实数据集抽取 137 个非顺序依赖的 flaky 测试,在相同执行预算下对比 Shaker 与普通重跑(ReRun)。结果显示 Shaker 未带来统计显著优势(37.2% vs 35.8%),原因在于不到一半的真实 flaky 测试在独

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

IFM 发布 K2-Horizon-3.7B 开放权重模型

IFM 在 Hugging Face 发布 K2-Horizon-3.7B,这是 K2-Horizon 系列中的小型稠密解码器模型,拥有 3.7B 核心参数和 512K 原生上下文窗口。该模型在 agentic、编码和推理基准上与 Qwen3.5-4B、G9v3-3B、Granite 4.2-3B、Nemotron 3 Nano-4B 等开放权重稠密模型对比

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布1

GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 上正式可用。GPT-6 Sol 面向编码、调试、数据分析等复杂任务,GPT-6 Sol 在内部事实性评估中的错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发、可重复的轻量任务,两者 API 定价均显著低于 GPT-5.6 前代。两款

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI模型发布

OpenAI 发布 GPT-6 Sol 和 Luna,成本更低错误更少

OpenAI 发布 GPT-6 系列新成员 Sol 和 Luna,称其在效率与成本上大幅优化,API 价格降至 5.6 系列的一半,并强调事实准确性和代码错误率改善。OpenAI 声称新模型在多项任务上优于 Anthropic 的 Fable 和 Opus,而 Anthropic 在 OpenAI 发布前 90 分钟刚推出 Opus 5.5。新模型已上线 C

正文结构化主题已通过公开置信门槛
TechCrunch AI模型发布

Anthropic 发布 Opus 5.5:降价且性能达 Fable 级

Anthropic 于周二发布新模型 Opus 5.5,公司称其在编程和知识工作性能上创下新纪录,并在多项基准上超过更大的 Fable 模型。该模型输出 token 价格从每百万 25 美元降至 20 美元,运行更快、所需算力更低,同时调整了沟通风格,减少术语并前置关键信息。这是 Anthropic CEO Dario Amodei 主张放缓前沿能力推进节奏

9月22日周二 · 3 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

poolside 发布 Laguna XS.2:33B MoE 本地智能体编程模型

poolside 发布 Laguna XS.2,一个 33B 总参数、每 token 激活 3B 的混合专家(MoE)模型,面向本地运行的智能体编程与长周期任务。模型采用滑动窗口注意力与全局注意力 3:1 混合布局、FP8 KV 缓存和原生交错推理,支持 262,144 token 上下文,并以 Apache 2.0 许可开源。在 SWE-bench Ver

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

用户画像如何影响LLM代码生成:偏见实证研究

该研究对LLM代码生成中的用户画像偏见进行了大规模实证分析,测试了Gemini 2.5 Pro和GPT-OSS-120B两个模型,使用覆盖国籍、性别和经验水平的18种人口统计画像,对比中性基线,分析了超过35,000个生成程序。结果显示,人口统计标记在高达65%的回复和70%的推理轨迹中出现,尽管与任务语义无关;在LiveCodeBench上,画像提示使Ge

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

身份还是提示噪声?LLM 代码生成的校准不变性审计

该研究对七个模型在 HumanEval+ 和 MBPP+ 上的 3073 万次 Python 代码生成进行了校准不变性审计,考察模型分配性别、国家和职业人设是否影响代码输出。经任务内随机化和 FDR 校正后,职业是最一致的结构性轴:CodeBLEU 离散度在 10/14 个模型-基准单元中超过可交换性零假设,但中位超额仅 0.141 分,且通过率离散度均不显