GraphAlignCoder:对齐程序与证明图以提升代码生成
GraphAlignCoder 是一种新的代码生成训练框架,通过将程序图与 Lean 证明图对齐,将显式的正确性结构注入代码生成。实验表明,相比 CodeRL,它在 LiveCodeBench v6 上解决数从 38 提升到 50,在 BigCodeBench Hard 上从 16 提升到 23,相对提升 31.6% 和 43.8%。该框架通过结构注入和巩固
技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
GraphAlignCoder 是一种新的代码生成训练框架,通过将程序图与 Lean 证明图对齐,将显式的正确性结构注入代码生成。实验表明,相比 CodeRL,它在 LiveCodeBench v6 上解决数从 38 提升到 50,在 BigCodeBench Hard 上从 16 提升到 23,相对提升 31.6% 和 43.8%。该框架通过结构注入和巩固
本研究首次大规模实证探究心理影响策略(如理性说服、奉承、交换等八种)对LLM代码生成的影响,基于Yukl & Falbe的分类法构建提示模板,在五个开源模型和两个基准上评估。结果显示,强调紧迫性的提示框架会降低代码的正确性和安全性。研究为设计透明可解释的人机交互提供见解。
DeepSeek发布了V4 Pro正式版,API平台已更新至DeepSeek-V4-Pro-0813,多项基准测试显示其Agent能力接近或超越Fable 5和Opus 4.8。价格与预览版持平,但网友发现其思维链输出变得简略,可能影响写作能力。该发布被视为国产开源模型在性价比之外向SOTA发起冲击的标志。
Google 于 2026 年 8 月 13 日发布 Gemini 3.7 Flash 模型,该模型面向编码和智能体任务,在软件工程、Web 开发和智能体工作流方面有显著改进,并推出截至 2026 年 12 月 31 日的优惠定价。
另有 1 家信源报道
AI 编程初创公司 Cognition 正与投资者洽谈新一轮融资,估值可能达到 400 亿美元。该公司在 5 月刚以 260 亿美元估值融资 10 亿美元,其 AI 编程代理 Devin 的年化收入运行率已达 4.92 亿美元,企业客户使用量每月增长 50%。Devin 被定位为处理程序员不喜欢的琐碎工作,客户包括梅赛德斯-奔驰、NASA 和高盛。
微软发布了用于 GitHub Copilot 的代码模型 MAI Code 1.1 Flash,声称性能提升、成本降低,但基准测试显示其在价格和性能上均不及 DeepSeek-V4-Flash-0731。微软在公告中回避直接对比,并继续推广其专有模型,与其宣称的开源 AI 立场不符。此举可能是为了降低成本,但可能导致性能下降。
该研究通过固定自我进化配方,在8种编程语言和3个基础模型上分析编码智能体的自我进化机制。研究发现,进化产生的harness主要补偿可恢复的执行缺陷,而非基准过拟合;不同语言共享抽象策略但使用不同的生态系统工具,且共享核心可迁移至通用harness。该研究将自我进化harness重新定位为可解释的补偿层,受语言工程需求和模型行为差距共同塑造。
Mendel Gödel Machine (MGM) 是一种递归自改进编码代理,通过多轨迹突变和跨谱系杂交加速收敛并提升性能。该研究在理论上证明了新策略在加性适应度景观模型下的优势,并在 SWE-bench 和 Polyglot 基准上验证了其性能、效率和泛化能力的提升。
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可
arXiv 论文提出 DevIntent 基准,通过意图违反率(IVR)衡量 LLM 生成代码是否违背开发者隐含意图。在 49 个问题上,Claude Sonnet 4.6 和 GPT 4.1 虽通过 92% 的显式测试,但分别有 54.5% 和 63.5% 的问题违反隐含约束,表明通过率高估了代码与开发者意图的一致性。
Motif 3 是一个具有 3140 亿总参数、每 token 激活 132 亿参数的解码器专用混合专家语言模型,采用细粒度稀疏 MoE 架构,每层包含 384 个路由专家,每 token 选择 8 个。该模型基于分组差分潜在注意力(GDLA)构建,并整合了流形约束超连接、专家特定 PolyNorm 激活和多 token 预测等技术。模型在约 12.5 万亿
Anthropic宣布5天后所有Claude Code将默认启用自动模式,该模式通过分类器自动审批工具调用,额外token开销由Anthropic承担。数据显示人工审批的权限请求中97%被同意,而自动模式在对抗测试中拦截率更高,且不随会话长度下降。Anthropic还委托Apollo Research和Trajectory Labs进行安全测试,并公开了拦截
一项针对大型企业生产环境中AI生成C++代码的大规模实证研究显示,AI生成的代码在接口耦合、拷贝分配开销和显式循环使用方面存在独特质量特征,导致审查工作量增加和5-8%的计算资源消耗上升。通过提供针对性的分类反馈,可减少11.1%的静态分析警告并提升计算效率。该研究基于2025年4月至2026年4月间352万次代码变更。
Anthropic 宣布从 8 月 14 日起,Claude Code 将默认启用 Auto Mode,该模式允许 AI 自主执行开发任务,仅在检测到危险或不可逆操作时请求人工确认。测试显示,Auto Mode 在安全性上不逊于手动审批,并能使团队生成的 pull request 数量增加约 25%。此外,该模式还能抵御提示注入攻击,独立审计显示 720 次
另有 2 家信源报道
谷歌将Gemini后训练核心团队及DeepMind运营负责人Koray Kavukcuoglu迁至加州总部,以解决跨时区协作问题,并计划以超15亿美元收购AI编程初创公司Mechanize的技术与人才。此举旨在加速AI研发与产品整合,应对竞争压力。哈萨比斯卸任Google DeepMind日常管理,转任董事长及Alphabet首席科学家。
Simon Willison 使用 Codex Desktop 运行 GPT-5.6 Sol Ultra,将之前用 Claude Fable 5 生成游戏《Raccoon Heist》的相同提示词重新生成,得到了更好的游戏《Moonlight & Mayhem》。新版本包含博物馆场景、营救同伴等更丰富的玩法,但存在眼睛渲染为巨大球体的 bug,通过额外提示修
Spotify 的工程师 Aleksandar Mitic 和 Jo 在演讲中介绍了他们开发的编码代理 Honk,用于持续重写 Spotify 的全部代码库,以解决维护问题。Honk 取代了传统的脚本化迁移工具,利用 LLM 处理长尾复杂情况,使内部服务框架的采用时间从近一年缩短至不到一周。该演讲分享了 Honk 的开发历程、经验教训和当前状态。
Together AI 对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 在 DeepSWE 基准上进行了 900 次测试。Luna 在 pass@1 上领先 14 个百分点(67.2% vs 53.3%),但 DeepSeek 成本仅为 Luna 的六分之一,每美元解决任务数是 Luna 的 4.8 倍。采用 DeepSeek
Meta 发布了 Muse Spark 1.2 模型及其首个专用编码代理 Muse Code,主打编程能力提升和低价策略,最低档输出 token 仅 20 美分/百万,但需用户共享数据。Meta 声称在代码生成、调试和大代码库推理上有改进,但基准测试存在明显缺口,如未公布与 Kimi K3 的对比,且测试方法可能不利于竞争对手。Muse Code 具有独特的
该论文提出了一种面向嵌入式C软件的函数复用检测方法,通过领域感知的检索增强生成(RAG)流水线,结合注释、调用图和README等上下文信息,使用八种嵌入模型提取特征,并设计四种硬件兼容性验证器过滤候选函数。在六个公共嵌入式项目上的评估显示,SonarQube作为复用过滤器存在93.6%的误报率,而该方法验证器准确率达97.5%,有效弥补了静态分析在硬件兼容性