神经形式验证:智能体驱动的语言无关程序形式推理
本文提出神经形式验证(NFV)方法,利用AI编码代理将主流编程语言程序翻译为Dafny等验证语言,并自动生成形式化证明或反例。在Python编程问题数据集上,NFV对57%的正确/错误条目返回Dafny证明(精度92%),对63%的错误程序返回CBMC反例(精度90%),相比LLM评判基线更具优势。该方法旨在让主流开发者无需形式方法专业知识即可获得机器检查的
技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
本文提出神经形式验证(NFV)方法,利用AI编码代理将主流编程语言程序翻译为Dafny等验证语言,并自动生成形式化证明或反例。在Python编程问题数据集上,NFV对57%的正确/错误条目返回Dafny证明(精度92%),对63%的错误程序返回CBMC反例(精度90%),相比LLM评判基线更具优势。该方法旨在让主流开发者无需形式方法专业知识即可获得机器检查的
SLICE 是一个针对代码生成中输入契约强制执行的框架,通过图结构规范分解、功能体生成和契约断言生成三个阶段,分别处理功能实现与输入条件验证。在 ContractEval 基准上,SLICE 在四个 LLM 上相比最强基线平均提升了 6.58% 的规范满足率(SSR)。该框架旨在解决生成代码时对输入契约的过度或不足强制问题。
Andrew Ng 通过 DeepLearning.ai 重新聚焦 AI 工程,基于对 1 万多个职位发布的分析和专家访谈,提出了 AI 工程师的四大核心技能:构建和部署 AI 应用、软件工程基础、使用编码代理以及塑造产品构建。Latent Space 对此表示赞同,并指出这些技能不仅适用于 AI 工程师,也适用于更广泛的开发者。此外,AI 社区讨论了代理框
SpareBank 1 Utvikling 的开发者 Asgaut Mjølne Söderbom 和 Ola Hast 在播客中分享了他们团队采用 mob 和 pair programming 的经验,并讨论了 Claude Code 在复杂遗留代码库中的局限性。他们强调通过持续协作和 TDD 提高代码质量,并指出 AI 工具在缺乏隐性上下文时可能产生低质
Ornith AI 发布了 Ornith-1.5-397B,这是一个 397B 参数的混合专家模型,通过端到端自我改进训练,在 Terminal-Bench 2.1 上得分 86.1,在 DeepSWE 上得分 56.0,性能与 Claude Opus 4.8 相当,并优于 GLM-5.2 和 DeepSeek-V4-Flash-0731 等开源模型。该模型
这篇综述论文系统梳理了“Vibe Coding”(AI辅助软件开发)的实践、性能、生产力和风险。研究发现早期基准测试已饱和,但任务级能力不均衡,如代码生成可靠而故障检测薄弱。生产力证据看似矛盾,但通过统一测量方法可解释,并指出收益在新代码上真实,在成熟代码库上可能缩小或逆转。
Ornith AI 发布了 Ornith-1.5-35B-A3B 模型,这是一个混合专家模型,每个 token 仅激活约 3B 参数。该模型通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成,在编码和智能体基准测试中显著优于同尺寸的 Qwen 3.6-35B,并大幅超越 Gemma 4-31B 等密集模型。
TRAE AI创造力大会在上海举办,吸引了3.7万人报名,最终评选出冠亚季军,分别获得30万、25万和10万元奖金。获奖项目包括AI硬件IDE、羽毛球AI教练和卫星仿真软件,展现了AI降低编程门槛、赋能非专业开发者的潜力。大会强调创造力与问题发现的重要性,而非单纯技术比拼。
Drew Breunig 在文章中讨论了 Fable 模型发布后对 AI 编程工作流的影响。他指出,在 Fable 之前,优化编码工具或上下文策略似乎不值得,因为新模型会以相同或更低价格解决大部分问题。但 Fable 的高成本促使团队重新思考如何分配工作,因为 Opus、5.6、K3 和 GLM 等模型已足够应对大部分编码需求。
ornith-ai 发布了 Ornith-1.5-9B 模型,这是 Ornith-1.5 系列中最轻量的 9B 密集模型,通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成。该模型在编码基准测试中表现优异,如 SWE-bench Verified 得分 70.6,并支持移动端量化部署。
mradermacher 发布了 KernelBench-RLVR-120b 模型的 GGUF 量化版本,该模型基于 Jarrodbarnes 的 KernelBench-RLVR-120b,专注于 GPU 内核代码生成,并通过 GRPO 强化学习在 KernelBench 数据集上训练。量化版本提供了多种精度的 GGUF 文件,方便用户在本地部署。
本文探讨了AI代理在2025年圣诞节前后突然变得有效的原因,作者认为这是模型能力与代理框架(harness)共同进步并交叉的结果。文章回顾了从ReAct、AutoGPT到Cursor、Claude Code的演进历程,指出模型正在吸收框架功能,而框架正转向管理人类注意力。
quimmedes 发布了 Qwen3.8-27B 的 GGUF 量化版本(XYZ 系列),专注于编码任务,提供从 Q1Q 到 Q8 及 ULTRA 的多种量化档位,并支持 MTP 投机解码和视觉投影。该系列通过每张量量化配方保留关键张量精度,并针对代码测试套件优化,但明确不追求通用知识性能。用户可通过 llama-server 使用 OpenAI 兼容 A
Hugging Face 上发布了 KAT-Coder-V2.5-Dev 模型的 APEX GGUF 量化版本,该版本移植了 Qwen3.6-35B-A3B 的 MTP 头,实现了投机解码加速。实测在 agentic 编码任务上最高获得 2.03 倍加速,且正确性不变。推荐使用 n-max 3 的投机深度设置,并提供了详细的性能对比数据。
亚信科技与火山引擎合作,通过TRAE IDE在企业内部实现AI Coding的规模化落地,已部署6000+席位,AI编码贡献率达32%,SDLC整体提效15%。双方构建了涵盖知识工程、智能体矩阵和数据闭环的解决方案,并推出Token ERP实现AI成本治理。该合作验证了企业级AI研发的落地路径,为大型企业AI转型提供了可复制的标杆。
蔚来汽车与火山引擎TRAE合作,将AI Coding应用于智能座舱研发,开发人员日活跃率超70%,AI代码采纳率达90%,AI代码入库率达19.8%。通过AI代码审查、知识沉淀和问题定位等实践,蔚来实现了从个人效率到组织智能的转变,并计划构建包含Knowledge、Skill、WorkFlow、Agent层的AI开发生态体系。
Jeff Dean在斯坦福2026 Frontier&Pioneer Symposium上首次公开访谈,谈及离开谷歌的原因、Gemini早期在Coding上的不足、TensorFlow的设计失误,以及新公司Discovery Loop的目标——通过自动化科学实验循环实现递归自我改进。他还指出AI在网络安全上的能力已接近顶级人类攻击者水平,并分享了快速浏览论文
SemaPLC 是一个面向 PLC 代码生成的验证门控代理框架,通过外部编译和实时运行验证生成的逻辑,而非仅依赖模型自评。在 117 个独立 POU 任务中,SemaPLC 在七个模型上取得了最高的严格验证通过率(平均 72.6%);在 65 个真实项目上下文任务中,其集成编译、静态行为和动态行为均表现最佳。动态行为测试最能区分方法,SemaPLC 得分 5
据彭博社报道,SpaceX 曾试图收购 AI 编程初创公司 Cognition,但 Cognition CEO Scott Wu 否认该报道,称公司不出售且双方未进行谈判。此前 SpaceX 刚以 600 亿美元收购了另一家 AI 编程公司 Cursor,并计划通过 AI 编码业务提升收入。Cognition 估值已达 250 亿美元,并正洽谈新一轮融资。
MiniMax核心工程负责人阿岛(缪宇航)已离职,其飞书状态显示离职,下一站未公开。阿岛曾负责M3.x、Agent、Audio及海螺AI等关键业务,并多次代表团队对外解释技术路线。他的离职发生在MiniMax重押Coding和Agent的关键时期,其职责交接情况尚不明确。