代码的 Token 签名:比较不同大语言模型的编码行为
Visa Research 提出 CLIC(Code Learning for Identification and Comparison),通过统计 LLM 生成代码中的 token 频率,将每个代码样本表示为特征向量,并训练可解释决策树来区分两个 LLM 的代码集合。研究定义了两个新指标:鲁棒性(逐步移除最具区分度 token 后两模型是否仍可区分)和集
技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Visa Research 提出 CLIC(Code Learning for Identification and Comparison),通过统计 LLM 生成代码中的 token 频率,将每个代码样本表示为特征向量,并训练可解释决策树来区分两个 LLM 的代码集合。研究定义了两个新指标:鲁棒性(逐步移除最具区分度 token 后两模型是否仍可区分)和集
Cloudflare 宣布其 Python Workers 在经历两年预览后正式 GA,Python 成为 Cloudflare 开发者平台上的一等公民语言。其实现方式是通过 Pyodide 将 Python 编译为 WebAssembly,运行在基于 V8 的 workerd 运行时中,但多进程与多线程在 Wasm 虚拟机中不可用。本地开发工具 pywra
另有 1 家信源报道
xAI 的 Grok 4.6 模型正式上线 Amazon Bedrock,成为 xAI 在 Bedrock 上的第二个模型。该模型面向长时运行的 agent、编程和知识工作,提供 500K token 上下文窗口和四档可配置推理强度(low、medium、high、xhigh)。相比前代,Grok 4.6 同时支持 bedrock-mantle 和 bedr
xAI 发布其迄今最强模型 Grok 4.7,主打编程与知识工作,基于更大基座模型、更长强化学习训练,并强化自我输出验证。定价为每百万输入 token 2 美元、每百万输出 token 6 美元,接近中国模型价位。但在 Artificial Analysis 智能指数上仅得 46 分,落后于同得 53 分的 Claude Fable 5.1 和 GPT-6;
研究团队提出 CodeMidas,一个以源代码为唯一任务特定输入的智能体流水线,将现有代码库中已实现的功能转化为可执行的强化学习环境。该方法通过智能体探索功能、构建基于原始代码执行的测试,并经过执行检查与多次解答采样来验证和筛选任务。最终数据集包含来自 3185 个开源代码库、覆盖 23 种编程语言和 15 个技术领域的 5545 个训练任务。用 GRPO
2026年9月21日,华为云码道CodeArts代码智能体面向鸿蒙开发者全面升级,上线鸿蒙编码大模型、码道鸿蒙智能体与鸿蒙开发者实践中心三大核心能力,宣称是全球首个专为鸿蒙生态打造的AI编码智能体。鸿蒙编码大模型依托鸿蒙增强训练体系,融合超百万鸿蒙原素材,官方称千行代码错误率降低80%以上、一次编译通过率提升78%以上、单次任务Token消耗降低20%以上,
研究者提出 RecreationWorld,一个面向混合计算机使用智能体(CUA)的五平台框架,覆盖 Ubuntu、macOS、Windows、Android 和 Web,通过让智能体复现运行中的参考应用来提供可验证的执行奖励。基于高质量开源应用扩展轨迹生成后,模型在五个分布外编码与混合计算机使用基准上均有提升,并更频繁地验证渲染输出。团队同时发布 Recr
该论文提出 Code2Skill,一个全自动流水线,可从源代码中提取可验证的程序性技能,构建出包含 1,006,822 条记录的 CodeSkillBank。在覆盖九种模型设置和八个基准的 72 项评估中,使用检索到的技能后模型平均提升 11.7%,并在 57 个案例中优于基线。研究还显示,从 AI 生成代码合成的技能通过率达 93.50%,略高于人类编写代
一位新入职大公司的工程师(voxium)在 Simon Willison 博客的引述中描述,其团队所有规格、代码、测试、PRD、工单及报告均由 Claude Code 生成,无人阅读产出内容,员工每天工作12至13小时只为按回车键。高层认为推送代码不是瓶颈,因此质疑团队为何缓慢,但团队成员普遍不喜欢这种被强制大量交付的工作方式。
中国电信AI开源了全栈国产化的轻量级代码智能体大模型Xing4.0-29B-A4B,采用MoE架构,总参数290亿、每次推理仅激活约40亿,经4-bit量化后可在单张RTX 3090上运行。该模型完全基于华为昇腾910C算力与MindSpore/MindFormers框架训练,支持256K上下文并可扩展至512K,重点强化Coding与Agent能力,已适配
量子位实测了Qwen 3.8 27B模型,该模型能通过一句Prompt在几分钟内生成完整网页工具,包括数据分析工具和仿12306抢票页面。工程师Alok结合Cerebras硬件实现了1950 token/s的生成速度,可秒级生成Google首页和YouTube界面。但实测发现生成的网页仅为前端外壳,无法接入真实后端、支付和实时数据,且Cerebras加速方案
DoorDash 构建了一套多智能体 LLM 系统,用于自动清理代码库中过期的功能开关(feature flag)。该系统结合实时实验数据、工程师审批、隔离的 Git worktree 和自动验证,在 50 个过期开关的评估中为 45 个生成了可用的 pull request,平均每次清理耗时 13.8 分钟、成本 4.79 美元,而人工清理估计需要 1 到
雷峰网报道称,2026年国内云厂商为冲刺MaaS收入,将销售人均MaaS指标推高至千万元级,并数周内要求日均Token收入翻数倍,导致某区域团队十几人集体离职,被内部定性为管理事故。由于自研模型竞争力不足,销售转向转售智谱、Seedance等第三方模型,引发国产模型折扣战与云资源券补贴,Codex的额度重置机制又进一步截走客户预算。文章还描述了销售在批折扣、
文章提出「类型化领域接地」(Typed Domain Grounding, TDG)方法,认为大模型在领域特定语言(DSL)上的幻觉本质是训练数据频率问题而非知识问题。TDG 将领域嵌入训练数据丰富的主语言中作为类型化内部 DSL,使领域错误表现为编译器类型错误而非静默失败。在 Claude Sonnet 5 的五十任务基准中,该方法比两种宽松的外部 DSL
火山引擎宣布豆包 2.1 Pro 模型更新至 0915 版本,新模型 API 已在火山方舟全量上线并接入豆包工作。新版在多模态理解、编程能力、通用 Agent 能力上均有增强,可调度多个子 Agent 并行开发,在开源游戏 Luanti 约 38.7 万行代码仓库的 1000 个真实历史 Issue 中,近 36 小时内将 83% 的问题修复至可合并级标准。
论文提出 Functionalizer,一种无损预分词框架,将大小写、变音符号和字符重复等正字法变化分解为可逆的 opcode/operand 前缀流,编码于 Unicode 私用区。在六种自然语言和代码语料上,该方法在无约束条件下将完整覆盖语料所需词表槽位减少最多 16%,并显著压缩缩进密集的代码序列(推理吞吐提升最多 22.8%),但在自然语言散文上序列
约克大学Lassonde工程学院的研究者提出AgentGuard,一个从异常编码智能体轨迹中自动学习执行护栏的指令级框架。该方法从642条真实失败轨迹中提取可复用的执行约束,并组织为轻量级技能,仅在触发条件满足时动态激活。使用Claude Code与Claude Haiku 4.5在100个任务上评估,异常执行率从69.0%降至26.7%,任务成功率从21.
研究者在 CodeClash 代码竞技场基准上以开源模型 Qwen3-Coder-30B 为案例,探索如何用更强智能体的知识蒸馏来提升弱代码智能体的长程交互能力。他们发现该模型常出现语法与协议错误、缺乏跨轮次策略调整,于是提出 ReAct SFT(将教师轨迹改写为 [obs][thought][act] 链)和轨迹质量加权 SFT(TQ-SFT,鼓励修改后检
谷歌近期通过内部开发平台 Antigravity 向全公司工程师开放 Anthropic 的 Opus 5 模型,此前多数员工被禁止使用 Claude Code、OpenAI Codex 等外部代码工具,仅 DeepMind 团队等有特例。此举反映 AI 代码赛道竞争白热化,谷歌为提升开发效率而转向竞争对手模型。
该研究指出多智能体代码生成系统通常固定使用单一通信拓扑,但实验发现层级协作相对单智能体的优势随问题难度从2.4分(简单)升至21.1分(困难),而token成本始终约为10倍。作者提出Difficulty-Aware Topology Selector(Dats),用图网络预测各拓扑解题概率并结合成本选择最优拓扑,在预算匹配协议下以40%的层级成本达到77.