Mistral AI 发布 Codestral 25.08 及企业级编码栈
Mistral AI 发布了 Codestral 25.08 模型,并推出了面向企业的完整编码栈,包括 Codestral Embed 和 Devstral 代理。该方案旨在解决企业采用 AI 编码工具的部署、定制、集成和可观测性等限制,声称可将开发、审查和测试时间减少 50%。Codestral 25.08 在补全接受率、代码保留和减少失控生成方面有显著提
技术方向 · AI 写代码的一切:编码助手、Vibe Coding、代码模型与开发工作流 · 共 214 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Mistral AI 发布了 Codestral 25.08 模型,并推出了面向企业的完整编码栈,包括 Codestral Embed 和 Devstral 代理。该方案旨在解决企业采用 AI 编码工具的部署、定制、集成和可观测性等限制,声称可将开发、审查和测试时间减少 50%。Codestral 25.08 在补全接受率、代码保留和减少失控生成方面有显著提
xAI 于 2026 年 7 月 28 日推出 Build Mode 功能,允许用户通过自然语言描述想法,让 Grok 在聊天中实时生成网站、应用、游戏和交互式仪表盘,并可发布为链接。该功能目前以早期测试版形式向 SuperGrok Heavy 订阅用户开放,支持网页、iOS 和 Android 平台。
Mistral AI 发布了 Mistral Medium 3.5,这是一个 128B 参数的开源权重模型,支持长时程编码和生产力任务,并成为 Le Chat 和 Mistral Vibe 的默认模型。同时推出了远程代理和 Le Chat 的 Work 模式,支持并行异步任务执行。该模型在 SWE-Bench Verified 上得分 77.6%,定价为每百
智谱AI发布了一系列新模型和产品,包括旗舰模型GLM-5.3、GLM-5.2、GLM-5.1、GLM-5、GLM-4.7等,以及多模态模型GLM-5.3-Flash、GLM-5V-Turbo、GLM-OCR等。这些模型在编程、长上下文、多模态理解等方面有显著提升,并推出了GLM Coding Plan团队版和AutoGLM-Phone框架。此外,还发布了语音
Meta 推出 Muse Spark 1.1 多模态推理模型,显著提升智能体任务、工具使用、编码和多模态理解能力,并首次通过 Meta Model API 公开预览提供。该模型支持百万 token 上下文,可编排多智能体系统,在计算机使用和编码方面表现优异,同时通过安全评估。
Anthropic 发布了 Claude Sonnet 5,这是其最强大的代理型 Sonnet 模型,在编码、代理任务和专业工作中表现出色,性能接近 Opus 4.8 但价格更低。该模型即日起在所有计划中可用,并通过 Claude API 提供,具有限时优惠定价。早期合作伙伴反馈显示其在复杂任务中的自主性和效率显著提升,安全评估也显示其不良行为率低于前代。
Anthropic 发布了 Claude Opus 5,这是 Opus 系列的新一代模型,在编码、知识工作和智能体任务上表现优异,接近 Fable 5 的智能水平但价格减半。该模型在多个基准测试中创下新纪录,如 Frontier-Bench 和 GDPval-AA,并在成本效率上优于前代 Opus 4.8。早期客户反馈显示其在调试、自动化工作流和科学分析中表
DeepSeek 发布 DeepSeek-V4-Flash 正式版 API,模型结构不变,仅重新后训练,在多个基准测试中表现优异。API 调用方式不变,模型名设为 deepseek-v4-flash。DeepSeek-V4-Pro 正式版将尽快发布。
另有 1 家信源报道
Daniel Doubrovkine在演讲中分享了他对LeetCode式编程面试的反对观点,并讲述了自己在FAANG公司面试中失败的经历。他展示了如何利用AI工具如Claude完成代码任务,并强调在AI时代应摒弃传统面试方式。他拥有丰富的编程经验,包括开发搜索引擎Alkaline,并认为AI工具为开发者提供了平等机会。
Google AI 宣布 Gemini API 的 Managed Agents 新增环境钩子、模型选择和免费层访问功能。该功能基于 Interactions API,在隔离云沙箱中协调推理、代码执行等任务。Gemini 3.6 Flash 现为默认模型,支持通过配置选择其他模型。环境钩子允许在工具调用前后运行自定义脚本,用于安全检查和代码格式化。此外,还引
Import AI 466 报道了 Epoch 和 METR 发布的 MirrorCode 基准测试,用于评估 AI 系统完成长期编程任务的能力,结果显示 Opus 4.7 等模型能在 14 小时内完成人类需 2-17 周的任务,但仍有部分任务无法解决。同时,Anthropic 展示了 Claude Opus 4.7 在机器人任务中自主完成速度比人类快 20
Anthropic 于周五发布了 Claude Opus 5 模型,官方基准显示其性能接近 Fable 5,但独立评估认为其实际表现更优。Epoch 的 ECI 指数显示 Opus 5 得分为 159,略低于 Fable 5 的 161,但在软件工程基准上持平。社区反馈强调其在编码和浏览器自动化等实际任务中的出色表现,同时也有对基准测试有效性的质疑。
Ollama 发布 v0.32.0 版本,引入全新的交互式代理体验,运行 ollama 命令即可启动代理,帮助用户编码和委派工作。该版本将 Codex App 集成更名为 ChatGPT,并简化了集成选择菜单,仅保留最受欢迎的集成。此外,对于较旧的代理模型(如 CodeLlama、Qwen2.5、Llama 3.x 等),启动前会显示弃用警告。
Anthropic 于 2026 年 6 月 30 日发布了 Claude Sonnet 5 模型,这是其最具代理能力的 Sonnet 系列模型,在推理、工具使用、编码和知识工作方面相较 Sonnet 4.6 有显著改进。该模型旨在提升自动化任务执行能力,相关细节已通过官方博客公布。
Z.ai 于 2026 年 6 月发布了开源模型 GLM-5.2,该模型在编码代理任务中表现出色,被社区视为开源代理的转折点。其性能在多个基准测试中与 OpenAI 和 Anthropic 的闭源模型相当,甚至超越,引发了广泛关注。作者认为 GLM-5.2 缩小了开源与闭源模型的能力差距,并可能对 Anthropic 等闭源实验室构成竞争压力。
GLM 发布了面向企业与开发团队的 Coding Plan 团队版自助订阅方案,提供高额模型用量并兼容主流编码工具。该方案支持席位、权限、用量与预算统一管理,以及集中账单和企业级数据安全,默认不将代码用于训练。高级版可优先接入最新旗舰模型并保障高峰期资源,旨在提升团队 AI 编程协作效率。
Anthropic 发布了 Claude Opus 4.8,相比 4.7 在编码、智能体技能、推理和实际知识工作方面有所改进。同时,企业版计划新增了连接器权限管理功能,允许管理员通过自定义角色控制连接器及其工具的访问权限。
斯洛文尼亚保险公司 Triglav 通过部署微软 Copilot 和培养 40 名数字导师,推动 AI 在内部流程中的应用,如法律文件起草和员工入职支持。公司强调治理和以人为本,将 AI 视为提升效率的文化转型工具。
Google 在 Gemini API 中发布了 gemini-3.5-flash 的 GA 版本,这是面向智能体和编码任务的最强模型,现已成为 gemini-flash-latest 的底层模型。同时,Google 推出了 Managed Agents 公共预览版,允许开发者在 Google 托管的隔离 Linux 沙箱环境中构建和部署自主、有状态的智能体
Google DeepMind 发布 Gemini 3.5 系列模型,首推 3.5 Flash,主打智能体与编码能力,性能超越前代 Pro 模型,速度提升 4 倍。该模型已通过 Gemini 应用、Google 搜索 AI 模式、开发者平台及企业平台向全球用户开放,并计划下月推出 3.5 Pro。同时,新模型内置前沿安全防护,减少有害内容生成。