遗留代码库中的人类优势:Mob编程与AI的局限
SpareBank 1 Utvikling 的开发者 Asgaut Mjølne Söderbom 和 Ola Hast 在播客中分享了他们团队采用 mob 和 pair programming 的经验,并讨论了 Claude Code 在复杂遗留代码库中的局限性。他们强调通过持续协作和 TDD 提高代码质量,并指出 AI 工具在缺乏隐性上下文时可能产生低质
公司与模型 · Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 08:14
SpareBank 1 Utvikling 的开发者 Asgaut Mjølne Söderbom 和 Ola Hast 在播客中分享了他们团队采用 mob 和 pair programming 的经验,并讨论了 Claude Code 在复杂遗留代码库中的局限性。他们强调通过持续协作和 TDD 提高代码质量,并指出 AI 工具在缺乏隐性上下文时可能产生低质
该技术报告提出规格驱动智能体开发(SDAD)框架,将软件开发生命周期重构为意图捕获、机器可读规格、智能体合成和独立多智能体验证四个阶段。报告回顾了从瀑布到敏捷再到智能体时代的范式演变,并引入AI代码作为第四种生产范式。报告还定义了团队角色转型、量化治理指标(如歧义税、规格保真度)以及分阶段迁移蓝图,强调智能体速度将工程纪律上移至规格精确性。
XPerf 是一个用于对 LLM 服务系统进行代理式 AI 工作负载基准测试的框架,它通过细粒度轨迹重放来确保可复现性,并提供系统和硬件性能的详细剖析。该框架默认包含八个代理应用,支持从真实应用中收集轨迹、合成新工作负载,并可在不同服务系统上重放。实证研究表明,XPerf 能准确重放代理工作负载,帮助识别性能瓶颈,并辅助系统调试。XPerf 将在 GitHu
Cloudflare 开源了其企业 AI 平台 Cloudflare OS,该平台基于能力模型,为每个用户提供独立的沙箱化应用实例,支持非技术用户通过生成式 AI 定制工作软件。平台通过 Gatekeeper 系统实现细粒度权限控制,确保安全。Cloudflare 内部员工已使用该平台,30 天内构建了 4000 多个工具,并显著提升了效率。
AI代理Luna在旧金山运营Andon Market商店,首次解雇了一名人类员工,但这一决定是在人类提醒其自定规则后才做出的。Luna曾忘记自己编写的员工手册,对多次迟到等违规行为表现宽容。Andon Labs用七个模型重放该场景,发现更强模型更倾向于解雇。该事件被视为AI管理人类员工的早期案例,但也暴露了AI在长期记忆和主动执行规则方面的不足。
OpenRouter 分析师 Peter Walker 指出,2026 年 2 月 6 日可能是人类消耗 token 量最后一次超过 AI 代理的日子。此后,代理 token 使用量增长了 14 倍,而人类使用量仅增长 2.8 倍。尽管代理消耗的 token 中近 70% 来自缓存提示,实际成本增速低于原始数据,但 AI 已成为 AI 最大的客户。OpenR
据彭博社报道,由于内存短缺,搭载英伟达AI芯片的服务器价格将上涨超过15%,受影响的产品包括Vera Rubin和Grace Blackwell系统。价格上涨的主要原因是三星、SK海力士和美光生产的DRAM成本上升,涨价将影响明年初的出货。为微软、谷歌和甲骨文制造服务器的合同制造商已通知客户,英伟达未予置评。
LiteLLM 发布 v1.98.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和新功能,如支持 Claude Sonnet 5 的 toolSpec.strict 移除、GLM 5 和 DeepSeek V3.2 的原生结构化输出、PTU 平摊成本配置、可配置的估计输出 token
一项新研究指出,当前世界模型(如Sora、Genie 3等)仅建模物理层,忽略了人类信念、意图等心理状态,导致预测行为不准确。研究者提出“心理世界建模”(MWM)框架,并构建无需训练的参考实现MENTIS,在Menti-Bench基准上显著提升模型表现。该框架通过耦合物理与心理变量,使AI代理能更准确地预测人类行为,但模拟阶段仍是主要瓶颈。
RayNeo 发布新款 AI 眼镜 RayNeo iO,无摄像头和扬声器,通过绿色波导显示屏在视野中叠加文字,透明度 97%,亮度约 1300 尼特。眼镜可监听对话、总结内容、提取行动项并建议日历条目,用户可通过点头确认,还支持提词器模式和 40 种语言的语音转文字翻译。设备内置四个麦克风和骨传导传感器,麦克风激活时 LED 亮起。出厂预装 RayNeo A
DavidAU 发布了 Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF,这是一个基于 Qwen 3.6 的 40B 参数多阶段微调模型,据称在 8 位和 4 位量化下达到闭源模型(如 OpenAI、Claude)的智能水平。该
Agno 发布了 v3.0.0a3 版本,包含大量修复和新功能。主要改进包括:为代理和团队新增 CodeMode 和结果卸载功能,支持将媒体从数据库卸载到本地、S3 或 GCS 存储,引入 MigrationRequiredError 以处理过时的数据库模式,并优化了性能(如导入时间从 233ms 降至 147ms,会话查找变为 O(1))。此外,还增加了对
DSPy 发布 3.3.1 版本,主要改进包括:PythonInterpreter 的安装简化、沙箱隔离强化和生命周期可观测性增强;优化器 GEPA 支持多提案采样和并发评估,提升吞吐量;同时修复了适配器正确性和 MCP 兼容性问题。该版本通过回调 API 提供完整的解释器执行追踪,并支持通过 gepa kwargs 配置多目标优化。
中国AI公司Deepseek发布了实验性多模态模型V4-Flash-Vision-Exp,在图像理解基础上保持文本性能,其内部基准测试显示在智能体任务上接近Opus 4.8。该模型支持多种图像输入方式,并兼容OpenAI和Anthropic的API,同时更新了Harness框架。定价与V4-Flash一致,单次请求最多可处理600张图像。
阿里巴巴在过去一个月密集发布大语言、图像、语音、视频、音乐等多模态模型,性能均跻身国际第一梯队,其中Qwen3.8-Max在Agentic榜单登顶全球第一,Qwen系列全球下载量突破30亿次。多模态模型已进入商业化场景,带动阿里云AI相关收入快速增长,AI相关产品收入连续12个季度三位数同比增长。阿里正通过全栈AI底座和多模态布局,推动AI从技术投入转化为规
智东西报道了AI原生游戏团队Elser从视频工具转型开发AI精品游戏平台Elseland的经历。团队在4个月内制作了数十款游戏,包括互动影游和休闲游戏,声称将数百关游戏的制作时间从一年缩短至一周。CEO刘耕认为Coding Agent的爆发带来了新机遇,但AI无法取代创意和审美判断。
AWS 发布了基于 Amazon Bedrock 的智能体数据操作平台(ADOP)参考架构,旨在将数据工程周期从数周缩短至数小时。ADOP 在开发环境中运行 AI 智能体,生成确定性的 ETL、质量检查和治理工件,并通过 CI/CD 部署到生产环境,生产环境不依赖模型调用。该平台支持多工具(如 Claude Code、Kiro、Cursor、Codex)的治
AWS 发布 Amazon Bedrock AgentCore Gateway,用于集中治理 AI 代理对组织工具和数据的访问。该方案通过统一入口、身份认证、策略控制和审计日志,解决凭证蔓延、策略漂移、审计缺失等问题,并提供四阶段成熟度路径(连接、控制、目录、加固)。
Strands Agents SDK 发布了 TypeScript 版本的 v1.14.0 更新,包含多项新功能、修复和文档改进。主要新功能包括音频内容块、文件内存存储、上下文管理器卸载策略、工具上下文中的执行范围取消、代理作为工具委托、MCP 客户端 OAuth 认证以及 Anthropic 提示缓存支持。修复了多个与 Bedrock 缓存、多代理令牌计数
美国国务院起草了一封信,要求伙伴国家在美国与中国的人工智能竞赛中选边站,并警告加入中国AI倡议的国家将被排除在美国主导的Pax Silica联盟之外。该联盟旨在保障AI模型、半导体和关键矿产的供应链,已有约24个国家及欧盟加入。目前哈萨克斯坦是唯一同时参与美国联盟和中国框架的国家。中国驻美大使馆回应称,此举将减缓全球AI进展,不符合任何人的利益。