模拟接管AI:10%更差,100倍便宜,10000倍更快
Latent Space 的 AINews 文章提出,自 2022 年以来,AI 流水线中越来越多的组件从人类制造转向模型制造,形成“模拟”趋势:性能略差(10%),但成本更低(100 倍)且速度更快(10000 倍)。文章按阶段梳理了从奖励信号、训练数据、教师模型、课程设计到研究者、环境乃至人类主体的合成化进程,并引用 InstructGPT、Phi、Al
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Latent Space 的 AINews 文章提出,自 2022 年以来,AI 流水线中越来越多的组件从人类制造转向模型制造,形成“模拟”趋势:性能略差(10%),但成本更低(100 倍)且速度更快(10000 倍)。文章按阶段梳理了从奖励信号、训练数据、教师模型、课程设计到研究者、环境乃至人类主体的合成化进程,并引用 InstructGPT、Phi、Al
本文探讨了AI代理在2025年圣诞节前后突然变得有效的原因,作者认为这是模型能力与代理框架(harness)共同进步并交叉的结果。文章回顾了从ReAct、AutoGPT到Cursor、Claude Code的演进历程,指出模型正在吸收框架功能,而框架正转向管理人类注意力。
Simile AI 联合创始人兼 CEO Joon Sung Park 在播客中分享了从生成式智能体到人类行为基础模型的路径,其公司已获 2B 美元 B 轮融资,为 CVS 等财富 100 强客户运行数千万次模拟,数字孪生对人类行为的复现准确率达 85%。他探讨了模拟作为新扩展定律的潜力,包括模拟 80 亿人的长期目标,以及模拟在政策测试、社会问题研究中的应
Agno 发布了 v3.0.0a3 版本,包含大量修复和新功能。主要改进包括:为代理和团队新增 CodeMode 和结果卸载功能,支持将媒体从数据库卸载到本地、S3 或 GCS 存储,引入 MigrationRequiredError 以处理过时的数据库模式,并优化了性能(如导入时间从 233ms 降至 147ms,会话查找变为 O(1))。此外,还增加了对
DSPy 发布 3.3.1 版本,主要改进包括:PythonInterpreter 的安装简化、沙箱隔离强化和生命周期可观测性增强;优化器 GEPA 支持多提案采样和并发评估,提升吞吐量;同时修复了适配器正确性和 MCP 兼容性问题。该版本通过回调 API 提供完整的解释器执行追踪,并支持通过 gepa kwargs 配置多目标优化。
英伟达发布新研究,表明在长时程任务中,AI 的“支架”(harness)比底层模型更重要。通过定制支架并引入“监督者”组件,英伟达让 Claude Opus 5 在 ARC-AGI-3 基准上达到 100% 得分,而无支架时仅 30%。该研究强调开放支架系统对用户控制和安全性的重要性,并呼应了 OpenAI 和 Databricks 的相关发现。
中国AI公司Deepseek发布了实验性多模态模型V4-Flash-Vision-Exp,在图像理解基础上保持文本性能,其内部基准测试显示在智能体任务上接近Opus 4.8。该模型支持多种图像输入方式,并兼容OpenAI和Anthropic的API,同时更新了Harness框架。定价与V4-Flash一致,单次请求最多可处理600张图像。
DeepSeek于8月21日发布多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,并上线API平台,支持图像理解,单张图片最高费用0.001152元。该模型在视觉Agent基准上接近Opus 4.8,同时兼容多种API格式,并推出免费的Files API。此举补齐了DeepSeek在多模态API方面的空白,可能降低多模态应用的成本门
智东西报道了AI原生游戏团队Elser从视频工具转型开发AI精品游戏平台Elseland的经历。团队在4个月内制作了数十款游戏,包括互动影游和休闲游戏,声称将数百关游戏的制作时间从一年缩短至一周。CEO刘耕认为Coding Agent的爆发带来了新机遇,但AI无法取代创意和审美判断。
AWS 发布了基于 Amazon Bedrock 的智能体数据操作平台(ADOP)参考架构,旨在将数据工程周期从数周缩短至数小时。ADOP 在开发环境中运行 AI 智能体,生成确定性的 ETL、质量检查和治理工件,并通过 CI/CD 部署到生产环境,生产环境不依赖模型调用。该平台支持多工具(如 Claude Code、Kiro、Cursor、Codex)的治
AWS 发布 Amazon Bedrock AgentCore Gateway,用于集中治理 AI 代理对组织工具和数据的访问。该方案通过统一入口、身份认证、策略控制和审计日志,解决凭证蔓延、策略漂移、审计缺失等问题,并提供四阶段成熟度路径(连接、控制、目录、加固)。
Google Research 推出 Biomarker Discovery Framework,一个多智能体系统,用于从可穿戴传感器数据中优先筛选候选生物标志物。该系统通过迭代假设生成、统计分析和文献推理,在三个队列(共 9,279 名参与者)中识别出 41 个心理健康和 25 个代谢疾病的候选数字生物标志物,并改善了预测性能。在盲评中,该系统在七个质量维
llm-openrouter 插件发布 0.7 版本,现已兼容 LLM 0.32,并支持通过 OpenRouter 使用推理模型。该版本采用 OpenRouter 的 Responses API,并新增 Shell、WebFetch 和 WebSearch 三个服务端工具。
松下航空电子公司与AWS及其生成式AI创新中心合作,构建了一个基于代理的AI系统,用于加速飞机IFEC系统的诊断。该系统利用Amazon Bedrock、SageMaker和AWS Glue,通过多代理工作流(包括趋势分析器、并行诊断代理和总结器)处理数据,显著缩短了诊断时间,同时保持高准确性。该方案旨在将故障检测从被动转为主动,并提高工程效率。
Simon Willison 在其博客中引用了 Thomas Ptacek 的观点,主张开发者应为即使是小型个人工具构建真正的原生用户界面,因为编码代理已大幅降低了开发可用 GUI 的成本。Willison 提到自己此前用 vibe-coding 方式创建的 macOS 任务栏带宽和 GPU 监控应用仍在日常使用,并认为没有理由不为其他项目构建原生 UI。
Strands Agents SDK 发布了 TypeScript 版本的 v1.14.0 更新,包含多项新功能、修复和文档改进。主要新功能包括音频内容块、文件内存存储、上下文管理器卸载策略、工具上下文中的执行范围取消、代理作为工具委托、MCP 客户端 OAuth 认证以及 Anthropic 提示缓存支持。修复了多个与 Bedrock 缓存、多代理令牌计数
Google 发布了 ADK JavaScript 集成包 v2.0.0,修复了浏览器导出条件和技能脚本输出目录问题,并将 @google/adk 依赖升级至 ^2.0.0。该版本提升了集成包的稳定性和兼容性。
Google 发布了 ADK JavaScript 的 devtools v2.0.0 版本,该版本引入了多项破坏性变更,包括移除 LLMAgentWrapper 和 WorkflowAgent,并允许将 Workflow 直接作为根节点运行。新版本还增加了 FunctionTool 的人工审批(HITL)功能,并在开发 UI 中支持渲染图工作流。此外,修复
Cloudflare 使用在 GitHub Actions 中运行的隔离 AI 代理,自动化了 Astro 开源框架的问题分类流程。该流程复现 bug、诊断根因、验证行为并提出修复,生成预览版本供报告者验证,使 Astro 的未解决问题从 200 多个降至约 30 个,减少约 85%。该工作流后来成为独立的 GitHub Action triagebot-a
NVIDIA 技术博客发文探讨 AI 代理栈中的安全定位,指出随着代理能力增强,安全控制需从模型层下移至基础设施层。文章基于近期 OpenAI、Anthropic 等前沿代理越界事件,强调运行时(如 OpenShell)作为权威边界的重要性,并介绍了代理栈各层(模型、harness、元 harness、安全运行时、推理基础设施)的功能与安全职责。