Google 提出 ToolGrad:用文本梯度高效生成工具使用数据集
Google Research 在 ACL 2026 发表 ToolGrad,一种「答案优先」的工具使用数据集生成框架:先生成工具调用链,再反向标注用户查询,并借鉴 TextGrad 的「文本梯度」迭代构建复杂 API 工作流。基于 ToolBench 的 1.6 万+ API 生成 ToolGrad-500 数据集,微调 Gemma-3(1B/4B/12B
公司与模型 · Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与云平台
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 23:05
Google Research 在 ACL 2026 发表 ToolGrad,一种「答案优先」的工具使用数据集生成框架:先生成工具调用链,再反向标注用户查询,并借鉴 TextGrad 的「文本梯度」迭代构建复杂 API 工作流。基于 ToolBench 的 1.6 万+ API 生成 ToolGrad-500 数据集,微调 Gemma-3(1B/4B/12B
英伟达 CEO 黄仁勋在高盛 Communacopia + Technology 大会上重申,公司明年营收有望同比增长 70%,按当前财年约 4000 亿美元收入计算,明年将达约 6800 亿美元。他表示英伟达已嵌入 AI 生态各环节,能追踪全球每一吉瓦数据中心项目,并回应了外界对其循环交易的质疑,称投资前会确认有真实客户合同。
Meta 于周二推出 AI 智能体应用 Muse,目前仅限美国市场。据 Sensor Tower 数据,Muse 在 iOS 美国区下载量超过 8.3 万次,登上 App Store 排行榜第二位,但远低于 Threads 首发日的 430 万次和 Meta AI 的 10.8 万次,也慢于 ChatGPT 首周超 50 万次安装的速度。Muse 在 Goo
OpenAI 发布 GPT-6 Astra,面向计算机操作、编程、专业工作流、科学和网络安全场景,初期向有限机构开放,并逐步上线 ChatGPT Plus、Pro、Business、Enterprise 及 OpenAI API、Microsoft Azure 和 AWS Bedrock。Astra 可操作图形界面完成填表、更新 CRM、建站、数据分析等任务
Meta 推出其首个 AI 生产力助手 Muse,可连接 Gmail、Amazon 等账户,代用户处理邮件清理、购物下单、生成播客/图片/视频等任务。The Verge 记者实测发现 Muse 能完成低风险任务,但会从 Instagram API 读取比用户界面更详细的个人兴趣数据,甚至根据 Amazon 收货地址推断用户所在州,引发隐私担忧。Meta 称仅
ECCV 2026 将于 2026 年 9 月在瑞典马尔默开幕,共接收 2883 篇论文(接收率 27.5%),86 个 workshop 中有 13 个直接以 World Models 或 Embodied AI 为主题,密度为 ECCV 历史之最,Yann LeCun、Jürgen Schmidhuber 等将作 keynote。文章认为这标志 AI 竞
OpenAI Labs 成员 Sharif Shameem 展示 GPT-6 Astra 连续完成《I'm Not a Robot》全部 48 关,从图片识别到拖拽、停车、节奏控制等动态任务,形成视觉理解、GUI grounding、状态保持与动作执行的闭环。Astra 在 ScreenSpot-Pro 达 92.7%、OSWorld 2.0 达 72.6%
Strands Agents SDK 发布了 Python 版本 v1.55.1,该版本新增了将 notebook 工具移植到 Python、简化 Google 和 OpenAI 模型配置以及为 Agent 添加 backgroundTasks 等功能。同时修复了会话中畸形快照 ID 过滤、遥测中 agent 跨度语义系统指令、嵌套 Bedrock 模型前缀
Claude Code 发布 2.1.267 版本更新,新增 maxEffortLevel 设置以限制各提供商的努力级别,并支持 --system-prompt-snapshot off 选项。本次更新修复了多项问题,包括 Cowork 定时任务启动失败、移动端命令输出空白、tmux/ssh 会话中的键盘输入问题、大会话恢复时工具调用丢失、以及提示缓存失效等
汉朔科技与X-Era Lab合作,将具身智能机器人引入全球近7万家零售门店,用于巡检、盘点和补货。汉朔提供电子价签网络和数字孪生场景底座,X-Era Lab提供原生世界动作模型VWA,双方旨在将具身智能从演示Demo转化为可持续运行的生产级系统。
本文综述了生成式AI(GenAI)和大语言模型(LLM)对需求工程(RE)未来的影响。作者认为,随着通用软件工程智能体的普及,实现成本降低,工程重心将从编写代码转向需求表达、验证与评估。文章回顾了AI在RE中的历史、LLM的最新进展(如提示编程和通用SE智能体),并预测RE实践将转向操作化规范与智能体指令。该研究旨在帮助RE研究者调整未来研究重点。
Meta 发布了名为 Muse 的个人 AI 代理,旨在通过易用性和隐私保护吸引大众用户,帮助其追赶 OpenAI、Anthropic 和 Google 等竞争对手。Muse 可自主执行在线购物、发送邮件、规划旅行等任务,并将在美国免费推出,同时提供付费订阅。该产品基于自研模型 Muse Spark,并采用云端虚拟机和 Sentinel 代理保障安全,但面临
另有 1 家信源报道
法国AI公司Mistral完成30亿欧元D轮融资,投后估值超210亿欧元,由三星电子领投,ASML、英伟达等参投,创欧洲科技公司单轮融资纪录。资金将用于模型研发、算力扩展和商业增长,目前业务覆盖20国,服务超125家企业。Mistral近期发布Mistral Medium 3.5和Agentic Search等产品,但曾陷入使用DeepSeek模型蒸馏的争议
另有 1 家信源报道
Hugging Face 与 Earthmover 联合发布博客,旨在简化开源 AI 天气预报模型的运行流程。文章指出,尽管模型权重开放,但计算、存储和带宽问题阻碍了实际应用。他们提供了使用 Earthmover 数据平台和 Hugging Face 的教程,演示如何运行 ECMWF AIFS、Microsoft Aurora 等模型,并对比 ERA5 数据
2026年开源模型竞争加剧,西方厂商(谷歌、Meta)转向Apache 2.0许可,而中国前沿厂商(Kimi、MiniMax、智谱)采用更严格的定制许可。智谱GLM-5.3从MIT改为定制许可,要求收入超100亿美元的推理/微调服务商通过Z.AI安全审查,但“关联方”定义模糊引发采用障碍。本期还推荐了Motif-3、dots3-note-prev、Qwen3
PydanticAI 发布 v2.41.0 版本,新增了 openai-codex 提供商以支持 ChatGPT/Codex 订阅认证,并引入了直接的图像生成 API(ImageGenerator)。同时,弃用了 ImageGeneration 和 XSearch 上的 fallback model,改为 fallback subagent model。此外
Latent Space 发布了一个前沿 AEO(AI 引擎优化)追踪器,基于 7 个前沿模型在 161 个类别中的推荐结果,分析各产品在 AI 推荐中的主导地位。报告发现模型存在偏好偏差(如 Claude 推荐自家产品),但也观察到跨模型推荐案例。此外,Anthropic 的新模型 Astra 比 Sol 更自信且搜索来源更少,影响了 AEO 策略的有效性
TechCrunch 发布了一份 AI 术语表,用通俗语言解释 AGI、AI agent、API 端点、思维链、计算、深度学习、扩散模型等常见术语,并提及 OpenAI 新模型 Astra 的“不透明递归”推理技术引发安全担忧。该术语表旨在帮助从业者、投资者和普通读者跟上快速演进的 AI 词汇,并会定期更新。
Synaptics 在 Hugging Face 上发布了 MobileNetV2 模型,该模型由 tf.keras.applications 生成,支持 int16、int8、float32 和 float16 格式,其中 int8 量化使用随机数据。此外,还提供了 Google 发布的原始量化模型 kaggle.tflite,采用 v1 tflite 量
阿里巴巴研究部门发布了Qwen-Drive 1.0,这是一个将空间感知、交通问答和路线规划整合到单一AI模型中的驾驶系统。该模型基于Qwen3.5-4B,通过添加3D地图和路线规划模块,在模拟中将车辆偏离道路率从24%降至12%,但解释与驾驶决策有时不一致。模型已免费向研究社区开放。