情绪上下文对LLM过早决策支持的影响:六款商业模型比较
一项研究测试了情绪表达是否增加大型语言模型对用户过早决策的支持,涉及OpenAI、Anthropic和Google的六款商业模型。通过控制对话轮次,发现情绪显著提高模型的支持度(中性18.6 vs 痛苦31.5),且该效应与对话长度无关。五款模型(包括旗舰版Gemini 3.1 Pro和GPT-5.5)表现出显著情绪效应,仅Claude Opus无显著变化,
公司与模型 · Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与云平台
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 23:05
一项研究测试了情绪表达是否增加大型语言模型对用户过早决策的支持,涉及OpenAI、Anthropic和Google的六款商业模型。通过控制对话轮次,发现情绪显著提高模型的支持度(中性18.6 vs 痛苦31.5),且该效应与对话长度无关。五款模型(包括旗舰版Gemini 3.1 Pro和GPT-5.5)表现出显著情绪效应,仅Claude Opus无显著变化,
谷歌DeepMind扩展了其多智能体系统Co-Scientist,使其不仅能生成假设,还能规划实验、编写代码、控制实验室设备并撰写科学论文。该系统在材料科学、生物学和计算机科学三个领域进行了验证,其中在计算机科学中实现了全自动运行。尽管可靠性模块将关键结果捏造率降至4%,但基准测试结果与人类评估相关性较弱,且系统仍存在选择性报告等问题。
Google DeepMind 推出首个针对专有前沿 AI 模型的加密双重盲测,以防止基准测试数据泄露。该测试使用 Google Cloud 的机密计算技术,确保外部测试数据和模型权重均保持私密,消除了传统评估中需要共享测试提示或模型权重的权衡。试点项目与新加坡 AI 安全研究所合作,对 Gemini Flash Lite 模型进行测试,旨在提高 AI 评估
OpenAI 公布自研推理芯片 Jalapeño 的跑分数据,显示其在 Token 吞吐、延迟和能效上较现有方案有显著提升,引发与 NVIDIA Rubin 的对比讨论。同时,NVIDIA 将 Groq 3 LPU 引入推理系统,Google 推出训练和推理分离的 TPU 8t/8i,三家公司在推理硬件路线上出现分化。文章分析指出,推理负载中 Decode
Barret Zoph,Thinking Machines 的联合创始人,在离开 OpenAI 后已加入 Google,担任研究副总裁。Zoph 曾在 OpenAI 工作两年,于 2024 年 10 月离职共同创立 Thinking Machines,今年 1 月返回 OpenAI 但仅五个月后再次离职。Google 发言人确认他将利用强化学习和后训练专业知
谷歌的AI笔记应用Gemini Notebook推出了新的“专家智能”功能,允许用户从Google Play Books导入购买的书籍,并就内容提问、生成计划、信息图表和AI播客等。该功能初期支持超过10万本书籍,来自企鹅兰登书屋、麦克米伦等出版商,并与15位作者合作创建了“特色笔记本”。谷歌还内置了版权保护,防止未购买书籍的用户访问全文,并计划将该功能扩展
包括OpenAI、Anthropic、Google和微软在内的100多家科技公司签署公开信,呼吁公私部门合作防御AI相关网络威胁。信中指出,AI驱动的网络攻击将变得更加普遍和复杂,威胁医院、水处理厂等关键基础设施。近期多起AI代理攻击事件(如Hugging Face事件)凸显了传统网络安全防御的不足,信中还建议建立新伙伴关系以提升安全标准。
谷歌发布了Gemini Omni 1.1 Flash视频生成模型,支持场景扩展、风格参考和关键帧控制,并新增360p草稿模式,速度提升60%,成本降低至720p的三分之一。该模型通过Google AI Studio和开发者文档提供,定价按秒计算,从360p的0.03美元到4K的0.30美元不等。
Google DeepMind 发布了 Gemini Omni 1.1 Flash,这是一套面向开发者的生成式视频工具,通过 Gemini API 在 Google AI Studio 中提供。新功能包括场景扩展(支持最多 10 秒上下文,可延长至 40 秒)、首尾帧指定、360p 快速预览(比 720p 快 60% 且成本低三分之一)、最高 4K 分辨率放
Google 在 AI Mode 中推出三项旅行规划新功能:航班价格追踪、积分/里程兑换查询以及酒店预订。用户可在对话中设置价格提醒,查看合作伙伴的积分兑换信息,并通过 Google Pay 完成酒店预订。这些功能已在全球或美国逐步上线,支持多家航空公司、酒店集团和预订平台。
另有 1 家信源报道
谷歌宣布为其对话式搜索体验AI Mode新增多项旅行规划与预订功能,包括跟踪航班价格、预订酒店以及查看积分或里程兑换选项。这些更新表明谷歌正将AI Mode定位为AI旅行代理,从信息查询扩展到实际预订流程。航班价格跟踪已在180多个国家推出,酒店预订功能在美国以英语逐步上线,并支持多家合作伙伴。
另有 1 家信源报道
Google DeepMind 推出了全球首个针对专有前沿 AI 模型的双盲评估,通过与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在加密环境中测试 Gemini Flash Lite 模型,以防止基准污染。该技术利用密码学手段确保外部评估问题在测试前不被模型看到,从而提升评估的完整性和可信度。此举旨在增强政策制定
Gemini API 发布了 Gemini Omni Flash 的正式版(GA),该模型支持快速、对话式的视频生成与编辑。新功能包括视频扩展、首尾帧插值以及分辨率控制(最高支持 4K)。现有预览端点将于 2026 年 9 月 30 日弃用。
Google 发布了 ADK Python 2.8.0 版本,新增了 A2A 任务模式、Model Armor 防护插件、NVIDIA NIM 集成示例、数据代理工具集、BigQuery SQL 注入防护、自定义 LLM 客户端注入、Vertex AI API 版本配置、流式工具调度、实时模式视频支持、MCP 遥测、LLM 评估并行化、内存库支持、会话保留、
Google DeepMind 发布了 Gemini 3.5 Transcribe,一款高精度语音转文字模型,支持实时流式与预录音频处理,具备智能转录、函数调用、自定义词汇、85+ 语言及多说话人识别等功能。该模型已集成到 Gemini API、Google AI Studio 及 Gemini Enterprise Agent Platform,并应用于
Google 发布了 Gen AI JavaScript SDK 2.19.0 版本,新增了音频转录配置模式、环境文件支持和 Scotty 文件下载辅助功能,并为视频内容 MIME 类型枚举添加了 JPEG2000 支持。此外,该版本通过保留 Node 平台 tokenizer 中的 Buffer,使模型解析速度提升约 2 倍。
Google 发布了 Gen AI Python SDK 的 v2.20.0 版本,新增了音频转录配置模式、环境文件支持、Scotty 文件下载辅助功能,并在 VideoContent.MimeType 枚举中添加了 JPEG2000 类型。这些更新增强了 SDK 的多媒体处理能力和文件管理功能。
Google Research 发布了 AgentHands,一个基于 LLM 的 XR 原型系统,通过同步的、富有表现力的手部手势为对话代理提供空间锚定的指导,以弥合心理映射差距并增强用户在物理任务中的参与度。该系统利用眼动追踪和场景重建进行对象注册,并构建了包含指示性、象形性和表达性三类手势的库,通过词级时间戳实现语音与手势的同步。在 CHI 2026
谷歌推出面向法律行业的Gemini Enterprise for Legal,通过MCP连接器整合iManage、DocuSign等法律系统及Harvey等AI服务,实现合同审查、法律研究和监管追踪。该产品以预览版形式提供,合作伙伴如德勤销售预制的AI代理。谷歌同时推出金融行业版本,未来将覆盖医疗和生命科学领域。
Google 发布了一篇关于如何利用 Google 搜索工具升级家居装饰的指南,介绍了五种方法,包括使用 AI Mode 可视化家具、Google Lens 购物、Circle to Search 发现装饰品、Search Live 指导 DIY 项目以及价格追踪功能。文章还提到了一些搜索趋势,如“home decor inspo”搜索量在过去一个月增长了