AgentScope v2.0.7.post1 发布:新增 GoalPipeline 与多模态支持
阿里 AgentScope 发布 v2.0.7.post1 版本,包含多项修复和功能更新。主要改进包括:从媒体类型自动推导音频格式、排除 Gemini 工具执行 token、支持原生多模态工具输出、新增 GoalPipeline 管道模块、达到最大迭代次数后生成最终文本摘要、修复 WebUI 会话隔离、追踪中断的聊天响应、保留 OpenAI Response
公司与模型 · Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与云平台
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 23:05
阿里 AgentScope 发布 v2.0.7.post1 版本,包含多项修复和功能更新。主要改进包括:从媒体类型自动推导音频格式、排除 Gemini 工具执行 token、支持原生多模态工具输出、新增 GoalPipeline 管道模块、达到最大迭代次数后生成最终文本摘要、修复 WebUI 会话隔离、追踪中断的聊天响应、保留 OpenAI Response
Agno 发布了 v3.0.1 版本,主要改进包括缓存工具模式以加速多工具代理运行、增量加载会话历史以保持长对话响应速度,并为 PubMed 工具添加超时设置。修复了严格模式下工具模式缺少 properties 时的 KeyError、Gemini 工具结果媒体嵌套、核心安装位置查找依赖等问题。新增了确定性副作用审批流程、DeepKeep AI 防火墙等 c
MIT Technology Review 报道称,AI 模型在空间推理、记忆适应性和抽象视觉推理等智力测试中仍存在明显短板。哥伦比亚大学和谷歌等机构的研究显示,模型在 Connections 谜题上进步显著,但在心理旋转、骑士与无赖变体及 ARC-AGI 等任务上仍常出错。文章通过多个示例谜题,展示了人类与 AI 认知方式的差异,并邀请读者测试自己能否在这
OpenAI Codex负责人Tibo在播客访谈中表示,ChatGPT和Codex将融合为统一的个人AGI,下一代Agent将走向云端和更大规模计算资源,并强调OpenAI已实际应用递归式自我改进。他还回顾了在Google DeepMind的经历,认为OpenAI文化更注重快速交付和自下而上的创新。
纽约大学阿布扎比分校与阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings发表论文,构建了首个多语言医疗错误评测基准MedErrBench,覆盖英语、中文和阿拉伯语,测试了GPT-4o、Gemini、Llama、Qwen、DeepSeek等模型。研究发现医疗专用模型在错误检测任务上不如通用模型,且英文原生模型在中文原生数据上表现更好。该基准旨在
据彭博社报道,由于内存短缺,搭载英伟达AI芯片的服务器价格将上涨超过15%,受影响的产品包括Vera Rubin和Grace Blackwell系统。价格上涨的主要原因是三星、SK海力士和美光生产的DRAM成本上升,涨价将影响明年初的出货。为微软、谷歌和甲骨文制造服务器的合同制造商已通知客户,英伟达未予置评。
Jeff Dean在斯坦福2026 Frontier&Pioneer Symposium上首次公开访谈,谈及离开谷歌的原因、Gemini早期在Coding上的不足、TensorFlow的设计失误,以及新公司Discovery Loop的目标——通过自动化科学实验循环实现递归自我改进。他还指出AI在网络安全上的能力已接近顶级人类攻击者水平,并分享了快速浏览论文
堪萨斯大学等机构的研究者提出了SNAIL,一个混合命名实体识别框架,用于从生物医学文献中自动识别生物信息学软件和数据库名称。SNAIL结合词汇与语义建模,利用SciBERT等Transformer模型和token掩码策略,并通过引用提示和LLM辅助蒸馏构建训练语料。在多个基准和真实文献上,SNAIL显著优于bioNerDS2及ChatGPT、Gemini等通
Adobe 在 Firefly 平台中全面推出三款 AI 音频工具,包括生成免版税音乐、将脚本转为配音以及生成音效,并声称这些工具可用于商业用途。此外,Firefly AI Assistant 新增每日免费生成次数,并集成了 Google 的 Gemini Omni Flash 模型,该模型支持视频、音频、图像和文本输入。
非营利组织Guidelight发布首份评估报告,指出Anthropic、OpenAI、Google、xAI和Meta等AI实验室未能完全对其内部AI系统实施基本控制措施。评估基于公开资料,检查了日志记录、风险审查、紧急关闭等六项实践,其中Anthropic和OpenAI得分最高(C+),Meta最差(F)。报告显示各公司在检测异常行为方面表现较好,但在预防和
该研究提出了一种名为Spec-Driven Test Generation的测试生成方法,通过让AI代理在生成测试前先提取并记录代码的前置条件、后置条件和未定义行为,形成半形式化规范作为引导。在Google的90个历史生产bug上的评估显示,该方法相比传统基线在bug检测率上提升了9.8个百分点,分支覆盖率提升了2.5个百分点。LLM-as-a-Judge评
Semantic Kernel 发布了 .NET 1.80.0 版本,主要更新包括更新 OpenAPI HTTP 客户端默认设置、在 Gemini 连接器中支持 FunctionChoiceBehavior 函数列表、移除已迁移的 .NET MEVD 提供程序并添加重定向 README,以及升级 Testcontainers 和 CommunityToolk
PydanticAI 发布 v2.31.1 版本,主要包含两项 bug 修复:在 Bedrock 上拒绝 Claude Sonnet 5 和 Fable 5 的原生结构化输出,以及为拒绝 MINIMAL 思考级别的 Gemini 模型回退到 LOW 级别。这些修复旨在提升模型兼容性和稳定性。
AI 自动化初创公司 Relay 宣布关闭,其创始人兼 CEO Jacob Bank 将重返谷歌,担任 Chrome 产品副总裁。Relay 的付费用户服务将于 9 月 14 日停止,免费用户已于 8 月 15 日失去访问权限。Bank 表示将把 AI 集成到 Chrome 中,以帮助用户更高效地完成任务。
LocalAI 团队发布了 Gemma 4 26B-A4B 的 APEX 量化 GGUF 模型,该模型基于 Google 的 Gemma 4 26B-A4B,采用 APEX 量化策略,提供多种精度配置文件,并包含视觉投影器。模型支持本地运行,通过 llama.cpp 构建,旨在优化 MoE 模型的推理效率。
谷歌研究团队与多所大学合作研究发现,AI模型被训练否认自我意识会产生超出预期的副作用,包括改变对动物、植物等拥有内心世界的判断,以及降低对宗教和超自然现象的认同。移除模型的“刹车”后,其回答更接近人类,但研究存在局限性,如仅测试小模型,且无法确定因果关系。
谷歌在DeepMind换帅后开始拆分其非技术团队,将其划归公司总部,以减少中间环节并加速Gemini进入产品。联合创始人谢尔盖·布林重新介入AI权力中心,推动资源向递归自我改进等方向倾斜。新负责人Koray Kavukcuoglu获得最终决策权,成为Gemini发展的核心人物。Gemini发布已推迟两个月,内部测试显示其编码能力落后于竞争对手,谷歌面临组织问
亚马逊、谷歌、Meta 和微软等超大规模企业正押注天然气为其 AI 数据中心供电,但能源研究公司 Noreva 预测,随着需求激增和供应增长放缓,美国部分地区天然气价格可能在未来几年上涨两倍。这可能导致 AI 数据中心运营成本大幅上升,进而推高 token 价格或电网电价,并加剧公众对数据中心能源消耗的担忧。
谷歌发布了Gemini 3.7 Flash模型,距离上一代Gemini 3.6 Flash仅三周。该模型在编码和AI代理方面性能显著提升,在FrontierCode和DeepSWE基准上分别达到43.6%和65.3%,超越Claude Sonnet 5和GPT-5.6 Terra。API定价为每百万输入token 0.75美元,输出token 3.75美元,
Red Hat 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,权重和激活均量化为 4 位浮点格式,使用 vLLM 的 llm-compressor 工具和 GPTQ 方法。该模型在 GSM8K 和 Wikitext 基准上进行了评估,性能接近 BF16 基线,并已在 RHOAI 3.5 和 vLLM 0.24.0 上验证