返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2394 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月23日周三 · 20 条
正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源商业1

NVIDIA 新加坡 AI Day 展示东南亚 AI 进展

NVIDIA 在新加坡举办 AI Day,联合东南亚合作伙伴展示多项 AI 进展。新加坡 HTX 使用 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型推进公共安全 AI;NCS、ST Engineering 等企业采用 Nemotron 模型和 NeMo 工具开发智能体 AI 方案。马来西亚、越南、泰国、文莱等国的机构也

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

乐享以太大模型:能量驱动重塑具身智能解题范式

乐享科技发布以太大模型(Energy-Driven 能量驱动架构),用于具身智能机器人决策,并在上海烧烤店进行近一小时公开直播,让两台机器人自主完成接单、烤串、上菜等任务,接受观众实时干扰测试。文章称该架构以能量函数替代 VLA/WAM 的预测范式,将任务目标与物理约束写入目标函数,并配合神经元分配实现实时计算。此前乐享曾指控 OpenAI 的 GPT-6

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

苹果高管不建议给iPhone贴膜引热议;DeepSeek将向联合国安理会介绍AI风险;Meta个人AI助手Muse爆红

苹果硬件工程副总裁Tom Marieb公开表示不建议用户给iPhone贴屏幕保护膜,称团队在屏幕耐刮耐磨方面投入大量研发,希望用户直接体验原厂屏幕,此番言论引发网友热议。此外,DeepSeek将向联合国安理会介绍AI风险,月之暗面等中国企业也受邀参会;Meta个人AI助手Muse上线两周下载量超250万次,登顶美国iOS免费榜,带动Meta股价单日上涨11.

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

IFM 发布 K2-Horizon-3.7B 开放权重模型

IFM 在 Hugging Face 发布 K2-Horizon-3.7B,这是 K2-Horizon 系列中的小型稠密解码器模型,拥有 3.7B 核心参数和 512K 原生上下文窗口。该模型在 agentic、编码和推理基准上与 Qwen3.5-4B、G9v3-3B、Granite 4.2-3B、Nemotron 3 Nano-4B 等开放权重稠密模型对比

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

slashreboot 发布 Athena-Class Model A 实验模型

slashreboot 在 Hugging Face 发布实验性研究模型 Athena-Class Model A,基于 Gemma 4 31B Instruct 进行 LoRA 微调并合并量化为 Q8 0。该模型主打持久身份、长上下文一致性与无需系统提示的自主智能体行为,在 AIME 2026 上取得 93.33%(Consensus@4)、GPQA Di

正文结构化主题已通过公开置信门槛
Latent Space研究

John Platt 谈 Google ERA:用 AI 优化可评分科学问题

Latent Space 播客采访了 Google 研究员 John Platt,他介绍了团队开发的 Empirical Research Assistance(ERA)系统。ERA 将可写成评分函数的科学问题转化为优化任务,利用 Gemini 维护实验树并通过类似蒙特卡洛树搜索的方式迭代改进代码,已帮助解决至少十个科研问题并发表多篇论文。访谈还讨论了 ER

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

Rabbit 推出无需 R1 硬件的独立 AI agent OS3

Rabbit 推出独立的 AI agent 操作系统 OS3,无需 R1 硬件即可在 Windows、Mac 和 Linux 设备上本地运行,云端协同。用户可绑定最多五台设备并选择偏好的 AI 模型,OS3 会自动判断完成任务所需的设备、文件、应用和模型,也可通过桌面网站、Telegram 或 iMessage 访问。Rabbit 创始人 Jesse Lyu

正文结构化主题已通过公开置信门槛
THE DECODER模型发布1

OpenAI 发布 GPT-6 Sol 与 Luna:价格减半,性能提升有限

OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,token 价格较 GPT-5.6 同系列减半,Sol 为每百万输入 2 美元、输出 10 美元,Luna 为输入 0.10 美元、输出 0.50 美元,同时将缓存输入 token 折扣提升至 90%。OpenAI 称降价源于缓存与推理优化,并将新模型定位为对标 Anthropic Claude

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

高通发布两款主打AI的新旗舰手机芯片

高通在年度骁龙峰会上发布两款旗舰手机处理器 Snapdragon 8 Elite Gen 6 和 Snapdragon 8 Elite Extreme Gen 6,重点强化端侧 AI 能力。新芯片配备可运行最高 2 亿参数小模型的传感中枢,支持本地个人记录、说话人区分和语音进出式智能体;Extreme 版可在本地运行 300 亿参数的混合专家(MoE)模型。

正文结构化主题已通过公开置信门槛
Strands Agents SDK Releases一手来源开源1

Strands Agents SDK Python v1.57.0 发布

Strands Agents SDK 发布 Python 版 v1.57.0,主要新增默认使用 Opus 5 与高思考模式、合并 Strands Harness、BedrockModel 支持 requestTimeout、新增 mcp router 工具与 handoff to user 工具、Graph 和 Swarm 支持快照会话管理,并上线重新设计的

正文结构化主题已通过公开置信门槛
Strands Agents SDK Releases一手来源开源1

Strands Agents SDK TypeScript v1.19.0 发布

Strands Agents SDK 发布 TypeScript 版本 v1.19.0,主要新增默认使用 Opus 5 与高思考模式、合并 Strands Harness、BedrockModel 支持 requestTimeout、Python 侧新增 mcp router 工具、Graph 与 Swarm 支持快照会话管理,并将 handoff to u

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布1

Meta 承认 Muse 深受开源项目 OpenClaw 启发

Meta 的 AI 产品 Muse 被早期用户质疑其实是开源项目 OpenClaw 的换皮版本。Meta 超级智能实验室产品负责人 Nat Friedman 在 X 上回应称,Muse 确实在产品层面「深受 OpenClaw 启发」,但是「从零构建」的。他承认团队爱上了 OpenClaw,目标是做出可扩展至数十亿人、安全易用的类似产品。Muse 已登上美国

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
智东西产品发布

浪潮信息发布SD200 Ultra与HC2000,破局Agent算力

在AICC 2026大会上,浪潮信息发布元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组,分别面向Agent时代算力的“向上”与“向广”需求。SD200 Ultra以128芯本土AI芯片、3D HyperMesh架构和8TB带宽、64TB内存,实现单机运行2.8万亿参数Kimi K3,Token生成时延首次突破5.85毫秒,并支持10

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源模型发布1

Claude Opus 5.5 上线 AWS Bedrock

Anthropic 的 Claude Opus 5.5 现已在 Amazon Bedrock 和 AWS 上的 Claude Platform 上线,是 Claude 5.5 系列首个模型。该模型面向智能体编程、知识工作和长时任务,据 Anthropic 称比 Opus 5 用更少 token 完成更多工作,且单 token 价格和缓存读取成本更低,从而降低

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布1

用 Strands Evals 与 Amazon Bedrock AgentCore 评估技能型智能体

AWS Machine Learning Blog 介绍了如何用 Strands Evals SDK 和 Amazon Bedrock AgentCore Evaluations 评估具备技能(Skill)的智能体。技能是遵循开放 Agent Skills 标准的模块化指令集,可让智能体按需加载领域流程。文章指出技能组合会带来两类通用指标难以发现的失败:选错

正文结构化主题已通过公开置信门槛
THE DECODER模型发布1

Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,成本降四成

Anthropic 发布新模型家族首款产品 Claude Opus 5.5,宣称在多数任务上达到 Claude Fable 5.1 的水平,但运行成本比 Opus 5 低约 40%,输出速度提升超 30%。该模型定价降至每百万输入 token 4 美元、输出 20 美元,缓存读取费用下降 60%,并首次配备与 Fable 5.1 同级的网络安全、生物和前沿

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布1

Claude Code 2.1.280 发布:新增默认 Opus 5.5 模型并修复大量问题

Claude Code 发布 2.1.280 版本,新增 Claude Opus 5.5 模型并设为默认 Opus 模型,支持 100 万 token 上下文,定价为每百万 token 输入 4 美元、输出 20 美元,缓存读取 0.20 美元。本次更新还改进了全屏模式下的鼠标操作、新增 MCP 描述长度环境变量、增强 OpenTelemetry 钩子事件,

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

零令牌置信度:读取模型内部状态,0.06秒零令牌完成验证

VIDRAFT 发布零令牌置信度(ZTC)方法,通过读取模型内部隐藏状态而非生成令牌来评估答案可信度,单次前向传播即可输出校准概率,已在 Hugging Face 上线。在 2,018 项共享基准上,ZTC·Darwin-397B 以 0.7394 AUC 登顶,而模型自报置信度仅 0.5000(等同随机猜测)。在 539 项留出集上,读取内部状态比直接询问

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

JEV 生态评测:13 个答案验证器同台竞技

Hugging Face 博客发布了一项针对答案验证(answer verification)系统的独立评测,在 2,018 条统一标注的测试集上对比了 13 个系统,并公开了评分代码。结果显示仅三个系统 AUC 超过 0.70,最强的 ZTC (397B) 与 JEV 差距仅 0.0014,统计上无法区分;而仅依赖答案长度和格式的基线达到 0.7036,高

正文结构化主题已通过公开置信门槛
Anthropic Java SDK Releases一手来源API 更新1

Anthropic Java SDK v2.65.0:支持 claude-opus-5-5 与 MCP 工具列表固定

Anthropic 发布 Java SDK v2.65.0,新增对 claude-opus-5-5 模型、内联工具定义以及 MCP 工具列表固定(beta)的支持。同时修复了 Managed Agents 事件权限枚举、响应关闭与 Bedrock 流终止、addTool() 即时生效等多项问题,并补充了 Dreams、User Profiles、Manage