对话 COBRA-Skills 一作:50 样本重构 Agent 技能降本路线
原标题:对话 COBRA-Skills 一作卢平琛:仅用 50 个样本,重构 Agent 技能降本路线
AI 摘要
香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队提出 COBRA-Skills,将 Agent 技能优化建模为带预算控制的情境多臂老虎机问题,用轻量 MLP 预测收益加 LinearUCB 量化探索来筛选候选技能,再由进化算子按对数调度生成与精炼技能。该方法仅用 50 个优化样本,在 6 个跨领域 Benchmark 上全面超越主流方法,优化成本降低 55%–58%,教学模型 Token 消耗缩减 67%–80%,并在 Claude Code 与 Codex 框架下验证了跨平台适配与跨模型复用能力。
正文节选
当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。 作者丨张 璐 编辑丨马晓宁 过去,智能体的技能(Skill)大多依赖人类专家手动撰写,不仅耗时费力,更难以覆盖海量复杂的真实场景。为此,借助大模型“自动化生成与优化技能”,成了让 Agent 迈向自主进化的新范式。然而,摆脱了人工编写的束缚,却撞上了高昂的 Token 账单。要验证一个自动生成的技能到底管不管用,必须让智能体带入真实任务中落地执行。每一次试错,都是实打实的 Token 消耗与多轮交互的时间成本。更棘手的是,许多候选技能在刚生成时就自带缺陷。但在现有框架下,我们缺乏“事前筛选”的能力,只能任由大量预算被这些低质候选无意义地吃掉。同时,后续的精炼流程也在频繁调用高阶 LLM,哪怕缺乏有效的新证据,这种“反思—重写”的流水线依然在机械重复。评估贵,精炼也贵,两笔账算下来,技能