基元律动发布NeoHorse模型,探索Harness驱动的递归自我改进路径
原标题:基元律动发布模型NeoHorse,探索Harness驱动的RSI路径
AI 摘要
基元律动联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布Agent-Native模型NeoHorse-1,包含4B和9B两个版本,基于Qwen3.5后训练,利用Routing Harness系统OpenSquilla产生的执行轨迹作为训练语料,通过路由信号、Agent执行监督和在策略蒸馏等方法提升模型能力。评测显示NeoHorse 4B在11项基准中未加权平均分领先,并在五项上超过Qwen3.5-9B底座。该工作被视为递归自我改进(RSI)的单轮工程验证,旨在探索Harness驱动的模型训练路径。
正文节选
0 在一次项目排期测试中,一个4B基础模型找到了工作目录中的文件,却漏读了一封包含最新依赖约束的邮件。它按照过时信息生成计划,并把文件写到了错误位置。 这一案例来自基元律动(TokenRhythm)近日发布的技术报告。该公司联合无问芯穹、清华大学、北京大学、阿里巴巴等机构,推出首个Agent-Native模型NeoHorse-1,包含4B和9B两个版本,探索将Agent使用工具、接收反馈和修正错误的经验转化为模型能力。 基元律动由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办。公司此前开发的开源Routing Harness系统OpenSquilla,用于在Agent执行任务时选择和组织不同模型。NeoHorse将这条技术路线延伸至模型训练。 据技术报告,训练语料以包括OpenSquilla在内的Routing Harness产生的执行轨迹为核心,并辅以公开数据。这些轨迹保留了能力需求预测、路由选择、模型响应、工具调用和环境反馈,经完整性检查及目标完成、证据一致性、错误恢复等质量评估后,用于后训练。 团队利用路由信号估计任务所需能力、安排训练顺序,并结合Agent执行监督和在策略