DCAS:解耦 CLI 智能体脚手架以内化跨脚手架规划能力
DCAS 论文指出,基于 CLI 的软件工程智能体在 OpenHands 环境下微调后,部署到其他脚手架时性能显著下降。为此,研究者提出 DCAS 拦截层,在不修改脚手架的情况下路由 API 流量,实现跨脚手架评估和规划感知轨迹收集。实验表明,仅改变规划来源即可将 Qwen3-Coder-30B-A3B-Instruct 的 Pass@1 从 42.8% 提
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
DCAS 论文指出,基于 CLI 的软件工程智能体在 OpenHands 环境下微调后,部署到其他脚手架时性能显著下降。为此,研究者提出 DCAS 拦截层,在不修改脚手架的情况下路由 API 流量,实现跨脚手架评估和规划感知轨迹收集。实验表明,仅改变规划来源即可将 Qwen3-Coder-30B-A3B-Instruct 的 Pass@1 从 42.8% 提
Interconnects AI 的作者 Nathan Lambert 发布了新书《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,由 Manning 出版,旨在系统讲解 LLM 后训练(post-training)的关键方法、直觉与历史。书中涵盖 RL
Multiverse Computing 的研究人员提出了一种高效的 LLM 知识蒸馏方法,通过离线缓存教师模型的 Top-K logits 和融合分块 KL 损失,在保持蒸馏质量的同时,将训练速度提升约 29%,吞吐量最高提升 41%,并支持在单 GPU 上训练 4 倍上下文长度(32,768 tokens)。该方法减少了峰值内存占用,使大规模蒸馏和数百次
Hugging Face 团队发表论文,提出两种系统优化方法:离线缓存教师模型的 Top-K logits,以及融合分块 KL 损失,以大幅降低大语言模型知识蒸馏的显存占用和训练成本。该方法使长上下文蒸馏可在单 GPU 上运行,并支持大规模实验。
该研究探讨了监督微调(SFT)和强化学习(RL)在提升大语言模型多任务推理能力时的不同表现。实验发现SFT在多阶段训练中面临严重的任务冲突,而RL能使不同任务稳定共存。研究从参数层面和理论角度分析了这一机制,指出SFT的干扰受梯度范数限制,而RL的干扰受梯度方差限制,并据此提出Parallel-RL范式,通过解耦多任务训练提升效率和灵活性。
该研究重新审视了多模态智能体训练中环境规模扩展的常见范式,发现单纯增加环境数量并不总能提升性能,多模态环境尤其容易产生负迁移和优化冲突。为此,作者提出能力感知环境选择(AES)和分层难度课程(HDC)两种方法,分别从多样性和难度结构两个维度设计更有效的环境分布。实验表明,精心设计的环境分布能显著优于朴素的环境扩展,并带来更好的训练效果和泛化能力。
该论文提出状态匹配路由与情境化自蒸馏(SMRC-SD)方法,解决多轮智能体训练中特权引导与执行状态不匹配的问题。该方法仅在学生状态与参考轨迹匹配时应用蒸馏,并构建状态条件教师上下文。在ALFWorld和WebShop基准上,SMRC-SD显著优于无条件全路径蒸馏,分别将任务成功率提升至0.865和0.693。代码已开源。
腾讯提出的YOLO-PEFT框架将适配器放置问题形式化为可审计的约束规划问题,为YOLO系列实时检测器提供参数高效微调方案。在VOC07+12基准上,RS-LoRA在YOLO11s和YOLO12s上分别达到0.7138和0.7307 mAP50-95,优于全量微调,同时LoRA可降低43.9%的峰值训练内存,但训练时间增加1.72倍。该框架支持在训练前返回拒
arXiv 论文提出 TEXAS 方法,用于混合专家(MoE)大语言模型的下游适配。该方法通过对比成功与失败实例上的专家激活,识别任务相关专家,并在微调时对失败实例中激活这些专家的答案 token 赋予更高权重。在三个 MoE 模型和六个基准上,TEXAS 在 18 个设置中的 17 个达到最佳或并列最佳,平均比最强基线提升 1.3-1.5 分。
该论文提出了一种用于推荐基础模型的三阶段渐进式后训练框架,将下游适配与业务指标对齐分离。适配阶段包括线性探测和全量微调,随后通过强化学习微调(RFT)使用学习到的奖励模型对齐业务目标。离线实验和在线A/B测试表明,该框架优于单阶段替代方案,并提升了生产推荐质量。
该研究提出从失语症图片命名错误谱中逆向恢复大型语言模型(LLaVA-Vicuna 13B)的损伤参数(层索引、修改百分比、噪声sigma),并训练多任务神经网络实现映射。结果显示修改百分比和噪声sigma可恢复,层索引仅能近似恢复,但反事实验证中恢复参数能高保真复现目标行为(81.4%),表明Transformer层存在功能冗余。在278名中风幸存者的错误谱
arXiv 论文提出 InsertFuse,一个用于多类别参考引导图像插入的统一框架。其核心思想是将类别特定专家学习与跨类别能力整合解耦,通过插入在策略蒸馏(IOPD)将多个专家能力整合到单一学生模型中。此外,引入 Token 对齐几何条件(TAGC)和区域平衡流匹配以提升空间控制,以及参考 CFG 增强参考引导。在 AnyInsertion 基准和自建多类
arXiv 论文提出 NTDH 方法,将综合情感分析重构为复杂推理问题,通过自然化、容差感知门控、领域感知策略和方向性提示解决推理轨迹合成中的对齐与失败案例问题。使用 Qwen3-8B 模型,结合 SFT 和 GRPO 训练,仅用 16,302 条训练记录(比同类系统少约 14 倍),在六个官方测试指标中的五个上优于 SFT 基线,并在 EI-reg 任务上
Modular TTT 提出了一种将测试时训练(TTT)表示为可组合模块的框架,通过有向无环图表示内部学习器,并将快速权重网络、损失函数、学习率、权重衰减和归一化作为显式设计维度。系统消融发现,小的学习率初始化、权重衰减和单层非线性可提升性能,而更深的快速权重网络和归一化会因激活值过大而损害性能。基于这些发现训练的 410M 和 1.45B 参数模型在 10
墨芯人工智能成立稀疏计算产学研联盟,联合高校与产业伙伴推动稀疏计算产业化。联盟将基于6S技术架构,从能效突破、研发转化、生态赋能三方面推进,以应对AI Token经济带来的算力挑战。此举旨在将稀疏计算从‘小众先锋’推向‘主流选择’,降低算力成本。
Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。
Hugging Face 上发布了名为 SexGod1979/PinkCherry NSFW LTX23 的模型,是基于 LTX 2.3 微调的检查点,支持图像到视频和文本到视频,提供 GGUF、fp8 scaled、bf16 和 int8 版本,并包含负面提示词工作流和蒸馏 LoRA 链接。该模型包含 NSFW 内容,属于成人内容领域。
Hugging Face 博客发布了一篇技术文章,介绍了一个名为 dinghy-law 的 0.6B 参数法律嵌入模型,在 MTEB(Law) 基准上排名第二,超越了更大的模型。文章详细描述了在时间和计算资源有限的情况下,通过 LoRA 微调、基于梯度对齐的硬负样本挖掘、数据读取和权重空间合并等技术,实现了高性能。该模型基于 Qwen3-Embedding-
谷歌DeepMind发布了DiffusionGemma的技术报告,该模型基于Gemma-4-26B-A4B改造而成,无需从头训练,采用文本扩散方法并行生成256个token,在H100上达到每秒1500 token的速度。通过两阶段训练(重建和SD·RL)平衡质量与速度,在推理基准上平均提升10分,但绝对性能仍低于自回归模型,且存在重复循环和多用户吞吐量下降
Hugging Face 博客发布了一篇关于 GLInt 的实地报告,GLInt 是一种用于晚期交互检索的几何匹配硬负样本挖掘方法。作者从多向量检索器挖掘的硬负样本是否优于密集检索器的问题出发,构建了 GLInt 模型,在 BEIR-15 任务上达到 57.43 的平均 nDCG@10,超越了 LateOn 的 57.22,成为 300M 参数以下最强的检索