重新思考专业设计数据的预训练:JONES-19 数据集的证据
arXiv 上发布了一篇关于设计数据预训练的研究论文,基于 JONES-19 文化设计数据集,比较了 ImageNet 预训练与从零开始训练 CNN 的性能。研究发现,虽然 ImageNet 预训练能提升判别性能,但通过多裁剪局部采样从零开始训练也能达到类似效果,表明在专业设计领域,精心策划的小型高质量数据集可能比大规模通用预训练更有效。
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
arXiv 上发布了一篇关于设计数据预训练的研究论文,基于 JONES-19 文化设计数据集,比较了 ImageNet 预训练与从零开始训练 CNN 的性能。研究发现,虽然 ImageNet 预训练能提升判别性能,但通过多裁剪局部采样从零开始训练也能达到类似效果,表明在专业设计领域,精心策划的小型高质量数据集可能比大规模通用预训练更有效。
该研究针对长时程智能体的跨基准泛化问题,对开放权重混合专家模型Qwen3.5-122B-A10B进行后训练,使用363个MCP任务和两阶段SFT-RL流程。训练后的模型在五个外部基准上均有提升,包括Toolathlon、tau^2-Bench、BFCL-V4、SWE-Bench Pro和Terminal-Bench 2,其中软件工程基准的提升尤为显著,尽管训
arXiv 上发表了一篇名为 Progressive$^2$ 的论文,提出了一种新的知识蒸馏方法,通过渐进增强教师模型和渐进缩小学生模型来协同进化,以解决服务器与客户端能力差距大时蒸馏性能下降的问题。该方法包含教师侧的多特征融合适配器和学生侧的渐进式网络缩减,可灵活部署,旨在实现模型压缩与性能的平衡。
本文提出视觉归因蒸馏(VAD),一种用于多模态同策略蒸馏的反事实目标重建算法,通过评估教师模型在有/无视觉证据时的输出差异,估计纠正信号中由视觉证据支持的部分。在4B和9B规模的六个细粒度视觉基准上,VAD优于直接特权视图蒸馏和视觉优势加权方法。结果表明,反事实目标重建是源混合监督的有效替代方案。
这项研究提出了一种名为“宪法式中期训练”的LLM对齐方法,在中期训练阶段插入基于Anthropic宪法的原则性内容,以提升对齐的持久性。在120B参数规模下,使用394M token的语料库进行实验,结果显示该方法在泛化和持久性上优于对照组,尤其在黑mail场景中,经过良性微调后仍能降低17.5个百分点的倾向,且不损害MMLU等能力。研究还发现,内容的存在比
Together AI 推出 LoLCATs 方法,通过注意力迁移将现有 Transformer LLM 快速转换为次二次复杂度模型,无需从头预训练。该方法在 Llama 3.1 全系列(8B/70B/405B)上首次实现线性化,仅用参数高效微调(<0.2%参数)和 4000 万训练 token,显著降低计算成本,同时提升零样本准确率,并匹配原始 Trans
Together AI 发布了一篇关于多轮对话微调 LLM 的教程,指出通用模型在领域适应、知识限制和多轮复杂性方面存在不足,而微调可解决这些问题。文章详细介绍了数据集准备、损失掩码策略(包括无掩码、全掩码和样板掩码)以及微调 Llama 8B 的实践,并引用了相关研究,强调掩码策略的选择取决于数据集特性。
Together AI 发布技术博客,探讨大语言模型长上下文能力的现状与挑战。文章指出,尽管模型宣称支持百万级 token,但实际有效上下文长度远低于标称值,性能随长度增加而下降。为解决此问题,Together AI 平台现已支持最长 32k token 的微调,并展示了通过微调 Llama 3.1 8B 模型在重复任务上性能大幅提升的案例,强调长上下文微调
微软研究博客发布了Orchard,一个用于可扩展和成本效益的智能体AI研究的开源框架,其核心是Orchard Env,一个可复用的环境服务,支持在多个任务领域训练和评估智能体。Orchard支持软件工程、网页导航和个人助理智能体,并能在Codex、OpenClaw和ZeroClaw等真实部署框架中直接训练。Orchard-SWE在SWE-bench Veri
SAF-OPD 提出了一种稳定优势融合框架,用于结合强化学习(RLVR)和在线蒸馏(OPD)训练。该框架通过四阶段流程(稀疏化、压缩、预热、退火)解决固定系数融合导致的熵崩溃问题,在七个数学推理和代码生成基准上,使用 Qwen3-1.7B/4B/8B 模型,将聚合分数提升了 0.51-2.70%,并实现了更稳定的训练。
xAI 发布了其最先进的模型 Grok 4.5,专为编码、智能体任务和知识工作设计。该模型在数万块 NVIDIA GB300 GPU 上训练,强调数据过滤和强化学习,以提升推理效率和编码能力。Grok 4.5 已集成到 Grok Build、Cursor 和 SpaceXAI 控制台,定价为每百万输入 token 2 美元、输出 token 6 美元,并宣称
雷峰网报道称,B300整机价格半年内从400多万元涨至超1200万元,市场出现虚假现货套取企业数据的安全隐患。大厂因数据安全、并发性能、计费黑箱和封号风险等问题,普遍不愿使用算力中转站。国产AI芯片企业分别推进AFN架构和Prefill芯片研发,3D堆叠芯片成为投资风口但面临量产挑战。一家AI Infra公司三位核心高管离职,行业从拼卡转向拼运营。投资人认为
Hugging Face 每日论文介绍了一篇关于基于评分标准的强化学习(Rubric-based RL)的研究。论文指出该方法的两个失败模式:未探索标准(UC)和受抑制标准(SC),其中SC在超过57%的训练样本中出现。作者提出Criterion-Distilled Policy Optimization(CriPO)方法,通过策略内自蒸馏和令牌级优势修正同
Liquid AI发布了新一代混合模型LFM2系列,包括350M、700M、1.2B和2.6B四个参数规模的检查点,专为边缘AI和端侧部署设计。LFM2采用乘法门和短卷积的新架构,训练速度比上一代快3倍,CPU上的解码和预填充速度比Qwen3快2倍,在知识、数学、指令跟随和多语言等基准上优于同尺寸模型。该系列支持8种语言,上下文长度32,768 tokens
NVIDIA与Hugging Face合作,推出NVIDIA NeMo Automodel开源库,支持对Diffusers格式的扩散模型进行分布式微调,无需转换检查点或重写模型。该库支持流匹配模型,提供全参数和LoRA微调,并支持FSDP2、张量并行等多种并行策略,可扩展至数百GPU。已为Wan 2.1、FLUX.1-dev、HunyuanVideo等模型提
作者在 Hugging Face 博客上分享了一项实验:仅使用奖励信号(REINFORCE 算法)从头训练一个 15M 参数的法国语言模型,使其学会生成特定句子,无需预训练或语言规则。实验发现,逐步奖励(如按位置匹配)能有效引导学习,而全有或全无奖励则完全失败。模型最终达到 99.9% 的语法正确率,但学习到的只是位置到字符的查表,缺乏抽象结构,迁移测试也证
Together AI 与斯坦福大学合作开发了 ThunderKittens 框架,并针对 NVIDIA Blackwell 架构开源了新的内核,包括 BF16/FP8 GEMM 和注意力前向/反向内核。这些内核在 B200 上接近 cuBLAS/cuDNN 速度,在 H100 上比 cuBLAS 和 FA3 快达 2 倍。文章深入探讨了如何利用第五代张量核
Together AI 宣布其微调平台新增持续微调功能,允许用户通过指定 --from-checkpoint 参数从先前检查点继续训练模型。文章深入探讨了持续微调的概念、应用场景(如多语言适应、任务性能提升)以及灾难性遗忘等挑战,并提供了相关代码示例。该功能旨在提高模型适配新任务和数据的效率,减少资源消耗。
Together AI 宣布其微调平台现已支持直接偏好优化(DPO),这是一种无需强化学习即可将语言模型与人类偏好对齐的技术。文章详细介绍了 DPO 的原理、与 RLHF 的对比,并推荐先进行监督微调(SFT)再进行 DPO 的两阶段训练方法,以提升模型的有用性、真实性和无害性。
Together AI 在 ICML 2025 论文中提出 Mixture-of-Agents Alignment (MoAA) 方法,通过将多个开源大模型的集体智能蒸馏到单个小模型中,使 Llama-3.1-8B 和 Gemma-2-9B 等模型性能接近甚至超越 10 倍大小的模型。该方法包括 MoAA-SFT 和 MoAA-DPO 两个阶段,使用 MoA