Hugging Face 上基于 GPT-2 微调的 small-agentic-model-1.5B 模型卡片
Hugging Face 上出现一个名为 joaosollatori/small-agentic-model-1.5B 的模型卡片,该模型基于 gpt2 微调,采用 MIT 许可证,使用 Transformers 5.0.0 与 PyTorch 2.10.0 训练。卡片由 Trainer 自动生成,训练数据集未说明,评估集损失为 3.1493,模型描述、预期
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 上出现一个名为 joaosollatori/small-agentic-model-1.5B 的模型卡片,该模型基于 gpt2 微调,采用 MIT 许可证,使用 Transformers 5.0.0 与 PyTorch 2.10.0 训练。卡片由 Trainer 自动生成,训练数据集未说明,评估集损失为 3.1493,模型描述、预期
开发者 lvladikov 在 Hugging Face 发布 Krea2-Turbo-Distill-4step-LoRA,这是一个基于 krea/Krea-2-Turbo 的蒸馏 LoRA 适配器,将文生图模型的最低可用步数从 8 步降至 4 步,端到端速度约提升 1.6 倍。该 LoRA 在单张 RTX 3090 上训练 21 天,使用 78,000
NVIDIA 在技术博客中介绍 NVLink 6 面向大规模 AI 工厂的多层弹性架构,覆盖物理层、链路层、系统冗余和应用软件层。物理层通过轻量级 FEC、物理层重传(PLR)和 UPHY 恢复实现无损传输,链路层采用基于信用的流控(CBFC)消除丢包,系统层消除单点故障,软件层提供 Dynamo Shadow Engine Recovery 和检查点恢复。
AWS 博客介绍如何用 Amazon SageMaker 无服务器模型定制构建 AI 产品打标系统。方案先对 Qwen3-8B 做监督微调(SFT),再用带可验证奖励的强化学习(RLVR)和 GRPO 优化,训练由 SageMaker 无服务器定制管理容量,最终模型部署到 SageMaker 异步推理做批量目录富化。文章对比了无服务器与 SageMaker
AWS 为 Amazon SageMaker AI 训练和 Processing 作业推出实例偏好列表功能,用户可在创建作业时按优先级指定最多五种可接受的实例类型。SageMaker 会按顺序自动评估并选择首个有可用容量的实例类型启动作业,无需手动重试脚本或轮询。该功能还支持与 Flexible Training Plans 预留容量集成,优先使用预留容量,
研究团队发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,从零训练,结合内部推理与外部工具使用,支持 256K 上下文。该模型采用架构与系统协同设计(交错门控滑窗与全注意力、稳定的 FP8 Muon 优化器)、渐进式课程与 MDP 中期训练,并借助智能体集群自主管理集群运维、数据整理与评估。在数学推理和智能体搜索任务上,其表现可与 Qwen3-235B
另有 1 家信源报道
研究团队发布 Atria Dawn Preview,一个通过可验证经验管线(Verifiable Experience Pipeline)训练的基础智能体语言模型,将工具交互与可执行环境及外部验证结果相连接。该模型在覆盖科研、工程和数字工作的 16 项基准测试中与前沿智能体相当,并在其中 5 项取得最高分。论文还以该模型研发过程为案例,分析 56 名参与者的
Hugging Face 的 PEFT 库正式将 ShadowPEFT 纳入为一等方法。ShadowPEFT 与 LoRA 的适配器几何结构根本不同,但共用 get peft model 入口和适配器保存/加载路径。它引入一个带持久隐藏状态的有状态影子模型,在每层进行影子注入、基础编码和影子更新,实现跨层协调,并让任务特定组件成为可独立推理的模型。
Meta FAIR与华盛顿大学发表论文,提出将知识蒸馏的学习单位从Token换成Byte,让字节级学生模型直接学习教师的字节级概率分布。团队提出Marginalize-It和End-Of-Token两种转换方法,以Llama 3-8B为教师进行实验。按缩放定律预测,End-Of-Token蒸馏的下游平均准确率上限达52.4%,比传统Token蒸馏的48.4%
该论文将「导数保真度」形式化为物理信息神经网络(PINN)的一种失效模式,并用一维基准函数进行验证。作者仅用函数值训练多层感知机拟合 sin(x) 与 exp(x),再单独评估自动微分得到的二阶导数,结果显示函数值拟合在视觉上准确的同时,二阶导数误差可能显著偏大,尤其在高曲率边界区域附近。研究据此提出一套诊断流程,用于区分函数值精度与物理残差可靠性。
该论文提出了一种名为 CSGR(Counterfactual Search for Grounding Regions)的自动标注流程,通过分割模型提出候选区域、用修复模型扰动这些区域,并测量其对模型答案分布的影响,从而识别出对答案起关键作用的「模型因果视觉证据」区域。CSGR 在多个评判模型间聚合证据以减少偏差,生成细粒度像素级标注。实验将该标注接入注意力
该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最
该论文系统评估了 token merging 技术在多语言语音识别模型 Whisper 上的效果,覆盖十六种语言和三种模型规模。研究发现,合并 token 能提升计算效率,在大多数低资源语言和模型规模下几乎不损失转录准确率,且在 DoRA 微调后依然有效。结果表明 token merging 是一种让多语言语音识别部署更快、更便宜的高实用方法。
XHToken 发布 Spark-X2.5-4B 与 Spark-X2.5-1.7B 两款紧凑型通用语言模型,采用混合注意力架构(1 层全注意力加 3 层滑动窗口注意力),原生支持最高 1M token 上下文与 200 多种语言。模型在华为昇腾集群上基于约 20 万亿 token 预训练,并通过大规模强化学习与 MOPD 后训练提升推理、编码与智能体能力。
北京中关村学院7名博士生用一个暑假从零训练出7B大模型ZGCM-1,并开源模型权重、训练代码、数据配方、中间checkpoint和日志。团队组建数百个Agent分头处理数据、跑实验、看日志和做评测,实践「AI4AI」研发范式,并对11类任务的Agent自主性做了L1-L5评级。ZGCM-1在多项通用评测中与Qwen3-8B等相近,部分数学推理和搜索任务可与更
Hugging Face 上发布了 cRia-LM-75M,一个 75.7M 参数的基座语言模型,采用 Relaxed Recursive Transformer(RRT)架构,用 11 层共享循环块执行两次遍历,第二次遍历使用 rank-172 LoRA 参数。训练分三阶段:Stage 1 在 10B token 上预训练 2K 上下文,Stage 2 用
AgentionAI 发布 Signal 3.8 27B,这是对 Qwen3.8-27B 的微调版本,以 GGUF 格式提供,采用自蒸馏训练,不引入外部数据。官方评测显示其答案 token 减少 25%、思考 token 减少 41%,同时 GSM8K 准确率持平或提升,并借助内置 MTP 草稿头提升投机解码接受率,端到端生成时间最多缩短约 19%。
Anthropic CEO Dario Amodei 发表文章呼吁放缓大语言模型开发速度,OpenAI CEO Sam Altman、Google DeepMind 主席 Demis Hassabis 和 SpaceXAI CEO Elon Musk 均表示支持。文章指出,这些头部 AI 实验室的公开表态转向“末日论”,但立场模糊,且可能出于商业考量。文章还
据404 Media调查,OpenAI雇佣数百名合同工阅读真实的ChatGPT用户对话,用于改进模型回复。这些审核员按1到7分给回复打分,并负责减少模型过度谄媚和拟人化行为。审核内容虽经匿名化处理,但仍可能包含敏感个人数据,且部分用户曾明确要求ChatGPT保密。OpenAI仅在FAQ中低调提及人工审核,用户可关闭默认开启的“Improve the mode
NVIDIA 技术博客介绍如何利用 JAX 和 NVIDIA Transformer Engine 加速无丢弃(dropless)MoE 训练。文章指出 MoE 训练面临动态路由、不规则张量、all-to-all 通信等瓶颈,在 DeepSeek-V3 于 GB200 上的基线仅 103 TFLOPS/GPU,通信占内核时间 84%。通过 Transform