LinkedIn 用多教师蒸馏将 AI 职位搜索训练提速 8 倍
LinkedIn 公布了其 AI 职位搜索背后的训练基础设施,采用多教师蒸馏流水线,将 8B 相关性教师模型和 1.7B 互动教师模型的知识压缩进 0.6B 参数的排序模型。系统基于开源 SGLang 构建自定义框架,在训练循环中直接服务教师模型,并通过在线/离线蒸馏拆分、LiGer、多节点训练、FSDP2 和 H200 集群等优化实现约 8 倍训练加速。该
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
LinkedIn 公布了其 AI 职位搜索背后的训练基础设施,采用多教师蒸馏流水线,将 8B 相关性教师模型和 1.7B 互动教师模型的知识压缩进 0.6B 参数的排序模型。系统基于开源 SGLang 构建自定义框架,在训练循环中直接服务教师模型,并通过在线/离线蒸馏拆分、LiGer、多节点训练、FSDP2 和 H200 集群等优化实现约 8 倍训练加速。该
llama.cpp 发布 b10903 版本,修复了 Vulkan 后端 argsort 中的竞态条件和越界访问问题(PR #28705),其中越界访问可能解释 CI 中的失败。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10902 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 矩阵乘法的二进制内核支持(PR #28268)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
llama.cpp 发布 b10901 版本,主要变更是 Vulkan 后端在上下文空闲时,ggml backend vk cpy tensor async 改用 CPU 写入方式。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA
llama.cpp 发布 b10900 版本,主要变更是 Vulkan 后端使用 add alloc dep 以在 prefill 阶段启用 topk moe 融合(PR #28422)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、C
OpenAI 发布 GPT-6 Astra,面向计算机操作、编程、专业工作流、科学和网络安全场景,初期向有限机构开放,并逐步上线 ChatGPT Plus、Pro、Business、Enterprise 及 OpenAI API、Microsoft Azure 和 AWS Bedrock。Astra 可操作图形界面完成填表、更新 CRM、建站、数据分析等任务
环球音乐集团(UMG)宣布与AI语音与音乐生成公司ElevenLabs达成多年授权协议,将推出一个AI音乐平台,允许用户基于其授权曲库创作混音、串烧和改编作品。艺人可自行选择是否参与。UMG此前已与Udio开发AI音乐平台,并与Spotify、Nvidia、Klay达成AI授权合作;本周Suno也发布了基于华纳音乐等授权歌曲训练的首个AI音乐模型。
llama.cpp 发布 b10894 版本,主要改动是清理旧模型代码中已失效的 switch 分支(#28669),移除早期重构时复制粘贴、现已不可能触发的条件判断,仅保留 llama model bert::graph::graph 的共享逻辑。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖
llama.cpp 发布 b10893 版本,主要变更是提高 Add fusion 测试的容差(#28691)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。
llama.cpp 发布 b10892 版本,主要变更是从 test-backend-ops.cpp 中移除 SYCL 的特殊处理逻辑(PR #28688)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CPU、Vulkan、ROCm、OpenVINO、SYCL、CU
llama.cpp 发布 b10889 版本,主要改动是内存优化:在索引器场景下不再分配 V cache,因为该缓存实际未被使用(PR #28330,由 Stanisław Szymczyk 参与)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、Ope
ECCV 2026 将于 2026 年 9 月在瑞典马尔默开幕,共接收 2883 篇论文(接收率 27.5%),86 个 workshop 中有 13 个直接以 World Models 或 Embodied AI 为主题,密度为 ECCV 历史之最,Yann LeCun、Jürgen Schmidhuber 等将作 keynote。文章认为这标志 AI 竞
llama.cpp 发布 b10887 版本,主要变更为在 ggml-cpu 的 s390x 架构上为 q4 0 量化格式增加 repack 支持,并清理了相关注释。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、Op
Hugging Face 上发布了 gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090,这是基于 Qwen/Qwen3.8-27B 的 NVFP4 量化检查点,使用 NVIDIA Model Optimizer 量化,专为 RTX 5090(Blackwell)优化。该模型在 32GB 显存上支持完整 262,144
Hugging Face 上发布了 GAP-models 仓库,用于备份 GAP 参考生成和量化评估所用的本地模型,包含多个模型族和检查点。仓库通过清单和 SHA256 校验确保文件来源和完整性,并记录了候选模型的资格评估结果,评估基于特定 CUDA 构建和硬件环境。文件保留原始模型的许可和归属,不统一替换许可。
AWS 发布了 Ray Serve 深度学习容器(DLC),用于替代不再维护的 TorchServe,提供预构建、优化的推理镜像。该容器集成了 PyTorch、Ray Serve、CUDA 等组件,并支持在 Amazon EKS 上部署视觉语言模型(如 Qwen3-VL-2B)。文章详细介绍了部署步骤和架构,旨在简化模型推理的依赖管理和安全补丁更新。
Hugging Face Transformers 库发布 v5.17.0 版本,新增多个模型支持,包括 HYV4、VibeVoice、NeoMME、Fun-ASR-Nano、KimiLinear 和 Canary。这些模型涵盖语言、语音、多模态等不同领域,并引入了多种创新架构。该版本扩展了 Transformers 的模型生态,为开发者提供了更多选择。
llama.cpp 发布 b10877 版本,主要更新为 CUDA 后端针对 RDNA3 架构的 MoE 模型推理优化,通过根据典型专家宽度调整 MMQ 的 N-tiles 大小来提升性能。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
Hugging Face 推出了内置在其聊天机器人中的 AI 助手“ML Intern”,允许用户通过对话描述想法来运行机器学习实验,无需专业知识。该助手能搜索模型和数据集、估算成本并自动执行训练、监控和报告等任务。Hugging Face 表示,示例实验运行约六小时,成本不到 0.50 美元。此举降低了机器学习项目的门槛,而 Hugging Face 正被
汉朔科技与X-Era Lab合作,将具身智能机器人引入全球近7万家零售门店,用于巡检、盘点和补货。汉朔提供电子价签网络和数字孪生场景底座,X-Era Lab提供原生世界动作模型VWA,双方旨在将具身智能从演示Demo转化为可持续运行的生产级系统。