Mistral-Nemo-Instruct-heretic:去审查版12B模型发布
Hugging Face 上发布了 Mistral-Nemo-Instruct-heretic,这是 Mistral-Nemo-Instruct-2407 的去审查变体,通过 Heretic 工具进行方向消融(abliteration)而非微调,抑制了模型的拒绝行为,同时保留了基础模型的能力。该模型提供多种 GGUF 量化版本,可在消费级 GPU 上运行,但
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
Hugging Face 上发布了 Mistral-Nemo-Instruct-heretic,这是 Mistral-Nemo-Instruct-2407 的去审查变体,通过 Heretic 工具进行方向消融(abliteration)而非微调,抑制了模型的拒绝行为,同时保留了基础模型的能力。该模型提供多种 GGUF 量化版本,可在消费级 GPU 上运行,但
cHunter789 在 Hugging Face 上发布了 Qwen3.8-27B 模型的 GGUF 量化版本,采用 ik llama.cpp 项目的 IQ4 KS 和 IQ4 KT 量化技术,旨在让模型适配 16GB 显存的 NVIDIA 显卡。该量化版本通过 q4 0 KV 缓存量化支持最长 110k 上下文,并对比了与 mradermacher 量化
Latent Space 的 AINews 文章提出,自 2022 年以来,AI 流水线中越来越多的组件从人类制造转向模型制造,形成“模拟”趋势:性能略差(10%),但成本更低(100 倍)且速度更快(10000 倍)。文章按阶段梳理了从奖励信号、训练数据、教师模型、课程设计到研究者、环境乃至人类主体的合成化进程,并引用 InstructGPT、Phi、Al
SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓
llama.cpp 项目发布了 v0.2.0 版本,包含大量底层优化和修复,涉及 CUDA、SYCL、OpenCL、Vulkan、Metal 等多个后端。新增功能包括对 LFM2 模型的支持、GraniteSWA 模型、Mamba-2 的 OpenCL 移植,以及服务器端多项改进。该版本还提升了量化内存使用效率,并增强了 CI 和发布流程。
企业支出管理平台 Ramp 推出了自己的 AI 模型路由服务 Router,允许用户和公司通过 API 使用和切换多种大语言模型。该服务目前仅在美国可用,2026 年剩余时间内免费,并提供 26 美元信用额度。Router 提供来自 OpenAI、Anthropic、DeepSeek 等多家公司的模型,并支持多种路由策略和仪表盘监控。此举旨在进入 AI 推理
中国机器人制造商宇树科技在上海IPO后估值约500亿美元,股价大涨。据英国《金融时报》报道,其需求依赖循环模式:制造商向国有培训中心出售机器人,再购回训练数据。分析师质疑高估值和数据实用性,宇树近四分之三的人形机器人收入来自教育和研究领域。
llama.cpp 发布 b10509 版本,新增 ggml rope set offset 操作,并支持 Metal、CUDA、Vulkan 后端。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
本文介绍了一个名为 DumpsterCluster 的 128-GPU 集群,完全由二手组件构建,用于服务 LLaMA-70B 等现代 LLM 推理。该集群成本仅为 2.2 万美元,远低于 8-GPU B200 系统的 60 万美元,并通过流水线并行优化实现了有竞争力的吞吐量。然而,研究发现二手 GPU 的能效较低,总拥有成本仅在电价低廉的地区有利,且碳排放
AI 芯片初创公司 Etched 宣布获得 7 亿美元新融资,估值达 210 亿美元,由量化基金 Jane Street 领投。该公司设计了两款新组件以加速推理过程,包括低电压预填充芯片和集群规模内存互连,承诺提高速度并降低成本。尽管早期曾被认为芯片为特定模型定制,Etched 表示其系统现在可运行任何前沿模型。
SemiAnalysis 的 Jordan Nanos 在演讲中分析了 AI 芯片市场现状,指出超大规模云厂商大幅上调资本支出,但台积电的晶圆产能扩张缓慢,成为关键瓶颈。他介绍了 SemiAnalysis 的 ClusterMAX 和 InferenceX 项目,用于测试云提供商和芯片性能,并强调硬件理解对软件开发的重要性。
支付公司 Stripe 以 70 亿美元收购 AI 模型路由平台 OpenRouter,交易在 90 天前其 13 亿美元 B 轮融资后完成。OpenRouter 年化收入 1.4 亿美元,毛利率约 70%,月处理 250 万亿 token,拥有 800 万开发者。该交易凸显模型聚合层的价值,但也引发对中间层利润压缩的担忧。
llama.cpp 发布 b10472 版本,主要修复了 HIP 构建中错误使用 UMA 覆盖的问题,AMD APU 现在通过 hipMemGetInfo 报告准确内存,避免小内存系统上的过度承诺。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。
llama.cpp 发布 b10431 版本,主要更新为 ggml ssm scan 支持循环状态回滚(recurrent state rollback),并支持 K 1 的情况,覆盖 CPU 和 CUDA 后端。该功能有助于提升状态空间模型(如 Nemotron)在推理时的效率。
法国初创公司Kog致力于通过软件优化在现有数据中心GPU上实现更快的AI推理速度,其技术预览在Hacker News上引起关注,并获得了200个商业线索。Kog计划在9月前将首个大型模型推理速度提升10倍,以吸引投资并推动业务发展。
逐际动力与阿里云无影灵构合作,将机器人研发环境迁移至云端,以应对算力需求两年增长5-10倍的挑战。无影灵构通过云上工作站提供标准化环境、弹性算力和低延迟3D交互,显著降低研发成本并提升效率。该合作旨在将具身智能研发基础设施标准化,使机器人公司聚焦于模型与算法创新。
新加坡AI芯片公司Acrab完成1.3亿美元B轮融资,累计融资超4.8亿美元,用于扩大产能和研发下一代平台。该公司成立不到三年,首颗端侧AI芯片GΞLIX 1已进入量产准备,并推出个人AI中心Agent Box,瞄准端侧Agent计算需求。Acrab强调CPU与NPU协同、统一内存和Prefill性能,其自测显示在特定条件下Prefill速度达1416 To
Hugging Face 发布了 Luth-2-0.8B 和 Luth-2-2B 两个法语小语言模型,基于 Qwen3.5 后训练,采用多域策略蒸馏(MOPD)技术,在数学、代码、指令跟随、通用知识和工具调用等基准上刷新了同尺寸模型的最优成绩,性能可与两到三倍大小的模型竞争。模型、数据、代码和评估方法均已开源。
一项针对215名乳腺影像学会成员的调查显示,约半数已使用FDA批准的AI工具,但AI在降低召回率、减少不必要活检和减轻倦怠方面的实际效果远低于放射科医生的预期。多数医生仅将AI视为第二意见,成本和缺乏机构支持是主要障碍。AI行业早前关于放射科医生失业的预测被指过于夸大。
Mistral 推出欧盟区域数据处理选项和优先队列访问服务,均需额外付费。区域推理仅覆盖部分功能,且账户设置等数据仍可能在区域外处理。优先层级提供 99.5% 可用性 SLA,但价格上浮 75%。此外,Mistral 平台开始托管第三方模型,如 Z.ai 的 GLM-5.2,并寻求长期算力承诺以支持欧洲数据中心建设。