Mistral 推出欧盟数据处理和优先访问服务,但存在重要限制
Mistral 推出欧盟区域数据处理选项和优先队列访问服务,均需额外付费。区域推理仅覆盖部分功能,且账户设置等数据仍可能在区域外处理。优先层级提供 99.5% 可用性 SLA,但价格上浮 75%。此外,Mistral 平台开始托管第三方模型,如 Z.ai 的 GLM-5.2,并寻求长期算力承诺以支持欧洲数据中心建设。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Mistral 推出欧盟区域数据处理选项和优先队列访问服务,均需额外付费。区域推理仅覆盖部分功能,且账户设置等数据仍可能在区域外处理。优先层级提供 99.5% 可用性 SLA,但价格上浮 75%。此外,Mistral 平台开始托管第三方模型,如 Z.ai 的 GLM-5.2,并寻求长期算力承诺以支持欧洲数据中心建设。
llama.cpp 发布 b10373 版本,主要更新为 imatrix.cpp 中的有限检查逻辑,仅检查被触及的专家。该版本提供了适用于 macOS、Linux、Windows、Android 及 openEuler 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。
Hugging Face 每日论文发布了一篇关于新型注意力机制的研究,提出 Power Law Graph Attention (PLGA),用学习到的幂律双线性算子替代固定缩放点积注意力 (SDPA),并构建了 PLDR-LLM 模型。论文通过定理和测量验证了 PLGA 在特定条件下包含 SDPA,并发现推理时存在输入不变性导致推理坍缩的现象。该研究还提供
Hugging Face 博客评估了 Intel Arc Pro B70 上 FP8 KV-cache 量化在 vLLM 中的表现,显示相比 BF16,FP8 KV 在所有测试模型上实现了确定性 2 倍 KV 缓存容量提升,并在长上下文(16K-32K)场景下带来最高 42.3% 的吞吐量增益。FP8 KV 在 10 个模型中的 8 个上接近无损,但 Dee
Hugging Face 每日论文介绍了一项名为 Decoding-Level Taboo 的运行时 logit 空间压力测试,用于评估大语言模型在非标称生成路径上的鲁棒性。研究发现,模型的鲁棒性受参数规模和指令对齐影响,规模越大、对齐越好则鲁棒性越强。该测试还可用于生成合成数据集、测试安全护栏和审计模型可靠性。
UniMoMo 是一种针对大型推荐系统中混合专家(MoE)模型的训练后压缩框架,通过功能相似性分组和层自适应保护,将训练好的 MoE 模型压缩为更小的标准 MoE 检查点,在保持精度的同时加速推理。实验表明,在 Amazon Beauty、KuaiRec 和 TenRec 数据集上,将专家数从 8 压缩到 4 时,NDCG@10 保持 99.92%–102.
AMD宣布收购AI推理芯片公司Taalas,计划将其技术纳入加速器路线图。Taalas采用模型硬化路线,将模型权重固化进硬件,以降低推理成本和提高速度,首款芯片HC1运行Llama 3.1 8B时生成速度达1.7万Token/s。该路线面临模型迭代风险,但Taalas通过可编程SRAM和掩膜修改应对。业内专家认为,AMD此举如同购买拖拉机,其价值取决于是否存
llama.cpp 发布 b10369 版本,主要更新是支持 pocket-tts 文本到语音模型。该实现将转置卷积重构为 GEMM 加 col2im,使 CUDA 上每帧生成时间降低 80%,CPU 上降低 50%,输出与参考实现高度一致。同时新增了语言包特定参数(如帧尾填充、短文本填充)和模型变体支持,并更新了文档。
本研究首次对4-bit量化在Gemma 4和Qwen 3.5等小型语言模型上的多语言性能损失进行了零样本评估,覆盖八种类型多样的语言。研究发现量化税在不同语言间极不平等,低资源和非拉丁文字语言出现结构性崩溃,而模型的基础语言(如英语、中文)也缺乏免疫性。多步逻辑推理受损严重,但联想记忆领域表现出量化抵抗性。
CurveFP 是一种新的低精度数据类型家族,通过交错对数曲线和紧凑块缩放实现封闭乘积,使乘法变为精确的符号异或和整数索引更新。CurveFP8 用于训练,CurveFP7 用于部署,在多个 7B-9B 模型上以更少的位达到或超过 FP8 的困惑度,并在 128.3M 参数预训练中实现 FP8 级质量,同时降低格式引起的惩罚。
LLM Agents Factory 是一个基于检索的框架,利用超过 20K 个预定义代理配置文件,按需构建领域特定且基于 Wikipedia 的代理。该框架支持语义搜索检索和蒸馏两种模式,在 MMLU、BIG-bench 等基准测试中,其检索式代理构建在准确率上超越非代理基线,并以更低推理成本匹配 AutoGen 的生成质量。该研究将代理构建视为信息检索问
魔搭 ms-swift 发布 v4.4.3 补丁版本,包含多项 bug 修复和功能更新。主要修复了 Qwen3.5、Qwen3-TTS、Qwen3-Omni 等模型的模板和训练问题,新增了 packing strategy、GKD 多轮支持、RLSD 自蒸馏优势重加权等功能,并优化了 Megatron、NPU 等后端兼容性。该版本提升了框架的稳定性和训练效率
llama.cpp 发布 b10362 版本,主要修复了 HIP 后端采样器测试中因缺少 CUB 支持而导致的崩溃问题,并调整了 CI 日志存储方式。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
研究者发现Anthropic、OpenAI和Google的专有LLM API返回的加密推理链可被重放至同系列较弱模型,通过越狱恢复明文推理内容。该漏洞已被修复,但论文附录展示了提取的推理细节,揭示了专有模型的思维链。
NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。
研究人员发现,Anthropic、OpenAI 和 Google 等大型语言模型提供商返回给客户端的加密推理痕迹块在不同会话、用户和模型间可互换,存在架构漏洞。通过将该痕迹注入同一提供商的较弱模型中,可强制其解码并输出明文,从而绕过反蒸馏机制,实现私有数据提取、隐藏危险信息泄露和隐形提示注入。研究团队从公共仓库中解码了 315,320 个推理块,恢复了 36
另有 1 家信源报道
Mistral AI 宣布三项举措以推进AI主权:推出区域端点和优先服务层级,支持第三方开放模型(如Z.ai的GLM-5.2),并组建联盟确保欧洲长期AI算力,目标到2030年建设1GW容量。这些措施旨在让企业和国家控制模型、基础设施和算力,同时保持区域合规和可靠性。
Hugging Face 博客介绍了 ALTK-Evolve 与 ACE 两种智能体记忆系统,均通过将智能体历史轨迹转化为可复用经验并在推理时注入,避免压缩经验。ALTK-Evolve 采用按需检索少量指南的方式,而 ACE 每步注入完整手册。在 AppWorld 基准上,ALTK-Evolve 在 DeepSeek-V3.2 上准确率更高且 token 消
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可
llama.cpp 发布 b10361 版本,修复了 EXAONE 4.5 模型滑动窗口注意力(SWA)未启用的问题,该问题源于 hparams 加载顺序错误,导致 MTP 头模型被误判。同时修复了元数据加载路径中 TENSOR SKIP 张量处理问题,并添加了相关测试。该版本提供了多平台二进制下载。