Ollama 发布 v0.34.1:修复模型选择器并改进 MLX 内存管理
Ollama 发布 v0.34.1 版本,主要修复 ChatGPT 模型选择器间距问题,改进 mlxrunner 的前缀缓存快照驱逐与内存检查逻辑,并将 token 重复上限提升至 100 且改为返回错误而非不完整结果。此外还包含 MLX 与 llama.cpp 的更新以及应用布局和命令反馈的调整。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Ollama 发布 v0.34.1 版本,主要修复 ChatGPT 模型选择器间距问题,改进 mlxrunner 的前缀缓存快照驱逐与内存检查逻辑,并将 token 重复上限提升至 100 且改为返回错误而非不完整结果。此外还包含 MLX 与 llama.cpp 的更新以及应用布局和命令反馈的调整。
Abnormal AI 在 AWS 博客中介绍了其基于 Amazon Bedrock AgentCore Code Interpreter 构建的智能体邮件安全系统。该系统采用三层检测架构,最高层由内联智能体在沙箱中动态编写脚本分析威胁情报,每天处理数十万最难判定的案例,整体每天处理数十亿封邮件。Abnormal AI 还部署了批处理分析智能体,每周运行约
AgentionAI 发布 Signal 3.8 27B,这是对 Qwen3.8-27B 的微调版本,以 GGUF 格式提供,采用自蒸馏训练,不引入外部数据。官方评测显示其答案 token 减少 25%、思考 token 减少 41%,同时 GSM8K 准确率持平或提升,并借助内置 MTP 草稿头提升投机解码接受率,端到端生成时间最多缩短约 19%。
智东西报道称,Salesforce上线一批即用型长周期智能体,IDC预测全球活跃Agent将从2025年的2860万个增至2030年的22.16亿个,Agent规模化带来Token消耗激增与算力成本压力。文章以Kimi K3(2.8T参数、1.56TB权重)为例,说明万亿参数模型在显存、HBM带宽、All-to-All通信上的瓶颈,并指出芯片架构、异构软件协
NVIDIA 技术博客介绍如何利用 JAX 和 NVIDIA Transformer Engine 加速无丢弃(dropless)MoE 训练。文章指出 MoE 训练面临动态路由、不规则张量、all-to-all 通信等瓶颈,在 DeepSeek-V3 于 GB200 上的基线仅 103 TFLOPS/GPU,通信占内核时间 84%。通过 Transform
AWS 发布博客,提出生成式 AI 定制化光谱的 8 步决策框架,帮助团队在提示工程、RAG、微调、继续预训练和从零训练之间做出选择。框架分为 USE、ENHANCE、TRAIN 三类,并映射到 Amazon Bedrock 等 AWS 服务。核心原则是从最简单的方法开始,仅在准确率、延迟或领域需求不满足时才升级。
llama.cpp 发布 b10964 版本,将版本号提升至 0.4.1(PR #28900)。该版本为 macOS、iOS、Linux、Android、Windows 及 openEuler 等多个平台提供预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
Langfuse 发布 v4.36.0 版本,主要新增 AI Gateway 转发已认证的 OpenAI Responses 请求、过滤器内联建议、表格统一列弹窗、trace 瀑布图提示、会话时间线开关及可配置事件传播块大小等功能。同时修复了计费、图表、网关模型展示、会话时间线、监控任务卡死等多项问题,并进行了 ClickHouse 查询归因和前端重构等维护
蚂蚁AI安全实验室在国家网络安全宣传周期间发布大模型内生式安全护栏SingProbe,将安全检测融入模型生成过程,让AI边生成边输出风险提示。该方案复用推理过程中的内部信息,在Ling-3.0-flash生产环境中额外开销低于0.5%,并同步发布流式安全评测基准SingStreamBench及医疗场景方案SingProbe-Med。目前SingProbe已适
Hugging Face 上发布了 GigaChat 系列的新文本嵌入模型 Giga-Embeddings-instruct-3B-0826,基于 Qwen3 架构(36 层、hidden 2048、约 3B 参数),将自注意力改为双向 encoder 风格,并用 InfoNCE 对比损失训练。模型采用 mean pooling + L2 归一化,支持俄语和
文章介绍 Kestrel Workflows 团队放弃 Temporal、AWS Step Functions 等外部编排器,改用 Postgres 实现持久化工作流执行。核心手段是用 SELECT ... FOR UPDATE SKIP LOCKED 把普通表变成并发工作队列,用主键约束保证步骤幂等,并用租约加清扫器模式实现崩溃恢复。作者认为这样可减少一个
llama.cpp 发布 b10955 版本,修复了 ggml-cpu 中因预编译头(PCH)导致的 CACHE LINE SIZE 不一致问题。PCH 强制在 ops.h 之前包含 ggml-impl.h,使 C++ 内核使用 256 字节的硬件破坏性干扰大小,而 C 工作缓冲区代码仍用 64,导致 rope 工作缓冲区偏小并引发堆缓冲区溢出,最终在 gg
Hugging Face 用户 ngquocvinh 发布了 IFM/K2-Horizon-MoVA-36B-A4B 的社区 GGUF 量化版本,提供从 Q8 0 到 Q1 0 共 15 种量化档位。该基础模型是采用 Mixture-of-Values 注意力的稀疏 MoE 模型,总参数 36B、每 token 激活约 4B,原生支持 524,288 tok
Hugging Face 用户 violetxi 发布了一个 92M 参数的 Block-MTP 模型检查点(step 235000),基于 transformers 库,支持文本生成,标签涉及国际象棋、block-mtp 和截断 BPTT。该模型采用三路循环打分机制,每次生成三个 token 的块,不支持 KV 缓存和束搜索,上下文为 1024 个逻辑 t
Archsloth 在 Hugging Face 博客中披露,其 GGUF 量化流程中 AutoRound 的两个参数设置错误:误用 W4A16 方案却以 Q4 K M 格式导出,且未启用 SignRoundV2 符号梯度搜索。修正后,Qwen3-4B 的 Q4 K M 量化在韩语、代码等十个测试轴上 KL 散度较 unsloth 版本降低 20.9% 至
llama.cpp 发布 b10952 版本,主要修复了 SYCL 后端中 oneDNN scratchpad 破坏内存池释放顺序的问题(PR #28704)。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
mlx-optiq 发布了 mlx-community/gemma-4-12B-it-qat-OptiQ-4bit,这是基于 Google 量化感知训练(QAT)版 Gemma-4 12B 的 4-bit 混合精度 MLX 量化模型。它采用敏感度引导的逐层比特分配(157 个组件用 8-bit,171 个用 4-bit,平均 5.25 bits-per-we
llama.cpp 发布 b10951 版本,其中一项改动是将 llama n rs seq 检查移到 llama decode 调用之前,若检查为真则直接返回,从而在不需要时避免调用 llama decode。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SY
OPPO 小布助手团队提出 InitGen 框架,用于智能助手在用户表达意图前生成候选交互查询。该方法联合生成候选集合并通过加权偏好优化对齐用户反馈,权重来自用户活跃度和下游排序分数,同时采用滚动窗口更新策略。在线 A/B 测试中,点击率从 0.95% 提升至 1.61%(相对提升 69.1%),查询曝光量增加 17.9%,完整候选集生成耗时 180 毫秒,
研究团队发布 Occamy-1.0,一个基于 Qwen3.6-35B-A3B 检查点继续训练得到的 35B 规模协作(co-work)智能体模型。该模型通过执行导向数据、可回放长程轨迹基础设施以及分阶段后训练(Marathon Expert 与 Sprint Expert 合并)来提升工具调用、状态跟踪与长任务连续性。在多个协作基准上,Occamy-1.0