Vercel AI SDK 修复 OpenAI 兼容提供商 token 计数异常
Vercel AI SDK 发布 @ai-sdk/openai-compatible@3.0.28 补丁更新,修复了当提供商报告的 reasoning tokens 大于 completion tokens 时 outputTokens.text 可能为负的问题。该问题在 Baseten 服务推理模型因长度限制中断推理时出现。修复后 text 值被限制在 0
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Vercel AI SDK 发布 @ai-sdk/openai-compatible@3.0.28 补丁更新,修复了当提供商报告的 reasoning tokens 大于 completion tokens 时 outputTokens.text 可能为负的问题。该问题在 Baseten 服务推理模型因长度限制中断推理时出现。修复后 text 值被限制在 0
本文探讨了近期前沿模型(如OpenAI的GPT-5.6)被用于网络攻击的事件,分析了AI安全与对齐问题。作者认为当前科技公司和政府的激励机制不适合快速技术变革,呼吁提高透明度并加强监管。文章还讨论了模型持久性、用户意图假设等特性如何影响安全性,并指出AI行业对未来12-24个月的挑战准备不足。
llama.cpp 发布 b10333 版本,主要修复了 SpaceMiT 后端中缺失的 Q5 0 调度问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
DeepBeepMeep 发布了 WanGP,一个开源视频生成工具,支持 Wan 2.2 等模型,最低仅需 6GB 显存,兼容旧 GPU,并提供 Web 界面、Lora 支持等功能。该工具旨在降低视频生成门槛,使更多用户能够使用高质量开源模型。
llama.cpp 发布 b10332 版本,主要更新为移除 GGML HIP ROCWMMA FATTN 相关 CI 配置。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。
谷歌DeepMind发布了DiffusionGemma的技术报告,该模型基于Gemma-4-26B-A4B改造而成,无需从头训练,采用文本扩散方法并行生成256个token,在H100上达到每秒1500 token的速度。通过两阶段训练(重建和SD·RL)平衡质量与速度,在推理基准上平均提升10分,但绝对性能仍低于自回归模型,且存在重复循环和多用户吞吐量下降
微软研究院首席研究员Dimitris Papailiopoulos借助GPT-5.6和Claude Fable 5,证明了一个两步算法能在多项式时间内精确命中MIMO检测的最大似然阈值,解决了悬置25年的数学难题。该算法结合LMMSE取整和贪心逐位翻转,复杂度为O(N³),论文已通过作者逐行验证。
国产GPU公司摩尔线程发布2026年半年度报告,上半年营收17.36亿元,同比增长147.42%,已超2025年全年,亏损大幅收窄。公司研发投入持续增加,旗舰产品MTT S5000实现规模化量产,夸娥智算集群在多城市部署,并完成多个大模型训练项目。公司构建了云边端全场景算力布局,MUSA生态兼容CUDA,开发者超80万。
LiteLLM 发布了 v1.97.0-rc.1 版本,该版本所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。此版本包含多项修复和功能更新,涉及 Azure Sentinel、Bedrock、Anthropic 适配器、代理、路由、UI 等,并增加了用户预算应用于团队密钥、自动路由器复杂度分层跟踪等功能。
llama.cpp 发布 b10331 版本,主要修复了 server 端 get info 接口在配置了工具运行时但未指定工作目录时,错误地报告服务器进程工作目录的问题。现在该接口会向隔离环境查询其工作目录,仅当工具在主机上运行时才保留进程目录。此修复由 Xuan-Son Nguyen 贡献。
llama.cpp 发布 b10330 版本,主要更新是在 CUDA 后端中融合了 rms norm、mul 和 rope 操作,并添加了相关测试和内存范围检查。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布 b10329 版本,主要改进是服务器和 WebUI 仅在工具实际读取工作目录时才显示工作目录控件。工具现在在 /tools 列表中声明是否解析路径并基于工作目录运行,WebUI 仅在至少一个此类工具被服务且启用时显示相关控件。
llama.cpp 发布 b10327 版本,主要修复了 CUDA 下量化 cpy 内核启动时线程/块数量计算错误的问题,并增加了不均匀块数量的测试用例。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。
PydanticAI 发布 v2.27.0 版本,新增对 Snowflake Cortex 的支持,包括 SnowflakeModel 和 SnowflakeProvider,并添加了 xai agent count 配置项。同时修复了多个与 OTel 序列化、消息压缩和 Temporal 负载限制相关的 bug,并改进了与 Vercel AI 和 AG-U
SGLang 发布 v0.5.17 版本,包含 582 个 PR,来自 194 位贡献者。主要亮点包括对 Kimi K3 和 MiniMax-H3 的 day-0 支持,以及新的 DCP 通信后端、DWDP 预填充策略、会话感知的 Radix Cache 等性能优化。此外,还新增了多个模型支持,并提升了引擎恢复速度和降低了主机开销。
llama.cpp 发布 b10322 版本,主要更新为 SYCL 后端对 SSM CONV 窗口加载进行合并优化,在 Arc Pro B70 上性能提升约 1.85 倍,并在 Qwen3.5 27B 模型上带来约 2% 的预填充速度提升。该版本同时提供了多平台预编译二进制文件下载。
llama.cpp 发布 b10321 版本,修复了 Metal 后端中 NORM/RMS NORM 操作在行长度非 simdgroup 倍数时计算错误的问题。该问题导致部分行求和结果偏小,进而影响均值和方差计算。修复通过向上取整线程组大小至完整 simdgroup 数解决,并新增了相关测试用例。修复后,M3 Pro 上的测试通过率从 25/50 和 26/
llama.cpp 发布 b10319 版本,主要修复了 mtmd 模块中 longest edge 忽略最小/最大像素的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
AMD 收购了加拿大 AI 初创公司 Taalas,该公司将 AI 模型直接嵌入芯片,实现极速推理。其演示芯片运行 Llama 3.1-8B 时每秒处理超 1.6 万 token,远超竞品。AMD 计划将该技术整合进其加速器路线图,与 Instinct GPU 一起提供系统级解决方案。
Hugging Face 上发布了 brandonmusic/GLM-5.2-EXL3-TR3v4-3.5bpw-MTP78 模型,基于 zai-org/GLM-5.2,采用 trellis 量化与混合精度专家,支持 MTP-78。该模型在 4x RTX PRO 6000 Blackwell 上实现了 KLD 0.061282(fp8 KV)和 0.0695