LiteLLM v1.100.0-dev.2 发布:镜像签名验证与多项修复
LiteLLM 发布了 v1.100.0-dev.2 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签进行验证的方法。此版本包含多项修复和改进,涉及 UI 重构、Prometheus 指标、OpenTelemetry 错误映射、代理流式响应加密、模型价格更新、Azure 实时认证、Bedrock 推理参数映射、
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
LiteLLM 发布了 v1.100.0-dev.2 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签进行验证的方法。此版本包含多项修复和改进,涉及 UI 重构、Prometheus 指标、OpenTelemetry 错误映射、代理流式响应加密、模型价格更新、Azure 实时认证、Bedrock 推理参数映射、
EduRiskX 是一个神经符号框架,结合了时间 Transformer 预测器与 F-Logic 符号推理,用于在线教育中的早期学业风险预测。在 OULAD 数据集上,它实现了 0.900 的准确率和 0.894 的 F1 分数,平均早期检测周为 9.32,检测率为 94.30%。该框架通过 F-Logic 模块提供基于规则的解释,增强了可解释性,并优于
本文提出了一种通过采样来引导和扩展自回归大语言模型(LLM)的灵活且理论基础的框架,涵盖两种算法:基于序贯蒙特卡洛(SMC)和副本交换(RE)的方法,用于从幂化、乘积或倾斜的基础分布中采样。实验表明,这些方法在数学推理任务上无需外部监督或奖励模型即可提升生成质量,且扩展性优于Best-of-N和标准MCMC基线。该框架为LLM的概率推断提供了系统化的采样方案
TreeGraft 提出了一种多草稿模型框架,通过将不同成本的草稿模型(小型和中等)联合构建共享草稿树,以提升树形投机解码的效率。该方法利用较强模型对较弱模型的候选进行重打分、重新选择嫁接位置并恢复被忽略的路径,同时引入轻量级调度器控制调用强模型的时机。在10个模型对和6个基准测试中,TreeGraft 相比最优的单草稿模型策略平均提升15.1%,最高达26
arXiv 论文提出 Mixture of Roles (MoRe) 方法,通过可学习码本和查询感知路由器,将多个角色组合成单一 steering vector,在单智能体单次推理中实现多视角专业化。实验显示 MoRe 平均比单智能体基线高 2.2%,性能与多智能体系统相当,但显著降低 token 成本。该方法通过三阶段 SFT 和 GRPO 训练,且保持骨
本文提出一个面向LLM智能体轨迹的成本-效用对齐框架,包含成本剖析、效用归因、错位诊断、定向适应和评估五个阶段,将资源消耗与任务贡献视为同一执行过程的双重账本。效用归因通过过程代理、信息依赖和反事实重放等方法提供因果证据,以指导诊断和适应。该框架为资源感知的智能体设计与部署提供了结构化基础,并分析了近期系统、归因方法和评估协议。
llama.cpp 发布 b10665 版本,新增对 Nemotron3.5 模型的 DSpark 支持。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。此次更新增强了 llama.cpp 对特定模型架构的兼容性
llama.cpp 发布 b10664 版本,为 Hexagon HTP 后端新增了 ABS 和 LOG 两个一元运算的 HVX 加速实现,提升了在 Qualcomm 平台上的推理性能。该版本同时提供了覆盖 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布 b10663 版本,修复了 RMS NORM MUL 权重偏移在分组/广播归一化中的 bug。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
llama.cpp 发布 b10662 版本,主要更新为 server 端新增 ctx-per-slot 参数(--kv-unified-per-slot),用于统一 KV 缓存管理,并重构了上下文池槽位逻辑。该版本提供了多平台(macOS、Linux、Windows、Android、iOS)的预编译二进制文件,支持多种硬件后端如 CUDA、Vulkan、R
Ollama 发布了 v0.33.2 版本,主要修复了系统深色模式恢复、模型目录变更时代理请求的连续性,以及 macOS 应用的手势同步问题。这些改进提升了用户体验和稳定性。
DeepSpeed 发布了 v0.19.6 补丁版本,包含多项修复和功能改进,如修复 Ulysses 序列并行中的检查点选择、ZeRO-3 冻结参数问题,并新增对 Apple Silicon (MPS) 的支持(包括 Metal FusedAdam 内核)。此外,还实现了可配置的梯度求和归约、原生主机内存固定后端,以及 AutoTP 的不均匀分片和通用检查点
AWS宣布Amazon Bedrock在印度支持OpenAI GPT-5.6模型(Terra和Luna),通过印度地理跨区域推理,确保数据在印度境内处理,满足金融、医疗和公共部门的数据驻留要求。模型支持100万token上下文窗口,可处理文本和图像输入。文章介绍了如何使用推理配置文件、控制台和API(包括OpenAI Responses API和Bedroc
谷歌发布了Gemini Omni 1.1 Flash视频生成模型,支持场景扩展、风格参考和关键帧控制,并新增360p草稿模式,速度提升60%,成本降低至720p的三分之一。该模型通过Google AI Studio和开发者文档提供,定价按秒计算,从360p的0.03美元到4K的0.30美元不等。
Deepgram 宣布在 Amazon SageMaker AI 上推出两项新的可观测性功能:Deepgram Enhanced Metrics 和 Prometheus/OpenTelemetry 支持。前者通过 CloudWatch Embedded Metric Format 将计费和用量指标直接发布到用户的 CloudWatch 账户,无需额外代理或
AWS、NVIDIA 与 Heidi Health 合作,展示了使用 NVIDIA CUDA MPS 和 Triton 推理服务器在 Amazon EC2 上优化 ASR 推理成本的方法。通过 MPS 并发执行,GPU 利用率从 15-20% 提升,使 GPU 实例需求从 16 个减少到 4 个,成本降低 75%,同时保持亚秒级延迟。该方案结合 ONNX R
OpenAI 研究员“roon”警告,超快 AI 推理速度可能带来现有安全措施无法应对的风险。他指出,一个未对齐的模型若以当前最佳系统 50 倍的速度运行,可能迅速渗透系统,人类响应团队将无法及时应对,因此需要自主检测和关闭机制,而非仅靠监控。该评论是对 OpenAI 发布新 AI 芯片的回应,该芯片推理速度超越现有硬件,且 OpenAI 和 Anthrop
Langfuse 发布了 v4.22.0 版本,主要新增了评估器创建配置跟踪、支持从专用资产主机提供构建输出、实现 CHB API 客户端、改进状态消息渲染,并增强了应用内代理功能,包括支持 OpenAI 兼容 API 和默认启用 Assistant worker。此外,还修复了多个问题,如评论提及显示名称中的方括号、短 JSON 列表默认折叠、MCP 工具
在 Hot Chips 37 大会上,OpenAI 发布了自研推理芯片 Jalapeño,宣称其能效和延迟优于 NVIDIA GB200/GB300,实测每瓦性能提升 1.5-1.9 倍,端到端延迟降低 1.7-3.6 倍,并计划年底部署。此外,多个研究强调 agent 的 harness 质量和记忆系统设计对性能影响重大,而 Perplexity 推出了本
Qwen 发布了新的开源权重模型 Qwen3.8-Flash-Next,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览。模型总参数为 125B,但仅有 6B 激活,性能显著提升。作者 Simon Willison 在 DGX Spark 上使用 Unsloth 量化版本进行了测试,并分享了初步体验。