阿里视频大模型Wan3.0正式上线,主打稳定真实有质感
阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,支持单次生成30秒视频及多种文档格式输入,在生成时长、真实世界还原等维度升级。企业用户反馈其表现稳定、真实、有质感,已进入短剧、影视、广告等生产流程。即日起可通过阿里云百炼等平台体验,并推出限时7折优惠。
另有 1 家信源报道
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,支持单次生成30秒视频及多种文档格式输入,在生成时长、真实世界还原等维度升级。企业用户反馈其表现稳定、真实、有质感,已进入短剧、影视、广告等生产流程。即日起可通过阿里云百炼等平台体验,并推出限时7折优惠。
另有 1 家信源报道
据FT报道,Anthropic的7月年化收入达650亿美元,预计Q3盈利,拥有6000个年消费10万美元以上的客户。但其最强模型Fable 5因成本高昂,在Ramp AI指数中仅占8.0%的模型支出份额,低于Opus 4.8的28.0%。OpenAI年化收入季度内增长35%,突破400亿美元,得益于GPT 5.6的发布。
一个名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上发布,引发互联网对其背后开发者的广泛猜测。该模型被描述为专为编码、持续代理工作和生产负载设计的推理模型,Stripe CEO Patrick Collison 对其表示赞赏。目前其开发者身份匿名,外界猜测涉及中国公司 Z.ai 的 GLM 模型或微软未发布的 MAI 模型,但尚无定论
llama.cpp 发布 b10603 版本,新增对 GLM-4.5-Air 模型的多 token 预测(MTP)支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。
谷歌推出开源编译器工具链 HEIR,旨在简化同态加密(HE)的部署,使预训练 AI 模型能够直接处理加密数据。HEIR 已用于隐私内容推荐、信用卡欺诈检测、网络入侵识别和音频热词识别等场景。目前编译过程尚未完全自动化,且性能开销仍是一个挑战,但部分评论认为对于某些应用场景是可接受的。
UmeAiRT 在 Hugging Face 上发布了 ComfyUI-Auto-Installer-Assets 资源库,这是一个纯资产存储库,通过 Git LFS 提供多种扩散模型(如 FLUX、WAN、QWEN、HiDream、LTX-2 等)的预打包模型文件、文本编码器、二进制文件和 Python 包,支持多种精度(如 fp16、fp8、GGUF 量
llama.cpp 发布 b10598 版本,主要更新为 mtmd 模块使用更精确的 Pillow 图像缩放算法,并修正了所有模型的 resize algo 参数,同时进行了速度优化。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO
llama.cpp 发布 b10594 版本,主要修复了设备信息循环在非 TRACE 日志级别下仍会创建 GPU 上下文并导致 CUDA 后端分配 550 MB 显存的问题。该修复通过检查日志详细级别,在无输出时跳过设备循环,避免不必要的 GPU 资源占用。
llama.cpp 发布 b10593 版本,主要修复了 DeepseekV4 在多序列场景下的回滚问题,并进行了模型加载修复、缓存清理优化和图拓扑静态化等改进。该版本提供了覆盖 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。
OpenRouter 分析师 Peter Walker 指出,2026 年 2 月 6 日可能是人类消耗 token 量最后一次超过 AI 代理的日子。此后,代理 token 使用量增长了 14 倍,而人类使用量仅增长 2.8 倍。尽管代理消耗的 token 中近 70% 来自缓存提示,实际成本增速低于原始数据,但 AI 已成为 AI 最大的客户。OpenR
protoLabsAI 发布了 Ornith-1.5-9B 模型的 GGUF 量化版本,内置蒸馏 MTP 草稿头,支持 llama.cpp 的无损多 token 自推测解码,无需单独草稿模型。该版本针对不同硬件提供多种量化档位,其中 NVFP4 在 Blackwell 上速度最快(299 tok/s),IQ4 XS 适合 6GB 显存,但 IQ2 M 在长文
llama.cpp 发布了 b10590 版本,主要更新是更新了 subprocess.h 依赖。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10589 版本,主要新增 CUDA 后端对 POOL 1D 操作的支持,并修复了 editorconfig 兼容性问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。
Comfy-Org 发布了 MiniMax-H3 模型的 ComfyUI 重打包版本,包含多种量化格式的扩散模型、文本编码器、LoRA、VAE 和嵌入文件,并提供了 I2V、T2V、R2V 工作流模板及文档。该版本旨在简化 MiniMax-H3 在 ComfyUI 中的使用,并支持非 Blackwell GPU 运行。
Ray 2.58.0 发布,重点包括 Ray Serve LLM 完成 KV 缓存和 token 感知路由,Ray Core 支持任务事件卸载,Ray Data 新增 Databricks Delta Lake 集成和 shuffle v2 后端,并推出实验性 Ray Sandbox 和 TPU 支持。这些改进提升了推理性能、数据处理效率和资源调度能力。
mradermacher 发布了 KernelBench-RLVR-120b 模型的 GGUF 量化版本,该模型基于 Jarrodbarnes 的 KernelBench-RLVR-120b,专注于 GPU 内核代码生成,并通过 GRPO 强化学习在 KernelBench 数据集上训练。量化版本提供了多种精度的 GGUF 文件,方便用户在本地部署。
DavidAU 发布了 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF 模型,这是一个基于 Qwen3.6 扩展的 40B 参数稠密模型,通过多阶段训练(包括 Heretic 去审查、Deckard 数据集和 Claude
LiteLLM 发布 v1.98.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和新功能,如支持 Claude Sonnet 5 的 toolSpec.strict 移除、GLM 5 和 DeepSeek V3.2 的原生结构化输出、PTU 平摊成本配置、可配置的估计输出 token
LiteLLM 发布 v1.99.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能更新,涉及 SCIM 组匹配、流式消息成本计算、Bedrock 响应头转发、spend 日志哈希、预算跟踪、路由响应体增强、guardrails 策略执行、Redis 集群超时处理等。
llama.cpp 发布 b10588 版本,主要修复了 json.h 在 clang LTO 下的编译问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。