Google 发布 Gemini 3.8 Live,以低价对标 OpenAI GPT-Live-1
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款面向开发者的音频模型,可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理在通话同时进行后台 API 调用和视觉输入处理,覆盖 97 种以上语言;Extended
另有 2 家信源报道
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款面向开发者的音频模型,可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理在通话同时进行后台 API 调用和视觉输入处理,覆盖 97 种以上语言;Extended
另有 2 家信源报道
无问芯穹联合清华大学、上海交通大学正式开源具身端侧推理引擎APXInf,支持RTX 4090、Jetson Orin、Jetson Thor等主流计算平台。该引擎在Jetson Thor上将PI 0.5 FP8的端到端推理延迟从278ms降至26ms以内,达到46Hz推理频率,并采用Rust极简运行时与Python接口兼顾稳定性与易用性。APXInf作为RL
另有 1 家信源报道
华为在AIDC产业发展大会上发布全球首个3D数据中心,将供冷、IT设备和供电系统分层部署,电池独立置于屋顶,机电系统预制化率超90%,机电交付周期由6个月缩短至3个月。华为云已在安徽、贵州和内蒙古三大枢纽布局3D数据中心,IT设备层部署昇腾950系列产品。华为还发行《3D数据中心》专著并开放概要设计图库,全球计算联盟联合数十家产业链伙伴发起共建新一代AIDC
Google ADK JavaScript 的 devtools 发布 v2.1.0 版本。新增 ContainerCodeExecutor 支持 Docker 沙箱化代码执行,为 agent engine deploy 增加 --min instances/--max instances 参数,并为开发服务器加入 Origin 校验以防御 DNS 重绑定攻
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款面向近实时语音交互的新模型。前者主打规模化与成本效率,支持近实时视觉输入、97 种语言自动切换及后台工具调用;后者面向高复杂度任务,可边推理边说话,在 Artificial Analysis 语音到语音质量指数上以
另有 2 家信源报道
NVIDIA 技术博客对比了稠密模型与 MoE(混合专家)架构,解释 MoE 如何让 30B 参数模型每 token 仅激活约 3B 参数,并仍利用大模型容量。文章以 Nemotron 3.5 Lightning 为例,说明 MoE 通过路由网络为每个 token 选择部分专家 FFN,注意力与嵌入权重仍全量参与。核心结论是 MoE 将显存成本(总参数)与计
开发者 lvladikov 在 Hugging Face 发布 Krea2-Turbo-Distill-4step-LoRA,这是一个基于 krea/Krea-2-Turbo 的蒸馏 LoRA 适配器,将文生图模型的最低可用步数从 8 步降至 4 步,端到端速度约提升 1.6 倍。该 LoRA 在单张 RTX 3090 上训练 21 天,使用 78,000
NVIDIA 在技术博客中介绍其 Vera Rubin 平台如何通过功耗管理实现高能效 AI 推理,核心是 NVIDIA Groq 3 LPX 的确定性执行模型。该模型让 LPU 编译器在运行前生成精确到时钟周期的执行调度,从而预测每个周期的电流需求,并借助 Preemptive Power(PEP)和 Clock Period Synthesis(CPS)
NVIDIA 在技术博客中介绍 NVLink 6 面向大规模 AI 工厂的多层弹性架构,覆盖物理层、链路层、系统冗余和应用软件层。物理层通过轻量级 FEC、物理层重传(PLR)和 UPHY 恢复实现无损传输,链路层采用基于信用的流控(CBFC)消除丢包,系统层消除单点故障,软件层提供 Dynamo Shadow Engine Recovery 和检查点恢复。
AWS 博客介绍 Amazon Bedrock 的提示缓存功能,通过在请求中加入 cachePoint 标记缓存系统提示、文档和工具定义等重复上下文,缓存命中时输入 token 成本最多降低 90%,TTFT 也会缩短。文章给出缓存写入比标准输入贵 25%、缓存读取便宜 90% 的定价,并展示消息内容、系统提示、工具定义、混合 TTL、租户隔离及 LangC
AWS 博客介绍如何用 Amazon SageMaker 无服务器模型定制构建 AI 产品打标系统。方案先对 Qwen3-8B 做监督微调(SFT),再用带可验证奖励的强化学习(RLVR)和 GRPO 优化,训练由 SageMaker 无服务器定制管理容量,最终模型部署到 SageMaker 异步推理做批量目录富化。文章对比了无服务器与 SageMaker
Mozilla AI 在 Hugging Face 发布 llamafile v0.10 系列仓库,基于 v0.10.5 版本构建了多个预打包 llamafile。这些文件内置对 CPU、Mac Metal GPU 以及 Linux/Windows 上 CUDA+Vulkan 的支持,并附带 Bonsai、Qwen3.5/3.6、Ministral 3、ge
阿里 ModelScope 发布 v1.40.1 版本,新增 JAEC 原生推理流水线以及 FLA-TF-Locoformer、FLA-T-SepReformer 两个语音分离模型,并加入 Agent IDP 与 MCP/Studio OpenAPI 支持。同时修复了 vLLM Ascend 在 OpenEuler 和 x86 上的构建依赖问题,统一上传环境
TechCrunch 宣布在 TechCrunch Disrupt 2026 的 Real World AI Stage 举办名为「From Prototype to Production: Can It Scale in Reality?」的专题讨论,聚焦 AI 原型走向量产部署的挑战。MBRYONICS 联合创始人兼 CEO John Mackey、Be
llama.cpp 发布 b10985 版本,修复了 RPC 后端的哈希缓存问题。此前 ggml backend rpc 会对所有超过 HASH THRESHOLD 的传输(包括调度器在节点间复制的激活值)进行哈希并写入 rpc-server 的磁盘缓存,导致 Qwen3.8-Flash-Next 双节点拆分下一天内缓存膨胀至 1.4 TB。补丁改为仅对标记
llama.cpp 发布 b10984 版本,主要更新为 CUDA 后端支持行连续的 SUM ROWS 操作,并整理代码、新增 GGML OP MEAN 以复用同一共享内核处理行连续张量,同时为 MEAN 的 permute/slice 添加测试。该版本同步提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。
Hugging Face 用户 ChrisColeTech 发布了 LTX-2.5-uncensored-v1.1-FP8,这是基于 Lightricks/LTX-2.5 的预合并量化版本,将 Eros10 NSFW、DMD 蒸馏、IC-LoRA、IC-LoRA Detailer 和 Img2Vid 五个微调 LoRA 直接烘焙进权重。模型提供 GGUF 与
llama.cpp 发布 b10983 版本,主要变更是将 build arch graph() 的函数定义移动到 graph 和 graph 模板特化之后,以修复编译顺序问题。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
联发科正式发布新一代旗舰移动平台天玑9600 Pro,这是天玑首款Pro旗舰,率先采用台积电2nm制程,并首创AI原生架构,将CPU、GPU、NPU、ISP等异构计算核心整合为系统级融合计算架构。该平台搭载2+3+3全大核CPU、双NPU架构、天玑神经网络渲染架构及智能影像架构,支持端侧运行最高30B MoE大模型,并与vivo、OPPO、阶跃星辰合作落地主
llama.cpp 发布 b10981 版本,主要针对 OpenVINO 后端进行优化,涵盖有状态解码、GPU MoE 推理、KV 状态重排、RoPE 与归一化翻译等。修复了 Gemma-4 等模型因逐层 KV 头数/头尺寸差异导致解码乱码的问题,并拒绝无法从 KV 状态恢复的有状态解码。性能上,GPU 上 gemma-4-12B 在深度 8192 时从 6