llama.cpp b10906:修复图像后推测解码位置传递问题
llama.cpp 发布 b10906 版本,修复了服务器端在图像输入后进行推测解码(speculation)时的位置传递问题:此前向 drafter 传递的是 token 数量而非实际位置,该问题影响所有 drafter 而不只是 DFlash。同时将 draft 参数 n past 重命名为 pos0,以明确其表示位置而非 token 数。该版本同步提供
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10906 版本,修复了服务器端在图像输入后进行推测解码(speculation)时的位置传递问题:此前向 drafter 传递的是 token 数量而非实际位置,该问题影响所有 drafter 而不只是 DFlash。同时将 draft 参数 n past 重命名为 pos0,以明确其表示位置而非 token 数。该版本同步提供
zai-org 发布并开源了多模态 OCR 模型 GLM-OCR,基于 GLM-V 编码器-解码器架构,引入多令牌预测(MTP)损失和全任务强化学习,并集成 CogViT 视觉编码器与 GLM-0.5B 语言解码器。该模型在 OmniDocBench V1.5 上取得 94.62 分排名第一,参数量仅 0.9B,支持 vLLM、SGLang、Ollama 等
2026 Inclusion·外滩大会在上海开幕,首次设立AI艺术节,围绕AI概念艺术展、AI影像展映、AI音乐会三大单元展开。其中《纠缠,而后日以作夜》为国内首个以智能体导览的AI概念艺术展,展出包括1985年由AI系统AARON自主署名的作品;影像展映联合MiniMax、可灵AI等平台展映100余部AI影像作品;9月11日晚将举办国内首场AI虚拟偶像Yu
斯坦福大学助理教授吴佳俊在 ECCV 2026 发表演讲,提出不依赖堆叠 Transformer 的多模态融合新范式:将视觉、听觉、触觉视为同一组物理属性(几何、材质、刚度)在不同感官通道上的投影,用统一物理底座建立跨模态共同坐标系。他介绍了 PhysDreamer(从视频扩散模型蒸馏物理属性)、WonderPlay(将仿真器输出作为生成模型条件)以及声音可
高德于9月10日宣布扫街榜全面AI化,推出2026版,用AI算法理解导航到店行为评分权重。其背后核心技术是空间智能,核心引擎ABot-Earth 0.7被称为全球首个3D原生城市世界模型,仅需一张卫星图或一段文字即可在消费级GPU上10分钟生成真实街景3D城市,效率提升1000倍。高德还展示了渲染器、模拟器、规划器三位一体的空间智能架构,并已落地具身机器人、
2026 Inclusion·外滩大会于9月10日至12日举办"创新者舞台",首日联合中国科学院科普品牌"格致论道",邀请8位来自复旦、北大、上海交大等机构的学者进行硬核科技科普分享;次日聚焦"超级个体",17位实践者分享一人公司、多智能体替代传统部门等实验;第三日举办AI艺术TALK,探讨AI完成99%生成后人类最后1%不可替代性的问题。活动整体呈现科技平
阿里云于9月11日升级Token Plan个人版,在价格和Credit额度不变的情况下,为Standard和Pro套餐新增Agent Harness工具权益,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发能力,均通过MCP标准协议开放。同时新增视频生成、Managed Agent托管智能体、RAG知识库、Memory记忆库与Sandb
该论文提出 MHE-Former,一种基于熵最大化的多假设 Transformer 框架,用于单目 3D 手部和身体网格恢复。它采用探索-利用范式:探索阶段通过概率建模和熵最大化生成多样且合理的假设,利用阶段借助 VLM 的视觉理解与推理能力进行上下文感知的假设选择。实验表明该框架在多个数据集上取得准确性和多样性的最优表现,用户偏好研究也验证了假设选择流程的
该论文研究多语言多模态实体链接中稀有实体的失败问题,指出传统基于流行度(如页面浏览量)的稀有度指标会遗漏许多知识图谱结构上稀疏的实体。作者提出用Wikidata结构指标刻画稀有度,并设计一个无需训练的框架,让具备推理能力的视觉语言模型迭代检索并推理Wikipedia证据。在MERLIN五语言基准上,最佳系统整体比SOTA提升6.9%,在稀有实体切片上最高提升
该论文提出 M3-Former,一个结合大语言模型与多模态 Transformer 的船舶轨迹预测框架,用于长期(1-4 小时)轨迹预测。方法将船舶静态属性与航行意图作为语义先验,通过预训练 LLM 编码并与动态轨迹特征对齐,同时引入双粒度混合专家(MoE)架构分别建模全局航线规划与局部机动行为,并设计转向加权交叉熵损失缓解稀疏转向样本的长尾问题。在丹麦真实
该论文提出GRADE方法,利用预训练生成先验与单帧毫米波雷达几何信息,在烟雾、雾霾和黑暗等视觉退化条件下估计高保真度量深度。GRADE先将原始4D雷达频谱映射为粗略度量深度,再用潜在扩散模型恢复结构细节,并通过像素空间适配器在可见时利用相机残差线索。在12栋建筑95K帧数据上训练评估,清晰场景MAE为0.303米,烟雾下为0.313米,优于现有基线。
2026蚂蚁InTech奖在外滩大会揭晓,10位青年科学家获科技奖(每人20万元),10位中国籍在读博士生获奖学金(每人5万元)。本届聚焦AGI、具身智能、数字医学、数据处理与安全隐私四大方向,申报量较首届增长近4倍。蚂蚁集团同时宣布未来三年投入1亿元扶持获奖者创业项目。
2026 Inclusion·外滩大会上,香港大学计算与数据科学学院主办“世界模型是AI走向物理世界的新大陆吗”见解论坛,马毅、王晓刚、骆怡航等高校与企业嘉宾围绕世界模型的能力边界、具身智能技术路径与商业化挑战展开讨论。王晓刚介绍大晓机器人ACE研发范式与开悟世界模型,骆怡航发布面向灵巧操作的通用世界模型Motus2,圆桌嘉宾就世界模型定义、风险、适用场景及
AWS 宣布 TwelveLabs Marengo Embed 3.0 作为嵌入模型在 Amazon Bedrock Knowledge Bases 中正式可用。该多模态嵌入模型可将视频、音频、图像和文本联合编码为 512 维向量,使视频和图像内容可通过自然语言进行语义搜索。Managed Knowledge Bases 自动完成分段、抽帧、转录和嵌入,用户
宇树公开新一代通用人形机器人基础模型UnifoLM-WLA-1.0,参数量60亿,使用约2500小时真机数据训练,一套模型可完成64项桌面与全身操作任务,并适配平行夹爪和两类灵巧手。模型引入具身推理、动态区域预测与动作学习体系,将末端执行器与下半身动作统一为离散Token。其具身推理模型UnifoLM-ER-1-4B在7项开源评测中取得最高成绩,部分空间理解
生数科技在外滩大会预告发布面向灵巧操作的自进化通用世界模型Motus2,将评估与反馈显式纳入统一模型,使机器人能预测动作后果并据此优化策略。文章以智谱(语言模型路线)与生数(世界模型路线)为对照,称二者为攀爬AGI的南北坡。生数已形成Vidu Q3生成世界、Vidu S1实时交互、Motubrain世界动作模型三类核心模型布局,创始人朱军团队在概率机器学习与
llama.cpp 发布 b10896 版本,修复了在使用 DFlash 推测解码与视觉模型(mtmd)配合时无法解码图像 chunk 的问题。修复方式是停止将图像 token 复制给 drafter,并将 M-RoPE 跳过逻辑限制为仅图像,允许音频正常通过。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制。
Meta 推出其首个 AI 生产力助手 Muse,可连接 Gmail、Amazon 等账户,代用户处理邮件清理、购物下单、生成播客/图片/视频等任务。The Verge 记者实测发现 Muse 能完成低风险任务,但会从 Instagram API 读取比用户界面更详细的个人兴趣数据,甚至根据 Amazon 收货地址推断用户所在州,引发隐私担忧。Meta 称仅
开发者 brandonmusic 在 Hugging Face 发布了 GLM-5.3-Flash 的 EXL3/TR3 4bpw 量化检查点,基于 zai-org/GLM-5.3-Flash-BF16,面向 SM120 双 GPU 环境。该版本提供多模态 DFlash2、纯文本 DFlash2 和纯文本 MTP3 三种 vLLM 服务配置,并附带可复现的
Hugging Face 用户 reaperdoesntknow 发布了基于 Qwen/Qwen3.5-0.8B 的 GGUF 量化模型仓库 Qwen3.5-0.8-Cyber-GGUF,提供从 BF16 到 Q2 K L 的多档量化版本,面向本地推理与资源受限场景。仓库还包含一个 BF16 mmproj 多模态投影文件,但作者明确表示未验证端到端多模态路径