LARK:面向多模态推荐的潜在对齐推理框架
本文提出 LARK(Latent-Aligned Reasoning frameworK),一种用于多模态推荐的两阶段潜在推理框架,旨在解决视觉-语言模型在多步推理中视觉和文本信号逐渐衰减的“跨模态稀释”问题。LARK 在第一阶段将可学习潜在标记与思维链推理交错,并与冻结的视觉编码器对齐;第二阶段通过桥接 MLP 和对比学习生成嵌入,并将中间特征与思维链隐藏
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
本文提出 LARK(Latent-Aligned Reasoning frameworK),一种用于多模态推荐的两阶段潜在推理框架,旨在解决视觉-语言模型在多步推理中视觉和文本信号逐渐衰减的“跨模态稀释”问题。LARK 在第一阶段将可学习潜在标记与思维链推理交错,并与冻结的视觉编码器对齐;第二阶段通过桥接 MLP 和对比学习生成嵌入,并将中间特征与思维链隐藏
arXiv 论文提出 SAGE 框架,通过将密集文档图像中的语义实体解析为层次化图节点并采用多向量嵌入,缓解了标准视觉语言检索器因单向量编码导致的“语义稀释”问题。作者还构建了 DEAR 基准数据集,包含 1055 对查询-图像对,用于评估多实体视觉检索。实验表明 SAGE 在 DEAR 上显著优于基线,Recall@3 达 0.849,代码已开源。
该研究提出MPS-Bench基准,包含5181个来自584张真实图像的高风险场景,用于评估视觉语言模型(VLM)的个性化安全。研究发现8个前沿VLM在86-99%的情况下直接回答而非寻求缺失上下文,个性化安全得分均不超过2.6/5。通过因果干预,研究者识别出'视觉主导'机制:视觉信息在早期层进入文本表示并抑制文本风险信号,导致后期内部修复不可靠。为此提出PR
Claude Code 发布 2.1.69 版本更新,新增了 /claude-api 技能、语音转文字支持 10 种新语言、远程控制会话命名、插件热加载等多项功能。同时修复了多个安全漏洞,包括嵌套技能发现可能加载 gitignored 目录中的技能、信任对话框静默启用所有 .mcp.json 服务器、符号链接绕过等。此外还改进了沙箱网络隔离设置、Git 指令
量子位报道称,具身智能领域正兴起In-Context Learning(ICL)创业热潮,Skild AI和Generalist AI分别发布机器人基础模型S1和GEN-1.5,展示机器人通过观看示范视频即可学习新任务,无需微调。国内创业公司可可矩阵(COCO Matrix)致力于将ICL作为具身智能的底层范式,其创始人高宇翔认为,具身智能的Scaling方
谷歌在Gemini应用中直接推出其Lyria 3.5音乐生成模型,并通过API提供。该模型相比前代具有更富表现力的人声和更丰富的音乐编排,用户可在Gemini应用中选择流派和风格,创建带人声或纯音乐的音轨。Lyria 3.5还可在Google Flow Music、Google AI Studio和Google Vids中使用。谷歌声称Lyria模型仅使用授
Lightricks 发布了 LTX-2.5 模型,支持图像/文本/音频到视频及音频的生成,并强调可自托管部署。该模型采用社区许可协议,提供 API 演示和 GitHub 资源,旨在提供全面的视频、音频和世界模拟能力。
OpenAI 发布了面向开发者的 GPT-6 Astra 模型,该模型在细节关注、用户提示理解和复杂输出生成方面表现更优,尤其在 3D 模型构建上能力突出。Simon Willison 的博客文章对此进行了介绍,并提及 Astra 在创意任务(如给骑自行车的鹈鹕戴红领巾)上的表现。
另有 1 家信源报道
Simon Willison 在 2026 年 9 月 4 日获得 GPT-6 Astra 的访问权限,并用它生成不同推理级别的自行车鹈鹕 SVG 图像,与 GPT-5.6 Sol、Terra 和 Luna 进行对比。结果显示 Astra 生成的图像质量明显优于其他模型,且成本效率更高,低推理级别下仅需 9.55 美分即可获得比 Sol 任何级别更好的结果。
AWS 发布了一篇技术博客,介绍如何使用 Amazon Bedrock AgentCore 和 Amazon Nova 2 部署一个多模态 WhatsApp 订餐助手。该助手支持文本、语音笔记和语音通话三种渠道,共享后端和跨渠道记忆,可识别同一客户。系统架构包括 API Gateway、Lambda、SQS、DynamoDB 等 AWS 服务,并通过 MCP
llama.cpp 发布 v0.4.0 版本,新增对 Qwen3.8-Flash-Next、Nemotron-3-Puzzle 等模型的支持,并引入按需张量读取、服务器每槽上下文限制和视频输入选项。核心更新包括 ggml 0.23.0 的稀疏闪存注意力与 RDMA 支持,以及多项多模态和服务器功能改进。
litert-community 发布了 Gemma 4 12B 模型的 LiteRT-LM 格式版本,支持文本、视觉和音频模态以及多令牌预测,可在 macOS、Linux、Windows 和 Web 上部署。该模型基于 Google 的 Gemma 4 12B,适合桌面端离线使用,需 LiteRT-LM v0.17 或更高版本。模型文件大小约 6.9GB,
AWS 博客介绍了如何利用 NVIDIA Cosmos 3 在 SageMaker HyperPod 上构建物理 AI 模型工厂。Cosmos 3 采用混合 Transformer 架构,统一处理视频、图像、动作和声音,支持前向动力学、逆动力学和动作策略三种模式。该设计使数据生成、后训练和评估可在同一 GPU 集群上运行,提高资源利用率。文章提供了端到端示例
Primitive AI 发布了 Qwen3.8-Flash-Next 的 NVFP4 量化版本,使 180B 参数的模型能在单张 96GB Blackwell GPU 上运行。该量化模型在 9 项基准测试中平均得分 92.2,支持 MTP 投机解码,并提供了详细的部署方案,包括 CPU 卸载和 NVMe 映射选项。
字节跳动旗下Seed研究团队发布了新一代视频生成模型Seedance 2.0,采用统一的多模态音视频联合生成架构,支持文本、图像、音频和视频四种输入模态,并具备多模态参考和编辑能力。相比1.5版本,该模型在复杂交互和运动场景的生成可用性、物理准确性、视觉真实感和可控性方面有显著提升,支持15秒多镜头音视频输出和双声道音频。官方称其在多主体交互和复杂运动场景中
TechCrunch报道称,AI生成的餐厅菜单因训练数据狭窄且追求“讨喜”美学,导致食物图像呈现诡异完美、同质化的外观,引发顾客不适。专家指出,这源于模型对快餐连锁菜单风格的模仿和反复编辑导致的“收敛”现象,虽非模型崩溃,但会降低输出质量。研究显示,AI食物图像引发“恐怖谷”效应,加剧了公众反感,并引发对AI内容真实性及证据可信度的担忧。
本文提出TopKSigLIP,一种用于乳腺X线摄影的视觉-语言模型,通过TopK-Patch模块学习采样高分辨率补丁以解决高分辨率与稀疏病灶问题,并采用Sup-sigmoid损失替代对比损失以应对报告同质性。该模型在零样本评估中优于现有开源乳腺和通用医学VLM,在密度评估、BI-RADS分类、发现亚型和癌症预测等任务上表现更佳,且TopK-Patch模块的病
这篇立场论文认为,视觉学习中无标签并不等于无人类监督,因为数据整理方案和训练目标中嵌入了大量人类先验。作者指出,当前“无监督”术语过于笼统,掩盖了不同方法间的差异,并观察到自2021年以来CV顶会中标题含“无监督”的论文数量下降。他们呼吁社区明确披露数据选择和训练目标中的先验,以改进学术交流、确保公平比较并保留方法论多样性。
字节跳动旗下 Seed 研究团队正式发布 Seed2.0 系列模型,针对大规模生产部署和多模态理解进行了系统优化,提升了视觉感知、复杂指令执行和推理能力,并提供 Pro、Lite、Mini 及代码模型等多种规格。Seed2.0 在多项公开基准上取得领先成绩,其 Pro 和代码模型已在豆包和 TRAE 上线,API 已通过火山引擎开放。
字节跳动旗下Seed团队发布Seedream 5.0 Lite图像生成模型,相比4.0版本在理解、推理和生成能力上全面提升,并引入实时搜索增强功能。该模型采用统一多模态架构,能更好地理解用户意图和世界知识,适用于信息可视化、视觉推理等场景。目前已在Dreamina AI和火山方舟体验中心上线。