Google 搜索五大妙招,助你升级家居装饰
Google 发布了一篇关于如何利用 Google 搜索工具升级家居装饰的指南,介绍了五种方法,包括使用 AI Mode 可视化家具、Google Lens 购物、Circle to Search 发现装饰品、Search Live 指导 DIY 项目以及价格追踪功能。文章还提到了一些搜索趋势,如“home decor inspo”搜索量在过去一个月增长了
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google 发布了一篇关于如何利用 Google 搜索工具升级家居装饰的指南,介绍了五种方法,包括使用 AI Mode 可视化家具、Google Lens 购物、Circle to Search 发现装饰品、Search Live 指导 DIY 项目以及价格追踪功能。文章还提到了一些搜索趋势,如“home decor inspo”搜索量在过去一个月增长了
Gamma 收购了由 Accel 支持的 AI 设计初创公司 Lica,以建立自己的设计研究实验室。Lica 的联合创始人将领导该实验室,专注于为不同受众定制 AI 模型的演示和沟通风格。此次收购旨在扩展 Gamma 的演示产品,探索多模态沟通形式。
llama.cpp 0.3.0 版本发布,新增 dots3-note 多模态模型及 DSA-ISWA KV 缓存,支持 GLM-4.5-Air 的 MTP 预测,并为 DeepSeek 4 添加张量分割模式和多序列回滚修复。ggml 升级至 v0.22.0,服务器新增调试参数,Web UI 支持标签页聊天导航。
LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V10-GGUF,该模型通过其自研的 Genesis 算法对 GGUF 格式的模型进行张量噪声修复,并融合了 Hermes 智能体微调数据。模型在保持无审查能力的同时,旨在提升稳
商汤科技正式开源了8B参数的生图模型SenseNova U1.5 Lite,该模型支持4K直出、长指令遵循、原生图像编辑和复杂布局,在多个核心场景上比肩闭源GPT-Image-2。模型采用NEO-unify统一多模态架构,通过多教师在线策略蒸馏技术MOPD将专项能力融合回单一模型,强调稳定性、指令遵循和编辑精度,旨在进入真实创作流程。
中科紫东太初旗下科研智能体ScienceClaw推出AutoProject项目级自主科研引擎,旨在将AI在科研中的工作单位从Task提升至Project。该系统通过Project2Task规划、TaskExecutor长程执行和EviGraph证据验证三层能力,实现从项目规划到成果沉淀的全流程自主科研。此举标志着AI4S从工具级能力向系统级能力跨越,行业竞争
人民教育音像数字出版社与小猿合作研发的“中小学课本学习智能体”于2026年8月21日在小猿AI学习机首发上线,该智能体基于教材内容和猿力大模型,提供AI伴学和AI导学双模式。试点数据显示,使用该智能体的学生语文和英语知识点掌握量分别提升33.6%和24%,家长日均陪读时长减少20分钟。双方签署合作协议,未来将推动智能体规模化应用。
arXiv 论文提出 Cora(反事实可观察冗余审计)框架,用于可审计的网站冗余 AI 审计。Cora 将冗余分解为重复负载、正常使用税和故障域恢复储备三个维度,并通过版本化视觉语言模型提出注释,经类型化验证和发布检查后选择性发布分数。在透明机制测试台上,Cora 的分解表示优于标量负载基线,但两个小型视觉语言模型因未满足发布要求而被拒绝自动评分。该框架定位
arXiv 论文介绍了 SD-AgentFoundry-2D 和 SD-AgentFoundry-3D,两个极简的本地模拟框架,分别用于 LLM 驱动的二维多智能体社会模拟和 VLM 驱动的三维具身模拟。框架支持本地模型运行,跨平台,并强调可修改性,旨在为教育和快速原型设计提供基础。
neureps 发布了 warmly-qwen35-2b-enko-gguf,这是离线 SNS 应用 Warmly 的生产模型仓库,基于 Qwen3.5-2B-enko 进行词汇剪枝和 GGUF 量化。仓库包含 base 版本和 distill-v1 版本,后者通过蒸馏提升了韩语自然性,并通过了官方门禁但尚未晋升。量化变体对比显示,IQ4 XS 结合领域 i
NVIDIA发布了Cosmos3系列全模态世界模型,包括Cosmos3-Edge、Nano、Super等多个版本,支持从文本、图像、视频和动作轨迹生成视频、图像、音频和动作输出,用于机器人、自动驾驶和智能空间等物理AI应用。该系列基于Mixture-of-Transformers架构,参数规模从4B到64B不等,并采用OpenMDW1.1许可证,可商用。
MCP Python SDK 发布 v2.1.0 版本,主要更新包括:Client 可直接接受 StdioServerParameters 对象,提示消息支持图像和音频,并导出相关消息类。请求体大小限制扩展到 SSE 和 OAuth 端点。行为变更包括:处理程序异常不再向客户端暴露详细信息,而是记录日志并返回通用错误;内容块返回注解不再自动生成 output
阿里巴巴发布了视频生成模型 Wan3.0 的测试版,支持从文本、图片、PDF、网页和 PowerPoint 生成最长 30 秒的视频,长度是前代 Wan2.5 的两倍。该模型能同时处理文本、图像、视频和音频,并旨在减少 AI 生成视频中的视觉漂移和失真。Wan3.0 通过 wan.video 网站、阿里云 Model Studio 和 Qwen Cloud
llama.cpp 发布 b10608 版本,主要修复了视频处理中 moov atom 位于文件末尾时的解析问题,并处理了 SIGPIPE 信号及 Windows 下的管道中断情况。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYC
Jina AI 发布了 jina-embeddings-v5-omni-nano,一个约 1.04B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型支持检索、分类、聚类和文本匹配任务,可通过 Hugging Face 或 Elastic Inference Service 使用。它定义了开放权重全模态嵌入模型
阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,该模型在生成时长、文档输入、真实世界还原等方面全面升级,单次可生成30秒视频,并支持多种文档格式。行业评价其“稳定、真实、有质感”,已进入企业生产流程,用于短剧、影视、广告等场景。即日起用户可在多个平台体验,阿里云百炼和千问AI平台提供限时7折优惠。
OmniAssistBench是一个用于评估全模态大语言模型(Omni-LLMs)作为实时视频助手能力的基准测试。该基准通过逆向工程现有互联网视频构建多轮交互数据集,要求模型根据预定义路径引导用户。测试结果显示,专有模型Gemini-3-Pro得分66.4,开源模型Qwen3-Omni-Instruct得分51.2,当前模型普遍存在视觉提示理解、上下文保持和
该综述系统分析了多模态智能体框架中感知、推理、规划、记忆和行动等核心模块,并提出了按模态分类的架构分类法。文章回顾了从文本智能体到多模态框架的演变,以及委托、晚期融合和早期融合等集成方式,并评估了在机器人、GUI与网页导航、多媒体内容生成与编辑、长视频理解与检索等领域的应用。最后讨论了性能、效率与可扩展性之间的权衡,并指出了未来研究方向。
南开大学等机构提出 OraRL,一种面向视频多模态大模型的高效强化学习后训练方法。该方法将标注作为 oracle 轨迹加入策略组,并设计解耦优势估计器避免优势反转,显著提升训练效率与性能。OraRL 在多项视频感知基准上超越现有模型,且推理速度大幅提升。
该研究提出一种基于线性判别树集成(LDT、LDF、LDAB)的可解释多模态分类框架,通过编码各模态为令牌、提取概念聚类、路由融合并通过改进的特征重要性指标解释趋势,在IEMOCAP、CMU-MOSI和自定义数学数据集上,相比多模态Transformer和可解释多模态路由(IMR),在F1-mod上提升4.3%、准确率提升3.0%,且特征重要性的人类标注一致性