雷鸟iO发布:轻至34g,全天候主动式AI眼镜
雷鸟创新发布全新雷鸟iO系列AI眼镜,主打轻至34g的日常佩戴设计、两天续航及全天候主动式AI功能,支持DeepSeek V4 Pro等大模型,并强调隐私保护。该产品定价1996元起,旨在推动AI眼镜从尝鲜品走向大众日常使用。
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
雷鸟创新发布全新雷鸟iO系列AI眼镜,主打轻至34g的日常佩戴设计、两天续航及全天候主动式AI功能,支持DeepSeek V4 Pro等大模型,并强调隐私保护。该产品定价1996元起,旨在推动AI眼镜从尝鲜品走向大众日常使用。
Jeff Dean在斯坦福2026 Frontier&Pioneer Symposium上首次公开访谈,谈及离开谷歌的原因、Gemini早期在Coding上的不足、TensorFlow的设计失误,以及新公司Discovery Loop的目标——通过自动化科学实验循环实现递归自我改进。他还指出AI在网络安全上的能力已接近顶级人类攻击者水平,并分享了快速浏览论文
浙江大学研究团队提出了Holtercare-Bench,一个用于评估长期动态心电图分析的多模态基准,并配套发布了包含788份临床Holter记录和22,980个问答对的Holtercare-23K数据集。该基准通过信号-视频-文本三模态对齐,评估模型在时间定位、临床诊断和全局总结方面的能力。零样本评估显示主流多模态大模型在处理超长病理序列时存在显著性能差距,
该研究审计了零样本视觉语言模型(如CLIP、OpenCLIP、SigLIP)在分布偏移下使用分裂共形预测的类别条件安全性。研究发现,边际覆盖率看似较高(如ImageNet-Sketch上约0.86),但最差类别的覆盖率可降至0,且10-12%的类别低于有限样本零下限。源域诊断无法预测失败,源端Mondrian校准不迁移,目标端类别校准虽提升尾部但需每类标签且
本文是一篇关于大语言模型在心理健康领域应用的系统综述,涵盖了社交媒体分析、临床对话代理、治疗支持工具、提示工程、多模态学习及伦理考量等方面。综述整合了跨学科研究,利用社交媒体帖子、电子病历和多模态数据实现抑郁症早期检测、自杀风险评估和个性化治疗支持,同时强调了提示工程和可解释性的重要性。文章还讨论了多模态融合技术的进展以及伦理、社会技术和监管方面的挑战,倡导
CAViAR 是一个由 NEC 实验室发布的新型因果视频数据集,包含 2,249 个真实行车记录仪事故视频,并标注了环境条件、事故类型、因果解释、责任方和违规规则等信息。通过评估多个视觉语言模型,研究发现现有模型在感知任务上表现较好,但在事故类型和责任推理上存在明显不足,揭示了感知与推理之间的差距。该数据集和代码已公开,旨在推动自动驾驶安全领域的多模态推理研
法国雷恩大学、CNRS、INRIA、IRISA和Vsora公司联合提出ClustRS,一种无需训练的视觉语言模型(VLM)token剪枝算法,包含注意力加权聚类和残差收缩去噪两个组件。实验表明,在LLaVA 1.5 7b上,ClustRS在极端噪声和token条件下(减少97%至16个token)比现有方法性能提升高达20%,并在LLaVA-OneVisio
llama.cpp 发布 b10541 版本,新增 --mmproj-device 参数及 MTMD BACKEND DEVICE 环境变量,用于指定多模态投影器的后端设备,并支持 -mmdev 短标志。该版本提供多平台预编译二进制,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 Vulkan、CUDA、ROCm 等。
TomoroAI 发布了 tomoro-colqwen3-embed-4b,这是一个基于 Qwen3-VL-4B-Instruct 和 Qwen3-Embedding-4B 融合的多模态嵌入模型,采用 ColPali 风格的多向量表示,支持文本、图像和视频检索。该模型在 ViDoRe 基准上达到或接近最先进性能,并将嵌入存储占用降低至约 0.82 TB/百万
优必选自研的“行者具身智能模型”通过中央网信办审核,完成生成式人工智能服务备案,成为具身智能机器人行业首批通过备案的企业之一。该模型面向情感交互进行专项微调,支持家庭陪伴等场景,并与开源模型Thinker共享具身底座。此次备案构建了内容安全合规工程能力,为家庭场景落地提供保障。
AWS宣布OpenAI GPT-5.6模型现已在Amazon Bedrock上支持跨区域推理,覆盖超过25个AWS区域。该功能通过地理和全球推理配置文件实现,允许请求在多个区域间路由,以提高吞吐量和性能。GPT-5.6系列包括Sol、Terra和Luna三个变体,支持文本和图像输入,具有100万token上下文窗口,并支持推理模式、工具调用和提示缓存。
0bserverx 发布了 Muse-Glimmer-30B-Heretic-Uncensored-GGUF,这是基于 Meta 的 Muse-Glimmer-30B 模型,通过 Heretic v1.4.0 进行 abliteration 处理,并提供了 27 种 GGUF 量化版本,内存占用从 6.53 GB 到 55.73 GB 不等。该模型支持视觉-
Adobe 在 Firefly 平台中全面推出三款 AI 音频工具,包括生成免版税音乐、将脚本转为配音以及生成音效,并声称这些工具可用于商业用途。此外,Firefly AI Assistant 新增每日免费生成次数,并集成了 Google 的 Gemini Omni Flash 模型,该模型支持视频、音频、图像和文本输入。
广州AI营销公司钛动科技宣布完成新一轮融资,由华泰泛大西洋基金领投,资金将用于钛极专业大模型和Navos多智能体等AI技术研发。公司已成为ChatGPT Ads首批官方技术合作伙伴,并推出GEO解决方案,测试显示客户ROI提升至2.5倍。此前公司已递交港交所上市申请,2025年前9个月营收同比增长74.5%。
Meta 发布了适用于 Mac 的 Meta AI 应用,内置系统级听写功能,并能基于屏幕内容使用 Muse Spark 模型回答问题。该应用还面向企业主,允许连接 Instagram、Facebook、广告活动和 Google Workspace 账户,提供营销洞察、创建提案和文档。此举是 Meta 推动 AI 工具服务企业自动化的一部分,CEO 马克·扎
阿里巴巴发布新季度业绩,阿里云外部商业化收入增速达45%,创22个季度新高,AI相关产品收入连续12个季度三位数增长。过去一个月,阿里密集发布多类模型,包括旗舰模型Qwen3.8-Max,并推出Agent产品“千问办公”。公司表示,前期在芯片、模型和基础设施上的投入已转化为商业回报。
2026年8月19日,蓝箭航天朱雀三号遥二火箭成功完成国内首次入轨级火箭一子级陆地回收。本次任务中,大疆Action6相机与SmallRig定制防护结构组成的“影像盒子”首次实现民用消费级相机完整拍摄火箭天地往返全过程,获取着陆腿内部独家画面。该合作打通民用影像硬件与航天观测产业链,为低成本太空影像记录提供新思路。
软件公司 Software Mansion 在 Hugging Face 上发布了用于 React Native ExecuTorch 库的 CLIP ViT-B/32 图像编码器模型,以 .pte 格式提供,支持 xnnpack 后端。该模型基于 OpenAI 的 clip-vit-base-patch32,导出时使用 ExecuTorch 1.1.0,不
中科通量发布OmniMate移动AI数字员工,采用本地边缘智能架构,提供可移动、多岗位复用的AI数字劳动力解决方案,覆盖迎宾讲解、培训赋能、获客引流、管理提效等场景。该产品已在通信营业厅、科技展厅完成部署验证,旨在降低人力成本、提升服务标准化,并保障数据安全。
Netflix 在 arXiv 发表论文,介绍其利用多模态嵌入(如 CLIP 图像嵌入和自研的 MediaFM 三模态模型)改进个性化推荐系统,包括艺术作品和视频预览的个性化。这些方法解决了冷启动问题,统一了多个画布模型,并在离线与在线 A/B 测试中取得显著效果。此外,论文还分享了生产工程决策和离线代理任务筛选方法,为从业者提供了可迁移的经验。