Blackfrost 发布 Muse Glimmer 30B 去拒绝 GGUF 量化版
Blackfrost-AI 发布了 Muse-Glimmer-30B-Abliterated-GGUF,这是基于 Meta 的 Muse Glimmer 30B 模型去除拒绝行为后的 GGUF 量化版本,支持本地运行。该模型提供从 Q2 K 到 Q8 0 的完整量化阶梯,并包含视觉投影器和 DFlash 投机解码器,在 RTX PRO 6000 上可实现约
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Blackfrost-AI 发布了 Muse-Glimmer-30B-Abliterated-GGUF,这是基于 Meta 的 Muse Glimmer 30B 模型去除拒绝行为后的 GGUF 量化版本,支持本地运行。该模型提供从 Q2 K 到 Q8 0 的完整量化阶梯,并包含视觉投影器和 DFlash 投机解码器,在 RTX PRO 6000 上可实现约
OpenAI 发布了 Python SDK v3.1.0,新增 WebSocket 流 ID、工作负载身份访问令牌事件,并弃用 Sora 视频 API。该版本还引入了 Ultrafast 层级、结构化 MCP 和 WebSocket 错误处理,并移除了 Stainless 归属和基础设施。
阿里巴巴的Qwen团队发布了Qwen3.8系列模型,包括核心的Qwen3.8-27B多模态稠密模型和更大的Qwen3.8-2.4T-A95B模型,权重以Apache 2.0许可证开源。Qwen3.8-27B在编码和办公任务上优于更大的Qwen3.7-Plus,并增强了智能体能力,原生支持262K上下文,可通过YaRN扩展到100万,支持图像和视频处理。模型已
谷歌宣布允许用户关闭Gemini和Flow中AI生成内容的可见水印,但会继续嵌入不可见的SynthID和C2PA水印。该设置将逐步推广至Search,但在要求可见水印的国家不会启用。此举与OpenAI、Meta等公司的做法一致,旨在平衡内容透明与用户体验。
谷歌宣布允许用户从其AI生成内容(包括图像、视频和歌曲)中移除可见水印,但不可见的SynthID水印和C2PA元数据仍将保留以确保透明度。该功能将在Gemini和视频编辑器Flow中提供,并即将支持Search。谷歌还开源了新库Credentio,使开发者能够在应用中嵌入本地验证机制。此举旨在平衡创意控制与安全,并紧随Anthropic为遵守欧盟法规而添加水
另有 1 家信源报道
阿里巴巴正式开源Qwen3.8-27B模型,该模型为原生多模态稠密模型,支持262K原生上下文,可通过YaRN技术扩展至1M tokens,在编程和办公场景性能大幅提升,并新增reasoning effort功能。模型以Apache 2.0协议开放权重,所有人可免费下载、部署和商用。目前千问已累计开源460余个模型,全球下载量超30亿次。
另有 1 家信源报道
阿里千问于8月14日晚正式开源Qwen3.8系列模型,其中Qwen3.8-27B为原生多模态稠密模型,仅270亿参数,性能超越Qwen3.7-Plus,在编程和办公场景表现出色,支持消费级显卡量化部署,采用Apache2.0协议。此前旗舰模型Qwen3.8-Max也已开源权重。阿里累计开源460余个模型,Qwen全球下载量超30亿次,衍生模型超30万个,稳居
余家辉于2026年8月14日宣布离开Meta,结束在Meta超级智能实验室(MSL)TBD Lab一年多的工作。他带领多模态团队推出了Muse Spark、Voice Mode、Muse Image和Muse Video等模型,但未透露新公司细节。其离职引发对Meta人才流失的关注,alphaXiv统计显示已有929名研究者离开Meta。
Unsloth 发布了 MiniMax-H3 的 GGUF 量化版本,支持本地运行,兼容 stablediffusion.cpp 和 Unsloth 平台。该模型能生成带原生立体声音频的视频,最长 15 秒、24 FPS、32 kHz 音频。提供两种去噪器变体(fl2va 和 ref2va)及多种量化等级,并附有使用示例和许可证说明。
AutoPrune 是一个由 Hugging Face 论文提出的 AI4AI 框架,利用大型语言模型自动设计视觉令牌剪枝策略,通过领域特定语言和残差搜索公式实现高效剪枝。实验表明,在移除 94.4% 视觉令牌时,AutoPrune 保留了超过 99% 的全令牌性能,同时将 FLOPs 减少 9.9 倍,预填充延迟降低 6.4 倍。该框架在 14 个多模态基
Vercel AI SDK 的 xAI 提供商更新至 v3.0.121,新增对 Grok Imagine Video 1.5 模型的支持,包括原生 1080p 分辨率(文本/图像转视频)和参考音频功能。修复了参考路由问题,并支持通过预设语音 ID 在提示中引用音频。
UniSwap是一个用于说话视频中流式音视频身份替换的框架,通过统一的流式音视频扩散Transformer实现外观和声音的同步替换。它采用交换-重建流程解决训练数据稀缺问题,并结合上下文预训练、条件流式适应和高效自强制DMD等技术,将采样步骤从30步减少到3步。实验表明,UniSwap在音视频同步、身份保持、流式效率和长时生成稳定性方面表现出色。
HIMEC 框架结合方向变化表示(DCR)与固定接口解码,用于遥感图像变化描述(RSICC)。DCR 将符号差异分离为出现、消失和共享上下文流,并通过学习查询编码器生成视觉条件变化查询令牌。在 LEVIR-CC 和 SECOND-CC 基准上,HIMEC 相比直接融合特征记忆显著提升 CIDEr 分数,并诊断了级联模型中的训练-推理不一致问题。源代码将在发表
本研究首次系统性地评估了多模态大语言模型(MLLM)生成网页的跨环境兼容性。研究者构建了包含2032个标注实例的WebCompat数据集,涵盖8种AI工具生成的网页在9种浏览器和设备组合下的渲染情况。研究发现68%的生成网页存在至少一个兼容性问题,主要症状为页面级布局失败(88.3%),根因包括缺失viewport meta标签(46%)和缺乏弹性布局(29
StrAD 论文提出了一种用于长视频音频描述生成的新基准和流式方法,将任务重新定义为流式密集视频描述,无需真实时间戳即可在滑动窗口内生成 AD。其微调模型 StrAD-FT 在 CMD-AD 上达到 SOTA(CIDEr 36.3),在 StrAD 基准上为 51.0,但流式任务中时间定位和叙事连贯性仍有局限。这是首个流式全视频 AD 生成方法,有助于推动可
AutoDesign 是一个利用元优化器递归改进代码代理的框架,用于长时程代理设计,在学术论文到海报生成任务上取得最新成果。在 PosterBench 主赛道中,AutoDesign 得分 78.32,超过商业系统 Claude Design 7.45 分。在完全自主的长时程循环中,它能在 40 分钟内执行 253 次工具调用和 11 次编辑,成本低于 3
英特尔宣布其Muse Glimmer模型在Intel GPU和Xeon CPU上通过上游vLLM和Hugging Face Transformers实现Day-0支持,覆盖从工作站到云实例的广泛硬件。该支持得益于英特尔的“Upstream First”承诺、对开源社区的持续贡献以及与Meta的紧密合作。用户可通过vLLM的HTTP服务器(兼容OpenAI A
研究人员提出了一种新的可提示凝视目标估计(PGE)任务,通过文本或视觉提示识别主体并预测凝视目标,无需多阶段流水线。他们开发了Gaze-Co数据集(包含12万张带提示标注的图像对)和GazeAnywhere模型,该模型使用基于Transformer的检测器融合冻结编码器特征,同时解决主体定位、帧内/外存在性和凝视目标热图估计。GazeAnywhere在多个P
Suno 推出 Studio 2.0,为 Premier 订阅用户提供基于聊天的 DAW 功能,用户可通过自然语言创建乐器、人声和自定义插件,并支持 MIDI 导入、录音、编辑、分轨分离、自动化曲线以及 32-bit/48 kHz 的无限制多轨导出。该更新与公司近期限制下载的政策相矛盾,可能意在吸引专业用户。此外,Suno 因使用受版权保护材料训练模型而面临
bartowski 发布了 Muse-Glimmer-30B 模型的 GGUF 量化版本,该模型由 meta-models 开发,支持文本和图像输入,并具备 MTP 和 imatrix 功能。量化版本使用 llama.cpp 生成,提供从 bf16 到 IQ3 XXS 的多种量化格式,以适应不同硬件和性能需求。推荐用户选择 Q4 K M 版本作为性能与大小的