百度营销发布擎舵3.0与智能投放,双擎驱动AI营销增长
百度营销在9月9日发布会上正式推出擎舵3.0营销创意智能体与全新升级的智能投放产品。擎舵3.0从AIGC创作工具进化为多Agent协同的营销创意智能体,包含图片Agent和视频Agent,已累计服务超15万家客户,人效提升超300%。智能投放产品AIMax升级为扩量、控本、稳效三位一体,客户渗透率达44.2%,超6000家客户将全部账户托管给AIMax。百度
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
百度营销在9月9日发布会上正式推出擎舵3.0营销创意智能体与全新升级的智能投放产品。擎舵3.0从AIGC创作工具进化为多Agent协同的营销创意智能体,包含图片Agent和视频Agent,已累计服务超15万家客户,人效提升超300%。智能投放产品AIMax升级为扩量、控本、稳效三位一体,客户渗透率达44.2%,超6000家客户将全部账户托管给AIMax。百度
Hugging Face 上发布了 gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090,这是基于 Qwen/Qwen3.8-27B 的 NVFP4 量化检查点,使用 NVIDIA Model Optimizer 量化,专为 RTX 5090(Blackwell)优化。该模型在 32GB 显存上支持完整 262,144
京东在JDD-2026全球科技探索者大会上发布物理AI建设成果,包括规划建设国产十万卡算力集群、推进1000万小时具身数据采集、发布实时可交互世界模型JoyAI-Echo WM(在WBench Navigation评测中以81.6分排名第一),以及物流超脑3.0、工业JoyIndustrial2.0、健康京医千询3.0等垂域模型。京东同时启动“物理AI加速计
Simon Willison 使用 GPT-6 Astra 和 ChatGPT Images 2.5 生成了一枚以电视剧《Pluribus》为主题的 Fabergé 彩蛋图片,随后将图片粘贴到 Codex 中,通过本地 Blender 技能让模型自动构建出 .blend 三维模型,耗时 17 分 51 秒。他将该模型接入自己此前搭建的浏览器端 Blender
Agention 发布了 Qwen3.8-Flash-Next 的 ROCmFP4 量化版 GGUF 模型,该模型可在 128GB 统一内存设备(如 Strix Halo)的 GPU 上完全运行,占用 87.06 GiB,困惑度仅比未量化模型高 2.48%。该量化版本支持视觉和投机解码,并针对长上下文预填充进行了优化,在 128k 上下文下仍保持 138 t
Suno发布了其首个与唱片行业合作训练的AI音乐模型v6,该模型使用了来自华纳音乐、BMG和Believe等合作伙伴的授权数据。v6包含三个子模型:v6、v6-wild和v6-mini,其中mini免费提供。新模型在理解音乐流派方面有显著提升,但仍无法生成自然的不完美音乐,且新增了通过聊天编辑歌曲部分、基于图像或视频生成音乐等功能。
另有 2 家信源报道
NVIDIA 技术博客介绍了编码-预填充-解码(EPD)分离技术,用于加速多模态模型推理。该技术将视觉编码阶段与 LLM 预填充和解码阶段分离,通过 NVIDIA Dynamo 框架实现独立扩展,在图像密集型提示和短输出场景下,可将首令牌时间(TTFT)提升至 5 倍,端到端响应时间提升至 7 倍。文章还讨论了 EPD 的适用场景和硬件放置选项,并指出在长输
Hugging Face 上发布了 GAP-models 仓库,用于备份 GAP 参考生成和量化评估所用的本地模型,包含多个模型族和检查点。仓库通过清单和 SHA256 校验确保文件来源和完整性,并记录了候选模型的资格评估结果,评估基于特定 CUDA 构建和硬件环境。文件保留原始模型的许可和归属,不统一替换许可。
Google DeepMind 与 Primordial Soup 合作,利用 AI 图像修复和动作捕捉技术,为结婚70多年的夫妇 Burt 和 Ethelle Shatz 重现了他们初次相遇的未记录记忆,制作成纪录片短片《Love, Rendered》。该片由 Liz Garbus 执导,展示了 AI 在记忆恢复和情感连接方面的潜力。技术团队通过生成模型修
AWS 发布了 Ray Serve 深度学习容器(DLC),用于替代不再维护的 TorchServe,提供预构建、优化的推理镜像。该容器集成了 PyTorch、Ray Serve、CUDA 等组件,并支持在 Amazon EKS 上部署视觉语言模型(如 Qwen3-VL-2B)。文章详细介绍了部署步骤和架构,旨在简化模型推理的依赖管理和安全补丁更新。
Hugging Face Transformers 库发布 v5.17.0 版本,新增多个模型支持,包括 HYV4、VibeVoice、NeoMME、Fun-ASR-Nano、KimiLinear 和 Canary。这些模型涵盖语言、语音、多模态等不同领域,并引入了多种创新架构。该版本扩展了 Transformers 的模型生态,为开发者提供了更多选择。
Shipt 是 Target 旗下的当日达配送平台,推出了名为“Ask Shipt”的 AI 购物助手,用户可通过自然语言生成定制购物车,或上传菜品图片自动添加食材。该工具已在 Shipt 应用和网站上可用,是继 Instacart、Uber Eats 和 DoorDash 之后又一采用 AI 助手的配送应用。
Suno发布新一代v6音乐生成模型,与华纳音乐、BMG和Believe合作开发,提供三个版本,其中v6-mini免费。新模型支持多模态输入和文本指令编辑歌曲部分,但训练数据细节保密。华纳已和解,环球和索尼仍在起诉。
另有 2 家信源报道
亚马逊Prime Video推出新AI功能,利用AI和视觉特效技术使演员口型与配音音频同步。该功能目前仅适用于德国剧集《Maxton Hall》的英语配音版,但计划未来扩展至更多内容。此前,Prime Video已在12部影视作品中试验AI辅助配音,而Meta和YouTube也推出了类似的口型同步自动配音功能。
OpenAI Agents Python 库发布 v0.22.2 版本,主要新增对当前图像生成工具选项的支持,并修复了 UnixLocal 沙箱中文件 API 的符号链接竞争问题,以及会话压缩响应链重置的缺陷。该版本还更新了相关文档,以反映 v0.22.1 的行为变更。
OpenAI 发布了 ChatGPT Images 2.5 图像生成模型,包含 Flare 和 Sunburst 两个版本,分别面向速度和精度。新模型支持更精准的编辑、自然光照和纹理,并引入 Sketch 绘图工具和可分享提示词。API 定价与旧版一致,但新增了更高品质档位,且无批量折扣。测试显示,在 ChatGPT 的 Work 模式下编辑一致性较好,而
另有 2 家信源报道
llama.cpp 发布 b10873 版本,主要修复了 mtmd 中视频 ID 传播的问题(PR #28601)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件后端,如 Vulkan、ROCm、CUDA、OpenVINO 等。
蚂蚁集团阿福医疗AI实验室与河北医科大学第四医院合作,利用AI分析病理切片和CT影像,开发了DeepComp、RSA和RCSA三个模型,分别用于预测胃癌术后并发症、早期复发和肝转移风险。研究基于数千例患者数据,在多个外部队列中验证了模型的有效性,部分成果已发表于《肿瘤学年鉴》和《自然·通讯》。该合作旨在提高胃癌风险预测的准确性,为临床决策提供更精准的参考,未
这篇综述首次统一回顾了扩散模型在图像、视频和3D三种视觉模态下的对抗攻击与防御研究。文章提出了一种以任务为中心的全面分类法,按模态、攻击/防御和生成任务组织文献,并深入分析了评估设置,包括数据集、指标和基准。最后,作者指出了若干开放挑战并提出了具体的未来研究方向。
CaseWeaver是一个多智能体框架,用于生成多模态虚拟临床病例。它基于时间线锚定的潜在临床病例图(LCCG)组织患者背景、疾病轨迹和模态证据,通过模态智能体生成临床记录、实验室结果、生理信号和医学图像。评估显示,CaseWeaver在临床可推断性和病例多样性上优于通用模型和智能体工作流基线。