GPT-6带火循环Transformer,阿里两篇顶会论文提前布局
GPT-6 Astra发布带火了循环Transformer技术,阿里团队早在11个月前就发表了MeSH和SpiralFormer两篇论文,分别解决循环内部信息管理和计算粒度问题。MeSH通过动态读写路由器管理记忆槽,减少计算冗余;SpiralFormer通过多分辨率序列处理,让每轮循环关注不同尺度的信息。两篇论文分别被ICLR 2026和EMNLP 2026
公司与模型 · 阿里通义千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
GPT-6 Astra发布带火了循环Transformer技术,阿里团队早在11个月前就发表了MeSH和SpiralFormer两篇论文,分别解决循环内部信息管理和计算粒度问题。MeSH通过动态读写路由器管理记忆槽,减少计算冗余;SpiralFormer通过多分辨率序列处理,让每轮循环关注不同尺度的信息。两篇论文分别被ICLR 2026和EMNLP 2026
阿里 FunASR 发布 v1.4.14 版本,主要修复了 Git 归档和源码安装的便携源码包问题,并确保 MOSS-Transcribe-Diarize 在模型、部署和服务文档中保持可发现性。该版本还提供了最新的实时和工业部署指南,并附带经过验证的 runtime-llamacpp-v0.2.6 跨平台二进制文件。
阿里 FunASR 发布 v1.4.13 版本,主要修复了 ONNX 运行时错误、NumPy 2 ABI 不匹配等问题,并新增了对 n8n OpenAI 音频转录的支持以及 Qwen3-ASR 的离线 vLLM 示例。该版本还提供了多平台的 llama.cpp/GGUF 运行时预编译二进制文件,方便用户快速部署语音识别模型。
Qwen团队发布Qwen-Drive-1.0,这是首个面向自动驾驶的视觉语言基础模型,基于Qwen3.5-4B架构,集成3D感知、视觉问答和运动规划。模型通过外部BEV感知头和规划专家模块,在保持通用视觉语言能力的同时实现驾驶场景理解。实验显示其在3D感知和规划性能上具有竞争力,并已开源模型权重和代码。
另有 1 家信源报道
阿里 FunASR 发布了 v1.4.11 版本,主要修复了 SentencePiece 词标记对齐问题,并自动附加 Python 包。该版本与 llama.cpp/GGUF 运行时 v0.2.6 配对,提供了多平台(Linux、macOS、Windows)的预编译二进制文件,支持 CUDA、Vulkan 等。用户可通过 PyPI 安装或下载对应平台的运行时
阿里 FunASR 发布 1.4.10 版本,修复了超长中文句子的可读字幕回退边界问题,通过平衡时长和长度并优先考虑 Jieba 词边界、标点、脚本转换和真实时间戳间隙,改善了字幕生成质量。在混合中韩样本上,84 个源片段生成了 133 个字幕,无时长或长度违规。该版本还包含已验证的 llama.cpp 运行时归档,支持多种平台和硬件变体。
阿里 FunASR 发布 v1.4.9 版本,主要修复了字幕分割、自动模型、Paraformer 时间戳预测器及实时长尾保留等问题,并新增了 MOSS 说话人日志的 SGLang 路径文档。该版本还捆绑了 llama.cpp/GGUF 运行时 v0.2.6,提供多平台预编译二进制文件,支持 Linux、macOS 和 Windows 的多种硬件加速选项。
阿里 FunASR 发布了 llama.cpp 运行时 v0.2.6,提供 SenseVoice、Paraformer 和 Fun-ASR-Nano 的预编译二进制文件,内置 FSMN-VAD。该版本支持 CPU、Vulkan 和 CUDA(包括 Blackwell)后端,并验证了资产完整性和 CUDA 依赖。用户可通过脚本下载量化模型并直接运行,无需 Py
阿里发布Qoder桌面端,新增桌宠形态,支持语音交互和自动执行编码任务,将Coding能力从IDE扩展到桌面环境。该产品基于Agentic Coding技术,已服务全球600万用户和10万家企业客户,旨在让非程序员也能通过自然语言实现软件开发。
该研究探讨了监督微调(SFT)对大型语言模型指令敏感性的影响。通过Qwen3(1.7B、4B、8B)及Mistral-7B、Gemma-2-9B模型在MS MARCO和ESCI-English上的实验,发现SFT并非统一降低指令敏感性:小模型(1.7B、4B)显著降低(54-71%),而8B模型个体变化不显著,但训练指令间的对比差异可靠。跨模型结果不一致,且
阿里 AgentScope 发布 v2.0.7.post1 版本,包含多项修复和功能更新。主要改进包括:从媒体类型自动推导音频格式、排除 Gemini 工具执行 token、支持原生多模态工具输出、新增 GoalPipeline 管道模块、达到最大迭代次数后生成最终文本摘要、修复 WebUI 会话隔离、追踪中断的聊天响应、保留 OpenAI Response
Qwen 发布了新的开源权重模型 Qwen3.8-Flash-Next,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览。模型总参数为 125B,但仅有 6B 激活,性能显著提升。作者 Simon Willison 在 DGX Spark 上使用 Unsloth 量化版本进行了测试,并分享了初步体验。
阿里AI应用搭建产品Meoo打通了自然语言生成App的全链路,用户只需用自然语言描述想法,即可自动生成页面与功能,支持真机测试、持续修改与一键打包,产出安卓与iOS原生应用。Meoo提供真机联调能力,确保相机、定位等原生功能正常,底层由阿里云提供基础设施。此举大幅降低了非技术用户将想法转化为应用的门槛。
阿里巴巴发布了视频生成模型 Wan3.0 的测试版,支持从文本、图片、PDF、网页和 PowerPoint 生成最长 30 秒的视频,长度是前代 Wan2.5 的两倍。该模型能同时处理文本、图像、视频和音频,并旨在减少 AI 生成视频中的视觉漂移和失真。Wan3.0 通过 wan.video 网站、阿里云 Model Studio 和 Qwen Cloud
阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,该模型在生成时长、文档输入、真实世界还原等方面全面升级,单次可生成30秒视频,并支持多种文档格式。行业评价其“稳定、真实、有质感”,已进入企业生产流程,用于短剧、影视、广告等场景。即日起用户可在多个平台体验,阿里云百炼和千问AI平台提供限时7折优惠。
阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,支持单次生成30秒视频及多种文档格式输入,在生成时长、真实世界还原等维度升级。企业用户反馈其表现稳定、真实、有质感,已进入短剧、影视、广告等生产流程。即日起可通过阿里云百炼等平台体验,并推出限时7折优惠。
另有 1 家信源报道
阿里巴巴宣布拟配售800亿港元新股,所得款项净额将100%用于投资全栈AI能力,加强AI基础设施建设。这是阿里2019年港股上市以来首次启动新股配售。此外,DeepSeek优化峰谷计费规则,周末全天按低谷价计费;英伟达搭载AI芯片的服务器价格将上涨超15%。
阿里巴巴宣布通过香港市场配售新股,募集约800亿港元,全部用于投资全栈AI能力,覆盖芯片、基础设施和模型开发。此次交易已超额认购,成为香港上市公司史上最大规模后续发行。阿里近期资本开支大幅增长,AI云收入增速创新高,全球AI竞争正转向资本开支竞赛。
阿里巴巴在过去一个月密集发布大语言、图像、语音、视频、音乐等多模态模型,性能均跻身国际第一梯队,其中Qwen3.8-Max在Agentic榜单登顶全球第一,Qwen系列全球下载量突破30亿次。多模态模型已进入商业化场景,带动阿里云AI相关收入快速增长,AI相关产品收入连续12个季度三位数同比增长。阿里正通过全栈AI底座和多模态布局,推动AI从技术投入转化为规
阿里发布2026年6月季度财报,显示速卖通本季度实现经营层面盈利,得益于物流优化和成本效益提升。速卖通加速本地化布局,海外托管服务覆盖30多个国家,欧洲官方仓覆盖西班牙、法国、波兰,德国仓在建。品牌化战略方面,Brand+计划带动品牌活跃买家渗透率超30%,618大促品牌GMV渗透率接近40%。速卖通正从流量场升级为品牌场,建立长期壁垒。