ONESTRUCTION 借助 AWS GenAIIC 构建 Ishigaki-IDS 基础模型
ONESTRUCTION 公司在 AWS GenAIIC 的技术支持下,基于 Qwen3 模型构建了面向建筑行业 BIM 工作流的领域基础模型 Ishigaki-IDS。该模型通过合成数据生成和 CPT、SFT、RLVR 三阶段训练流程,解决了 IDS 标准数据稀缺、IFC 词汇注入和语法生成等挑战,降低了 BIM 专业人员使用 IDS 的门槛。
公司与模型 · 阿里通义千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
ONESTRUCTION 公司在 AWS GenAIIC 的技术支持下,基于 Qwen3 模型构建了面向建筑行业 BIM 工作流的领域基础模型 Ishigaki-IDS。该模型通过合成数据生成和 CPT、SFT、RLVR 三阶段训练流程,解决了 IDS 标准数据稀缺、IFC 词汇注入和语法生成等挑战,降低了 BIM 专业人员使用 IDS 的门槛。
NVIDIA 在八月庆祝本地 AI 生态,发布多款新模型和工具,包括 Cosmos 3 Edge、MiniMax-H3、Laguna S 2.1、DeepSeek-V4-Flash、Inkling-Small、Wan-Animate-2 和 LTX-2.5,并支持 Meta 的 Muse Glimmer 模型。这些模型和工具旨在推动本地 AI 和智能代理的发
该研究提出一种基于激活工程的虚假信息检测框架,通过对比真实与虚假陈述的激活差异提取“虚假方向”,并在推理时将未知声明的最后token激活投影到该方向进行分类,无需微调或外部知识检索。方法在Gemma、Llama和Qwen家族的11个模型(270M至12B参数)上评估,在LIAR和FACTors基准上匹配或超越零样本和少样本提示基线,尤其在小模型上提升显著,但
Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。
本文研究了在线策略蒸馏(OPD)及其改进版在线策略增量蒸馏(OPD^2)在多语言数学推理中的应用,涵盖英语、韩语和日语。实验基于Qwen3模型,结果显示OPD^2在韩语和日语上显著优于OPD,并缩小了英语与韩语之间的性能差距。此外,仅使用英语数据的OPD虽能提升韩语和日语性能,但会导致回答偏向英语,凸显了多语言数据的重要性。
阿里巴巴的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,追平Claude Opus 4.8,但落后于Kimi K3(57分),且Kimi K3成本低25%。在GDPval-AA基准上,Qwen3.8 Max得分超过Kimi K3,但需要更多步骤和输入token,导致成本更高。此外,该模型在AA
斯坦福李飞飞、吴佳俊、张吕民及哈佛Yilun Du等学者联合发表论文MVA,提出将机器人动作转化为像素遮罩轨迹,直接利用现成视频生成模型Wan2.2,仅用15小时数据微调即可实现跨本体泛化。该方法通过URDF和逆运动学解算,解决了机器人跨机型迁移难题,挑战了机器人需专属大模型的主流认知,对具身智能产业影响深远。
DavidAU 发布了基于 Qwen3.6-27B 的多阶段微调模型 Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP,声称在 ARC-C 基准上首次突破 700 分,超越 OpenAI、Claude 和 Gemini 的闭源模型水平。该模型在 4bit 和 8bit 量化下均超过基座模型,
该研究针对中小企业在使用大语言模型时面临的幻觉和错误信息问题,提出了基于检索增强生成(RAG)的VectorRAG和GraphRAG建模方法。研究在LLaMA、Mistral和Qwen等多个先进LLM上进行了实验评估,结果显示RAG增强的LLM能显著减少幻觉和错误信息,提高响应质量和上下文相关性,从而支持更可靠、可信的决策。
SAF-OPD 提出了一种稳定优势融合框架,用于结合强化学习(RLVR)和在线蒸馏(OPD)训练。该框架通过四阶段流程(稀疏化、压缩、预热、退火)解决固定系数融合导致的熵崩溃问题,在七个数学推理和代码生成基准上,使用 Qwen3-1.7B/4B/8B 模型,将聚合分数提升了 0.51-2.70%,并实现了更稳定的训练。
Liquid AI发布了新一代混合模型LFM2系列,包括350M、700M、1.2B和2.6B四个参数规模的检查点,专为边缘AI和端侧部署设计。LFM2采用乘法门和短卷积的新架构,训练速度比上一代快3倍,CPU上的解码和预填充速度比Qwen3快2倍,在知识、数学、指令跟随和多语言等基准上优于同尺寸模型。该系列支持8种语言,上下文长度32,768 tokens
llama.cpp 发布 b10227 版本,主要新增了 Qwen3 专用解析器,支持带标签的思维工具解析、工具调用省略及 Qwen3-Coder 的注释处理。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等后端。
Hugging Face 宣布升级 vLLM 的 transformers 建模后端,通过 torch.fx 静态分析和 AST 源码重写,动态应用推理层融合,使 transformers 模型在 vLLM 中达到或超过原生实现的吞吐。在 Qwen3 系列(4B、32B、235B MoE)上验证了性能,用户只需添加 --model-impl transfor
Ollama 发布 v0.32.4 版本,新增对 Apple GPU 上 Laguna 模型的支持(通过 MLX 引擎),并优化了推测解码草稿模型的量化处理。同时修复了 Qwen3 MoE 模型中不同量化专家解码的问题,并提升了打包门控/上投影的速度(在 M5 Max 上提升约 4-9%)。
vLLM 发布 v0.22.0 版本,包含 459 个提交,来自 230 位贡献者。该版本重点提升了 DeepSeek V4 的成熟度,包括新增 NVFP4 融合 MoE 支持、CUDA 图优化和 MTP 投机解码。同时,Model Runner V2 成为 Qwen3 稠密模型的默认选项,并引入了实验性的 Rust 前端。性能方面,批量不变推理通过 Cut
Text Generation Inference 发布 v3.3.2 版本,主要改进包括升级 vllm 扩展操作、切换到 hf-nix、新增 Qwen3 支持、fp8 compressed tensors w8a8 支持,并修复了 Llama-4-Scout 和 Llama-4-Maverick 在 Gaudi 上的 OOM 和崩溃问题。