Ornith AI 发布 397B 自改进模型 Ornith-1.5,性能对标 Claude Opus 4.8
Ornith AI 发布了 Ornith-1.5-397B,这是一个 397B 参数的混合专家模型,通过端到端自我改进训练,在 Terminal-Bench 2.1 上得分 86.1,在 DeepSWE 上得分 56.0,性能与 Claude Opus 4.8 相当,并优于 GLM-5.2 和 DeepSeek-V4-Flash-0731 等开源模型。该模型
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Ornith AI 发布了 Ornith-1.5-397B,这是一个 397B 参数的混合专家模型,通过端到端自我改进训练,在 Terminal-Bench 2.1 上得分 86.1,在 DeepSWE 上得分 56.0,性能与 Claude Opus 4.8 相当,并优于 GLM-5.2 和 DeepSeek-V4-Flash-0731 等开源模型。该模型
南开大学等机构提出 OraRL,一种面向视频多模态大模型的高效强化学习后训练方法。该方法将标注作为 oracle 轨迹加入策略组,并设计解耦优势估计器避免优势反转,显著提升训练效率与性能。OraRL 在多项视频感知基准上超越现有模型,且推理速度大幅提升。
BF1 是一种确定性的块对齐二进稀疏注意力机制,结合局部邻域、全局首块和对数间隔历史块,实现 O(n log n) 交互和 O(log n) 通信深度。在 NVIDIA RTX PRO 6000 Blackwell GPU 上,BF1 在 32K 上下文下实现每层 10.91 倍加速,并将 Qwen3-0.6B 模型的首 token 时间降低 15.3%。在
本文探讨了在版权法下训练AI模型的合法性问题,指出法律尚未跟上技术发展,法官需依据1976年的法律裁决。近期Anthropic因盗版书籍被罚15亿美元,但法官认为其训练行为合法,类似阅读。法院在Thomson Reuters诉Ross案中裁定直接竞争性使用不构成合理使用。专家认为这些裁决对AI公司有利,但法律不确定性仍存。
ornith-ai 发布了 Ornith-1.5-9B 模型,这是 Ornith-1.5 系列中最轻量的 9B 密集模型,通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成。该模型在编码基准测试中表现优异,如 SWE-bench Verified 得分 70.6,并支持移动端量化部署。
Ray 2.58.0 发布,重点包括 Ray Serve LLM 完成 KV 缓存和 token 感知路由,Ray Core 支持任务事件卸载,Ray Data 新增 Databricks Delta Lake 集成和 shuffle v2 后端,并推出实验性 Ray Sandbox 和 TPU 支持。这些改进提升了推理性能、数据处理效率和资源调度能力。
Latent Space 的 AINews 文章提出,自 2022 年以来,AI 流水线中越来越多的组件从人类制造转向模型制造,形成“模拟”趋势:性能略差(10%),但成本更低(100 倍)且速度更快(10000 倍)。文章按阶段梳理了从奖励信号、训练数据、教师模型、课程设计到研究者、环境乃至人类主体的合成化进程,并引用 InstructGPT、Phi、Al
Netflix开发了基于语言模型的推荐系统GenRec,将用户行为转换为纯文本,通过微调开源权重模型进行推荐排序。离线测试和在线A/B实验显示,其推荐质量优于现有系统,且所需标注数据减少约40倍。Netflix认为这是从定制架构向通用语言模型转变的一部分,但尚未完全替代现有系统。
DavidAU 发布了基于 Qwen3.8-27B 的微调模型 Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF,采用 COLD FUSION(GAIN+Unsloth)训练方法,将思考 token 减少至原来的 1/2 到 1/10,同时保持或提升推理能力。该模型在 4bit 和 8bit
DavidAU 发布了 Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF,这是一个基于 Qwen 3.6 的 40B 参数多阶段微调模型,据称在 8 位和 4 位量化下达到闭源模型(如 OpenAI、Claude)的智能水平。该
英伟达将以6亿美元收购AI初创公司Poolside的“Model Factory”软件,并吸纳其109名员工,这些员工曾参与Laguna模型的开发。此外,英伟达还将以120亿美元投前估值向Poolside投资10亿美元,三位创始人将继续留任。该交易并非传统收购或人才收购,而是通过许可技术和招聘员工来规避监管审查,英伟达此前与Groq和Enfabrica也有类
阿里最新财报显示,阿里云营收达487.37亿元,同比增长45%,经调整EBITA同比增长133%,利润率升至11.6%。增长主要来自AI算力需求激增和MaaS收入增加,同时自研芯片出货和全栈优化提升利润。阿里全栈AI布局使其在商业化中更具优势,云厂商成为AI浪潮中的受益者。
Poolside 创始人宣布,NVIDIA 以 12 亿美元获得其模型工厂授权,并雇佣了 109 名员工,创始人留任并获得 1 亿美元,员工获得 6 亿美元。Poolside 因未能及时融资 2 亿美元而失去 4 万 GB300 集群,转向新方向,其基础设施公司 PIC 计划扩展至 7GW 规模。创始人认为开源模型将商品化人类级智能,而超级智能和科学发现将成
千寻智能在2026世界机器人大会上重演了此前在WAIC展示的“整理客厅”Demo,但内部性能显著提升:可乐放入冰箱成功率从约80%提升至99%以上,碗放入洗碗机从约90%提升至99%以上,导航目标确认耗时降低近50%。这些进步源于其全栈技术体系,包括数据管线、后训练机制、Spirit v1.6基座模型、Agent决策层、导航与硬件基础设施的协同优化。千寻智能
本文提出非对称注意力头(AAH)框架,允许Transformer各头或头组使用不同长度的因果上下文窗口,同时保持标准多头注意力输出接口。在4096 token的实验中,多种AAH局部分配变体取得了比纯全注意力更低的验证损失。作者强调AAH主要作为质量与可解释性的结构化上下文分配机制,当前实现未证明GPU FLOPs减少。
RGA-Designer 是一种受 RLHF 启发的奖励引导自回归图生成方法,用于高效设计多智能体通信拓扑。它训练一个联合捕捉任务正确性和结构紧凑性的奖励模型,并以此微调预训练图生成器,在保持 ARG-Designer 任务准确率的同时,平均减少约 30% 的 token 消耗。该方法在六个基准上验证了有效性,代码已开源。
该研究提出一种方法,通过微调语言模型智能体,使人群模拟中的目的地分布与从聚合移动数据中观测到的OD流一致。研究者使用迭代比例拟合和重采样校正训练数据,避免了主导类别的过度膨胀。在棒球比赛数据上的实验表明,该方法将目的地份额误差降低了25%,且无需推理时校正。
AI 数据初创公司 Micro1 在八个月内将年度总营收从 1 亿美元提升至 5 亿美元,净营收约 1.5 亿至 2 亿美元。该公司为顶级实验室和企业提供 AI 训练数据,并越来越多地生成合成数据,毛利率可达 80%-90%。其创始人表示不向中国模型制造商出售数据,以维护美国 AI 优势。
Hugging Face 用户 wangzhang 发布了 Qwen3.8-27B-abliterated,这是基于 Qwen3.8-27B 的拒绝抑制模型,通过 10 轮迭代 LoRA 自蒸馏管道(基于 Abliterix)生成。该模型在 100 个有害提示中拒绝率为 19%,KL 散度为 0.0069,旨在用于安全研究、红队测试和对齐评估,而非有害使用或
微软研究院发布了深度学习密度泛函(DFT)模型 Skala 1.1,该版本训练数据量是前版的2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala 现已集成到 CP2K,并正在整合到 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件中,同时推出实时基准以跟踪性能。这些进展旨在使计算化学模拟更具预测性,并广泛