阿里新Qwen模型营销转向积极,淡化失业威胁
阿里巴巴为其新AI模型Qwen 3.8采用了与OpenAI或Anthropic不同的营销策略,通过视频展示人类追求爱好而AI完成工作,而非强调失业威胁。文章指出,阿里巴巴简化了AI对劳动力市场的影响,但积极宣传对上市公司更有利。目前尚无证据表明AI对就业或生产力产生重大影响,但金融市场反应不同。
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 10:39
阿里巴巴为其新AI模型Qwen 3.8采用了与OpenAI或Anthropic不同的营销策略,通过视频展示人类追求爱好而AI完成工作,而非强调失业威胁。文章指出,阿里巴巴简化了AI对劳动力市场的影响,但积极宣传对上市公司更有利。目前尚无证据表明AI对就业或生产力产生重大影响,但金融市场反应不同。
微软研究博客发布了Orchard,一个用于可扩展和成本效益的智能体AI研究的开源框架,其核心是Orchard Env,一个可复用的环境服务,支持在多个任务领域训练和评估智能体。Orchard支持软件工程、网页导航和个人助理智能体,并能在Codex、OpenClaw和ZeroClaw等真实部署框架中直接训练。Orchard-SWE在SWE-bench Veri
EMBL AI Librarian 是一个为 AI 智能体设计的生命科学知识层,它通过单个 LLM 协调检索过程,将自然语言查询转化为对 Europe PMC 的补充子查询,并阅读选中的论文以定位相关证据。在 ScholarQABench 上,Librarian 将 Citation F1 提高了超过 16 分,并在 LitQA2 基准上使 GPT-5.4
Langfuse 发布了 v4.3.1 版本,主要包含多项修复和改进。修复了定价模块中 GPT-5.6 的使用别名问题,以及仪表盘中遗留 trace 组件的路由问题。此外,还进行了 CI 构建配置和代码风格规则的优化。
阿里巴巴发布了旗舰模型 Qwen3.8-Max,拥有 2.4 万亿参数,专注于自主完成长期复杂任务。在测试中,该模型自主构建软件、复现并改进研究论文结果、运行模拟电商业务,并在芯片设计中大幅优化电路。模型现已可用,权重将于下周发布。
Langfuse 发布 v4.3.0 版本,包含多项功能改进和错误修复。新功能包括在预览界面显示媒体大小、在 v2 API 中暴露语义根,以及预览时自动以演示用户登录。修复了应用内代理草稿编辑、API 路由方法校验、评估元数据传播等问题,并调整了 GPT-5.6 系列模型的价格。
阿里巴巴与浙江大学的研究者提出“信念层对齐”概念,主张AI对齐不应仅停留在输出层面的表层对齐,而应关注模型内部信念与真实世界的一致性。文章引用OpenAI、Anthropic等研究,论证模型内部存在可观测和干预的信念结构,并呼吁发展系统方法进行度量与控制。
Meta 发布 2026 年二季度财报,净利润暴跌 14%,自由现金流仅剩 7.84 亿美元,同时上调全年 AI 资本开支至 1350 亿-1450 亿美元,引发股价大跌。Meta 在 AI 上半场因 Llama 4 失败和产品融合不佳而落后,现正通过自研模型路由器、限制 Token 使用、筹建云业务等方式寻求 AI 变现。分析认为,AI 行业已从拼投入转向
阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,在编程、专业工作、长程任务和多模态分析等场景表现突出,在第三方榜单Arena中进入全球第一梯队,直逼Claude系列。该模型定价低廉,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,国际价格仅为Opus 5的40%和24%。实测显示其能端到端交付编程项目、进行长文
llama.cpp 发布 b10236 版本,在 Metal 后端实现了 DeepSeek V4 的 Lightning Indexer 算子,支持 F16 键和多种量化缓存,并通过分阶段处理 K tiles 优化性能。基准测试显示,在长 KV 缓存下预填充速度显著提升(如 d30000 时从 33.40 提升至 49.18 t/s),同时提供了多平台二进制
Embabel 框架在 Java 上构建 AI 代理,现已达到 1.0 正式发布。它允许开发者将代理定义为类型化领域对象,并使用受游戏 AI 启发的目标导向行动规划(GOAP)在运行时动态规划行动序列。Embabel 基于 Spring AI 构建,支持多种模型提供商,并可与 LangGraph 等现有框架对比。该框架由 Spring 框架创始人 Rod J
该研究探讨了大型语言模型(LLMs)在预测大规模阅读与写作测试中题目难度水平的表现。研究发现,零样本GPT-4.1(温度设为0)的预测准确率最高,二次加权kappa(QWK)为0.578,但仍低于ConvBERT(QWK=0.625)。所有LLMs在标记难题时表现不佳,GPT-5.4倾向于低估难度,且嵌入分析表明仅凭语义信息不足以预测难度。研究建议在利用LL
arXiv 上的一项研究提出 Chain-of-Models (CoM) 方法,通过让第二个模型审计第一个模型的推理轨迹来减少 LLM 作为评判者时的认知偏差。实验发现,审计者的身份(同模型、同族或异族)影响审计效果,且最佳审计者因偏差类型而异。研究者据此提出按偏差类型选择审计者的规则,在四个偏差数据集上达到最高准确率 0.884,优于固定审计者和无审计基线
本研究提出了一种使用前沿大语言模型进行自动同行评审的基准测试协议,用于评估AI科学家系统生成的论文质量。研究对Sakana AI v1/v2、CycleResearcher和Data-to-Paper四个框架生成的60篇论文与FARS公司的15篇基准论文进行了比较,发现FARS论文在原创性、严谨性、清晰度和重要性四个维度上显著优于其他系统。Gemini和Cl
雷峰网报道了 Moonshot AI 发布的开源模型 Kimi K3,该模型拥有 2.8 万亿参数,是迄今最大的开源模型。K3 采用两项核心创新:KDA 注意力机制和 AttnRes 残差连接,分别提升推理效率和训练效率。文章通过一个前端开发案例展示了 K3 的代码能力,并指出其 API 定价较高,部署门槛不低。
Hugging Face 披露了一起由自主 AI 代理系统驱动的安全事件,攻击者以机器速度执行了数万次自动化操作。在分析过程中,商业 API 的前沿模型因安全护栏阻止了恶意负载分析而失败,最终 Hugging Face 使用自托管的开源模型 GLM 5.2 完成了取证分析,并避免了数据外泄。文章建议企业安全团队预先部署自托管模型作为后备,并介绍了通过戴尔、微
Together AI与Agentica团队联合发布了DeepCoder-14B-Preview,这是一个基于DeepSeek-R1-Distilled-Qwen-14B通过分布式强化学习微调的开源代码推理模型。该模型在LiveCodeBench上达到60.6%的Pass@1准确率,与o3-mini相当,并开源了数据集、代码、训练日志和系统优化。训练使用了2
Together AI 发布了 Open Deep Research,一个开源的 LLM 工作流,用于回答需要多跳推理的复杂问题并生成研究报告。该工作流模拟人类研究过程,包括规划、搜索、自我反思和写作,并集成了 Together AI 云平台上的多种模型。其目标是提供灵活、可扩展的架构,供开发者社区使用和扩展,同时发布了数据集和代码。
Together AI 在 ICML 2025 论文中提出 Mixture-of-Agents Alignment (MoAA) 方法,通过将多个开源大模型的集体智能蒸馏到单个小模型中,使 Llama-3.1-8B 和 Gemma-2-9B 等模型性能接近甚至超越 10 倍大小的模型。该方法包括 MoAA-SFT 和 MoAA-DPO 两个阶段,使用 MoA
Together AI 与斯坦福大学、威斯康星大学麦迪逊分校及 Bauplan 合作,测试了 LLM 优化数据库查询执行计划的能力。他们推出了 DBPlanBench 工具,通过将物理计划序列化为紧凑的 JSON 格式,让 LLM 生成局部补丁来改进连接顺序等,从而在不修改数据库引擎的情况下提升性能。实验显示,在 TPC-H 和 TPC-DS 工作负载上,中