三星收缩中国手机业务;阿里发布Qwen3.8-Max;DeepSeek日处理8万亿Token
三星被曝收缩中国手机业务,将清退月销售额不足30万元的门店,以应对市场份额仅0.1%的困境。阿里巴巴发布Qwen3.8-Max模型,带动港股上涨,并推出千问办公产品。DeepSeek V4 Flash单日处理8万亿Token,OpenAI被迫降价。智元官网披露合伙人团队,蚂蚁灵波确认融资传闻,MiniMax H3开源获多芯片适配。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2503 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
三星被曝收缩中国手机业务,将清退月销售额不足30万元的门店,以应对市场份额仅0.1%的困境。阿里巴巴发布Qwen3.8-Max模型,带动港股上涨,并推出千问办公产品。DeepSeek V4 Flash单日处理8万亿Token,OpenAI被迫降价。智元官网披露合伙人团队,蚂蚁灵波确认融资传闻,MiniMax H3开源获多芯片适配。
DSPy 3.3.0 发布,引入实验性 Flex 优化器,可优化程序结构而非仅提示词;新增原生工具感知的 ReActV2,支持并行工具调用和多轮工具历史,成本降低达 50%;推进类型化、供应商中立的 LM 接口,并解耦 LiteLLM。现有程序大多无需更改,但部分 API 有调整。
Vibe coding 初创公司 Superblocks 与 AWS 达成多年联合营销协议,使其工具可嵌入 AWS 客户的私有云中,确保数据不离开企业环境,并集成 Amazon Bedrock 和 Aurora 数据库。AWS 将帮助销售 Superblocks,这反映了超大规模云提供商推动企业采用多云模型和自有 AI 基础设施的趋势。Superblocks
LiteLLM 发布了 v1.96.0-rc.1 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签进行验证的方法。此版本包含多项修复和功能更新,涉及 MCP 工具调用、代理管理、UI 改进、类型检查和依赖升级等。这些更新旨在提升系统的稳定性、安全性和用户体验。
Azure 首席工程师 Kishorekumar Pattabiraman 在 Azure 架构博客中提出了在构建 AI 系统时选择技能(skill)或子代理(sub-agent)的实用标准,强调可重用性、简单性和长期可维护性。他指出了四个关键维度:迭代模型、语音保真度、人工门控位置和任务重复频率,并讨论了社区中关于两者权衡的讨论。文章还提到,在实践中技能和
Together AI 的研究团队提出了一种名为 Minions 的方法,通过让小型端侧模型与云端前沿模型协作,将大量 LLM 工作负载转移到消费设备上,仅本地读取长上下文,从而降低云成本且几乎不损失质量。实验表明,Minions 在保持 97.9% 准确率的同时,成本仅为云端方案的 17.5%。该方法通过分解-执行-聚合循环,解决了小模型长上下文和多步指令
Formula 1与AWS合作构建了Data Accelerator解决方案,利用Amazon Bedrock AgentCore上的代理AI,将MarTech数据平台从手动维护转变为自动化管理。该方案将数据源接入时间从6-8周缩短至约40分钟代码生成加数小时部署,并实现了自动化的GDPR分类、异常检测和端到端可观测性。F1的IT总监和数据运营负责人强调了该
阿里巴巴为其新AI模型Qwen 3.8采用了与OpenAI或Anthropic不同的营销策略,通过视频展示人类追求爱好而AI完成工作,而非强调失业威胁。文章指出,阿里巴巴简化了AI对劳动力市场的影响,但积极宣传对上市公司更有利。目前尚无证据表明AI对就业或生产力产生重大影响,但金融市场反应不同。
微软研究博客发布了Orchard,一个用于可扩展和成本效益的智能体AI研究的开源框架,其核心是Orchard Env,一个可复用的环境服务,支持在多个任务领域训练和评估智能体。Orchard支持软件工程、网页导航和个人助理智能体,并能在Codex、OpenClaw和ZeroClaw等真实部署框架中直接训练。Orchard-SWE在SWE-bench Veri
Google 与 Kaggle 合作推出“5 天 AI 智能体:Vibe 编码强化课程”,吸引了超过 35.3 万名注册学员,其中 39.2 万人在 Discord 上活跃互动,收到 6000 多个项目提交。课程旨在通过自然语言编程(vibe coding)教授生产级 AI 智能体的设计、安全与部署,所有内容仍可在 Kaggle Learn 上自学。
EMBL AI Librarian 是一个为 AI 智能体设计的生命科学知识层,它通过单个 LLM 协调检索过程,将自然语言查询转化为对 Europe PMC 的补充子查询,并阅读选中的论文以定位相关证据。在 ScholarQABench 上,Librarian 将 Citation F1 提高了超过 16 分,并在 LitQA2 基准上使 GPT-5.4
研究人员开发了一种利用开源大语言模型的自复制计算机病毒原型,该病毒能利用被感染机器的GPU资源进行推理,并自主发现漏洞、发起攻击和复制自身。该研究由多伦多大学、剑桥大学等机构完成,展示了AI驱动的自主网络威胁已成为现实。研究者认为未来互联网将充满攻防AI代理,需要人类部署防御性AI代理来对抗。
Cloudflare 发布了 @cloudflare/computer 的早期预览版,这是一个开源代理运行时,为每个代理提供虚拟文件系统和多种执行环境(如隔离环境和容器),以解决传统容器化在扩展性上的不足。该包基于 Cloudflare Workers 的隔离技术,支持水平扩展和高效计算,旨在帮助开发者构建大规模代理系统。
阿里巴巴发布了旗舰模型 Qwen3.8-Max,拥有 2.4 万亿参数,专注于自主完成长期复杂任务。在测试中,该模型自主构建软件、复现并改进研究论文结果、运行模拟电商业务,并在芯片设计中大幅优化电路。模型现已可用,权重将于下周发布。
xAI 发布了其最先进的模型 Grok 4.5,专为编码、智能体任务和知识工作设计。该模型在数万块 NVIDIA GB300 GPU 上训练,强调数据过滤和强化学习,以提升推理效率和编码能力。Grok 4.5 已集成到 Grok Build、Cursor 和 SpaceXAI 控制台,定价为每百万输入 token 2 美元、输出 token 6 美元,并宣称
微软于2026年4月2日将Agent Framework升级至1.0正式版,并在Build 2026大会上发布了Agent Harness、GitHub Copilot SDK和Claude Agent SDK连接器,以及多智能体编排模式,均达到稳定版本。该框架提供统一的运行时,支持本地、容器和托管部署,并内置OpenTelemetry等治理功能。MBZUA
前 Salesforce 高管 Efrat Rapoport 创立的初创公司 June 于周一正式亮相,旨在通过自动扫描企业现有系统、识别瓶颈并构建优化的 AI 代理流程,解决 AI 在企业部署中的难题。该公司已获得由 Marc Benioff 旗下 Time Ventures 领投的 2000 万美元种子前融资,其他投资者包括 Michael Dell、A
Meta 推出 Muse Spark,这是 Meta Superintelligence Labs 开发的首个原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排。该模型在 meta.ai 和 Meta AI 应用中可用,并开放了私有 API 预览。Muse Spark 在多项任务上表现强劲,其 Contemplating 模式通过并行多智能体推理,在
Cohere 发文指出,企业 AI 总拥有成本(TCO)正随使用量上升,token 定价仅是显性成本,隐藏成本包括推理、上下文、代理步骤等。Gartner 预测 2026 年全球 AI 支出达 2.52 万亿美元,IDC 调查显示 96% 的生成式 AI 部署成本超预期。Cohere 建议企业区分自有与租用 AI 基础设施,以控制成本并实现可预测的财务规划。
ExtractBench 是一个用于评估模式引导的企业文档提取任务的基准,包含 370 份企业文档、4869 页内容,覆盖 8 个业务领域和 67 种文档类型。该基准首次同时评估值准确性、记录完整性、溯源性和成本。研究发现商业 VLM 在短文档上表现良好但在长文档上会截断记录,而编码代理虽准确率高但成本更高,LlamaExtract Agentic Plus