AWS 生成式 AI 定制化光谱:从提示工程到自定义模型
AWS 发布博客,提出生成式 AI 定制化光谱的 8 步决策框架,帮助团队在提示工程、RAG、微调、继续预训练和从零训练之间做出选择。框架分为 USE、ENHANCE、TRAIN 三类,并映射到 Amazon Bedrock 等 AWS 服务。核心原则是从最简单的方法开始,仅在准确率、延迟或领域需求不满足时才升级。
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
AWS 发布博客,提出生成式 AI 定制化光谱的 8 步决策框架,帮助团队在提示工程、RAG、微调、继续预训练和从零训练之间做出选择。框架分为 USE、ENHANCE、TRAIN 三类,并映射到 Amazon Bedrock 等 AWS 服务。核心原则是从最简单的方法开始,仅在准确率、延迟或领域需求不满足时才升级。
该论文提出 DataFlex-RL,一个用于在统一 GRPO 配方下比较 RLVR 数据策略(rollout 选择、重加权、领域混合)的评估平台。实验使用 Qwen2.5-7B-Base 和 Llama-3.1-8B-Base,在 12 个数学、逻辑与科学基准上测试 13 种配置、12 个匹配种子,发现均匀采样比未训练检查点平均准确率提升 7.76 个百分点
克雷数学研究所(CMI)就千禧年大奖难题之一的纳维-斯托克斯问题发表声明,称该问题“显然已被解决”,解决方案目前正在审查中。数学家 Tristan Buckmaster 指控 OpenAI 在有关其研究的传闻泄露后,将资源转向该问题,将其草稿用于训练数据,并拒绝其合著者、就职于 Anthropic 的 Levent Alpöge 署名。CMI 表示审查过程刻
另有 1 家信源报道
Hugging Face 上发布了 GigaChat 系列的新文本嵌入模型 Giga-Embeddings-instruct-3B-0826,基于 Qwen3 架构(36 层、hidden 2048、约 3B 参数),将自注意力改为双向 encoder 风格,并用 InfoNCE 对比损失训练。模型采用 mean pooling + L2 归一化,支持俄语和
微软GitHub副总裁Scott Hanselman在播客中提出,随着AI代理承担初级开发者原本的训练任务,软件行业应借鉴护理行业的导师制,设立专职培训新工程师的导师,并以培训效果而非代码产出作为考核标准。他指出AI擅长生成功能但架构设计能力差,工程师需作为审查者和协调者保持人类判断。他还警告企业过度追求短期优化会忽视人力资本和导师制投资,导致初级工程师培养
该论文提出 Feyospace-v1,一个以数据为中心的后训练框架,通过 Choulea、SkyReal、Hongzwang、PSBreakup、Kreator 五个系统解决可执行环境成本、多轮监督与教师模型获取等瓶颈。团队构建可重置的代码、漏洞、CTF、内核、固件等环境,经执行验证与证据审计后保留 164,269 条轨迹用于长上下文监督微调。三个检查点在
Hugging Face 用户 violetxi 发布了一个 92M 参数的 Block-MTP 模型检查点(step 235000),基于 transformers 库,支持文本生成,标签涉及国际象棋、block-mtp 和截断 BPTT。该模型采用三路循环打分机制,每次生成三个 token 的块,不支持 KV 缓存和束搜索,上下文为 1024 个逻辑 t
OpenAI CEO Sam Altman 呼吁为先进 AI 建立全国统一的安全框架,并主张行业不应等待立法者,同时表示 OpenAI 现在会在可能带来重大能力跃升的训练前设定明确的安全协议。他强调“放缓”不等于“停止”,AI 进步仍将保持快速。周末 Anthropic CEO Dario Amodei、前 DeepMind CEO Demis Hassab
元空智能(元空AI)发布端侧模型Boxer、办公Agent元空AI Work和科研Agent元空AI Science,提出「生产力=模型×Agent×设备」的端侧AI公式,主张设备是持续产生稀缺数据的环境,让模型与设备共同进化。其Boxer-35B-A3B-v0-0819在自建WorkArena评测中得73.1分,并在40 TOPS、不到8GB内存占用下保留
OPPO 小布助手团队提出 InitGen 框架,用于智能助手在用户表达意图前生成候选交互查询。该方法联合生成候选集合并通过加权偏好优化对齐用户反馈,权重来自用户活跃度和下游排序分数,同时采用滚动窗口更新策略。在线 A/B 测试中,点击率从 0.95% 提升至 1.61%(相对提升 69.1%),查询曝光量增加 17.9%,完整候选集生成耗时 180 毫秒,
该研究探讨代码大语言模型能否完全离线进行强化学习后训练,而不依赖在线采样。作者在Qwen Coder、DeepSeek Coder和CodeLLaMa等0.5B至7B参数模型上,使用CodeNet数据集进行实验,发现仅需数小时训练即可显著提升零样本代码生成性能。研究还发现离线RL对学习率和训练轮数高度敏感,长时间训练会导致模型崩溃,其主因是logit方差而非
CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家高校发布MetaRSI-v1,称其为全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,可改进自我改进过程本身。在无外部教师模型参与下,30亿激活参数小模型在四项基准平均自我提升10.9分,GPT-5.6、Claude Opus 5等六款前沿模型平均提升7.3
该论文提出 Latent Interface Training(LIT),一种与框架无关的两阶段训练策略,用于提升机器人基础模型在视觉分布偏移下的动作泛化能力。第一阶段在不使用图像的情况下,基于语言、机器人状态和末端执行器 SE(3) 位姿训练动作先验;第二阶段引入受位姿监督的潜在接口,作为预训练动作专家唯一的视觉条件通路。在 Pi0.5、MolmoAct2
智谱在港交所公告配售新H股并发行201.4亿元人民币零息可转债,合计预计净募约393亿港元,上市不到九个月累计净募约755亿港元。约60%资金将投入下一代GLM基础模型和“完全自训练”体系研发,该体系被定义为递归式自我改进闭环,涵盖数据自产、环境自造、基础设施自我优化三个维度。公告还预告GLM-6.0将提升有效规模、原生多模态统一建模和长程任务强化学习能力,
一位作者在 Hugging Face 博客中回顾自己从使用 ChatGPT 转向开源模型 DeepSeek 和 Qwen 的经历,并分享了自己尝试训练超小模型(如 Single Floppy、floppyx3、floppyx4)的失败过程。作者认为开源模型可检查内部机制,比闭源服务更可信,并提到因图书馆屏蔽 DeepSeek 而短暂使用 Claude,但受限
智谱宣布完成约50亿美元(约合人民币335.4亿元)融资,包括约20亿美元股份配售及约30亿美元零息可转债,资金约60%用于下一代GLM基础模型与完全自训练体系研发,重点探索递归式自我改进(RSI)循环。公司披露2026年上半年营收9.54亿元、同比增长近400%,MaaS及API收入8.25亿元,ARR达16亿美元。此举反映国产大模型头部厂商融资与上市竞赛
中国实验室 AllSpark 发布开源搜索智能体 Iris-mini(350 亿参数)和 Iris-pro(3970 亿参数),基于 Qwen 系列模型,支持 256K 上下文,并公开完整训练配方。训练数据从网页链接结构反向构造多步问题,经两阶段过滤和强化学习(SFT-RL climbing)优化。团队称两者在各自规模的开源搜索智能体中表现最强,并指出运行时
Hugging Face 上出现了一个名为 kikusuka/breezy-78m-pretrain 的模型,由 Trainer 自动生成模型卡。该模型是基于 generator 数据集微调的 78M 参数版本,但模型描述、预期用途和评估结果均未填写。训练使用 AdamW 优化器、余弦学习率调度和原生混合精度,共 50000 步。
斜跃智能完成数亿元天使+轮融资,投资方包括线性资本、钧山资本、弘颐资本、隐山资本等。公司由理想前AI首席科学家陈伟与前产品线总裁张骁联合创立,以家庭为第一落地场景,推进Duplex Reasoning范式驱动的具身基础模型。资金将用于具身基础模型训练、算力与数据基础设施建设、核心团队扩充及家庭机器人本体研发和场景验证。
开发者 DavidAU 在 Hugging Face 发布 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF,这是基于 Qwen3.8 27B 的多阶段微调与合并模型,提供常规与 MTP 的 Neo/NEO MAX GGUF 量化版本。模型宣称在 arc