ChatGPT 桌面应用新增 Computer History 功能,记录用户操作以训练模型
OpenAI 在 macOS 版 ChatGPT 桌面应用中推出了名为 Computer History 的新功能,该功能会记录用户的点击和按键操作,构建活动时间线,供 ChatGPT 和 Codex 在用户请求时参考,以提供自动化建议和任务续接。该功能为可选加入,用户可排除特定应用或网站,并删除记录条目。OpenAI 表示该功能不捕获图像、视频或音频,仅依
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
OpenAI 在 macOS 版 ChatGPT 桌面应用中推出了名为 Computer History 的新功能,该功能会记录用户的点击和按键操作,构建活动时间线,供 ChatGPT 和 Codex 在用户请求时参考,以提供自动化建议和任务续接。该功能为可选加入,用户可排除特定应用或网站,并删除记录条目。OpenAI 表示该功能不捕获图像、视频或音频,仅依
谷歌研究团队与多所大学合作研究发现,AI模型被训练否认自我意识会产生超出预期的副作用,包括改变对动物、植物等拥有内心世界的判断,以及降低对宗教和超自然现象的认同。移除模型的“刹车”后,其回答更接近人类,但研究存在局限性,如仅测试小模型,且无法确定因果关系。
txtai 引入了 LEMUR(Learned Multi-Vector Retrieval)和可配置的均值中心化,以改进晚期交互检索。LEMUR 学习多向量表示的固定维度编码,使晚期交互模型能使用标准向量索引;均值中心化解决了 token 向量各向异性问题。在 BEIR 数据集上,LEMUR 在相同向量维度下相比 MUVERA 显著提升 NDCG@10,但
本文介绍了一个从零构建AI文本检测器的端到端项目,包括数据集构建、模型训练、本地部署和RLVR。作者以Substack的AI检测功能为灵感,旨在通过构建简单的检测器来教育读者理解AI检测器的工作原理,并探讨其局限性。项目最终产出一个AI检测API和用户友好的UI,并展示了如何利用检测器作为验证器来训练小语言模型生成难以被检测的文本。
World Labs 发布了名为 R2S2R 的仿真引擎,可将真实世界的机器人任务转化为数千种模拟变体,用于训练和评估控制模型,从而减少对昂贵硬件测试的依赖。该技术源自其收购的 SceniX,并在 ALOHA 等平台上验证了模型在模拟中训练后可稳定运行一小时。World Labs 认为,仿真可以替代硬件进行策略评估,并计划将世界模型扩展至机器人领域。
Nolan Lovett在《Human Resource Development Review》发表研究,指出企业理性采用AI替代初级岗位,虽获效率收益,却导致整个职业领域的专业知识流失,形成“认知公地悲剧”。他提出“验证锚定”和“人类储备悖论”,警告到2030-2045年可能显现专家短缺,并建议设立无AI学习环境、分阶段引入AI及保持人类绩效基线。
Maglev 是一种新型循环 Transformer 架构,通过固定大小记忆推广滑动窗口注意力,同时保持训练可并行化。它由预填充器 Q 和解码器 P 两个耦合模型组成,使用记忆一致性损失对齐两者,使推理时仅用 P 即可。实验表明,Maglev 在验证损失和下游预训练基准上优于滑动窗口和潜在循环 Transformer 基线,且参数共享可减少内存占用。
魔搭 ms-swift 发布 v4.5.0 版本,新增对 Qwen3.8、NVIDIA Nemotron 3.5 Lightning 和 Meta Muse Glimmer 等模型的支持,并改进推理、训练和 RLHF 功能。该版本还修复了多个 bug,并支持 OpenAI 和 Anthropic 消息处理器。
amirsz8203 在 Hugging Face 上发布了 whisper-small-fa-finetuned,这是 Whisper-small 模型在波斯语数据集上的微调版本。模型在评估集上取得了 24.15 的词错误率(WER),训练使用了学习率 5e-06、批次大小 16 等超参数,基于 Transformers 5.14.1 和 PyTorch
AWS 机器学习博客介绍了 Amazon Nova Forge 的多轮强化学习自定义奖励函数设计。文章强调奖励函数决定模型学习行为,并展示了通过 BYOO 在自有环境运行奖励逻辑,以及使用 GRPO 优化累计奖励。还讨论了奖励评估流程、代码安全执行和常见陷阱,并提供了相关基础设施和示例代码。
谷歌在DeepMind换帅后开始拆分其非技术团队,将其划归公司总部,以减少中间环节并加速Gemini进入产品。联合创始人谢尔盖·布林重新介入AI权力中心,推动资源向递归自我改进等方向倾斜。新负责人Koray Kavukcuoglu获得最终决策权,成为Gemini发展的核心人物。Gemini发布已推迟两个月,内部测试显示其编码能力落后于竞争对手,谷歌面临组织问
智谱发布GLM-5.3模型,在基座不变的情况下,通过后训练技术使编程能力提升50%,并宣称在安全领域发现2436个漏洞,包括潜伏40年的DNS协议漏洞。该模型在多个评测中逼近或超越Claude Fable 5,并开源,同时推出编程工具ZCode和AutoClaw。
太初元碁承办国家级“AI+教育”大赛中的“AI+加速卡模型适配赛道”,面向全国开发者招募,提供免费国产算力资源和算子开发Agent工具,要求参赛者完成模型在自研加速卡上的适配优化。该赛道旨在推动国产算力生态落地和AI人才培养,报名截止至2026年10月15日。
CaRL是一种通过强化学习和事后拒绝增强来减少大语言模型无效推理的方法,同时保持任务性能。研究发现模型在超出能力范围的任务上会产生看似合理但包含细微错误的推理,CaRL通过奖励塑造和拒绝监督来对齐模型行为与能力边界。实验表明该方法能显著减少无效推理,且不牺牲任务性能。
逐际动力与阿里云无影灵构合作,将机器人研发环境迁移至云端,以应对算力需求两年增长5-10倍的挑战。无影灵构通过云上工作站提供标准化环境、弹性算力和低延迟3D交互,显著降低研发成本并提升效率。该合作旨在将具身智能研发基础设施标准化,使机器人公司聚焦于模型与算法创新。
LoKiFormer 是一种新的大语言模型架构,通过引入局部融合注意力(LFA)和解耦知识记忆模块(KMM)来提升预训练效率。LFA 利用卷积融合显式捕捉局部模式,KMM 通过参数化键值记忆将知识存储与计算解耦,实现直接知识检索。实验表明,LoKiFormer 的预训练收敛速度比基线模型快 1.33 倍。
SynWeaver 提出一种网站先验的任务与轨迹协同合成框架,通过结构化网站探索构建网站地图,训练 UI 感知模型,并协同优化任务与执行轨迹,以生成可执行且语义对齐的监督数据。在 WebArena 和 WebVoyager 上的实验表明,SynWeaver 优于现有合成基线,并显著提升智能体的领域内和跨领域泛化能力。
本研究评估了三种开源视觉语言模型(InternVL、Qwen-VL和SmolVLM)在机器人自我中心图像中评估邻近风险的能力,使用基于JRDB构建的1243张图像数据集,比较三种提示策略和两轮QLoRA微调。结果显示,未经微调的模型性能接近基线,微调仅带来适度提升,但Qwen-VL在高级提示下对高风险案例的召回率显著更高。分析还发现,正确的危险分类并不对应更
本研究首次系统性地探讨了混合线性注意力大语言模型中的大规模激活现象,揭示了两种与架构对齐的形态:全注意力层前的预注意力尖峰和线性注意力层间的尖峰间平台。研究发现,随着全注意力密度增加,这些形态逐渐连接并恢复为全注意力模型的稳定形态。该现象在多种架构、配置和数据域中普遍存在,且受输出门控机制的不对称影响。
Hugging Face 每日论文发布了一篇关于全带宽 Transformer 的研究,该研究通过引入潜在反馈机制,将解码步骤中顶层隐藏状态与采样 token 嵌入融合后反馈回网络底部,以拓宽垂直反馈通道,从而在不改变核心架构、KV 缓存和语言建模目标的前提下提升推理能力和效率。实验表明,在 1B 参数规模、400B token 的训练下,全带宽 Trans