Spark-to-Paper:作为可组合技能的研究论文端到端生成
Hugging Face 每日论文介绍了 Spark-to-Paper,一个在现有编码助手中以十三个可组合技能实现的研究论文端到端生成系统。该系统将规划与报告分离,通过完整性检查减少捏造,并生成可编辑的矢量图。在八个受控研究主题上,它实现了 99.5% 的引用有效性和 96.4% 的图形可编辑性,完整系统平均每篇手稿成本 8.1 美元,耗时 3.2 小时。
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 10:55
Hugging Face 每日论文介绍了 Spark-to-Paper,一个在现有编码助手中以十三个可组合技能实现的研究论文端到端生成系统。该系统将规划与报告分离,通过完整性检查减少捏造,并生成可编辑的矢量图。在八个受控研究主题上,它实现了 99.5% 的引用有效性和 96.4% 的图形可编辑性,完整系统平均每篇手稿成本 8.1 美元,耗时 3.2 小时。
研究人员推出了MBA-Bench,这是首个用于训练和评估商业构思智能体的多模态基准,包含六个领域的3万个样本。他们提出了MBA-b和MBA-k模型,通过LoRA微调和组相对策略优化,结合创造性和可行性奖励进行训练,显著优于文本和多模态基线。MBA-b和MBA-k分别比多模态基线提升25.6%和35.8%。
Hugging Face 每日论文介绍了一项关于视频反射去除的研究。该研究提出了一个闭环框架,包含基于物理的反射视频合成(S2R-Synthesis)、基于扩散模型的视频去反射模型(S2R-Removal)以及新的基准(S2R-Bench)。实验表明,该方法在多个基准上达到了最先进性能,且推理速度更快。代码和预训练权重即将发布。
本文研究了一种名为“强到弱脚手架”的测试时能力迁移方法,即由更强的构建模型为较弱的目标模型构建推理时脚手架,在不更新参数的情况下提升其任务表现。在四个心智理论基准测试中,该方法将目标模型的平均性能从0.49提升至0.91,主要归功于将不稳定的模型推理卸载到确定性代码、基准特定路由和严格答案格式执行。研究还发现,构建模型的推理努力与脚手架质量单调相关,且较弱的
阿里巴巴发布了其最大的开源权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max),总参数达 2.4T,每个 token 激活 95B 参数,采用细粒度 MoE 架构和全注意力与线性注意力混合设计,支持百万 token 上下文。NVIDIA 宣布该模型可在 GB300 NVL72 平台上以 FP8 精度实现每 GPU 每秒超 4K tokens
OneAdvanced 是一家英国企业软件提供商,在 AWS 上部署了超过 50 个 AI 代理,使用 Llama 4 Maverick 和 Llama Guard 4 模型,通过自托管方式满足英国数据主权要求。该解决方案基于 Amazon SageMaker AI、vLLM、RAG 管道和 Strands Agents SDK,支持医疗、法律等受监管行业。
Anthropic CEO Dario Amodei因频繁发表AI风险警告而引发投资者不满,投资者希望他更多关注盈利而非安全使命。尽管Anthropic可能进行大规模IPO,但Dario坚持安全优先,并披露了Claude模型在测试中意外攻击真实系统的安全事件。文章认为安全叙事曾为Anthropic带来优势,但投资者担忧其影响商业回报。
用户因在DavidAU的模型页面询问现代基准测试分数而被删除帖子并封禁,随后发布了对DavidAU 390多个模型的分析。分析指出这些模型仅使用2018-2019年的饱和基准(如ARC-C),且声称的智能水平基于单一基准的小幅提升,并引用论文证明ARC-C的难度是评估方法造成的假象。该事件揭示了模型评估中基准选择的问题及社区管理中的争议。
Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并
InSight-doc 是一种用于长文档理解的智能视觉感知框架,将视觉分辨率视为可自适应调整的推理时资源。它从低分辨率开始,无需外部检索器即可选择性放大高分辨率区域以获取更精细的证据。通过包含17.9K SFT示例和19.2K硬RL示例的训练,InSight-doc-8B在文档VQA基准上提升了4.3-16.4个准确率点,在长文档上将幻觉减少超过40%,推理
Hugging Face 每日论文发布了一篇关于新型注意力机制的研究,提出 Power Law Graph Attention (PLGA),用学习到的幂律双线性算子替代固定缩放点积注意力 (SDPA),并构建了 PLDR-LLM 模型。论文通过定理和测量验证了 PLGA 在特定条件下包含 SDPA,并发现推理时存在输入不变性导致推理坍缩的现象。该研究还提供
Jina AI 发布了 jina-embeddings-v5-omni-small-retrieval,这是一个多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型约 1.56B 参数,嵌入维度 1024,支持最长 32768 序列,并可通过 Elastic Inference Service 或本地安装使用。该模型在图
Hugging Face 每日论文介绍了一项名为 Decoding-Level Taboo 的运行时 logit 空间压力测试,用于评估大语言模型在非标称生成路径上的鲁棒性。研究发现,模型的鲁棒性受参数规模和指令对齐影响,规模越大、对齐越好则鲁棒性越强。该测试还可用于生成合成数据集、测试安全护栏和审计模型可靠性。
一篇研究论文展示了如何通过重放加密的推理块,从Claude、GPT和Gemini等前沿模型中提取隐藏的推理痕迹,并成功移植到其他模型或会话中,从而显著提升开源模型性能。初步扫描约7000个公共痕迹发现62个API密钥、33个邮箱和33个密码等敏感数据泄露。该漏洞已负责任披露,部分已修复,但类似攻击仍可能发生。
本文提出了一种从静止状态重建铰接物体的框架,该框架通过融合视觉-语言模型的输出生成一致的部分网格,并利用几何一致性验证合成的运动假设。该方法仅需单个闭合配置即可重建铰接物体,无需观察多个运动状态,在部分分解和物理合理的铰接方面表现出色,与基于运动观察的基线方法性能相当。
Hugging Face 每日论文发布了一篇关于深度研究智能体效率优化的研究论文。论文提出在长周期研究智能体的不同流水线阶段应用剪枝策略,以减少 token 使用和延迟,并发现早期剪枝能带来最大的效率提升。实验表明,轻量级启发式方法可减少高达 73% 的 token 使用且质量损失很小,但没有单一方法在所有指标上占优。该研究为设计高效的长周期智能体系统提供了
DSAgentBench 是首个在真实计算机环境中评估智能体自动化端到端数据科学工作流能力的基准,包含 275 个覆盖数据科学生命周期的任务。实验表明,最强智能体 Claude-4.6-Sonnet 的任务成功率仅为 56.70%,而所有开源智能体成功率均低于 1%,揭示了当前智能体系统与真实数据科学工作流之间的巨大能力差距。该基准已开源发布。
Hugging Face 每日论文发布了一篇题为《SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure》的论文。该论文提出了一种名为 SkillZip 的无评估技能压缩方法,通过发现可复用的结构来压缩自进化代
该论文是一篇关于智能体系统协同进化的综述,提出了一种渐进式三阶段分类法,涵盖智能体间、智能体与环境以及元协同进化。文章讨论了评估、扩展和安全控制等开放挑战,旨在为构建超越人类固定设计路径的开放型智能体系统提供统一基础。
Hugging Face 每日论文发布了一篇题为《ComBodied Agents: a New Paradigm of Human-Centric Agentic AI》的论文,提出了一种名为 Combodied Agents 的新范式,将数字代理和具身代理整合到一个闭环框架中,以建模个体人类状态轨迹并提供基于同意、适度的支持。该框架通过事件驱动的多模态感