DFT-GEN:面向阅读障碍教育文本的保真视觉可访问性框架
香港理工大学的研究团队提出了DFT-GEN框架,用于在面向阅读障碍学生的教育文本中保持信息保真度的同时提升视觉可访问性。该框架结合了受保护跨度保留和确定性阅读障碍可访问性控制器(DAC),并在2280个双语考试题目上进行了评估,结果显示在视觉可访问性方面优于对照组,同时保持了任务关键信息。
技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
香港理工大学的研究团队提出了DFT-GEN框架,用于在面向阅读障碍学生的教育文本中保持信息保真度的同时提升视觉可访问性。该框架结合了受保护跨度保留和确定性阅读障碍可访问性控制器(DAC),并在2280个双语考试题目上进行了评估,结果显示在视觉可访问性方面优于对照组,同时保持了任务关键信息。
顶级数学家Timothy Gowers和Peter Sarnak认为,大型语言模型在数学计算方面表现出色,但在创造性思维上存在局限。Gowers指出,模型擅长组合已知方法和探索多条路径,但缺乏在广阔搜索空间中选择有效路径的直觉。Sarnak补充说,AI能从现有理论推导结果,但无法从基本问题出发发展出支撑重大证明的抽象概念。DeepMind研究员Tom Zah
本文提出 MAS-DecStream 系统,其核心是 LLM-MR-CNP 协议,扩展了经典合同网协议,引入语义化 CFP 生成、渐进式上下文披露、多轮提案修订、协商记忆和确定性验证。实验基于阿里 ASI 追踪数据,结果显示该方案将延迟违规率降至 3%,消除资源过度承诺,在 20 个代理下冲突解决率达 0.91,效用相比多轮规则基线提升最多 22%。研究表明
Simon Willison 在其博客中介绍了一种利用 LLM 进行内容标签化的新方法。该方法不直接让模型从现有标签列表中选择,而是先让模型自由生成可能的标签,再通过向量嵌入与现有标签库匹配,找到最接近的具体标签。Doug Turnbull 提出了这一解决方案,并建议在提示中提供标签形状示例以提升效果。
该论文提出了一种混合流水线,结合基于大语言模型的性别分类与标签感知的神经机器翻译,以缓解英语到罗马尼亚语机器翻译中的性别偏见。系统通过微调的LLM检测目标词的性别并插入提示标签,再由微调的Transformer模型生成形态正确的罗马尼亚语翻译。在WinoMT和WinoGender基准上,性别准确率相比基线系统提升了超过40个百分点。这是首个显式解决并评估英罗
麦吉尔大学的研究人员提出一个基准测试,评估大语言模型在无通信、单轮博弈中的协调能力,并与纳什均衡对比。结果显示,两个前沿托管模型在双人矩阵游戏中持续超过纳什基准,接近最优联合结果,而多数开源模型仅获得部分收益,且在四人及以上团队游戏中性能显著下降。该研究为多智能体系统的去中心化协调提供了新见解。
本文提出 Distribird 方法,利用大型语言模型(LLM)自动搜索科学文献并提取数值,为贝叶斯模型校准构建可追溯的信息先验分布。该方法解决了传统均匀先验不充分且文献调研成本高的问题,同时克服了直接提示 LLM 生成先验缺乏可追溯性和引用的问题。研究表明,Distribird 能提供有据可依的先验,提高校准效率与可靠性,并确保科学研究的可审计性和归因。
本研究首次系统性地探讨了混合线性注意力大语言模型中的大规模激活现象,揭示了两种与架构对齐的形态:全注意力层前的预注意力尖峰和线性注意力层间的尖峰间平台。研究发现,随着全注意力密度增加,这些形态逐渐连接并恢复为全注意力模型的稳定形态。该现象在多种架构、配置和数据域中普遍存在,且受输出门控机制的不对称影响。
一项研究通过构建4200篇改写论文和超过42000次AI评审,系统分析了修辞框架对AI科学评审分数的影响。研究发现,证据框架和新颖性立场对评分影响最大,且效果受评审者身份、原始分数和评审严格程度影响,而非改写复杂度。研究还发现,更复杂的改写流程并不总能带来更大收益,并建议构建对内容保持性写作变化鲁棒的评估系统。
该论文提出一种在笔记本电脑上模拟大规模LLM智能体社会的方法,通过用低参数代理模型替代每个LLM智能体,这些代理模型从数百到数千次廉价查询中拟合而来。研究引入了一个交互顺序×记忆的分类法,用于预测替代误差的N趋势,并在EconAgent等八个LLM模拟中验证了该方法的有效性。
另有 1 家信源报道
本文首次将扩散语言模型(DLMs)引入无损文本压缩领域,以替代自回归LLM的逐符号生成瓶颈。作者设计了符号提交调度和初始上下文策略,解决DLM在压缩中的算法挑战。在enwik8基准上的实验表明,该框架在压缩率和吞吐量权衡上优于现有神经压缩方法,并具有进一步改进的潜力。
该研究通过对照实验发现,商业AI检测器无法区分AI辅助编辑与完全由LLM生成的文本,导致合规使用AI辅助写作的学生面临更高的处罚风险,而使用人类化工具规避检测的作弊行为却几乎无法被识别。研究分析了2013-2015年与2023-2025年四个领域的642篇摘要,发现未修改的2023-2025年原文被误报率为9-15%,非STEM领域更高,而经Undetect
该研究通过控制实验比较了六种工具架构对编码智能体行为的影响,涉及三个模型和11,700条轨迹。结果显示,即使工具能力相似,架构也会改变智能体行为:结构化低级接口提高一致性,自然语言搜索扩大探索范围,Python CodeAct风格接口减少41.6%步骤和56.3%令牌使用,而轻量级认知脚手架工具影响有限。
Sci-Surf 是一个面向科学文献发现的意图中心系统,结合了反馈驱动的个性化推荐与多模态博客式论文摘要。该系统通过 LLM 用户画像细化意图表示,并生成融合文本和视觉信息的结构化摘要。真实用户评估显示,引入口头化画像使预测对齐度平均提升 10.4%。
本研究探讨了大型语言模型(LLM)在巴西通用数据保护法(LGPD)背景下简化需求工程(RE)的潜力。研究开发并评估了一种基于检索增强生成(RAG)的系统,利用LGPD文本和ANPD指南,通过少样本提示和思维链技术自动生成用户故事和验收测试场景。评估结果显示高性能,证实了LLM能从软件初始阶段确保法规合规,弥补了现有研究多聚焦GDPR且偏重事后验证的空白。
本研究首次大规模实证探究心理影响策略(如理性说服、奉承、交换等八种)对LLM代码生成的影响,基于Yukl & Falbe的分类法构建提示模板,在五个开源模型和两个基准上评估。结果显示,强调紧迫性的提示框架会降低代码的正确性和安全性。研究为设计透明可解释的人机交互提供见解。
根据Pangram、OpenRouter和Similarweb的最新数据,谷歌的Gemini在AI市场份额上持续下滑,从12%降至1.9%,而OpenAI的ChatGPT保持50%以上份额,Anthropic的Claude从4.3%升至14.9%。Similarweb显示谷歌网站市场份额微降,但同比仍大幅增长。数据来源各有局限,但均指向Gemini使用率下降
作者撰写了一本关于强化学习人类反馈(RLHF)的教科书,并反思了AI在长篇非虚构写作上的停滞。他认为,尽管模型在编码和数学上进步显著,但在组织知识、保持连贯性方面仍显不足,这限制了AI在科学发现中的自主性。作者对AI作为辅助工具持乐观态度,但认为其尚需人类引导。
擎羽科技发布三款仿生柔性机器人FEAGINE A01、A02、A03及第一代跨本体基础模型Fi0,旨在通过柔性本体和跨本体智能,让任务知识与世界理解在不同机器人身体间复用。公司认为人形并非唯一路径,柔性本体可拓展近人交互与复杂动作边界,为机器人进入真实生活空间提供新方案。
该研究对大型语言模型在民主审议中的推理能力提出实证批评,指出其能力不能从可验证任务基准推断。通过应用政治学中的审议理性指数(DRI),对1980次五智能体LLM运行进行分析,发现LLM群体的程序性话语质量接近人类,但视角多样性仅约为人类的三分之一,且审议过程呈现发散而非收敛。研究结论认为,LLM可作为支持人类推理的工具,但当前证据不支持将其视为自主审议代理。