Anthropic 工程师解释:Claude 模型更聪明,写作却变差
Anthropic 负责 Claude 微调的工程师 Jackson Kernion 解释,为何模型在数学、代码和推理上越来越强,写作质量却停滞甚至变差。他指出,新模型被优化用于数学和代码,并被训练成面向其他 AI 模型生成技术解释,从而形成人类读者觉得过于密集的“Claudeish”文风。Kernion 表示 Opus 4.6 是最后一个写作表现好的模型,
技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Anthropic 负责 Claude 微调的工程师 Jackson Kernion 解释,为何模型在数学、代码和推理上越来越强,写作质量却停滞甚至变差。他指出,新模型被优化用于数学和代码,并被训练成面向其他 AI 模型生成技术解释,从而形成人类读者觉得过于密集的“Claudeish”文风。Kernion 表示 Opus 4.6 是最后一个写作表现好的模型,
伦敦AI初创公司Basecamp Research完成1.4亿美元融资,投资方包括英伟达、Anthropic的Anthology Fund、NATO创新基金等,由S32领投。该公司利用来自雨林、海洋和温泉的遗传物质训练名为EDEN的生物AI模型,用于设计抗生素和细胞疗法工具。其CTO Phil Lorenz在采访中表示生物学问题远比语言复杂,公共基因组数据库
Convergent Intelligence LLC 研究部门在 Hugging Face 发布 SymbioticLM-14B,一个基于 Qwen3-14B 的符号-Transformer 混合模型,声称拥有 178 亿参数、4096 个持久符号记忆状态及多种符号处理模块。该模型定位为实验性研究检查点,作者明确表示能力描述仅为架构意图而非基准测试结果。模
它石智航创始人兼CEO陈亦伦在2026"跨国企业上海行"推介会上作为唯一获邀发言的上海本土企业代表,分享了公司以具身智能技术赋能全球工业转型的实践。它石智航已完成基座模型突破、硬件迭代优化、规模化落地的三级跃迁,自研AWE具身智能基座大模型及A系列轮式机器人、T系列双足机器人、DexHand灵巧手等产品,并组建了硕博占比超80%的研发团队。公司未来将继续扩大
阿里巴巴宣布由前华为天才少年刘大一恒正式接任Qwen(千问)大模型项目负责人,此前该职位由林俊旸离职后由周靖人代管。刘大一恒是Qwen初期核心成员,曾负责预训练工作并主导Qwen1至Qwen3.5系列及Qwen-Math等模型开发。他在云栖大会发表「Qwen:迈向真实世界智能体」主题演讲,透露Qwen下一步将聚焦真实世界智能体方向。
该论文研究个性化搜索中LLM交叉编码器重排序时行为信号(如点击率)的融合问题。作者发现,将查询切片统计(QSS)直接注入提示虽在特征可用时提升13.3%排序质量,但会导致模型过度依赖该特征,在稀疏或缺失场景下性能下降。为此提出双样本特征丢弃训练策略,在保留排序增益的同时将QSS移除场景性能相对提升4.0%,在线测试中搜索成功率提升约2%。
研究评估了医学基础模型 MedGemma(基于 Gemini 的医学通用基础模型)及其针对肺癌检测诊断微调版本,在 NLST 数据集上与 12 位放射科医生进行 Lung-RADS v2022 评估的对比。放射科医生平均 AUC 为 0.90(范围 0.80–0.94),原生基础模型 AUC 仅 0.70,微调后提升至 0.83,处于放射科医生表现的较低区间
该论文研究日志解析中的长尾分布问题,发现罕见日志组(少于5个实例)在Loghub-2.0基准中占近20%的模板但不足0.01%的日志消息,导致所有解析器在这些组上性能大幅下降。作者提出TAILOR框架,通过模板保持增强为罕见日志组补充结构一致的日志消息,从而提升模板推断准确率。实验显示TAILOR在罕见日志组上比最强基线提升19%的解析准确率,并在完整数据集
多伦多大学等机构的研究者提出 ReFilter,一个混合框架,先用嵌入向量检索语义相近的移动应用候选集,再用大语言模型进行上下文过滤,以识别真正功能相似的应用。该方法在检索相似应用任务上取得 90% 的 F1 分数,兼顾效率与精度,可支持应用对比、竞品分析和推荐。作者称这是首个将上下文感知的 LLM 过滤应用于大规模应用检索的研究。
Hugging Face 博客发布了一项针对答案验证(answer verification)系统的独立评测,在 2,018 条统一标注的测试集上对比了 13 个系统,并公开了评分代码。结果显示仅三个系统 AUC 超过 0.70,最强的 ZTC (397B) 与 JEV 差距仅 0.0014,统计上无法区分;而仅依赖答案长度和格式的基线达到 0.7036,高
Simon Willison 发布了 LLM 插件 llm-typesafe 0.1a0,用于支持 TypeSafe AI 的新模型 Jev。用户安装插件并设置 API key 后,可通过命令行进行是/否(noul)、选择和评分三类问答。该插件将 Jev 的决策模型能力接入 LLM 工具链。
智能经济30人论坛AGI测评中心发布2026年9月12日至18日《AGI市场观察》,基于OpenRouter词元消耗、厂商官方价格及Arena基准测评追踪国产大模型。报告显示,DeepSeek V4 Flash、V4.1 Flash、腾讯Hy4 preview、智谱AI GLM 5.3 Flash四款轻量级模型周用量均破10万亿tokens,四强合计约占中国
OpenAI 宣称其内部模型在仅一个月训练后解决了 100 多个长期未解的数学难题,包括 Navier-Stokes 千禧年问题,并可能涉及 Hodge 猜想。此举引发数学家对 AI 生成解法可能削弱概念理解的批评,OpenAI 随即在高等研究院成立独立数学顾问小组,成员包括菲尔兹奖得主 Timothy Gowers。但 OpenAI 明确该小组无权干预其研
美团技术团队提出统一推荐基座大模型 MTFM,在外卖多个主要业务场景实现统一精排模型,通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计解决规模可扩展性、场景可延展性与架构高效性挑战。该模型在外卖多业务中实现订单量提升 2.06% 6.68%,推理成本降低 24%,相关工作已被 KDD 2026 收录。
该研究对LLM代码生成中的用户画像偏见进行了大规模实证分析,测试了Gemini 2.5 Pro和GPT-OSS-120B两个模型,使用覆盖国籍、性别和经验水平的18种人口统计画像,对比中性基线,分析了超过35,000个生成程序。结果显示,人口统计标记在高达65%的回复和70%的推理轨迹中出现,尽管与任务语义无关;在LiveCodeBench上,画像提示使Ge
该论文提出一种面向输电系统运营商控制室的治理感知型LLM编排智能体数字孪生系统。LLM仅负责选择并参数化白名单分析工具,所有动作必须经过模型无法绕过的治理层,该层强制执行四条规则:仅执行白名单工具、不超步数预算、有副作用的动作需操作员明确批准、答案中每个数字均由后端结果渲染并附带单位变量时间。在希腊输电网络数字孪生的118任务基准上,主模型590次运行工具选
该研究分析了19个使用Stale Bot的GitHub仓库中14,234个停滞的Pull Request(PR)和164,562条评审评论,并开发了基于LLM的投票分类器来按贡献类型分类。研究发现,功能增强和问题修复类PR占停滞贡献的77%以上;停滞主要源于沟通协调失败(如缺少互动、反馈延迟)以及技术障碍(如检查失败、配置问题、兼容性)。仅39.56%的贡献
该论文提出 PRQuant,一种无需训练、低开销的 W4A4 量化框架,结合通道重排与静态权重侧残差补偿。方法先用 AWQ 风格缩放识别对权重量化误差贡献最大的输入通道,将其置换到连续尾部块并离线构建残差子张量,使推理时残差补偿转化为规则的尾部增强 GEMM,避免在线收集开销。实验显示 PRQuant 在五个下游基准上平均准确率超过默认 MXFP4 及所评估
该论文提出一种通用多模态基础模型,旨在解决现有融合模型只能处理预定义模态和单一任务的问题。作者基于结构多模态因果模型(SMCM)构建大规模合成多模态数据集进行训练,使模型学习可迁移的多模态关联模式,而非依赖特定模态。模型扩展自表格基础模型 TabPFN,通过统一 token 生成机制将异构模态映射到统一空间,并在推理时利用上下文示例激活任务相关关联,无需参数
在2026云栖大会上,阿里巴巴公布大模型最新进展:Qwen3.8-Max在编程与办公领域表现强劲并登顶多个榜单,基于下一代架构的Qwen4已投入训练,未来Qwen4.5、Qwen5参数将扩展至5到10万亿。阿里还发布Qwen-Image-3.1、Qwen-Audio-3.1、Wan3.0、HappyOyster 2.0 Preview等多模态模型,并披露大模