返回全部动态
GPT-6带火循环Transformer,阿里两篇顶会论文提前布局
原标题:GPT-6带火循环Transformer,阿里早已布局
AI 摘要
GPT-6 Astra发布带火了循环Transformer技术,阿里团队早在11个月前就发表了MeSH和SpiralFormer两篇论文,分别解决循环内部信息管理和计算粒度问题。MeSH通过动态读写路由器管理记忆槽,减少计算冗余;SpiralFormer通过多分辨率序列处理,让每轮循环关注不同尺度的信息。两篇论文分别被ICLR 2026和EMNLP 2026接收,为循环架构成为下一代高效大模型候选路线提供了支持。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
GPT-6带火循环Transformer,阿里早已布局 手握两篇顶会论文 GPT-6 Astra一发布,recurrent depth突然一夜火了! 最早是The Information爆料,Astra使用了这种「循环深度」技术: 让同一组Transformer层反复运行,在不增加同等规模参数的情况下,把计算做得更深。 ??模型不必继续疯狂「长肉」,也能让现有参数多干几轮活,还有这好事。 不出所料,争议很快到来。。。 由于循环发生在hidden state里,中间过程未必会写成人类可读的思维链,模型会不会因此更难监测? OpenAI也由此被AI安全专家集体讨伐,甚至一度逼得首席科学家Jakub Pachocki亲自下场回应。 Jakub Pachocki还透露,自己正在憋一篇小作文以完整解释整件事情。 边等小作文,边让我们把目光拉回循环Transformer本身: 多循环几圈,模型真的就会更强吗? 学界其实早已踩坑。 同等算力下,省了参数的循环模型,经常打不过普通Transformer。 卡住它的,是一个相当现实的问题: 「计算冗余」。 有意思的是,阿里早在11个月前就发了相关论文,靶
发布时间:2026-09-05 23:07
抓取时间:2026-09-05 23:55
来源机构:量子位