继何恺明团队ELF后,南京大学基于昇腾算力同步提出连续扩散语言模型
最近,何恺明老师团队提出 ELF(Embedded Language Flows),在连续语义空间中建模语言模型,在文本生成类任务上取得了相当优秀的结果。这使得连续扩散语言模型成为了讨论焦点:语言能否像其他连续模态一样,在连续空间里完成生成?
近日来自南京大学模式识别实验室(PRLab)的梁嘉骏、廖宇程,在司晨阳教授的指导下,联合新加坡南洋理工大学、英国帝国理工学院,提出连续扩散语言模型 AURORA-LM(Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling),对连续空间下的语言建模作出了更多的思考和发现。AURORA-LM 的全部实验均在昇腾 NPU上完成,并进一步扩展至约 10 亿参数规模,验证了连续扩散语言模型在国产 AI 算力平台上的训练与扩展的可行性
- 论文标题:AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
- 论文:https://arxiv.org/abs/2608.02602
- 项目主页:https://aurora-lm-project.github.io/
- 代码地址:https://github.com/fyv587/AURORA-LM
连续空间下的语言建模难在哪里?
(相关资料图)
语言由离散 token 组成,即使生成过程转到连续空间,最终结果仍需从连续表达(latent)序列映射回 token。于是,这条序列既要保留足够的信息,供解码器准确地映射回完整的文字;又不能让模型面对过于难以学习的分布。究竟如何构造连续空间下的 latent 序列映射,便成为连续空间语言生成中的关键问题。
AURORA-LM 将这个问题拆解成两步:
- 第一步,通过一个完全重新训练的自编码器为文本构造语义信息足够充分、可解码的连续向量序列;
- 第二步,由一个特别设计的 “分块因果扩散模型” 来学习这条编码后的向量序列的生成分布。
同时,AURORA-LM 针对带噪状态输入、训练过程和少步采样等进行设计,保障在更大语义空间下的稳定高效的建模。
模型结构
AURORA-LM 将连续语言生成拆成两个阶段。第一阶段,AURORA-LM 先为文本构造一条按前缀顺序组织的连续 latent 序列。随着 latent 位置向后移动,它能够读取的 token 前缀逐步变长;反过来,解码某个 Token 时,模型也只能使用相应的 latent 前缀。这样,连续 latent 序列保留了与文本从左到右展开相对应的结构。
编码器 - 解码器以恢复原始 token 为训练目标:
第二阶段,通过分块因果扩散模型建模 latent 序列的生成分布。AURORA-LM 将 latent 序列划分为连续的多个块,块与块之间采用从左到右的因果注意力掩码, 而块内通过双向注意力机制进行建模。对每个带噪 latent 块,模型直接预测其对应的干净 latent;所有块的预测拼接后,在完整 latent 空间中计算训练误差:
推理时,块与块间从左到右按顺序推理,并通过 kv cache 复用前缀计算结果;块内不同位置可以采用双向注意力机制、进行联合去噪,同步输出:
此外,AURORA-LM 对当前带噪 latent 块的预测可以利用两类来源不同的附加信息。对于无条件生成,模型将当前 latent 块在上一步所预测的干净 latent 回传给下一步,为后续预测提供了自身的轨迹信息;对于有条件生成,给定的提示文本先被编码器转换为干净的 latent 前缀,提供了待生成文本的外部语义条件,从而强化模型对上下文的遵循。
为什么要保留高容量 latent?
这里所说的「高容量」,主要体现为每个 latent 向量有更大的维度。更高维的向量为文本信息保留了更多丰富的语义,使词语、语法和局部顺序在噪声扰动下仍更容易被解码。
如图(a)所示,增加 latent 向量的维度后,其在噪声扰动下仍能保留更多可供解码的文本信息;图(b)展示了,不同宽度校准训练噪声分配后,生成质量也随之提升。
但更高的 latent 容量也带来代价:扩散模型需要从带噪状态中恢复完整的干净 latent 也同样维度更高,学习目标随之更加复杂。
通过实验,研究团队发现两个关键策略对模型训练效率有较大的影响:如图(a)所示,研究团队发现适度收窄带噪输入维度(bottleneck),极大程度提升最终模型文本生成的质量,图(b)则显示,提高在训练过程中,输入高噪声状态的概率可进一步提升生成结果。
少步去噪时,如何避免误差累积?
此外,研究团队进一步探索了 AURORA-LM 在少步去噪时如何抑制误差沿去噪轨迹累积。训练时,模型面对的是独立采样的带噪 latent;实际生成时,却需沿着自身预测连续推进。若相邻去噪状态下的判断不一致,误差便可能逐步累积。
为此,AURORA-LM 引入自轨迹一致性:在训练时,模型先根据当前带噪 latent 得到对应的干净 latent 估计,再据此推进至相邻的更低噪声状态,并约束相邻状态下的干净 latent 估计保持一致。
这一更新过程可写为:
训练时,AURORA-LM 将 flow-matching 损失与这一一致性损失共同优化:
实验显示,自轨迹一致性在所有评测的生成步数下均能提升结果,其中少步生成时的改善最为明显。
更多数据、更大模型规模下的效果验证
研究团队先对齐 ELF-B 的测试设置,在 130M 规模模型下,采用 OpenWebText 与 Xsum 作为训练数据,通过自由生成与条件摘要两个任务形式进行对比,再将分块因果扩散模型扩展至 1B 参数,并基于更丰富的开源数据训练,来验证当下策略在更大的模型规模下的效果。
- 自由生成:在 OpenWebText 上,AURORA-LM 与自回归、离散扩散和其他连续生成模型进行比较。AURORA-LM 的Gen-PPL 降至 23.56,MAUVE 达到 0.890,在两项指标上均取得表中最佳结果。
- 条件摘要:在论文展示的 XSum 对比中,AURORA-LM 的ROUGE-1、ROUGE-2 和 ROUGE-L 分别达到 36.6、13.4 和 28.9,三项结果均为表中最高。
- 1B 规模验证:研究团队进一步将扩散结构扩展至约 1B 参数,基于开源预训练数据累计训练计算量约为1500 EFLOPs。如图(b)所示,在涵盖常识推理、阅读理解等九项语言基准任务的评测中,AURORA-LM-L 的平均得分为32.6;与一个公开可用、参数规模更大的连续语言模型相比,AURORA-LM-L 在论文表中的九项任务上均取得更高分数。
结语
AURORA-LM 先为文本学习高容量、可映射回 token 的连续 latent,再让分块因果扩散模型对其分布进行建模。围绕这条 latent 所做的输入、训练与采样设计,使连续扩散生成能够同离散 token 解码衔接起来,也为更长上下文和更大规模的连续语言模型提供了一条可继续探索的路径。
相关阅读
-
亚马尔购入夏奇拉-皮克旧宅,豪宅内泳池球场陈列奖杯
亚马尔购入夏奇拉-皮克旧宅,豪宅内泳池球场陈列奖杯,豪宅,泳池,旧宅,奖杯,亚马尔,十大中场,巴塞罗那队,杰拉德·皮克,夏奇拉-皮克 -
创新药商业化加速兑现,华宝基金医药类ETF集体大涨!创新药8月迎来主升浪?|最新资讯
创新药商业化加速兑现,华宝基金医药类ETF集体大涨!创新药8月迎来主升浪? -
武汉试点智能捕蚊“黑科技”,20天灭蚊超7万只
(记者牛润哲、方亚东、熊翔鹤)傍晚时分,位于湖北武汉的西北湖公园里,湖岸边三三两两的游人正散步纳凉。不少人发现,与以往游园时被蚊虫频繁叮咬不同,今年夏天公园里的 -
短讯!GPT-5.6和Fable联手,解决了一道悬了25年的数学难题
GPT-5.6和Fable联手,解决了一道悬了25年的数学难题,算法,信号,翻译,译码,信道,复杂度,数学难题 -
继何恺明团队ELF后,南京大学基于昇腾算力同步提出连续扩散语言模型
继何恺明团队ELF后,南京大学基于昇腾算力同步提出连续扩散语言模型,向量,序列,何恺明,语言模型,南京大学 -
苏州市相城区黄桥街道:趣植魔豆伴成长 暑托二十天争做劳育小当家
苏州市相城区黄桥街道:趣植魔豆伴成长暑托二十天争做劳育小当家 -
广钢气体(688548.SH):6.28亿股限售股8月17日解禁 独家焦点
格隆汇8月9日丨广钢气体(688548.SH)公布,本次股票上市类型为首发限售股份;股票认购方式为网下,上市股数为628,189,519股。本次股票上市流通日期为2026年8月17日。 -
新女婿第一次上门能出多少洋相? 焦点消息
新女婿第一次上门能出多少洋相?,同床,新婚,刘海,订婚,洋相,新女婿 -
今头条!山东泰山B队客场3:1上海海港富盛经开
山东泰山B队客场3:1上海海港富盛经开,中乙,b队,山东泰山 -
25岁中医准研究生在开封万岁山景区当NPC把脉走红:每天4次,每次40分钟,让游客在不知不觉中记住养生知识-讯息
25岁中医准研究生回应在景区当NPC -
短讯!“熔颜”绽江南……朱炳仁朱军岷首度联展在无锡启幕
“熔颜”绽江南……朱炳仁朱军岷首度联展在无锡启幕 -
当前聚焦:年轻人重新定义北京的公园:青春自有安放处
年轻人重新定义北京的公园:青春自有安放处,朝阳,大雁,野鸭湖,植物园,北京市,北京的公园,奥林匹克森林公园 -
上海AI Lab、浙大、NUS团队:世界模型,何去何从?
上海AILab、浙大、NUS团队:世界模型,何去何从?,轨迹,lab,上海市,agent -
快报:上海工商业续期新政发布 提振REITs市场信心
CFi.CN讯:本周中证REITs全收益指数收于938.1点,下跌1.6%,日均成交金额达5亿元,环比增长17.9%。上海市规划和自然资源局发布《上海市工商业项 -
每日消息!中梁控股前7个月累计合约销售金额约为39.8亿元 同比减少45.7%
中梁控股前7个月累计合约销售金额约为39.8亿元同比减少45.7% -
当前聚焦:飞天茅台自营店涨价,终端售价已涨至1760元/瓶
每经记者|熊嘉楠每经编辑|段炼叶峰时隔半个月,飞天茅台自营价格再度上调。今日,有消息称,飞天茅台自营店售价已涨至1753元/瓶,7月底该产品在自营门店刚刚上 -
防御台风“白海豚” 浙江将防台风应急响应提升至Ⅰ级
南方财经8月8日电,为防御应对今年第13号台风“白海豚”可能正面袭击浙江等情况,经研判会商,浙江省防指决定于8月8日20时将防台风应急响应提升至Ⅰ级,要求各地各部门密切关注台风发展动态,按预案方案全力 -
焦点快播:16次全明星KD遭曝骂队友 史密斯定调火箭:阵痛已过将飞跃
16次全明星KD遭曝骂队友史密斯定调火箭:阵痛已过将飞跃,火箭,贾巴里,湖人球员,凯文杜兰特,全明星kd,史密斯(海峡殖民地总督) -
快消息!中国公开赛战报:连爆大冷,世界冠军3-6一轮游,丁俊晖1-6惨败
中国公开赛战报:连爆大冷,世界冠军3-6一轮游,丁俊晖1-6惨败,丁俊晖,周跃龙,中国公开赛,上海大师赛 -
热门看点:曼联求购无果?纽卡21岁左闸提前离营,伤病与转会悬念并存
曼联求购无果?纽卡21岁左闸提前离营,伤病与转会悬念并存,曼联,伯恩,左闸,刘易斯,纽卡斯尔队







