arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12193 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12193 篇

2606.15327 2026-06-16 cs.LG 新提交 79%

Semantic DLM+: Improving Diffusion Language Models through Bias-variance Trade-off in Transition Kernel Design

语义DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型

Keyue Jiang, Yuxiang Wang, Yanan Zhao, Xiang Yu, Qifang Zhao, Bohan Tang, Baojian Zhou, Yanghua Xiao, Lin Qu, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文通过分析泛化误差的三个关键因素,提出SemDLM+模型,通过全局转移和语义频率惩罚解决语义盆地问题,在LM1B和OpenWebText上提升了训练动态和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05878 2026-06-16 cs.LG 版本更新 79%

TS-ICL: A Flexible Time-Indexed Foundation Model for Time Series via In-Context Learning

TS-ICL: 一种基于上下文学习的灵活时间索引时间序列基础模型

Etienne Le Naour, Tahar Nabil, Adrien Petralia

机构 * EDF R&D(EDF研究与发展)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 提出TS-ICL,一种基于上下文学习的概率编码器-回归器Transformer,统一了时间序列预测与插值,并在插值任务上达到新最优,同时在部分观测回溯窗口预测中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24275 2026-06-16 cs.LG math.OC stat.ML 版本更新 79%

GradPower: Powering Gradients for Faster Language Model Pre-Training

GradPower: 通过梯度加速更快的语言模型预训练

Jinbo Wang, Mingze Wang, Jiaqi Zhang, Wei Wang, Peng Pei, Xunliang Cai, Weinan E, Lei Wu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文提出GradPower,一种轻量级的梯度变换技术,用于加速语言模型预训练。通过元素级符号幂变换,将梯度输入基础优化器,无需修改优化器内部逻辑或超参数,从而在多种架构、参数规模、数据集和学习率调度方案中均取得更低的终端损失。

Comments 24 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12977 2026-06-16 cs.LG 版本更新 79%

Exact Federated Continual Unlearning for Ridge Heads on Frozen Foundation Models

冻结基础模型上岭回归头的精确联邦持续遗忘

Yijun Quan, Wentai Wu, Giovanni Montana

机构 * WMG, University of Warwick, Coventry CV4 7AL, UK(沃里克大学WMG学院,沃里克大学,英格兰考文特里CV4 7AL,英国) Department of Computer Science, Jinan University, Guangzhou 510632, China(广州大学计算机科学系,广州510632,中国)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 针对冻结基础模型+岭回归头的联邦学习场景,提出基于充分统计量的通信协议,实现精确且高效的连续遗忘,支持任意添加和删除请求,保证与集中式重训练等价的确定性。

Comments Accepted to ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12908 2026-06-12 cs.CL 新提交 79%

SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

SENTINEL: 用于训练工具使用语言模型智能体的失败驱动强化学习

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Qun Liu, Chen Luo, Jiri Gesi, Hanqing Lu, Yisi Sang, Manling Li, Jing Huang, Dakuo Wang

机构 * Northeastern University(东北大学) Independent Researcher(独立研究员) Northwestern University(西北大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 提出SENTINEL框架,通过将智能体失败转化为针对性训练任务,在Tau2-Bench Retail上提升Qwen3-4B模型Pass@1从66.4到74.9,优于通用合成任务上的强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12609 2026-06-12 cs.LG q-bio.QM 新提交 79%

Viral Proteins Reveal Geometry of Protein Language Models

病毒蛋白质揭示蛋白质语言模型的几何结构

Arthur Bigot, Harmon Bhasin, Core Francisco Park, Eugene Shakhnovich, Dianzhuo Wang

机构 * University of Washington(华盛顿大学) DeepMind(深度思维)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 研究蛋白质语言模型在不平衡数据下对病毒蛋白的表示,发现嵌入空间中存在主导的“天然性”轴,该轴按模型困惑度排序序列,且缩放效果因病毒家族而异,但嵌入仍保留病毒特异性信号。

Comments Accepted at ICML 2026 GenBio Workshop and FM4LS Workshop. Code available at https://github.com/MisteFr/viral-proteins-plms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06853 2026-06-08 cs.CV cs.AI 新提交 79%

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22278 2026-06-08 cs.CV cs.LG 版本更新 79%

The Dual Mechanisms of Spatial Variable Binding in Vision-Language Models

视觉-语言模型中空间变量绑定的双重机制

Kelly Cui, Nikhil Prakash, Shoval Messica, Ayush Raina, David Bau, Antonio Torralba, Tamar Rott Shaham

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Northeastern University(东北大学) Sony Playstation(索尼PlayStation)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文揭示视觉-语言模型通过语言骨干中的内容无关空间关系编码和视觉编码器中的全局布局表示两种机制实现空间变量绑定,其中视觉编码器起主导作用。

Comments 37 pages, 53 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06347 2026-06-05 eess.SY cs.LG cs.SY 79%

Attack Detection using Time Series Foundation Models

使用时间序列基础模型的攻击检测

Sribalaji C. Anand, Anh Tung Nguyen, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) KTH Royal Institute of Technology(皇家理工学院) Uppsala University(乌普萨拉大学)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 针对无模型知识的网络物理系统,提出基于TimesFM时间序列基础模型的零样本攻击检测方法,在IEEE 14节点电力系统上验证其性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03344 2026-06-03 cs.CR cs.LG 79%

RogueMerge: Robust and Unified Attacks against LLM Model Merging

RogueMerge: 针对大语言模型合并的鲁棒统一攻击

Jinghuai Zhang, Yetian He, Kunlin Cai, Han Zhao, Fnu Suya, Yuan Tian

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他LLM :LLM(title,abstract);分类 cs.LG

AI总结 提出RogueMerge框架,通过联合优化、元学习模拟和分布鲁棒优化,解决模型合并中针对自回归生成、未知合并配置和攻击提示泛化的三大挑战,实现鲁棒且统一的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23080 2026-06-02 cs.LG 79%

The Attribution Contract: Feature Attribution for Generative Language Models

归因契约:生成式语言模型的特征归因

Giang Nguyen

机构 * Guide Labs(Guide实验室)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 针对生成式语言模型中特征归因的歧义性,提出归因契约规范,明确归因对象、特征范围、生成过程等要素,并通过自回归和扩散模型案例展示不同契约下的归因效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22985 2026-06-01 cs.LG 79%

dgMARK: Decoding-Guided Watermarking for Diffusion Language Models

dgMARK: 面向扩散语言模型的解码引导水印方法

Pyo Min Hong, Albert No

机构 * Department of Computer Engineering, Hongik University(鸿基大学计算机工程系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 提出dgMARK方法,通过引导离散扩散语言模型的去掩码顺序满足奇偶约束,实现无需显式重加权概率的文本水印嵌入,并利用滑动窗口检测器保证对编辑操作的鲁棒性。

Comments Accepted at ICML 2026. Project page: https://dgmark-watermarking.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26689 2026-05-27 cs.CV cs.CL 79%

PinPoint: Prompting with Informative Interior Points

PinPoint: 通过信息性内部点进行提示

Pouya Sadeghi, Shawn He, Pedro Pablo Guerrero Vela, C. Thomas, Alex Wong, Sirisha Rambhatla

机构 * University of Waterloo(滑铁卢大学) Critical ML Apple(苹果公司)

专题命中 其他LLM :prompting(title);language model(abstract);分类 cs.CL

AI总结 针对指代图像分割中VLM与SAM结合时因提示模糊导致的性能差距,提出无需训练的确定性点选择器PinPoint,通过融合视觉线索选择稳定、信息丰富的内部点,在无训练下达到监督和强化学习方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26501 2026-05-27 cs.CV cs.AI 79%

Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization

揭示视觉-语言模型的脆弱性:通过纹理约束扰动和跨模态优化的多模态对抗协同

Xiang Fang, Wanlong Fang, Changshuo Wang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 提出多模态对抗协同框架,通过纹理约束的通用对抗扰动和可学习的文本提示扰动,在黑盒设置下联合优化,揭示视觉-语言模型在多模态攻击下的脆弱性。

Comments Publish in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26163 2026-05-27 cs.IT cs.LG math.IT math.OC 79%

Adversarial Water-Filling: Theory, Algorithms and Foundation Model

对抗性注水:理论、算法与基础模型

Xindi Tong, Chee Wei Tan, H. Vincent Poor

机构 * College of Computing and Data Science (CCDS), Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院(CCDS),新加坡) Princeton University, United States(普林斯顿大学,美国)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 针对频率和空间上的竞争资源分配问题,提出对抗性注水(AWF)问题及其理论和算法,并开发无线基础模型学习AWF搜索动力学,实现超过一个数量级的运行时间改进。

Comments Submitted to IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26097 2026-05-26 cs.LG 79%

Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay

语言模型中的遗忘:容量、优化与自生成回放

Martin Marek, Dongkyu Cho, Shikai Qiu, Rumi Chunara, Pavel Izmailov, Andrew Gordon Wilson

机构 * New York University(纽约大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文研究了语言模型中的遗忘问题,发现自生成样本可作为有效的回放数据几乎消除遗忘,并揭示了容量限制和低学习率对遗忘的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18646 2026-05-26 cs.CL 79%

Language-Switching Triggers Take a Latent Detour Through Language Models

语言切换触发器通过语言模型的潜在迂回路径

Francis Kulumba, Wissam Antoun, Théo Lasnier, Benoît Sagot, Djamé Seddah

机构 * Inria Paris(巴黎研究所) Sorbonne Université(索邦大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 本文通过电路分析揭示了一个8B参数自回归语言模型中语言切换后门攻击的内部机制,该攻击由三个拉丁词触发,将英语输出重定向为法语,并发现触发信号通过正交于语言身份方向的潜在空间传播,最终由最后一层MLP转换为法语logits。

Comments 15 pages, 16 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19329 2026-05-22 cs.CV cs.AI 79%

RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding

RE-VLM:事件增强的视觉-语言模型用于场景理解

Hanqing Liu, Mingjie Liu, Luoping Cui, Endian Lin, Donghong Jiang, Chuang Zhu

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 本文提出RE-VLM,一种结合RGB图像和事件流的双流视觉-语言模型,旨在提升在正常和恶劣条件下对场景的理解能力。通过事件相机提供的高时间分辨率和宽动态范围的数据,RE-VLM在场景描述和视觉问答任务中优于现有模型。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20923 2026-05-21 cs.LO cs.AI cs.PL 79%

Causal Past Logic for Runtime Verification of Distributed LLM Agent Workflows

因果过去逻辑用于分布式大语言模型代理工作流的运行时验证

Benedikt Bollig

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, LMF, Gif-sur-Yvette, France(巴黎-萨克雷大学,国家科学研究中心,巴黎-萨克雷高等师范学院,LMF,法国吉夫昂蒂埃)

专题命中 其他LLM :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种因果过去逻辑(CPL)用于分布式大语言模型代理工作流的运行时验证,通过在ZipperGen框架中引入CPL,实现了对工作流中因果可见事件的实时监控和控制流影响,从而将运行时验证整合到协调语言本身。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03019 2026-05-21 q-bio.GN cs.CL 79%

DNACHUNKER: Learnable Tokenization for DNA Language Models

DNACHUNKER: 用于DNA语言模型的可学习分词

Taewon Kim, Jihwan Shin, Hyomin Kim, Youngmok Jung, Jonghoon Lee, Won-Chul Lee, Sungsoo Ahn, Insu Han

机构 * Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院) Department of Electrical Engineering, KAIST(韩国科学技术院电气工程系) Inocras Korea Inc.(Inocras韩国公司)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 本文提出DNACHUNKER,一种可学习的DNA分词方法,通过动态分段模块生成上下文依赖的变长单元,提升DNA语言模型在基因组序列处理中的鲁棒性和效率。

Comments ICML 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17310 2026-05-19 cs.CV cs.AI 79%

Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models

注意力劫持:跨查询的视觉-语言模型响应操控

Zhiqiang Wang, Dongrui Liu, Yan Li, Zonghao Ying, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Beihang University(北京航空航天大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型中跨查询响应操控问题,提出了一种新的对抗攻击方法Attention Hijacking,通过引导内部注意力分布保持图像主导模式,提高攻击在不同查询下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15676 2026-05-18 cs.CL 79%

Dynamic Chunking for Diffusion Language Models

扩散语言模型的动态分块

Yichen Zhu, Xiaoming Shi, Peng Zhao, Weiyu Chen, Debing Zhang, James Kwok

机构 * CSE, HKUST(香港科技大学计算机科学与工程系) Xiaohongshu Inc.(小红书公司) Alibaba group(阿里巴巴集团) CityUHK(城市大学香港校区)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 本文提出动态分块扩散模型,通过内容定义语义分块替代固定位置分块,提升序列结构利用效率,在参数规模达1.5B的下游任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15562 2026-05-18 cs.CL 79%

GiLT: Augmenting Transformer Language Models with Dependency Graphs

GiLT:通过依赖图增强Transformer语言模型

Tianyu Huang, Yida Zhao, Chuyan Zhou, Kewei Tu

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(智能视觉与成像上海工程研究中心)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 GiLT通过依赖图增强Transformer语言模型,提升语法泛化能力,同时保持竞争力的困惑度,且能通过微调提升下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15440 2026-05-18 cs.CL 79%

Why are language models less surprised than humans? Testing the Parse Multiplicity Mismatch Hypothesis

为何语言模型比人类更不惊讶?测试解析多重性不匹配假说

William Timkey, Brian Dillon, Tal Linzen

机构 * Department of Linguistics, New York University(纽约大学语言学系) Center for Data Science, New York University(纽约大学数据科学中心) Department of Linguistics, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校语言学系)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 研究探讨语言模型在处理句子时的 surprisal 与人类处理的差异,通过调整解析数量来测试解析多重性不匹配假说对句法歧义的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14025 2026-05-15 q-bio.NC cs.AI 79%

Do Language Models Align with Brains? Prediction Scores Are Not Enough

语言模型与大脑对齐吗?预测分数并不足够

Xiao Jia

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(人工智能学院,香港中文大学(深圳))

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 本文通过L-PACT框架评估语言模型与大脑的对齐性,发现预测分数不足以支持两者对齐的结论,所有测试结果均被控制条件解释。

Comments 39 pages, 4 main figures, 6 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13681 2026-05-14 cs.LG stat.ML 79%

Sampling from Flow Language Models via Marginal-Conditioned Bridges

通过边缘-条件化桥梁采样流语言模型

Iskander Azangulov, Leo Zhang

机构 * Department of Statistics, University of Oxford(牛津大学统计系)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文提出通过边缘-条件化桥梁采样流语言模型,该方法在每一步从因子化后验中采样干净的一热序列,并利用奥本-乌伦贝克桥进行下一步状态采样,从而在不训练的情况下提升质量-多样性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09751 2026-05-12 cs.CL 79%

Language Models Without a Trainable Input Embedding Table: Learning from Fixed Minimal Binary Token Codes

无可训练输入嵌入表的语言模型:从固定最小二进制令牌代码中学习

A. Bochkov

机构 * Andrey Bochkov(安德里·博赫科夫)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 本文探讨了现代语言模型中可训练输入嵌入表的必要性,通过固定最小二进制令牌代码和无参数提升方法,在不使用可训练嵌入表的情况下实现了与传统方法相当的验证集困惑度,证明了其非必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08721 2026-05-12 cs.CL 79%

Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents

打破僵局:用于社交语言代理的双尺度进化策略训练

Minzheng Wang, Run Luo, Yanbo Wang, Zichen Liu, Yuqiao Tan, Tao Tan, Xu Nan, Yinhe Zheng, Wenji Mao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Ritzz-AI

专题命中 其他LLM :language agent(title,abstract);分类 cs.CL

AI总结 本文提出双尺度进化策略训练方法,解决社交语言游戏中因策略空间庞大导致的进化停滞问题,通过动态优化景观干预,恢复梯度信号并促进持续战略探索。

Comments Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08029 2026-05-11 cs.CV cs.LG 79%

STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

STARFlow2:连接语言模型与归一化流以实现统一的多模态生成

Ying Shen, Tianrong Chen, Yuan Gao, Yizhe Zhang, Yuyang Wang, Miguel Ángel Bautista, Shuangfei Zhai, Joshua M. Susskind, Jiatao Gu

机构 * Apple(苹果公司)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文提出STARFlow2,通过归一化流与预训练视觉语言模型结合,实现高效的多模态生成,采用深度浅层流设计和统一FAE潜在空间,提升生成效率与性能。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07933 2026-05-11 cs.CL 79%

How to Train Your Latent Diffusion Language Model Jointly With the Latent Space

如何与潜在空间联合训练潜在扩散语言模型

Viacheslav Meshchaninov, Alexander Shabalin, Egor Chimbulatov, Nikita Gushchin, Ilya Koziev, Alexander Korotin, Dmitry Vetrov

机构 * Constructor University(Constructor大学) HSE University(莫斯科国立高等经济大学) Applied AI Institute(应用人工智能研究所) AXXX Independent researcher(独立研究者)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 本文提出联合训练潜在扩散语言模型,通过重塑预训练语言模型的表示构建潜在空间,提升生成性能并加快速度。

详情

展开后加载摘要…

URL PDF HTML 收藏