arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139665 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12452 篇

2602.12556 2026-02-16 cs.LG cs.AI 73%

SD-MoE: Spectral Decomposition for Effective Expert Specialization

SD-MoE:通过谱分解实现有效的专家专业化

Ruijun Huang, Fang Dong, Xin Zhang, Hengjie Cao, Zhendong Huang, Anrui Chen, Jixian Zhou, Mengyi Chen, Yifeng Yang, Mingzhi Dong, Yujiang Wang, Jinlong Hou, Qin Lv, Robert P. Dick, Yuan Cheng, Fan Yang, Tun Lu, Chun Zhang, Li Shang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) University of Bath, Bath, United Kingdom(巴斯大学) Oxford Suzhou Centre for Advanced Research, Suzhou, China(牛津苏泽研究中心) Department of Electrical Engineering and Computer Science, University of Michigan(密歇根大学电气工程与计算机科学系) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Department of Computer Science, University of Colorado Boulder, Colorado, USA(科罗拉多大学博尔德分校计算机科学系) Research Institute of Tsinghua University in Shenzhen, Shenzhen, China(清华大学深圳研究院) Greater Bay Area National Center of Technology Innovation, Research Institute of Tsinghua University in Shenzhen, Shenzhen, China(粤港澳大湾区国家技术创新中心,清华大学深圳研究院) School of Microelectronics, Fudan University, Shanghai, China(复旦大学微电子学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SD-MoE通过谱分解解决MoE中专家专业化不足的问题,提升模型性能并兼容多种现有架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10168 2026-02-16 q-bio.QM cs.AI cs.LG 73%

EVA: Towards a universal model of the immune system

EVA:朝着免疫系统通用模型迈进

Scienta Team, Ethan Bandasack, Vincent Bouget, Apolline Bruley, Yannis Cattan, Charlotte Claye, Matthew Corney, Julien Duquesne, Karim El Kanbi, Aziz Fouché, Pierre Marschall, Francesco Strozzi

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 EVA是首个跨物种多模态免疫学基础模型,通过整合转录组和组织学数据,提升免疫疾病研究的转化应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09570 2026-02-11 cs.CL cs.AI cs.IR 73%

LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval

LEMUR:一种用于多语言法律嵌入模型检索鲁棒微调的语料库

Narges Baba Ahmadi, Jan Strich, Martin Semmann, Chris Biemann

机构 * Hub of Computing and Data Science (HCDS) University of Hamburg(计算与数据科学中心(HCDS)乌姆斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LEMUR通过构建多语言法律语料库并微调嵌入模型,提升了多语言法律检索的鲁棒性和准确性,尤其在低资源语言中表现显著。

Comments Accepted at EACL SRW 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10364 2026-02-10 cs.LG cs.CL cs.CR 73%

Can We Infer Confidential Properties of Training Data from LLMs?

能否从LLMs中推断出训练数据的保密属性?

Pengrun Huang, Chhavi Yadav, Kamalika Chaudhuri, Ruihan Wu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PropInfer基准任务,通过两种微调范式评估LLMs属性推断攻击,揭示LLMs在隐私保护方面的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06949 2026-02-09 cs.RO cs.AI cs.CV cs.LG 73%

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

DreamDojo:从大规模人类视频中学习通用机器人世界模型

Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie, Ruijie Zheng, Dantong Niu, You Liang Tan, K. R. Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, Linxi "Jim" Fan

机构 * NVIDIA HKUST(香港科技大学) UC Berkeley(加州大学伯克利分校) Stanford(斯坦福大学) KAIST(韩国科学技术院) UofT(多伦多大学) UCSD(加州大学圣地亚哥分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 DreamDojo通过大规模人类视频学习通用机器人世界模型,解决动作标签稀缺问题,实现高精度物理理解和实时交互。

Comments Project page: https://dreamdojo-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04301 2026-02-09 cs.LG cs.CL 73%

Quantifying the Effect of Test Set Contamination on Generative Evaluations

量化测试集污染对生成评估的影响

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi, Ken Ziyu Liu, Brando Miranda, Ahmed Ahmed, Fazl Berez, Abhay Puri, Stella Biderman, Niloofar Mireshghallah, Sanmi Koyejo

机构 * University of Oxford(牛津大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05106 2026-02-06 cs.CL cs.LG stat.ML 73%

Data Kernel Perspective Space Performance Guarantees for Synthetic Data from Transformer Models

变换器模型合成数据的Data Kernel视角空间性能保证

Michael Browder, Kevin Duh, J. David Harris, Vince Lyzinski, Paul McNamee, Youngser Park, Carey E. Priebe, Peter Viechnicki

机构 * Department of Mathematics at the University of Maryland, College Park(马里兰大学College Park数学系) Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人机语言技术中心) Center for Imaging Science (CIS), the Institute for Computational Medicine (ICM), and the Mathematical Institute for Data Science (MINDS), Johns Hopkins University(约翰霍普金斯大学影像科学中心(CIS)、计算医学研究所(ICM)和数据科学数学研究所(MINDS)) Department of Applied Mathematics and Statistics (AMS), the Center for Imaging Science (CIS), and the Mathematical Institute for Data Science (MINDS), Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系(AMS)、影像科学中心(CIS)和数据科学数学研究所(MINDS))

专题命中 预训练与数据 :LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Data Kernel Perspective Space(DKPS)方法,通过数学分析为变换器模型的合成数据质量提供统计保证,旨在提升下游任务如神经机器翻译模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 73%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02619 2026-02-05 cs.LG cs.AI cs.SE 73%

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

daVinci-Agency: 解锁长周期代理数据高效性

Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03772 2026-02-04 cs.LG cs.AI 73%

UniGeM: Unifying Data Mixing and Selection via Geometric Exploration and Mining

UniGeM: 通过几何探索与挖掘统一数据混合与选择

Changhao Wang, Yunfei Yu, Xinhao Yao, Jiaolong Yang, Riccardo Cantoro, Chaobo Li, Qing Cui, Jun Zhou

机构 * Politecnico di Torino(托斯大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Institute of Microelectronics of the CAS(中国科学院微电子研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 UniGeM通过几何探索与挖掘统一数据混合与选择,提升大语言模型的数据效率和推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00576 2026-02-03 cs.LG cs.AI 73%

Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs

数据分布作为引导优化器实现LLM超一般化的杠杆

Tushaar Gangavarapu, Jiping Li, Christopher Vattheuer, Zhangyang Wang, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过调整训练数据分布降低简单性偏见,提升大型语言模型的泛化能力,实验表明在数学推理任务中性能提升达18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI 73%

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00068 2026-02-02 cs.CL cs.AI 73%

Framing Political Bias in Multilingual LLMs Across Pakistani Languages

在巴基斯坦多种语言中框架化政治偏见

Afrozah Nadeem, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了巴基斯坦五种语言中13种先进LLM的政治偏见,发现其在区域语言中表现出更集权的框架,强调文化适应的偏见审计框架的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17858 2026-01-27 cs.LG cs.AI 73%

MergeMix: Optimizing Mid-Training Data Mixtures via Learnable Model Merging

MergeMix: 通过可学习模型合并优化中训练数据混合

Jiapeng Wang, Changxin Tian, Kunlong Chen, Ziqi Liu, Jiaxin Mao, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MergeMix通过可学习模型合并权重优化中训练数据混合,实现高效的数据混合优化,性能优于传统手动调优,且具有高一致性与强可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15118 2026-01-23 cs.SD cs.CL cs.LG 73%

WavLink: Compact Audio-Text Embeddings with a Global Whisper Token

WavLink: 基于全局Whisper标记的紧凑音频-文本嵌入

Gokul Karthik Kumar, Ludovick Lepauloux, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究所)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 WavLink通过在Whisper编码器中引入可学习的全局标记,实现紧凑的音频-文本嵌入,提升了模型的可扩展性和检索性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07192 2026-01-13 cs.CL cs.AI 73%

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

Relink:为GraphRAG构建查询驱动的证据图谱

Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03469 2026-01-08 econ.EM cs.AI cs.CL cs.CY 73%

Content vs. Form: What Drives the Writing Score Gap Across Socioeconomic Backgrounds? A Generated Panel Approach

内容与形式:不同社会经济背景下写作分数差距的驱动因素?一种生成面板方法

Nadav Kunievsky, Pedro Pertusi

机构 * Knowledge Lab, University of Chicago(芝加哥大学知识实验室) Insper, Institute of Education and Research(Insper教育与研究学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过生成面板方法研究社会经济地位对写作分数差距的影响,发现内容质量占69%,风格差异占26%,评估标准差异占5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03420 2026-01-08 cs.LG cs.AI cs.CR 73%

Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks

无需梯度或先验知识的LLM劫持:有效且可转移的攻击

Zhakshylyk Nurlanov, Frank R. Schmidt, Florian Bernard

机构 * Department of Visual Computing, University of Bonn(视觉计算系,波恩大学) Bosch Center for Artificial Intelligence(博世人工智能中心) University of Bonn(波恩大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RAILS通过无需梯度或先验知识的令牌级迭代优化,实现了对LLM的有效且可转移的对抗性攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23163 2026-01-08 cs.CL cs.AI 73%

Beyond Direct Generation: A Decomposed Approach to Well-Crafted Screenwriting with LLMs

超越直接生成:一种分解方法用于利用LLM进行精心构思的剧本创作

Hang Lei, Shengyi Zong, Zhaoyan Li, Ziren Zhou, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出双阶段细化框架,通过分解生成方法提升LLM在剧本创作中的表现,实现高质量剧本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15722 2026-01-08 cs.CL cs.AI 73%

Shared Path: Unraveling Memorization in Multilingual LLMs through Language Similarities

共享路径:通过语言相似性揭示多语言大语言模型中的记忆现象

Xiaoyu Luo, Yiyi Chen, Johannes Bjerva, Qiongxiu Li

机构 * Department of Computer Science(计算机科学系) Department of Electronic Systems(电子系统系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过语言相似性分析,揭示多语言大语言模型中记忆现象的跨语言关联及其影响因素。

Comments 17 pages, 14 tables, 10 figures

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 19372-19388, Suzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-01-06 cs.CL cs.LG 73%

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21043 2026-01-05 cs.AI cs.LG 73%

Combinatorial Creativity: A New Frontier in Generalization Abilities

组合创造力:一般化能力的新前沿

Samuel Schapiro, Sumuk Shashidhar, Alexi Gladstone, Jonah Black, Royce Moon, Dilek Hakkani-Tur, Lav R. Varshney

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science(计算与数据科学学院) Spiral Works AI Innovation Institute(人工智能创新研究所) Stony Brook University(石溪大学) Simons Institute for the Theory of Computing, Berkeley(伯克利理论计算研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出组合创造力的概念,通过理论框架和算法任务评估LLMs的创造力,并发现最优模型参数和新颖性-实用性权衡对提升创造力的重要性。

Comments Preprint. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14975 2026-01-05 cs.LG cs.AI cs.RO 73%

Flattening Hierarchies with Policy Bootstrapping

通过策略自举 flattening 层次结构

John L. Zhou, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种通过自举子目标策略训练平坦目标条件策略的方法,解决长horizon任务中GCRL扩展难题,实现高维控制性能提升。

Comments NeurIPS 2025 (Spotlight, top 3.2%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06696 2026-01-05 cs.CL cs.LG 73%

Simple and Effective Input Reformulations for Translation

简单而有效的输入改写用于翻译

Brian Yu, Hansen Lillemark, Kurt Keutzer

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文通过简单输入改写方法提升翻译任务的性能,实验表明在佛洛斯200基准测试中性能提升达3.5 chrF++。

Comments 13 pages, 6 figures. To be published in Empirical Methods in Natural Language Processing (Main) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22293 2025-12-30 cs.LG cs.CL cs.CR 73%

Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against

从负例学习:为什么警告框架的训练数据教会了它所警告的内容

Tsogt-Ochir Enkhbayar

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现,警告框架的训练数据未能有效阻止模型学习警告行为,而是通过统计共现性主导了模型的学习过程。

Comments Submitted to Neel Nanda's MATS Stream

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00654 2025-12-30 cs.CV cs.CL cs.LG 73%

ICONS: Influence Consensus for Vision-Language Data Selection

ICONS: 视觉-语言数据选择中的影响共识

Xindi Wu, Mengzhou Xia, Rulin Shao, Zhiwei Deng, Pang Wei Koh, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind) Allen Institute for AI(人工智能研究院)

专题命中 预训练与数据 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 ICONS通过影响共识方法高效选择视觉-语言数据,保持高性能并支持多任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21515 2025-12-29 cs.LG cs.CL 73%

Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training

感知度意识的数据扩展定律:感知度景观预测持续预训练的表现

Lei Liu, Hao Zhu, Yue Shen, Zhixuan Chu, Jian Wang, Jinjie Gu, Kui Ren

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出感知度意识的数据扩展定律,通过感知度景观预测持续预训练的表现,有效提升数据利用效率和训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20204 2025-12-24 cs.CL cs.AI 73%

Corpus of Cross-lingual Dialogues with Minutes and Detection of Misunderstandings

多语言对话语料库及误解检测

Marko Čechovič, Natália Komorníková, Dominik Macháček, Ondřej Bojar

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理学院) Institute of Formal and Applied Linguistics (ÚFAL)(形式与应用语言学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多语言对话语料库及自动检测误解的方法,通过手动标注和模型测试,验证了Gemini模型在识别误解方面的性能。

Comments 12 pages, 2 figures, 6 tables, published as a conference paper in Text, Speech, and Dialogue 28th International Conference, TSD 2025, Erlangen, Germany, August 25-28, 2025, Proceedings, Part II. This version published here on arXiv.org is before review comments and seedings of the TSD conference staff

Journal ref Text, Speech, and Dialogue 28th International Conference, TSD 2025, Erlangen, Germany, August 25-28, 2025, Proceedings, Part II: Corpus of Cross-Lingual Dialogues with Minutes and Detection of Misunderstandings (pp 301-312)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07414 2025-12-22 cs.AI cs.CL cs.GT 73%

Language Self-Play For Data-Free Training

数据自由训练的语言自博弈

Jakub Grudzien Kuba, Mengting Gu, Qi Ma, Yuandong Tian, Vijai Mohan, Jason Chen

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语言自博弈方法,通过模型与自身博弈实现数据自由训练,提升指令遵循、数学和编码任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12167 2025-12-16 cs.CL cs.AI 73%

Extending the Context of Pretrained LLMs by Dropping Their Positional Embeddings

通过删除预训练语言模型的位置嵌入来扩展上下文

Yoav Gelberg, Koshi Eguchi, Takuya Akiba, Edoardo Cetin

机构 * Sakana AI University of Oxford(牛津大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过删除预训练语言模型的位置嵌入,实现无需长上下文微调的零样本上下文扩展,提升语言模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏