arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2601.04301 2026-02-09 cs.LG cs.CL 73%

Quantifying the Effect of Test Set Contamination on Generative Evaluations

量化测试集污染对生成评估的影响

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi, Ken Ziyu Liu, Brando Miranda, Ahmed Ahmed, Fazl Berez, Abhay Puri, Stella Biderman, Niloofar Mireshghallah, Sanmi Koyejo

机构 * University of Oxford(牛津大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05106 2026-02-06 cs.CL cs.LG stat.ML 73%

Data Kernel Perspective Space Performance Guarantees for Synthetic Data from Transformer Models

变换器模型合成数据的Data Kernel视角空间性能保证

Michael Browder, Kevin Duh, J. David Harris, Vince Lyzinski, Paul McNamee, Youngser Park, Carey E. Priebe, Peter Viechnicki

机构 * Department of Mathematics at the University of Maryland, College Park(马里兰大学College Park数学系) Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人机语言技术中心) Center for Imaging Science (CIS), the Institute for Computational Medicine (ICM), and the Mathematical Institute for Data Science (MINDS), Johns Hopkins University(约翰霍普金斯大学影像科学中心(CIS)、计算医学研究所(ICM)和数据科学数学研究所(MINDS)) Department of Applied Mathematics and Statistics (AMS), the Center for Imaging Science (CIS), and the Mathematical Institute for Data Science (MINDS), Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系(AMS)、影像科学中心(CIS)和数据科学数学研究所(MINDS))

专题命中 预训练与数据 :LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Data Kernel Perspective Space(DKPS)方法,通过数学分析为变换器模型的合成数据质量提供统计保证,旨在提升下游任务如神经机器翻译模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 73%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02619 2026-02-05 cs.LG cs.AI cs.SE 73%

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

daVinci-Agency: 解锁长周期代理数据高效性

Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03772 2026-02-04 cs.LG cs.AI 73%

UniGeM: Unifying Data Mixing and Selection via Geometric Exploration and Mining

UniGeM: 通过几何探索与挖掘统一数据混合与选择

Changhao Wang, Yunfei Yu, Xinhao Yao, Jiaolong Yang, Riccardo Cantoro, Chaobo Li, Qing Cui, Jun Zhou

机构 * Politecnico di Torino(托斯大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Institute of Microelectronics of the CAS(中国科学院微电子研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 UniGeM通过几何探索与挖掘统一数据混合与选择,提升大语言模型的数据效率和推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00576 2026-02-03 cs.LG cs.AI 73%

Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs

数据分布作为引导优化器实现LLM超一般化的杠杆

Tushaar Gangavarapu, Jiping Li, Christopher Vattheuer, Zhangyang Wang, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过调整训练数据分布降低简单性偏见,提升大型语言模型的泛化能力,实验表明在数学推理任务中性能提升达18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI 73%

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00068 2026-02-02 cs.CL cs.AI 73%

Framing Political Bias in Multilingual LLMs Across Pakistani Languages

在巴基斯坦多种语言中框架化政治偏见

Afrozah Nadeem, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了巴基斯坦五种语言中13种先进LLM的政治偏见,发现其在区域语言中表现出更集权的框架,强调文化适应的偏见审计框架的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17858 2026-01-27 cs.LG cs.AI 73%

MergeMix: Optimizing Mid-Training Data Mixtures via Learnable Model Merging

MergeMix: 通过可学习模型合并优化中训练数据混合

Jiapeng Wang, Changxin Tian, Kunlong Chen, Ziqi Liu, Jiaxin Mao, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MergeMix通过可学习模型合并权重优化中训练数据混合,实现高效的数据混合优化,性能优于传统手动调优,且具有高一致性与强可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15118 2026-01-23 cs.SD cs.CL cs.LG 73%

WavLink: Compact Audio-Text Embeddings with a Global Whisper Token

WavLink: 基于全局Whisper标记的紧凑音频-文本嵌入

Gokul Karthik Kumar, Ludovick Lepauloux, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究所)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 WavLink通过在Whisper编码器中引入可学习的全局标记,实现紧凑的音频-文本嵌入,提升了模型的可扩展性和检索性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07192 2026-01-13 cs.CL cs.AI 73%

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

Relink:为GraphRAG构建查询驱动的证据图谱

Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03469 2026-01-08 econ.EM cs.AI cs.CL cs.CY 73%

Content vs. Form: What Drives the Writing Score Gap Across Socioeconomic Backgrounds? A Generated Panel Approach

内容与形式:不同社会经济背景下写作分数差距的驱动因素?一种生成面板方法

Nadav Kunievsky, Pedro Pertusi

机构 * Knowledge Lab, University of Chicago(芝加哥大学知识实验室) Insper, Institute of Education and Research(Insper教育与研究学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过生成面板方法研究社会经济地位对写作分数差距的影响,发现内容质量占69%,风格差异占26%,评估标准差异占5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03420 2026-01-08 cs.LG cs.AI cs.CR 73%

Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks

无需梯度或先验知识的LLM劫持:有效且可转移的攻击

Zhakshylyk Nurlanov, Frank R. Schmidt, Florian Bernard

机构 * Department of Visual Computing, University of Bonn(视觉计算系,波恩大学) Bosch Center for Artificial Intelligence(博世人工智能中心) University of Bonn(波恩大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RAILS通过无需梯度或先验知识的令牌级迭代优化,实现了对LLM的有效且可转移的对抗性攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23163 2026-01-08 cs.CL cs.AI 73%

Beyond Direct Generation: A Decomposed Approach to Well-Crafted Screenwriting with LLMs

超越直接生成:一种分解方法用于利用LLM进行精心构思的剧本创作

Hang Lei, Shengyi Zong, Zhaoyan Li, Ziren Zhou, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出双阶段细化框架,通过分解生成方法提升LLM在剧本创作中的表现,实现高质量剧本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15722 2026-01-08 cs.CL cs.AI 73%

Shared Path: Unraveling Memorization in Multilingual LLMs through Language Similarities

共享路径:通过语言相似性揭示多语言大语言模型中的记忆现象

Xiaoyu Luo, Yiyi Chen, Johannes Bjerva, Qiongxiu Li

机构 * Department of Computer Science(计算机科学系) Department of Electronic Systems(电子系统系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过语言相似性分析,揭示多语言大语言模型中记忆现象的跨语言关联及其影响因素。

Comments 17 pages, 14 tables, 10 figures

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 19372-19388, Suzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21043 2026-01-05 cs.AI cs.LG 73%

Combinatorial Creativity: A New Frontier in Generalization Abilities

组合创造力:一般化能力的新前沿

Samuel Schapiro, Sumuk Shashidhar, Alexi Gladstone, Jonah Black, Royce Moon, Dilek Hakkani-Tur, Lav R. Varshney

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science(计算与数据科学学院) Spiral Works AI Innovation Institute(人工智能创新研究所) Stony Brook University(石溪大学) Simons Institute for the Theory of Computing, Berkeley(伯克利理论计算研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出组合创造力的概念,通过理论框架和算法任务评估LLMs的创造力,并发现最优模型参数和新颖性-实用性权衡对提升创造力的重要性。

Comments Preprint. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14975 2026-01-05 cs.LG cs.AI cs.RO 73%

Flattening Hierarchies with Policy Bootstrapping

通过策略自举 flattening 层次结构

John L. Zhou, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种通过自举子目标策略训练平坦目标条件策略的方法,解决长horizon任务中GCRL扩展难题,实现高维控制性能提升。

Comments NeurIPS 2025 (Spotlight, top 3.2%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06696 2026-01-05 cs.CL cs.LG 73%

Simple and Effective Input Reformulations for Translation

简单而有效的输入改写用于翻译

Brian Yu, Hansen Lillemark, Kurt Keutzer

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文通过简单输入改写方法提升翻译任务的性能,实验表明在佛洛斯200基准测试中性能提升达3.5 chrF++。

Comments 13 pages, 6 figures. To be published in Empirical Methods in Natural Language Processing (Main) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22293 2025-12-30 cs.LG cs.CL cs.CR 73%

Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against

从负例学习:为什么警告框架的训练数据教会了它所警告的内容

Tsogt-Ochir Enkhbayar

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现,警告框架的训练数据未能有效阻止模型学习警告行为,而是通过统计共现性主导了模型的学习过程。

Comments Submitted to Neel Nanda's MATS Stream

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00654 2025-12-30 cs.CV cs.CL cs.LG 73%

ICONS: Influence Consensus for Vision-Language Data Selection

ICONS: 视觉-语言数据选择中的影响共识

Xindi Wu, Mengzhou Xia, Rulin Shao, Zhiwei Deng, Pang Wei Koh, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind) Allen Institute for AI(人工智能研究院)

专题命中 预训练与数据 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 ICONS通过影响共识方法高效选择视觉-语言数据,保持高性能并支持多任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21515 2025-12-29 cs.LG cs.CL 73%

Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training

感知度意识的数据扩展定律:感知度景观预测持续预训练的表现

Lei Liu, Hao Zhu, Yue Shen, Zhixuan Chu, Jian Wang, Jinjie Gu, Kui Ren

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出感知度意识的数据扩展定律,通过感知度景观预测持续预训练的表现,有效提升数据利用效率和训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20204 2025-12-24 cs.CL cs.AI 73%

Corpus of Cross-lingual Dialogues with Minutes and Detection of Misunderstandings

多语言对话语料库及误解检测

Marko Čechovič, Natália Komorníková, Dominik Macháček, Ondřej Bojar

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理学院) Institute of Formal and Applied Linguistics (ÚFAL)(形式与应用语言学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多语言对话语料库及自动检测误解的方法,通过手动标注和模型测试,验证了Gemini模型在识别误解方面的性能。

Comments 12 pages, 2 figures, 6 tables, published as a conference paper in Text, Speech, and Dialogue 28th International Conference, TSD 2025, Erlangen, Germany, August 25-28, 2025, Proceedings, Part II. This version published here on arXiv.org is before review comments and seedings of the TSD conference staff

Journal ref Text, Speech, and Dialogue 28th International Conference, TSD 2025, Erlangen, Germany, August 25-28, 2025, Proceedings, Part II: Corpus of Cross-Lingual Dialogues with Minutes and Detection of Misunderstandings (pp 301-312)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07414 2025-12-22 cs.AI cs.CL cs.GT 73%

Language Self-Play For Data-Free Training

数据自由训练的语言自博弈

Jakub Grudzien Kuba, Mengting Gu, Qi Ma, Yuandong Tian, Vijai Mohan, Jason Chen

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语言自博弈方法,通过模型与自身博弈实现数据自由训练,提升指令遵循、数学和编码任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12167 2025-12-16 cs.CL cs.AI 73%

Extending the Context of Pretrained LLMs by Dropping Their Positional Embeddings

通过删除预训练语言模型的位置嵌入来扩展上下文

Yoav Gelberg, Koshi Eguchi, Takuya Akiba, Edoardo Cetin

机构 * Sakana AI University of Oxford(牛津大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过删除预训练语言模型的位置嵌入,实现无需长上下文微调的零样本上下文扩展,提升语言模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13867 2025-12-03 cs.AI cs.LG 73%

Generative Fuzzy System for Sequence Generation

生成模糊系统用于序列生成

Hailong Yang, Zhaohong Deng, Wei Zhang, Zhuangzhuang Zhao, Guanjin Wang, Kup-sze Choi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合数据与知识驱动机制的生成模糊系统框架GenFS,用于提升序列生成任务的准确性和流畅性。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18934 2025-11-25 cs.CL cs.AI cs.DB 73%

Skeletons Matter: Dynamic Data Augmentation for Text-to-Query

骨架很重要:面向文本到查询的动态数据增强

Yuchen Ji, Bo Xu, Jie Shi, Jiaqing Liang, Deqing Yang, Yu Mao, Hai Chen, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Computer Science and Technology, Donghua University(东华大学计算机科学与技术学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Ant Group(蚂蚁集团) Shanghai Key Laboratory of Data Science(上海数据科学 key laboratory)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种动态数据增强框架,通过识别查询骨架作为共同优化目标,提升文本到查询任务的泛化能力和效率。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17161 2025-11-24 cs.CL cs.AI 73%

The PLLuM Instruction Corpus

PLLuM指令语料库

Piotr Pęzik, Filip Żarnecki, Konrad Kaczyński, Anna Cichosz, Zuzanna Deckert, Monika Garnys, Izabela Grabarczyk, Wojciech Janowski, Sylwia Karasińska, Aleksandra Kujawiak, Piotr Misztela, Maria Szymańska, Karolina Walkusz, Igor Siek, Maciej Chrabąszcz, Anna Kołos, Agnieszka Karlińska, Karolina Seweryn, Aleksandra Krasnodębska, Paula Betscher, Zofia Cieślińska, Katarzyna Kowol, Artur Wilczek, Maciej Trzciński, Katarzyna Dziewulska, Roman Roszko, Tomasz Bernaś, Jurgita Vaičenonienė, Danuta Roszko, Paweł Levchuk, Paweł Kowalski, Irena Prawdzic-Jankowska, Marek Kozłowski, Sławomir Dadas, Rafał Poświata, Alina Wróblewska, Katarzyna Krasnowska-Kieraś, Maciej Ogrodniczuk, Michał Rudolf, Piotr Rybak, Karolina Saputa, Joanna Wołoszyn, Marcin Oleksy, Bartłomiej Koptyra, Teddy Ferdinan, Stanisław Woźniak, Maciej Piasecki, Paweł Walkowiak, Konrad Wojtasik, Arkadiusz Janz, Przemysław Kazienko, Julia Moska, Jan Kocoń

机构 * University of Lodz(卢兹大学) NASK National Research Institute(国家研究 institute) Institute of Slavic Studies PAS(波兰科学院斯拉夫研究所) National Information Processing Institute(国家信息处理研究所) Institute of Computer Science PAS(波兰科学院计算机科学研究所) Wroclaw Tech(沃拉日县技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PLLuM项目构建了首个指令语料库,用于微调大语言模型,分析人工与合成指令数据对语言适应的影响,并发布首个代表性子集供其他模型开发参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10819 2025-11-21 cs.AI cs.LG 73%

PoE-World: Compositional World Modeling with Products of Programmatic Experts

PoE-World: 通过程序专家的乘积进行组合世界建模

Wasu Top Piriyakulkij, Yichao Liang, Hao Tang, Adrian Weller, Marta Kryven, Kevin Ellis

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Dalhousie University(达尔豪斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PoE-World通过程序专家的乘积有效建模复杂非网格世界领域,利用LLMs学习世界模型并实现高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14334 2025-11-20 cs.AI cs.LG 73%

When Words Change the Model: Sensitivity of LLMs for Constraint Programming Modelling

Alessio Pellegrino, Jacopo Mauro

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14806 2025-11-20 q-bio.GN cs.AI cs.LG 73%

MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging

Siyuan Li, Kai Yu, Anna Wang, Zicheng Liu, Chang Yu, Jingbo Zhou, Qirong Yang, Yucheng Guo, Xiaoming Zhang, Stan Z. Li

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

Comments AAAI 2026 (Oral Presentation) Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏