arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138999 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2506.18316 2025-06-24 cs.IR cs.CL 77%

Team LA at SCIDOCA shared task 2025: Citation Discovery via relation-based zero-shot retrieval

Trieu An, Long Nguyen, Minh Le Nguyen

机构 * Japan Advanced Institute of Science and Technology(日本先进科学研究院) Hanoi University of Engineering and Technology(河内工程大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments In the Proceedings of SCIDOCA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06606 2025-06-11 cs.LG 77%

Stacey: Promoting Stochastic Steepest Descent via Accelerated $\ell_p$-Smooth Nonconvex Optimization

Xinyu Luo, Cedar Site Bai, Bolian Li, Petros Drineas, Ruqi Zhang, Brian Bullins

机构 * Purdue University(普渡大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

Journal ref Published in ICML 2025: https://openreview.net/forum?id=TaqwI9qF5Q

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17739 2025-06-11 cs.CL 77%

Enhancing Arabic Automated Essay Scoring with Synthetic Data and Error Injection

Chatrine Qwaider, Bashar Alhafni, Kirill Chirkunov, Nizar Habash, Ted Briscoe

机构 * MBZUAI New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01856 2025-06-11 cs.CL 77%

Poro 34B and the Blessing of Multilinguality

Risto Luukkonen, Jonathan Burdge, Elaine Zosa, Aarne Talman, Ville Komulainen, Väinö Hatanpää, Peter Sarlin, Sampo Pyysalo

机构 * TurkuNLP, University of Turku, Finland(图尔库NLP,图尔库大学,芬兰) Silo AI, Finland(Silo AI,芬兰) University of Helsinki, Finland(赫尔辛基大学,芬兰) CSC – IT Center for Science, Finland(芬兰IT科学中心,芬兰) Aalto University(阿尔托大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07948 2025-06-10 cs.LG cs.CR 77%

TokenBreak: Bypassing Text Classification Models Through Token Manipulation

Kasimir Schulz, Kenneth Yeung, Kieran Evans

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06982 2025-06-10 cs.CL 77%

Chain of Methodologies: Scaling Test Time Computation without Training

Cong Liu, Jie Wu, Weigang Wu, Xu Chen, Liang Lin, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Temple University

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Journal ref ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06244 2025-06-05 cs.LG 77%

PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts

Zeman Li, Yuan Deng, Peilin Zhong, Meisam Razaviyayn, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02350 2025-06-04 cs.CL 77%

Truth over Tricks: Measuring and Mitigating Shortcut Learning in Misinformation Detection

Herun Wan, Jiaying Wu, Minnan Luo, Zhi Zeng, Zhixiong Su

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01675 2025-06-03 cs.CL 77%

Cross-Lingual Transfer of Cultural Knowledge: An Asymmetric Phenomenon

Chen Zhang, Zhiyuan Liao, Yansong Feng

机构 * Wangxuan Institute of Computer Technology(计算机技术研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12583 2025-05-30 cs.CL 77%

LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data

Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Shengjie Ma, Aofan Liu, Hui Xiong, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArc Tech Ltd.(DataArc科技有限公司) Hithink RoyalFlush Information Network Co., Ltd(Hithink皇家Flush信息网络有限公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20672 2025-05-28 cs.AI 77%

GIFARC: Synthetic Dataset for Leveraging Human-Intuitive Analogies to Elevate AI Reasoning

Woochang Sim, Hyunseok Ryu, Kyungmin Choi, Sungwon Han, Sundong Kim

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17102 2025-05-26 cs.CL 77%

BanglaByT5: Byte-Level Modelling for Bangla

Pramit Bhattacharyya, Arnab Bhattacharya

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology Kanpur(计算机科学与工程系,印度理工学院坎浦尔)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16800 2025-05-23 cs.CL 77%

Learning Beyond Limits: Multitask Learning and Synthetic Data for Low-Resource Canonical Morpheme Segmentation

Changbing Yang, Garrett Nicolai

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16340 2025-05-23 cs.LG 77%

Improving Chemical Understanding of LLMs via SMILES Parsing

Yunhui Jang, Jaehyung Kim, Sungsoo Ahn

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16277 2025-05-23 cs.CL 77%

Spontaneous Speech Variables for Evaluating LLMs Cognitive Plausibility

Sheng-Fu Wang, Laurent Prevot, Jou-an Chi, Ri-Sheng Huang, Shu-Kai Hsieh

机构 * Academia Sinica Institute of Linguistics(学术院语言研究所) CNRS & MEAE CEFC(国家科学研究中心与外交与国际合作部CEFC) Graduate Institute of Linguistics National Taiwan University(国立台湾大学语言研究所) Department of CSIE National Taiwan University(国立台湾大学计算机科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments The 14th Workshop on Cognitive Modeling and Computational Linguistics (CMCL). May 3, 2025. Collocated with NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00761 2025-05-23 cs.CL 77%

FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training

Liangyu Xu, Xuemiao Zhang, Feiyu Duan, Sirui Wang, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Peking University(北京大学) Beihang University(北航) Tsinghua University(清华大学) Meituan(美团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14846 2025-05-22 cs.CV cs.CL 77%

Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation

Yue Yang, Ajay Patel, Matt Deitke, Tanmay Gupta, Luca Weihs, Andrew Head, Mark Yatskar, Chris Callison-Burch, Ranjay Krishna, Aniruddha Kembhavi, Christopher Clark

机构 * University of Pennsylvania(宾夕法尼亚大学) Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in ACL 2025, project page: https://yueyang1996.github.io/cosyn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11081 2025-05-19 cs.LG 77%

ShiQ: Bringing back Bellman to LLMs

Pierre Clavier, Nathan Grinsztajn, Raphael Avalos, Yannis Flet-Berliac, Irem Ergun, Omar D. Domingues, Eugene Tarassov, Olivier Pietquin, Pierre H. Richemond, Florian Strub, Matthieu Geist

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07184 2025-05-13 cs.CL 77%

Structural Entropy Guided Agent for Detecting and Repairing Knowledge Deficiencies in LLMs

Yifan Wei, Xiaoyan Yu, Tengfei Pan, Angsheng Li, Li Du

机构 * State Key Laboratory of CCSE,School of Computer Science and Engineering,Beihang University(信息与通信系统国家重点实验室,计算机科学与工程学院,北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Institute of Technology(北京理工大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07157 2025-05-13 cs.CL 77%

HAMLET: Healthcare-focused Adaptive Multilingual Learning Embedding-based Topic Modeling

Hajar Sakai, Sarah S. Lam

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06782 2025-05-13 cs.CL cs.SI 77%

Utilizing LLMs to Investigate the Disputed Role of Evidence in Electronic Cigarette Health Policy Formation in Australia and the UK

Damian Curran, Brian Chapman, Mike Conway

机构 * Computing & Information Systems University of Melbourne(计算与信息系统墨尔本大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06282 2025-05-13 cs.LG 77%

InfoNCE is a Free Lunch for Semantically guided Graph Contrastive Learning

Zixu Wang, Bingbing Xu, Yige Yuan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);pretraining(abstract);分类 cs.LG

Comments 10 pages, 5 figures, Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04660 2025-05-09 cs.CL cs.CV 77%

AI-Generated Fall Data: Assessing LLMs and Diffusion Model for Wearable Fall Detection

Sana Alamgeer, Yasine Souissi, Anne H. H. Ngu

机构 * Texas State University(德克萨斯州立大学) University of North Carolina(北卡罗来纳大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02829 2025-05-06 cs.AI 77%

LISAT: Language-Instructed Segmentation Assistant for Satellite Imagery

Jerome Quenum, Wen-Han Hsieh, Tsung-Han Wu, Ritwik Gupta, Trevor Darrell, David M. Chan

机构 * Department of Electrical Engineering and Computer Sciences, University of California-Berkeley, Berkeley, CA, USA(电气工程与计算机科学系,加州大学伯克利分校)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI

Comments 28 pages, 10 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15993 2025-04-23 cs.CL 77%

Fearful Falcons and Angry Llamas: Emotion Category Annotations of Arguments by Humans and LLMs

Lynn Greschner, Roman Klinger

专题命中 预训练与数据 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments accepted to NLP4DH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14375 2025-04-22 cs.LG 77%

Bottom-Up Synthesis of Knowledge-Grounded Task-Oriented Dialogues with Iteratively Self-Refined Prompts

Kun Qian, Maximillian Chen, Siyan Li, Arpit Sharma, Zhou Yu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted by NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14368 2025-04-22 cs.LG cs.CR 77%

Do You Really Need Public Data? Surrogate Public Data for Differential Privacy on Tabular Data

Shlomi Hod, Lucas Rosenblatt, Julia Stoyanovich

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13055 2025-04-15 cs.LG cs.DC 77%

Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training

Jared Fernandez, Luca Wehrstedt, Leonid Shamis, Mostafa Elhoushi, Kalyan Saladi, Yonatan Bisk, Emma Strubell, Jacob Kahn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08112 2025-04-14 cs.LG cond-mat.mtrl-sci 77%

Scaling Laws of Graph Neural Networks for Atomistic Materials Modeling

Chaojian Li, Zhifan Ye, Massimiliano Lupo Pasini, Jong Youl Choi, Cheng Wan, Yingyan Celine Lin, Prasanna Balaprakash

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted by DAC'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07964 2025-04-11 cs.LG 77%

C3PO: Critical-Layer, Core-Expert, Collaborative Pathway Optimization for Test-Time Expert Re-Mixing

Zhongyang Li, Ziyue Li, Tianyi Zhou

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏