arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12460 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2503.02240 2025-07-15 cs.CL cs.DB 77%

OmniSQL: Synthesizing High-quality Text-to-SQL Data at Scale

Haoyang Li, Shang Wu, Xiaokang Zhang, Xinmei Huang, Jing Zhang, Fuxin Jiang, Shuai Wang, Tieying Zhang, Jianjun Chen, Rui Shi, Hong Chen, Cuiping Li

机构 * Renmin University of China(中国人民大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08603 2025-07-14 cs.AI cs.SD eess.AS 77%

Unlocking Speech Instruction Data Potential with Query Rewriting

Yonghua Hei, Yibo Yan, Shuliang Liu, Huiyu Zhou, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Big Data Research Institute(广西壮族自治区大数据研究院) The Hong Kong University of Science and Technology(香港科技大学) School of Artificial Intelligence, Shanghai Jiaotong University(上海交通大学人工智能学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15379 2025-07-11 cs.IR cs.AI cs.CV 77%

Diffusion Augmented Retrieval: A Training-Free Approach to Interactive Text-to-Image Retrieval

Zijun Long, Kangheng Liang, Gerardo Aragon-Camarasa, Richard Mccreadie, Paul Henderson

机构 * Hunan University(湖南大学) University of Glasgow(格拉斯哥大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05997 2025-07-09 cs.CL 77%

DocIE@XLLM25: In-Context Learning for Information Extraction using Fully Synthetic Demonstrations

Nicholas Popovič, Ashish Kangen, Tim Schopf, Michael Färber

机构 * ScaDS.AI & TU Dresden(ScaDS.AI与德累斯顿技术大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17495 2025-07-03 cs.AI cs.SI 77%

Human Mobility Modeling with Household Coordination Activities under Limited Information via Retrieval-Augmented LLMs

Yifan Liu, Xishun Liao, Haoxuan Ma, Brian Yueshuai He, Chris Stanford, Jiaqi Ma

机构 * UCLA Mobility Lab, Department of Civil and Environmental Engineering, University of California, Los Angeles, Los Angeles, USA(加州大学洛杉矶分校移动实验室,土木与环境工程系,加州大学洛杉矶分校,洛杉矶,美国) Civil and Environmental Engineering Department, University of Louisville, Louisville, Kentucky, USA(路易斯维尔大学土木与环境工程系,路易斯维尔,肯塔基州,美国) Novateur Research Solutions, Ashburn, VA, USA(Novateur研究解决方案,弗吉尼亚州阿什本,美国)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18316 2025-06-24 cs.IR cs.CL 77%

Team LA at SCIDOCA shared task 2025: Citation Discovery via relation-based zero-shot retrieval

Trieu An, Long Nguyen, Minh Le Nguyen

机构 * Japan Advanced Institute of Science and Technology(日本先进科学研究院) Hanoi University of Engineering and Technology(河内工程大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments In the Proceedings of SCIDOCA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06606 2025-06-11 cs.LG 77%

Stacey: Promoting Stochastic Steepest Descent via Accelerated $\ell_p$-Smooth Nonconvex Optimization

Xinyu Luo, Cedar Site Bai, Bolian Li, Petros Drineas, Ruqi Zhang, Brian Bullins

机构 * Purdue University(普渡大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

Journal ref Published in ICML 2025: https://openreview.net/forum?id=TaqwI9qF5Q

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17739 2025-06-11 cs.CL 77%

Enhancing Arabic Automated Essay Scoring with Synthetic Data and Error Injection

Chatrine Qwaider, Bashar Alhafni, Kirill Chirkunov, Nizar Habash, Ted Briscoe

机构 * MBZUAI New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01856 2025-06-11 cs.CL 77%

Poro 34B and the Blessing of Multilinguality

Risto Luukkonen, Jonathan Burdge, Elaine Zosa, Aarne Talman, Ville Komulainen, Väinö Hatanpää, Peter Sarlin, Sampo Pyysalo

机构 * TurkuNLP, University of Turku, Finland(图尔库NLP,图尔库大学,芬兰) Silo AI, Finland(Silo AI,芬兰) University of Helsinki, Finland(赫尔辛基大学,芬兰) CSC – IT Center for Science, Finland(芬兰IT科学中心,芬兰) Aalto University(阿尔托大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07948 2025-06-10 cs.LG cs.CR 77%

TokenBreak: Bypassing Text Classification Models Through Token Manipulation

Kasimir Schulz, Kenneth Yeung, Kieran Evans

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06982 2025-06-10 cs.CL 77%

Chain of Methodologies: Scaling Test Time Computation without Training

Cong Liu, Jie Wu, Weigang Wu, Xu Chen, Liang Lin, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Temple University

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Journal ref ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06244 2025-06-05 cs.LG 77%

PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts

Zeman Li, Yuan Deng, Peilin Zhong, Meisam Razaviyayn, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02350 2025-06-04 cs.CL 77%

Truth over Tricks: Measuring and Mitigating Shortcut Learning in Misinformation Detection

Herun Wan, Jiaying Wu, Minnan Luo, Zhi Zeng, Zhixiong Su

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01675 2025-06-03 cs.CL 77%

Cross-Lingual Transfer of Cultural Knowledge: An Asymmetric Phenomenon

Chen Zhang, Zhiyuan Liao, Yansong Feng

机构 * Wangxuan Institute of Computer Technology(计算机技术研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12583 2025-05-30 cs.CL 77%

LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data

Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Shengjie Ma, Aofan Liu, Hui Xiong, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArc Tech Ltd.(DataArc科技有限公司) Hithink RoyalFlush Information Network Co., Ltd(Hithink皇家Flush信息网络有限公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20672 2025-05-28 cs.AI 77%

GIFARC: Synthetic Dataset for Leveraging Human-Intuitive Analogies to Elevate AI Reasoning

Woochang Sim, Hyunseok Ryu, Kyungmin Choi, Sungwon Han, Sundong Kim

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17102 2025-05-26 cs.CL 77%

BanglaByT5: Byte-Level Modelling for Bangla

Pramit Bhattacharyya, Arnab Bhattacharya

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology Kanpur(计算机科学与工程系,印度理工学院坎浦尔)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16800 2025-05-23 cs.CL 77%

Learning Beyond Limits: Multitask Learning and Synthetic Data for Low-Resource Canonical Morpheme Segmentation

Changbing Yang, Garrett Nicolai

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16340 2025-05-23 cs.LG 77%

Improving Chemical Understanding of LLMs via SMILES Parsing

Yunhui Jang, Jaehyung Kim, Sungsoo Ahn

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16277 2025-05-23 cs.CL 77%

Spontaneous Speech Variables for Evaluating LLMs Cognitive Plausibility

Sheng-Fu Wang, Laurent Prevot, Jou-an Chi, Ri-Sheng Huang, Shu-Kai Hsieh

机构 * Academia Sinica Institute of Linguistics(学术院语言研究所) CNRS & MEAE CEFC(国家科学研究中心与外交与国际合作部CEFC) Graduate Institute of Linguistics National Taiwan University(国立台湾大学语言研究所) Department of CSIE National Taiwan University(国立台湾大学计算机科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments The 14th Workshop on Cognitive Modeling and Computational Linguistics (CMCL). May 3, 2025. Collocated with NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00761 2025-05-23 cs.CL 77%

FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training

Liangyu Xu, Xuemiao Zhang, Feiyu Duan, Sirui Wang, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Peking University(北京大学) Beihang University(北航) Tsinghua University(清华大学) Meituan(美团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14846 2025-05-22 cs.CV cs.CL 77%

Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation

Yue Yang, Ajay Patel, Matt Deitke, Tanmay Gupta, Luca Weihs, Andrew Head, Mark Yatskar, Chris Callison-Burch, Ranjay Krishna, Aniruddha Kembhavi, Christopher Clark

机构 * University of Pennsylvania(宾夕法尼亚大学) Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in ACL 2025, project page: https://yueyang1996.github.io/cosyn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11081 2025-05-19 cs.LG 77%

ShiQ: Bringing back Bellman to LLMs

Pierre Clavier, Nathan Grinsztajn, Raphael Avalos, Yannis Flet-Berliac, Irem Ergun, Omar D. Domingues, Eugene Tarassov, Olivier Pietquin, Pierre H. Richemond, Florian Strub, Matthieu Geist

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07184 2025-05-13 cs.CL 77%

Structural Entropy Guided Agent for Detecting and Repairing Knowledge Deficiencies in LLMs

Yifan Wei, Xiaoyan Yu, Tengfei Pan, Angsheng Li, Li Du

机构 * State Key Laboratory of CCSE,School of Computer Science and Engineering,Beihang University(信息与通信系统国家重点实验室,计算机科学与工程学院,北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Institute of Technology(北京理工大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07157 2025-05-13 cs.CL 77%

HAMLET: Healthcare-focused Adaptive Multilingual Learning Embedding-based Topic Modeling

Hajar Sakai, Sarah S. Lam

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06782 2025-05-13 cs.CL cs.SI 77%

Utilizing LLMs to Investigate the Disputed Role of Evidence in Electronic Cigarette Health Policy Formation in Australia and the UK

Damian Curran, Brian Chapman, Mike Conway

机构 * Computing & Information Systems University of Melbourne(计算与信息系统墨尔本大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06282 2025-05-13 cs.LG 77%

InfoNCE is a Free Lunch for Semantically guided Graph Contrastive Learning

Zixu Wang, Bingbing Xu, Yige Yuan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);pretraining(abstract);分类 cs.LG

Comments 10 pages, 5 figures, Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04660 2025-05-09 cs.CL cs.CV 77%

AI-Generated Fall Data: Assessing LLMs and Diffusion Model for Wearable Fall Detection

Sana Alamgeer, Yasine Souissi, Anne H. H. Ngu

机构 * Texas State University(德克萨斯州立大学) University of North Carolina(北卡罗来纳大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02829 2025-05-06 cs.AI 77%

LISAT: Language-Instructed Segmentation Assistant for Satellite Imagery

Jerome Quenum, Wen-Han Hsieh, Tsung-Han Wu, Ritwik Gupta, Trevor Darrell, David M. Chan

机构 * Department of Electrical Engineering and Computer Sciences, University of California-Berkeley, Berkeley, CA, USA(电气工程与计算机科学系,加州大学伯克利分校)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI

Comments 28 pages, 10 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15993 2025-04-23 cs.CL 77%

Fearful Falcons and Angry Llamas: Emotion Category Annotations of Arguments by Humans and LLMs

Lynn Greschner, Roman Klinger

专题命中 预训练与数据 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments accepted to NLP4DH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏