arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12452 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12452 篇

2501.05952 2025-06-10 cs.CV cs.CL 85%

Scalable Vision Language Model Training via High Quality Data Curation

Hongyuan Dong, Zijian Kang, Weijie Yin, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Douyin Content Group(字节跳动抖音内容团队)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);SFT(abstract);分类 cs.CL

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02592 2025-06-04 cs.CL 85%

Beyond the Surface: Measuring Self-Preference in LLM Judgments

Zhi-Yuan Chen, Hao Wang, Xinyu Zhang, Enrui Hu, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) Huawei Poisson Lab(华为Poisson实验室) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01814 2025-06-03 cs.CL cs.SI 85%

Analysis of LLM Bias (Chinese Propaganda & Anti-US Sentiment) in DeepSeek-R1 vs. ChatGPT o3-mini-high

PeiHsuan Huang, ZihWei Lin, Simon Imbot, WenCheng Fu, Ethan Tu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13917 2025-06-03 cs.CL 85%

TESS 2: A Large-Scale Generalist Diffusion Language Model

Jaesung Tae, Hamish Ivison, Sachin Kumar, Arman Cohan

机构 * Yale University(耶鲁大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) The Ohio State University(俄亥俄州立大学)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL

Comments ACL 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24263 2025-06-02 cs.CL 85%

Simulating Training Data Leakage in Multiple-Choice Benchmarks for LLM Evaluation

Naila Shafirni Hidayat, Muhammad Dehan Al Kautsar, Alfan Farizki Wicaksono, Fajri Koto

机构 * Faculty of Computer Science, Universitas Indonesia(印度尼西亚大学计算机科学学院) Department of Natural Language Processing, MBZUAI(MBZUAI自然语言处理部门)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15712 2025-06-02 cs.CL cs.HC 85%

Contrastive Learning for Task-Independent SpeechLLM-Pretraining

Maike Züfle, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11441 2025-05-29 cs.CL 85%

Which Retain Set Matters for LLM Unlearning? A Case Study on Entity Unlearning

Hwan Chang, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Korea(人工智能系, Chung-Ang 大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20380 2025-05-28 cs.LG 85%

GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining

Simin Fan, Maria Ios Glarou, Martin Jaggi

机构 * EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20023 2025-05-27 cs.CL 85%

Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking

Yihan Chen, Benfeng Xu, Xiaorui Wang, Yongdong Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone技术公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17410 2025-05-26 cs.SD cs.CL eess.AS 85%

LLM-based Generative Error Correction for Rare Words with Synthetic Data and Phonetic Context

Natsuo Yamashita, Masaaki Yamamoto, Hiroaki Kokubo, Yohei Kawaguchi

机构 * Hitachi, Litd.Japan(日本日立公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by INTERSPEECH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11726 2025-05-21 cs.CL cs.HC 85%

Revealing and Mitigating the Challenge of Detecting Character Knowledge Errors in LLM Role-Playing

Wenyuan Zhang, Shuaiyi Nie, Jiawei Sheng, Zefeng Zhang, Xinghua Zhang, Yongquan He, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Alibaba Inc.(阿里巴巴公司) Meituan Inc.(美团公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 25 pages, 6 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12031 2025-05-20 cs.AI 85%

LLM-based Automated Theorem Proving Hinges on Scalable Synthetic Data Generation

Junyu Lai, Jiakun Zhang, Shuo Xu, Taolue Chen, Zihang Wang, Yao Yang, Jiarui Zhang, Chun Cao, Jingwei Xu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01052 2025-05-14 cs.LG 85%

ALinFiK: Learning to Approximate Linearized Future Influence Kernel for Scalable Third-Party LLM Data Valuation

Yanzhou Pan, Huawei Lin, Yide Ran, Jiamin Chen, Xiaodong Yu, Weijie Zhao, Denghui Zhang, Zhaozhuo Xu

机构 * Google LLC(谷歌公司) Rochester Institute of Technology(罗切斯特理工学院) Stevens Institute of Technology(史蒂文斯理工学院) Northeastern University(东北大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Proceedings of the NAACL 2025. Keywords: Influence Function, Data Valuation, Influence Estimation. https://aclanthology.org/2025.naacl-long.589/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07609 2025-05-13 eess.AS cs.LG cs.SD 85%

TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining

Paul Primus, Florian Schmid, Gerhard Widmer

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments submitted to the IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), 2025. Dataset (Zenodo): https://zenodo.org/records/15379789, Implementation (GitHub): https://github.com/OptimusPrimus/tacos

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04996 2025-05-09 cs.CL 85%

Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models

Weixin Liang, Lili Yu, Liang Luo, Srinivasan Iyer, Ning Dong, Chunting Zhou, Gargi Ghosh, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Xi Victoria Lin

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted to TMLR 2025; 48 pages

Journal ref Transactions on Machine Learning Research (2025), ISSN: 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03196 2025-05-07 cs.NI cs.AI 85%

A Trustworthy Multi-LLM Network: Challenges,Solutions, and A Use Case

Haoxiang Luo, Gang Sun, Yinqiu Liu, Dusit Niyato, Hongfang Yu, Mohammed Atiquzzaman, Schahram Dustdar

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) University of Oklahoma(俄克拉荷马大学) TU Wien(维也纳技术大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00030 2025-05-02 cs.CL 85%

Can Language Models Represent the Past without Anachronism?

Ted Underwood, Laura K. Nelson, Matthew Wilkens

机构 * School of Information Sciences, University of Illinois(伊利诺伊大学信息科学学院) Department of Sociology, University of British Columbia(不列颠哥伦比亚大学社会学系) Department of Information Science, Cornell University(康奈尔大学信息科学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08563 2025-04-29 cs.AI cs.CY stat.AP 85%

Vox Populi, Vox AI? Using Language Models to Estimate German Public Opinion

Leah von der Heyde, Anna-Carolina Haensch, Alexander Wenz

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

Journal ref Social Science Computer Review (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18106 2025-04-28 cs.CL 85%

Comparative Study on the Discourse Meaning of Chinese and English Media in the Paris Olympics Based on LDA Topic Modeling Technology and LLM Prompt Engineering

Yinglong Yu, Zhaopu Yao, Fang Yuan

机构 * Communication University of China(中国传媒大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15548 2025-04-23 cs.CL cs.CY 85%

LLM-based Semantic Augmentation for Harmful Content Detection

Elyas Meguellati, Assaad Zeghina, Shazia Sadiq, Gianluca Demartini

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01534 2025-04-03 cs.CL 85%

Context-Aware Toxicity Detection in Multiplayer Games: Integrating Domain-Adaptive Pretraining and Match Metadata

Adrien Schurger-Foy, Rafal Dariusz Kocielnik, Caglar Gulcehre, R. Michael Alvarez

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11425 2025-03-25 cs.AI 85%

Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training

Siyu Yuan, Zehui Chen, Zhiheng Xi, Junjie Ye, Zhengyin Du, Jiecao Chen

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);language agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19482 2025-03-21 cs.LG 85%

Measuring memorization in language models via probabilistic extraction

Jamie Hayes, Marika Swanberg, Harsh Chaudhari, Itay Yona, Ilia Shumailov, Milad Nasr, Christopher A. Choquette-Choo, Katherine Lee, A. Feder Cooper

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

Comments NAACL 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18042 2025-03-21 cs.CV cs.CL 85%

EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions

Kai Chen, Yunhao Gou, Runhui Huang, Zhili Liu, Daxin Tan, Jing Xu, Chunwei Wang, Yi Zhu, Yihan Zeng, Kuo Yang, Dingdong Wang, Kun Xiang, Haoyuan Li, Haoli Bai, Jianhua Han, Xiaohui Li, Weike Jin, Nian Xie, Yu Zhang, James T. Kwok, Hengshuang Zhao, Xiaodan Liang, Dit-Yan Yeung, Xiao Chen, Zhenguo Li, Wei Zhang, Qun Liu, Jun Yao, Lanqing Hong, Lu Hou, Hang Xu

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.CL

Comments Accepted by CVPR 2025. Project Page: https://emova-ollm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15571 2025-03-21 cs.SE cs.ET cs.IR cs.LG cs.PL 85%

LLM-Aided Customizable Profiling of Code Data Based On Programming Language Concepts

Pankaj Thorat, Adnan Qidwai, Adrija Dhar, Aishwariya Chakraborty, Anand Eswaran, Hima Patel, Praveen Jayachandran

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00057 2025-03-21 cs.CV cs.CL 85%

Improved YOLOv12 with LLM-Generated Synthetic Data for Enhanced Apple Detection and Benchmarking Against YOLOv11 and YOLOv10

Ranjan Sapkota, Manoj Karkee

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 8 pages, 5 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09481 2025-03-13 cs.CL 85%

BAMBI: Developing Baby Language Models for Italian

Alice Suozzi, Luca Capone, Gianluca E. Lebani, Alessandro Lenci

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17954 2025-03-13 cs.AI 85%

Enhancing elusive clues in knowledge learning by contrasting attention of language models

Jian Gao, Xiao Zhang, Ji Wu, Miao Li

专题命中 预训练与数据 :language model(title,abstract);small language model(abstract);pretraining(abstract);分类 cs.AI

Comments Oral presentation in AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04429 2025-03-05 cs.CV cs.LG 85%

VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation

Yecheng Wu, Zhuoyang Zhang, Junyu Chen, Haotian Tang, Dacheng Li, Yunhao Fang, Ligeng Zhu, Enze Xie, Hongxu Yin, Li Yi, Song Han, Yao Lu

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.LG

Comments Code: https://github.com/mit-han-lab/vila-u. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16533 2025-03-05 cs.CL 85%

Tool Learning in the Wild: Empowering Language Models as Automatic Tool Agents

Zhengliang Shi, Shen Gao, Lingyong Yan, Yue Feng, Xiuyi Chen, Zhumin Chen, Dawei Yin, Suzan Verberne, Zhaochun Ren

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Accepted by WWW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏