arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-18 至 2025-11-18 共收录 33 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 33 篇

2511.12116 2025-11-18 cs.CL cs.AI 91%

LLMLagBench: Identifying Temporal Training Boundaries in Large Language Models

Piotr Pęzik, Konrad Kaczyński, Maria Szymańska, Filip Żarnecki, Zuzanna Deckert, Jakub Kwiatkowski, Wojciech Janowski

机构 * University of Lodz(洛兹大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18966 2025-11-18 cs.CL 89%

DataGen: Unified Synthetic Dataset Generation via Large Language Models

Yue Huang, Siyuan Wu, Chujie Gao, Dongping Chen, Qihui Zhang, Yao Wan, Tianyi Zhou, Jianfeng Gao, Chaowei Xiao, Lichao Sun, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Huazhong University of Science and Technology(华中科技大学) MBZUAI University of Washington(华盛顿大学) Peking University(北京大学) University of Maryland, College Park(马里兰大学学院市分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Lehigh University(莱斯大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12131 2025-11-18 cs.CV cs.AI 89%

OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description

Quanxing Xu, Ling Zhou, Feifei Zhang, Jinyu Tian, Rubing Huang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06031 2025-11-18 q-fin.ST cs.CL cs.LG q-fin.TR 88%

FinGPT: Open-Source Financial Large Language Models

Hongyang Yang, Xiao-Yang Liu, Christina Dan Wang

机构 * AI4Finance Foundation(AI4Finance基金会) Columbia University(哥伦比亚大学) New York University Shanghai(纽约大学上海)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by the FinLLM Symposium at IJCAI 2023. Recipient of the Best Presentation Award (Hongyang Yang). Workshop link: https://finllm.github.io/workshop. This is the first official FinGPT paper; please cite this work when referencing FinGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09862 2025-11-18 cs.LG 88%

RadarLLM: Empowering Large Language Models to Understand Human Motion from Millimeter-Wave Point Cloud Sequence

Zengyuan Lai, Jiarui Yang, Songpengcheng Xia, Lizhou Lin, Lan Sun, Renwen Wang, Jianran Liu, Qi Wu, Ling Pei

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments Accepted by AAAI 2026 (extended version with supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13647 2025-11-18 cs.CV 88%

Part-X-MLLM: Part-aware 3D Multimodal Large Language Model

Chunshi Wang, Junliang Ye, Yunhan Yang, Yang Li, Zizhuo Lin, Jun Zhu, Zhuo Chen, Yawei Luo, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08961 2025-11-18 cs.SD eess.AS 88%

DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models

Yuanyuan Wang, Dongchao Yang, Yiwen Shao, Hangting Chen, Jiankun Zhao, Zhiyong Wu, Helen Meng, Xixin Wu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13640 2025-11-18 cs.LG cs.AI 86%

Data Value in the Age of Scaling: Understanding LLM Scaling Dynamics Under Real-Synthetic Data Mixtures

Haohui Wang, Jingyuan Qi, Jianpeng Chen, Jun Wu, Lifu Huang, Lecheng Zheng, Kevin Choi, Balaji Veeramani, Edward Bowen, Alison Hu, Tyler Cody, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Michigan State University(密歇根州立大学) University of California, Davis(加州大学戴维斯分校) Deloitte(德勤)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10338 2025-11-18 cs.CL cs.AI 86%

BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages

Guduru Manoj, Neel Prabhanjan Rachamalla, Ashish Kulkarni, Gautam Rajeev, Jay Piplodiya, Arul Menezes, Shaharukh Khan, Souvik Rana, Manya Sah, Chandra Khatri, Shubham Agarwal

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12448 2025-11-18 cs.CR cs.AI 85%

SeedAIchemy: LLM-Driven Seed Corpus Generation for Fuzzing

Aidan Wen, Norah A. Alzahrani, Jingzhi Jiang, Andrew Joe, Karen Shieh, Andy Zhang, Basel Alomair, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11622 2025-11-18 cs.LG cs.AI cs.CL 85%

Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models

Alexis Roger, Gwen Legate, Kashif Rasul, Yuriy Nevmyvaka, Irina Rish

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12768 2025-11-18 cs.CL cs.AI 84%

Evidence of Phase Transitions in Small Transformer-Based Language Models

Noah Hong, Tao Hong

机构 * Lynbrook High School(林brook高中) Keysight Technologies(Keysight技术公司)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11572 2025-11-18 cs.GL cs.CL cs.LG 84%

LLM Architecture, Scaling Laws, and Economics: A Quick Summary

William H. Press

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11912 2025-11-18 cs.LG cs.CR 83%

A Systematic Study of Model Extraction Attacks on Graph Foundation Models

Haoyan Xu, Ruizhi Qian, Jiate Li, Yushun Dong, Minghao Lin, Hanson Yan, Zhengtao Yao, Qinghua Liu, Junhao Dong, Ruopeng Huang, Yue Zhao, Mengyuan Li

机构 * University of Southern California(南加州大学) Florida State University(佛罗里达州立大学) The Ohio State University(俄亥俄州立大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12475 2025-11-18 cs.CL cs.AI 81%

PhayaThaiBERT: Enhancing a Pretrained Thai Language Model with Unassimilated Loanwords

Panyut Sriwirote, Jalinee Thapiang, Vasan Timtong, Attapol T. Rutherford

机构 * Department of Linguistics Chulalongkorn University(语言学系朱拉隆功大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

Comments revised to fix formatting error, content unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11940 2025-11-18 cs.LG eess.SP 80%

Learning the relative composition of EEG signals using pairwise relative shift pretraining

Christopher Sandino, Sayeri Lala, Geeling Chau, Melika Ayoughi, Behrooz Mahasseni, Ellen Zippi, Ali Moin, Erdrin Azemi, Hanlin Goh

机构 * Apple(苹果公司) Stanford University(斯坦福大学) California Institute of Technology(加州理工学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG;foundation model(comments)

Comments Foundation Models for the Brain and Body NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13150 2025-11-18 cs.CV 78%

Skeletons Speak Louder than Text: A Motion-Aware Pretraining Paradigm for Video-Based Person Re-Identification

Rifen Lin, Alex Jinpeng Wang, Jiawei Mo, Min Li

专题命中 预训练与数据 :pretraining(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13159 2025-11-18 cs.CL 77%

Distinguishing Repetition Disfluency from Morphological Reduplication in Bangla ASR Transcripts: A Novel Corpus and Benchmarking Analysis

Zaara Zabeen Arpa, Sadnam Sakib Apurbo, Nazia Karim Khan Oishee, Ajwad Abrar

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Islamic University of Technology(伊斯兰科技大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12690 2025-11-18 cs.CL cs.AI cs.LG 75%

Improving Direct Persian-English Speech-to-Speech Translation with Discrete Units and Synthetic Parallel Data

Sina Rashidi, Hossein Sameti

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02124 2025-11-18 cs.AI cs.CL cs.LG 75%

Trainable Dynamic Mask Sparse Attention

Jingze Shi, Yifan Wu, Yiran Peng, Bingheng Wu, Liangdong Wang, Guang Liu, Yuyu Luo

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09287 2025-11-18 cs.AI cs.CY cs.LG 73%

From Model Training to Model Raising

Roland Aydin, Christian Cyron, Steve Bachelor, Ashton Anderson, Robert West

机构 * Hamburg University of Technology(汉堡理工大学) Helmholtz-Zentrum Hereon(海德堡研究中心) University of Toronto(多伦多大学) EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in Communications of the ACM (CACM), Opinion section

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13022 2025-11-18 cs.LG 72%

Learning Time-Scale Invariant Population-Level Neural Representations

Eshani Patel, Yisong Yue, Geeling Chau

机构 * Computing & Mathematical Sciences(计算与数学科学) Computation & Neural Systems(计算与神经系统) California Institute of Technology(加州理工学院)

专题命中 预训练与数据 :foundation model(abstract,comments);pretraining(abstract);分类 cs.LG

Comments 10 pages, 5 figures, NeurIPS 2025 Foundation Models for the Brain and Body

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12452 2025-11-18 cs.CV cs.CL 70%

DenseAnnotate: Enabling Scalable Dense Caption Collection for Images and 3D Scenes via Spoken Descriptions

Xiaoyu Lin, Aniket Ghorpade, Hansheng Zhu, Justin Qiu, Dea Rrozhani, Monica Lama, Mick Yang, Zixuan Bian, Ruohan Ren, Alan B. Hong, Jiatao Gu, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24645 2025-11-18 cs.AI 70%

FunReason-MT Technical Report: Advanced Data Synthesis Solution for Real-world Multi-Turn Tool-use

Zengzhuang Xu, Bingguang Hao, Zechuan Wang, Yuntao Wen, Xinyi Xu, Yang Liu, Long Chen, Dong Wang, Maolin Wang, Tong Zhao, Yicheng Chen, Cunyin Peng, Jinjie Gu, Leilei Gan, Xiangyu Zhao, Chenyi Zhuang, Shi Gu

机构 * Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12188 2025-11-18 cs.LG 70%

Scaling Law Analysis in Federated Learning: How to Select the Optimal Model Size?

Xuanyu Chen, Nan Yang, Shuai Wang, Dong Yuan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments The extended version of the paper "Scaling Law Analysis in Federated Learning: How to Select the Optimal Model Size?". Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01211 2025-11-18 econ.GN cs.CE cs.CL cs.DL q-fin.EC 70%

Novelty and Impact of Economics Papers

Chaofeng Wu

机构 * Department of Computer Science, Northwestern University(计算机科学系,西北大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13685 2025-11-18 cs.LG cs.AI 62%

Protein Secondary Structure Prediction Using 3D Graphs and Relation-Aware Message Passing Transformers

Disha Varshney, Samarth Garg, Sarthak Tyagi, Deeksha Varshney, Nayan Deep, Asif Ekbal

机构 * Banaras Hindu University, Varanasi, India(班纳拉锡大学) Indiana University, Bloomington(印第安纳大学) Indian Institute of Technology Jodhpur, India(印度理工学院朱罗尔分校) Indian Institute of Technology Patna, India(印度理工学院帕坦分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09443 2025-11-18 cs.CL cs.LG 62%

Scaling Laws for Conditional Emergence of Multilingual Image Captioning via Generalization from Translation

Julian Spravil, Sebastian Houben, Sven Behnke

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13655 2025-11-18 cs.CV cs.LG 57%

OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation

Henry Herzog, Favyen Bastani, Yawen Zhang, Gabriel Tseng, Joseph Redmon, Hadrien Sablon, Ryan Park, Jacob Morrison, Alexandra Buraczynski, Karen Farley, Joshua Hansen, Andrew Howe, Patrick Alan Johnson, Mark Otterlee, Ted Schmitt, Hunter Pitelka, Stephen Daspit, Rachel Ratner, Christopher Wilhelm, Sebastian Wood, Mike Jacobi, Hannah Kerner, Evan Shelhamer, Ali Farhadi, Ranjay Krishna, Patrick Beukema

机构 * Allen Institute for AI(人工智能研究所) University of Washington(华盛顿大学) Arizona State University(亚利桑那州立大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13497 2025-11-18 cs.LG quant-ph 57%

Quantum Machine Learning via Contrastive Training

Liudmila A. Zhukas, Vivian Ni Zhang, Qiang Miao, Qingfeng Wang, Marko Cetina, Jungsang Kim, Lawrence Carin, Christopher Monroe

机构 * Duke Quantum Center, Duke University(杜克大学量子中心,杜克大学) Department of Physics, Duke University(杜克大学物理系) Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Physics and Astronomy, Tufts University(塔夫茨大学物理与天文学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

Comments 7 figures, 20 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏