arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2508.11758 2025-10-22 cs.CL cs.AI 73%

Can we Evaluate RAGs with Synthetic Data?

Jonas van Elburg, Peter van der Putten, Maarten Marx

机构 * IRLab, Informatics Institute, UvA, Amsterdam, the Netherlands(IR实验室、信息研究所、乌得勒支大学、阿姆斯特丹、荷兰) AI Lab, Pegasystems, Amsterdam, the Netherlands(AI实验室、佩加系统的阿姆斯特丹分部) LIACS, Leiden University, Leiden, the Netherlands(LIACS、莱顿大学、莱顿、荷兰)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted for the SynDAiTE workshop at the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML-PKDD 2025), September 15, 2025 - Porto, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02456 2025-10-21 cs.LG cs.AI cs.NA math.NA 73%

Market-Driven Subset Selection for Budgeted Training

Ashish Jha, Valentin Leplat, AH Phan

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所) Innopolis University(因诺波利斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Retitled major revision of the same work (formerly "Market-Based Data Subset Selection -- Principled Aggregation of Multi-Criteria Example Utility"). Abstract and exposition revised; ablations added; theory clarified. Core results unchanged. Supersedes v1; please process as a replacement

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09004 2025-10-21 cs.CL cs.CY cs.LG 73%

Hope vs. Hate: Understanding User Interactions with LGBTQ+ News Content in Mainstream US News Media through the Lens of Hope Speech

Jonathan Pofcher, Christopher M. Homan, Randall Sell, Ashiqur R. KhudaBukhsh

机构 * Rochester Institute of Technology(罗切斯特理工学院) Drexel University(德雷塞尔大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16007 2025-10-21 cs.LG cs.AI 73%

Layer-Aware Influence for Online Data Valuation Estimation

Ziao Yang, Longbo Huang, Hongfu Liu

机构 * Department of Computer Science(计算机科学系) Brandeis University(布兰迪斯大学) Institute for Interdisciplinary Information Sciences(交叉信息科学研究院) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12634 2025-10-20 cs.CV cs.AI cs.CL cs.RO 73%

MotionScript: Natural Language Descriptions for Expressive 3D Human Motions

Payam Jome Yazdian, Rachel Lagasse, Hamid Mohammadi, Eric Liu, Li Cheng, Angelica Lim

机构 * School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算机科学系) Dept. of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Project webpage: https://pjyazdian.github.io/MotionScript

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09710 2025-10-16 cs.CL cs.AI 73%

SeCon-RAG: A Two-Stage Semantic Filtering and Conflict-Free Framework for Trustworthy RAG

Xiaonan Si, Meilin Zhu, Simeng Qin, Lijia Yu, Lijun Zhang, Shuaitong Liu, Xinfeng Li, Ranjie Duan, Yang Liu, Xiaojun Jia

机构 * Institute of Software Chinese Academy of Sciences Beijing China(中国科学院软件研究所) Key Laboratory of System Software (Chinese Academy of Sciences) and State Key Laboratory of Computer Science, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院系统软件重点实验室和计算机科学国家重点实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Northeast University China(东北大学) Institute of Ai For industries Nanjing China(人工智能产业研究院) Southwest University China(西南大学) Nanyang Technological University Singapore(新加坡南洋理工大学) Alibaba China(阿里巴巴(中国))

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06635 2025-10-09 cs.LG cs.AI stat.ML 73%

Valid Inference with Imperfect Synthetic Data

Yewon Byun, Shantanu Gupta, Zachary C. Lipton, Rachel Leah Childers, Bryan Wilder

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) University of Zurich(苏黎世大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00656 2025-10-09 cs.CL cs.LG 73%

2 OLMo 2 Furious

Team OLMo, Pete Walsh, Luca Soldaini, Dirk Groeneveld, Kyle Lo, Shane Arora, Akshita Bhagia, Yuling Gu, Shengyi Huang, Matt Jordan, Nathan Lambert, Dustin Schwenk, Oyvind Tafjord, Taira Anderson, David Atkinson, Faeze Brahman, Christopher Clark, Pradeep Dasigi, Nouha Dziri, Allyson Ettinger, Michal Guerquin, David Heineman, Hamish Ivison, Pang Wei Koh, Jiacheng Liu, Saumya Malik, William Merrill, Lester James V. Miranda, Jacob Morrison, Tyler Murray, Crystal Nam, Jake Poznanski, Valentina Pyatkin, Aman Rangapur, Michael Schmitz, Sam Skjonsberg, David Wadden, Christopher Wilhelm, Michael Wilson, Luke Zettlemoyer, Ali Farhadi, Noah A. Smith, Hannaneh Hajishirzi

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) New York University(纽约大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Shorter version accepted to COLM 2025. Updated to include 32B results. Model demo available at playground.allenai.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07731 2025-10-06 cs.CL cs.LG eess.AS 73%

Spoken Language Understanding on Unseen Tasks With In-Context Learning

Neeraj Agrawal, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Journal ref Proc. Interspeech 2025, 4103-4107

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04408 2025-10-02 cs.CL cs.AI 73%

Unpacking Let Alone: Human-Scale Models Generalize to a Rare Construction in Form but not Meaning

Wesley Scivetti, Tatsuya Aoyama, Ethan Wilcox, Nathan Schneider

机构 * Georgetown University(杰克逊维尔大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments Empirical Methods for Natural Language Processing (EMNLP) 2025, Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26507 2025-10-01 cs.NE cs.AI cs.LG stat.ML 73%

The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain

Adrian Kosowski, Przemysław Uznański, Jan Chorowski, Zuzanna Stamirowska, Michał Bartoszkiewicz

机构 * Pathway

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Code available at: https://github.com/pathwaycom/bdh Accompanying blog: https://pathway.com/research/bdh

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13322 2025-09-26 cs.IR cs.AI cs.LG 73%

Scaling Laws for Online Advertisement Retrieval

Yunli Wang, Zhen Zhang, Zixuan Yang, Tianyu Xu, Zhiqiang Wang, Yu Li, Rufan Zhou, Zhiqiang Liu, Yanjie Zhu, Jian Yang, Shiyang Wen, Peng Jiang

机构 * Kuaishou Technology(快手科技) M-A-P

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments v2 add some theoretical analysis and experimental validation; 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18938 2025-09-24 cs.CV cs.AI cs.LG 73%

No Labels Needed: Zero-Shot Image Classification with Collaborative Self-Learning

Matheus Vinícius Todescato, Joel Luís Carbonera

机构 * Institute of Informatics(信息学院) UFRGS(乌拉圭国家研究学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments This paper was accepted at International Conference on Tools with Artificial Intelligence (ICTAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15447 2025-09-22 cs.CL cs.AI 73%

PILOT: Steering Synthetic Data Generation with Psychological & Linguistic Output Targeting

Caitlin Cisar, Emily Sheffield, Joshua Drake, Alden Harrell, Subramanian Chidambaram, Nikita Nangia, Vinayak Arannil, Alex Williams

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15283 2025-09-22 cs.SE cs.AI cs.LG cs.PL 73%

Evaluating the Limitations of Local LLMs in Solving Complex Programming Challenges

Kadin Matotek, Heather Cassel, Md Amiruzzaman, Linh B. Ngo

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Comments: 16 pages, 3 figures, 8 tables, accepted to CCSC Eastern 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11417 2025-09-18 cs.RO cs.AI cs.CV cs.LG 73%

Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations

Shresth Grover, Akshay Gopalkrishnan, Bo Ai, Henrik I. Christensen, Hao Su, Xuanlin Li

机构 * UC San Diego(圣迭戈大学) Hillbot

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Project Page: https://gen-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13305 2025-09-17 cs.LG cs.CL 73%

WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning

Kuan Li, Zhongwang Zhang, Huifeng Yin, Rui Ye, Yida Zhao, Liwen Zhang, Litu Ou, Dingchu Zhang, Xixi Wu, Jialong Wu, Xinyu Wang, Zile Qiao, Zhen Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

专题命中 预训练与数据 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.LG

Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11176 2025-09-16 cs.CL cs.AI 73%

Differentially-private text generation degrades output language quality

Erion Çano, Ivan Habernal

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 3 figures, 35 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17767 2025-09-16 cs.CL cs.LG 73%

ISACL: Internal State Analyzer for Copyrighted Training Data Leakage

Guangwei Zhang, Qisheng Su, Jiateng Liu, Cheng Qian, Yanzhou Pan, Yanjie Fu, Denghui Zhang

机构 * City University of Hong Kong(香港城市大学) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google LLC(谷歌公司) Arizona State University(亚利桑那州立大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04871 2025-09-08 cs.AI cs.LG 73%

Cloning a Conversational Voice AI Agent from Call\,Recording Datasets for Telesales

Krittanon Kaewtawee, Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn

机构 * Amity AI Research and Application Center(阿米蒂AI研究与应用中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04515 2025-09-08 cs.CL cs.AI 73%

Mitigation of Gender and Ethnicity Bias in AI-Generated Stories through Model Explanations

Martha O. Dimgba, Sharon Oba, Ameeta Agrawal, Philippe J. Giabbanelli

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04485 2025-09-08 cs.CL cs.AI 73%

ASCENDgpt: A Phenotype-Aware Transformer Model for Cardiovascular Risk Prediction from Electronic Health Records

Chris Sainsbury, Andreas Karwath

机构 * NHS Greater Glasgow and Clyde(英国格拉斯哥和克莱德国家健康服务署) University of Birmingham(伯明翰大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19475 2025-09-04 cs.CV astro-ph.GA cs.AI cs.LG 73%

GalaxAlign: Mimicking Citizen Scientists' Multimodal Guidance for Galaxy Morphology Analysis

Ruoqi Wang, Haitao Wang, Qiong Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) School of Computer Science and Engineering, Sun Yat-Sen University(中山大学计算机科学与工程学院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13748 2025-09-04 cs.CL cs.LG 73%

Learn and Unlearn: Addressing Misinformation in Multilingual LLMs

Taiming Lu, Philipp Koehn

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22771 2025-09-03 cs.CL cs.AI 73%

Automated Essay Scoring Incorporating Annotations from Automated Feedback Systems

Christopher Ormerod

机构 * Cambium Assessment Inc.(Cambium评估公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, AIME-Con Conference Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14252 2025-09-03 cs.CL cs.AI 73%

From Intents to Conversations: Generating Intent-Driven Dialogues with Contrastive Learning for Multi-Turn Classification

Junhua Liu, Yong Keat Tan, Bin Fu, Kwan Hui Lim

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to Proceedings of CIKM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00375 2025-09-03 cs.CL cs.AI 73%

Open Data Synthesis For Deep Research

Ziyi Xia, Kun Luo, Hongjin Qian, Zheng Liu

机构 * BAAI(北京人工智能研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11465 2025-09-03 cs.LG cs.CL 73%

Re-examining learning linear functions in context

Omar Naim, Guilhem Fouilhé, Nicholas Asher

机构 * Institut de Recherche en Informatique de Toulouse, IRIT France(图卢兹信息研究所,IRIT法国) Université de Toulouse, France(图卢兹大学,法国) CNRS, France(法国国家科学研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Journal ref KI 2025: Advances in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11017 2025-08-29 cs.CL cs.AI 73%

Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics

Carter Blum, Katja Filippova, Ann Yuan, Asma Ghandeharioun, Julian Zimmert, Fred Zhang, Jessica Hoffmann, Tal Linzen, Martin Wattenberg, Lucas Dixon, Mor Geva

机构 * Google DeepMind(谷歌DeepMind) Tel Aviv University(特拉维夫大学) Harvard University(哈佛大学) New York University(纽约大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19570 2025-08-28 cs.LG cs.AI 73%

Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era

Dawei Li, Yue Huang, Ming Li, Tianyi Zhou, Xiangliang Zhang, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) University of Notre Dame(圣母大学) University of Maryland(马里兰大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by CIKM 2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏