arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-04 至 2025-11-04 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 35 篇

2511.01090 2025-11-04 cs.CL 90%

Improving Romanian LLM Pretraining Data using Diversity and Quality Filtering

Vlad Negoita, Mihai Masala, Traian Rebedea

机构 * National University of Science and Technology(科学与技术国家大学) POLITEHNICA Bucharest(布加勒斯特理工大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24448 2025-11-04 cs.CV cs.AI 89%

Rethinking Visual Intelligence: Insights from Video Pretraining

Pablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf, Ahmad Rahimi, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern(伯尔尼大学计算机视觉组) VITA Lab, EPFL(苏黎世联邦理工学院VITA实验室)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Updated version from preprint arXiv:2506.07280 (Gen2Gen) focused on visual intelligence. This work can be considered as v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00318 2025-11-04 cs.LG cs.AI stat.ML 86%

A Technical Exploration of Causal Inference with Hybrid LLM Synthetic Data

Dana Kim, Yichen Xu, Tiffany Lin

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01840 2025-11-04 cs.CY cs.AI 85%

A Detailed Study on LLM Biases Concerning Corporate Social Responsibility and Green Supply Chains

Greta Ontrup, Annika Bush, Markus Pauly, Meltem Aksoy

机构 * Research Center Trustworthy Data Science and Security, University Alliance Ruhr(可信数据科学与安全研究所以及鲁尔大学联盟) Department of Computer Science, University of Duisburg-Essen(杜伊斯堡- Essen大学计算机科学系) Department of Computer Science, Technical University Dortmund(图恩大学计算机科学系) Chair of Mathematical Statistics and Applications in Industry, Technical University Dortmund(工业数学统计与应用教授职位,图恩大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 37 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04340 2025-11-04 cs.CL cs.AI 84%

Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time

Daniel Tan, Anders Woodruff, Niels Warncke, Arun Jose, Maxime Riché, David Demitri Africa, Mia Taylor

机构 * University College London(伦敦大学学院) Center on Long-Term Risk(长期风险中心) McGill University(麦吉尔大学) UK AI Security Institute(英国人工智能安全研究所)

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 40 pages, 22 figures. Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00346 2025-11-04 cs.CR cs.AI cs.LG 84%

Exploiting Latent Space Discontinuities for Building Universal LLM Jailbreaks and Data Extraction Attacks

Kayua Oleques Paim, Rodrigo Brandao Mansilha, Diego Kreutz, Muriel Figueredo Franco, Weverton Cordeiro

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 5 figures, 4 tables, Published at the Brazilian Symposium on Cybersecurity (SBSeg 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09846 2025-11-04 cs.LG cs.AI math.OC stat.ML 84%

Through the River: Understanding the Benefit of Schedule-Free Methods for Language Model Training

Minhak Song, Beomhan Baek, Kwangjun Ahn, Chulhee Yun

机构 * KAIST(韩国科学技术院) SNU & KAIST InnoCORE LLM(首尔国立大学及韩国科学技术院InnoCORE LLM) Microsoft Research(微软研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00341 2025-11-04 cs.CL 83%

Reversal Invariance in Autoregressive Language Models

Mihir Sahasrabudhe

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments 7 pages, theoretical note

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16713 2025-11-04 cs.CL 81%

so much depends / upon / a whitespace: Why Whitespace Matters for Poets and LLMs

Sriharsh Bhyravajjula, Melanie Walsh, Anna Preus, Maria Antoniak

机构 * University of Washington(华盛顿大学) University of Colorado Boulder(科罗拉多大学 Boulder分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Journal ref Text2Story Workshop @ ECIR 2022, CEUR Workshop Proceedings, Vol. 3117, pp. 67-74, 2022. Available at https://ceur-ws.org/Vol-3117/paper7.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00049 2025-11-04 cs.LG cs.AI 81%

Adaptive Spatio-Temporal Graphs with Self-Supervised Pretraining for Multi-Horizon Weather Forecasting

Yao Liu

机构 * School of Computer Science, Xiangtan University, Xiangtan, 411105, China(计算机学院,湘潭大学,湘潭,411105,中国)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01615 2025-11-04 cs.CL cs.AI 79%

Imperfect Language, Artificial Intelligence, and the Human Mind: An Interdisciplinary Approach to Linguistic Errors in Native Spanish Speakers

Francisco Portillo López

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01512 2025-11-04 cs.CL cs.AI 79%

BanglaNirTox: A Large-scale Parallel Corpus for Explainable AI in Bengali Text Detoxification

Ayesha Afroza Mohsin, Mashrur Ahsan, Nafisa Maliyat, Shanta Maria, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Under review, 6 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01550 2025-11-04 cs.AI 77%

Analyzing Sustainability Messaging in Large-Scale Corporate Social Media

Ujjwal Sharma, Stevan Rudinac, Ana Mićković, Willemijn van Dolen, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01289 2025-11-04 cs.CL 77%

FirstAidQA: A Synthetic Dataset for First Aid and Emergency Response in Low-Connectivity Settings

Saiyma Sittul Muna, Rezwan Islam Salvi, Mushfiqur Rahman Mushfique, Ajwad Abrar

机构 * Islamic University of Technology(伊斯兰技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL

Comments Accepted at the 5th Muslims in Machine Learning (MusIML) Workshop, co-located with NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09889 2025-11-04 cs.CL 77%

BrainLLM: Generative Language Decoding from Brain Recordings

Ziyi Ye, Qingyao Ai, Yiqun Liu, Maarten de Rijke, Min Zhang, Christina Lioma, Tuukka Ruotsalo

机构 * Tsinghua University, Beijing, China(清华大学) University of Amsterdam, Amsterdam, Netherlands(阿姆斯特丹大学) University of Copenhagen, Copenhagen, Denmark(哥本哈根大学) Lappeenranta-Lahti University of Technology, Lappeenranta, Finland(拉普兰塔-拉赫蒂技术大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Nature Communications Biology

Journal ref Communications Biology, 2025, 8(1): 346

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17359 2025-11-04 cs.IR 75%

MLLM-Driven Semantic Identifier Generation for Generative Cross-Modal Retrieval

Tianyuan Li, Lei Wang, Ahtamjan Ahmat, Yating Yang, Bo Ma, Rui Dong, Bangju Han

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract)

Comments We plan to revise the methodology and update the experimental analysis before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10707 2025-11-04 cs.LG cs.AI 73%

ConTextTab: A Semantics-Aware Tabular In-Context Learner

Marco Spinaci, Marek Polewczyk, Maximilian Schambach, Sam Thelin

机构 * SAP France(SAP法国分公司) SAP SE(SAP德国分公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted as spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01258 2025-11-04 cs.CL cs.AI 73%

Measuring Algorithmic Partisanship via Zero-Shot Classification and Its Implications on Political Discourse

Nathan Junzi Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03869 2025-11-04 cs.LG cs.AI 73%

Outlier Gradient Analysis: Efficiently Identifying Detrimental Training Samples for Deep Learning Models

Anshuman Chhabra, Bo Li, Jian Chen, Prasant Mohapatra, Hongfu Liu

机构 * University of South Florida, Tampa, FL, USA(佛罗里达州立大学) Brandeis University, Waltham, MA, USA(布兰迪大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted to ICML 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01791 2025-11-04 cs.RO cs.AI 70%

GenDexHand: Generative Simulation for Dexterous Hands

Feng Chen, Zhuxiu Xu, Tianzhe Chu, Xunzhe Zhou, Li Sun, Zewen Wu, Shenghua Gao, Zhongyu Li, Yanchao Yang, Yi Ma

机构 * The University of Hong Kong(香港大学) Transcengram Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01589 2025-11-04 cs.CL 70%

BIRD: Bronze Inscription Restoration and Dating

Wenjie Hua, Hoang H. Nguyen, Gangyan Ge

机构 * Wuhan University(武汉大学) University of Illinois, Chicago(伊利诺伊大学芝加哥分校) Xinjiang University(新疆大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00875 2025-11-04 cs.IR cs.LG 70%

Controlling Gender Bias in Retrieval via a Backpack Architecture

Amirabbas Afzali, Amirreza Velae, Iman Ahmadi, Mohammad Aliannejadi

机构 * Sharif University of Technology(谢里夫理工大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00446 2025-11-04 cs.CV cs.CR cs.LG 70%

ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training

Xin Yao, Haiyang Zhao, Yimin Chen, Jiawei Guo, Kecheng Huang, Ming Zhao

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Miner School of Computer & Information Sciences, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校Miner计算机与信息科学学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23763 2025-11-04 cs.RO cs.CL cs.CV 70%

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

Siyin Wang, Jinlan Fu, Feihong Liu, Xinzhe He, Huangxuan Wu, Junhao Shi, Kexin Huang, Zhaoye Fei, Jingjing Gong, Zuxuan Wu, Yu-Gang Jiang, See-Kiong Ng, Tat-Seng Chua, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23719 2025-11-04 cs.LG 70%

TiRex: Zero-Shot Forecasting Across Long and Short Horizons with Enhanced In-Context Learning

Andreas Auer, Patrick Podest, Daniel Klotz, Sebastian Böck, Günter Klambauer, Sepp Hochreiter

机构 * NXAI GmbH(NXAI公司) ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单元、LIT AI实验室、机器学习研究所) Interdisciplinary Transformation University Austria(跨学科转型大学奥地利)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00268 2025-11-04 cs.CL cs.AI cs.IR cs.LG 67%

IL-PCSR: Legal Corpus for Prior Case and Statute Retrieval

Shounak Paul, Dhananjay Ghumare, Pawan Goyal, Saptarshi Ghosh, Ashutosh Modi

机构 * IIT Kharagpur(印度克哈格普尔理工学院) IIT Kanpur(印度坎普尔理工学院)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12205 2025-11-04 cs.SE 67%

PredicateFix: Repairing Static Analysis Alerts with Bridging Predicates

Yuan-An Xiao, Weixuan Wang, Dong Liu, Junwei Zhou, Shengyu Cheng, Yingfei Xiong

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

Comments 13 pages, 5 figures; accepted for ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06111 2025-11-04 cs.RO cs.AI cs.LG 62%

UniVLA: Learning to Act Anywhere with Task-centric Latent Actions

Qingwen Bu, Yanting Yang, Jisong Cai, Shenyuan Gao, Guanghui Ren, Maoqing Yao, Ping Luo, Hongyang Li

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

Comments Accepted to RSS 2025. Code is available at https://github.com/OpenDriveLab/UniVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00191 2025-11-04 cs.CV cs.AI cs.LG 62%

A Retrospect to Multi-prompt Learning across Vision and Language

Ziliang Chen, Xin Huang, Quanlong Guan, Liang Lin, Weiqi Luo

机构 * Jinan University(济南大学) Sun Yat-sen University(中山大学) Pazhou Laboratory(琶洲实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

Comments ICCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00987 2025-11-04 cs.LG 57%

Balanced Multimodal Learning via Mutual Information

Rongrong Xie, Guido Sanguinetti

机构 * Scuola Internazionale Superiore di Studi Avanzati (SISSA)(国际先进研究学院(SISSA))

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏