arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2509.10729 2025-12-23 cs.LG 77%

Using LLMs for Late Multimodal Sensor Fusion for Activity Recognition

利用大语言模型进行晚阶段多模态传感器融合以进行活动识别

Ilker Demirel, Karan Thakkar, Benjamin Elizalde, Miquel Espi Marques, Aditya Sarathy, Yang Bai, Umamahesh Srinivas, Jiajie Xu, Shirley Ren, Jaya Narain

机构 * Apple(苹果公司) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 利用大语言模型进行晚阶段多模态融合,实现零样本和单样本活动分类,无需特定任务训练。

Comments NeurIPS Workshop on Learning from Time Series for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23548 2025-12-16 cs.CL 77%

Translation in the Wild

野外翻译

Yuri Balashov

机构 * Department of Philosophy Institute for Artificial Intelligence University of Georgia(哲学系人工智能研究所佐治亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文探讨了LLMs在翻译任务上的能力来源,提出其可能源于两种不同的预训练数据类型,并讨论了验证这一假设的前景及其对翻译概念的影响。

Comments 4 figures

Journal ref Information 2025, 16, 1077

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23229 2025-12-16 cs.LG 77%

Citegeist: Automated Generation of Related Work Analysis on the arXiv Corpus

Citegeist: 在arXiv语料库上自动生成相关工作分析的应用程序

Claas Beger, Carl-Leander Henneking

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Citegeist通过动态RAG技术在arXiv语料库上自动生成相关工作分析,结合嵌入相似性匹配、总结和多阶段过滤,提供引用支持的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11458 2025-12-15 cs.CV cs.AI 77%

Boosting Skeleton-based Zero-Shot Action Recognition with Training-Free Test-Time Adaptation

通过无训练测试时适应提升基于骨架的零样本动作识别

Jingmin Zhu, Anqi Zhu, Hossein Rahmani, Jun Liu, Mohammed Bennamoun, Qiuhong Ke

机构 * Monash University(墨尔本大学) Lancaster University(兰卡斯特大学) University of Western Australia(西澳大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过引入Skeleton-Cache框架,利用LLM引导的语义先验实现无训练测试时适应,提升基于骨架的零样本动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10630 2025-12-12 cs.CL cs.CY 77%

From Data Scarcity to Data Care: Reimagining Language Technologies for Serbian and other Low-Resource Languages

从数据匮乏到数据关怀:重新构思塞尔维亚及其他低资源语言的语言技术

Smiljana Antonijevic Ubois

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出Data Care框架,旨在通过CARE原则重构低资源语言的语言技术,以解决数据偏见和文化不平等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08548 2025-12-10 cs.RO cs.AI 77%

Bridging Scale Discrepancies in Robotic Control via Language-Based Action Representations

通过基于语言的动作表示弥合机器人控制中的尺度差异

Yuchi Zhang, Churui Sun, Shiqi Liang, Diyuan Liu, Chao Ji, Wei-Nan Zhang, Ting Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出基于语言的动作表示方法,通过规范动作以缓解机器人控制中的尺度差异问题,提升操作任务的泛化能力和迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05648 2025-12-08 cs.LG 77%

Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs

超越数据过滤:LLMs中能力移除的知识定位

Igor Shilov, Alex Cloud, Aryo Pradipta Gema, Jacob Goldman-Wetzler, Nina Panickssery, Henry Sleight, Erik Jones, Cem Anil

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出SGTM方法,通过局部化知识并屏蔽梯度来移除LLM中的危险能力,相比数据过滤和梯度路由,在标签噪声下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03334 2025-12-04 cs.CL 77%

Modeling Topics and Sociolinguistic Variation in Code-Switched Discourse: Insights from Spanish-English and Spanish-Guaraní

在混合语言话语中建模主题与社会语言学变异:来自西班牙-英语和西班牙-瓜拉尼语的洞察

Nemika Tyagi, Nelvin Licona Guevara, Olga Kellert

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究利用大型语言模型构建标注流程,分析西班牙-英语和西班牙-瓜拉尼语混合话语中的主题与社会语言学变异,揭示性别、语言主导地位与话语功能的关系,并扩展了双语现象的定量证据。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03080 2025-12-04 physics.chem-ph cs.AI cs.CE 77%

AtomDisc: An Atom-level Tokenizer that Boosts Molecular LLMs and Reveals Structure--Property Associations

AtomDisc: 一种提升分子大语言模型并揭示结构-性质关联的原子级分词器

Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能动力部,香港科学与技术大学(广州)) The College of Computer Science and Technology, The Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AtomDisc通过原子级分词提升分子LLM性能,揭示结构-性质关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19645 2025-12-02 cs.LG 77%

Tensor-Parallelism with Partially Synchronized Activations

具有部分同步激活的张量并行

Itay Lamprecht, Asaf Karnieli, Yair Hanani, Niv Giladi, Daniel Soudry

机构 * Intel, Israel(英特尔(以色列)) Department of Electrical and Computer Engineering - Technion, Haifa, Israel(技术学院电子与计算机工程系(海法,以色列)) AWS AI Labs(亚马逊AWS人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 CAAT-Net通过部分同步激活减少张量并行通信,提升LLM训练和推断效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00214 2025-12-02 cs.CL 77%

Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis

迈向基于语料库的代理LLM用于多语言语法分析

Matej Klemen, Tjaša Arčon, Luka Terčon, Marko Robnik-Šikonja, Kaja Dobrovoljc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院) University of Ljubljana, Faculty of Arts(卢布尔雅那大学艺术学院) Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于语料库的代理LLM框架,用于多语言语法分析,通过数据驱动推理提升语法探究的可解释性和扩展性。

Comments Pre-print, submission under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16397 2025-11-27 cs.CL 77%

AICC: Parse HTML Finer, Make Models Better -- A 7.3T AI-Ready Corpus Built by a Model-Based HTML Parser

AICC:解析HTML更精细,使模型更优秀——通过基于模型的HTML解析器构建的7.3T AI-ready语料库

Ren Ma, Jiantao Qiu, Chao Xu, Pei Chu, Kaiwen Liu, Pengli Ren, Yuan Qu, Jiahui Peng, Linfeng Hou, Mengjie Liu, Lindong Lu, Wenchang Ning, Jia Yu, Rui Min, Jin Shi, Haojiong Chen, Peng Zhang, Wenjian Zhang, Qian Jiang, Zengjie Hu, Guoqiang Yang, Zhenxiang Li, Fukai Shang, Runyuan Ma, Chenlin Su, Zhongying Tu, Wentao Zhang, Dahua Lin, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 AICC通过基于模型的HTML解析器构建,显著提升了网络数据提取质量,从而在多个基准测试中优于现有方法,证明提取质量对模型性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14993 2025-11-26 cs.AI cs.CV 77%

Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification

多模态生成式AI:多模态大语言模型、扩散模型与统一

Xin Wang, Yuwei Zhou, Bin Huang, Hong Chen, Wenwu Zhu

机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。

Comments 21 pages, 10 figures, 3 tables

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17977 2025-11-25 cs.SE cs.LG cs.NI 77%

Synthesizing Precise Protocol Specs from Natural Language for Effective Test Generation

从自然语言合成精确的协议规范以实现有效的测试生成

Kuangxiangzi Liu, Dhiman Chakraborty, Alexander Liggesmeyer, Andreas Zeller

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出了一种两阶段方法,利用大语言模型从自然语言规范生成形式化协议规范,以提高测试生成的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15192 2025-11-21 cs.AI 77%

As If We've Met Before: LLMs Exhibit Certainty in Recognizing Seen Files

似曾相识:LLM在识别已见过的文件时表现出确定性

Haodong Li, Jingqi Zhang, Xiao Cheng, Peihua Mai, Haoyu Wang, Yan Pang

机构 * Huazhong University of Science and Technology(华中科技大学) National University of Singapore(国立新加坡大学) Macquarie University(麦考瑞大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 COPYCHECK利用LLM的不确定性信号,通过双策略检测训练数据中的受版权内容,实现高准确率的版权检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13159 2025-11-18 cs.CL 77%

Distinguishing Repetition Disfluency from Morphological Reduplication in Bangla ASR Transcripts: A Novel Corpus and Benchmarking Analysis

Zaara Zabeen Arpa, Sadnam Sakib Apurbo, Nazia Karim Khan Oishee, Ajwad Abrar

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Islamic University of Technology(伊斯兰科技大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06151 2025-11-13 cs.CR cs.AI 77%

Joint-GCG: Unified Gradient-Based Poisoning Attacks on Retrieval-Augmented Generation Systems

Haowei Wang, Rupeng Zhang, Junjie Wang, Mingyang Li, Yuekai Huang, Dandan Wang, Qing Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05535 2025-11-11 cs.CL cs.DB cs.IT math.IT 77%

Future of AI Models: A Computational perspective on Model collapse

Trivikram Satharasi, S Sitharama Iyengar

机构 * University of Florida(佛罗里达大学) Florida International University(佛罗里达国际大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Submitted to Springer Nature. Code Available at https://github.com/t-satharasi/AI-Modal-Collapse-Code-for-Reproduction.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01550 2025-11-04 cs.AI 77%

Analyzing Sustainability Messaging in Large-Scale Corporate Social Media

Ujjwal Sharma, Stevan Rudinac, Ana Mićković, Willemijn van Dolen, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01289 2025-11-04 cs.CL 77%

FirstAidQA: A Synthetic Dataset for First Aid and Emergency Response in Low-Connectivity Settings

Saiyma Sittul Muna, Rezwan Islam Salvi, Mushfiqur Rahman Mushfique, Ajwad Abrar

机构 * Islamic University of Technology(伊斯兰技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL

Comments Accepted at the 5th Muslims in Machine Learning (MusIML) Workshop, co-located with NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09889 2025-11-04 cs.CL 77%

BrainLLM: Generative Language Decoding from Brain Recordings

Ziyi Ye, Qingyao Ai, Yiqun Liu, Maarten de Rijke, Min Zhang, Christina Lioma, Tuukka Ruotsalo

机构 * Tsinghua University, Beijing, China(清华大学) University of Amsterdam, Amsterdam, Netherlands(阿姆斯特丹大学) University of Copenhagen, Copenhagen, Denmark(哥本哈根大学) Lappeenranta-Lahti University of Technology, Lappeenranta, Finland(拉普兰塔-拉赫蒂技术大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Nature Communications Biology

Journal ref Communications Biology, 2025, 8(1): 346

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27569 2025-11-03 cs.CL 77%

MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic Retrieval

Qi Luo, Xiaonan Li, Yuxin Wang, Tingshuo Fan, Yuan Li, Xinchi Chen, Xipeng Qiu

机构 * School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07877 2025-11-03 cs.CL 77%

Ready to Translate, Not to Represent? Bias and Performance Gaps in Multilingual LLMs Across Language Families and Domains

Md. Faiyaz Abdullah Sayeedi, Md. Mahbub Alam, Subhey Sadi Rahman, Md. Adnanul Islam, Jannatul Ferdous Deepti, Tasnim Mohiuddin, Md Mofijul Islam, Swakkhar Shatabda

机构 * United International University(国际联合大学) Qatar Computing Research Institute(卡塔尔计算研究所) Amazon GenAI(亚马逊生成人工智能) University of Virginia(弗吉尼亚大学) BRAC University(布拉克大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16325 2025-10-31 cs.CL 77%

This Candidate is [MASK]. Prompt-based Sentiment Extraction and Reference Letters

Fabian Slonimczyk

机构 * International College of Economics and Finance, HSE(俄罗斯经济金融国际学院,俄罗斯)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22694 2025-10-28 cs.CV cs.CL cs.IR 77%

Windsock is Dancing: Adaptive Multimodal Retrieval-Augmented Generation

Shu Zhao, Tianyi Shen, Nilesh Ahuja, Omesh Tickoo, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Intel(英特尔)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025 UniReps Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22099 2025-10-28 cs.CL 77%

Generalization or Memorization: Dynamic Decoding for Mode Steering

Xuanming Zhang

机构 * Stanford University, Palo Alto, USA(斯坦福大学) Department of Computer Science, University of Wisconsin-Madison, Madison, USA(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21867 2025-10-28 cs.CV cs.AI 77%

Addressing Corner Cases in Autonomous Driving: A World Model-based Approach with Mixture of Experts and LLMs

Haicheng Liao, Bonan Wang, Junxian Yang, Chengyue Wang, Zhengbin He, Guohui Zhang, Chengzhong Xu, Zhenning Li

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学) Department of Civil and Environmental Engineering, University of Macau(土木与环境工程系,澳门大学) Senseable City Lab, Massachusetts Institute of Technology(可感知城市实验室,麻省理工学院) Department of Civil and Environmental Engineering, University of Hawaii(土木与环境工程系,夏威夷大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21836 2025-10-28 cs.LG 77%

COLA: Continual Learning via Autoencoder Retrieval of Adapters

Jaya Krishna Mandivarapu

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20083 2025-10-27 cs.CL 77%

Universal Cross-Tokenizer Distillation via Approximate Likelihood Matching

Benjamin Minixhofer, Ivan Vulić, Edoardo Maria Ponti

机构 * University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19806 2025-10-23 cs.CL 77%

The Art of Asking: Multilingual Prompt Optimization for Synthetic Data

David Mora, Viraat Aryabumi, Wei-Yin Ko, Sara Hooker, Julia Kreutzer, Marzieh Fadaee

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏