arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-09 至 2025-10-09 共收录 196 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2510.07000 2025-10-09 cs.CL cs.AI 86%

Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages

Neel Prabhanjan Rachamalla, Aravind Konakalla, Gautam Rajeev, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06530 2025-10-09 cs.CR cs.ET cs.LG cs.NI 85%

From Description to Detection: LLM based Extendable O-RAN Compliant Blind DoS Detection in 5G and Beyond

Thusitha Dayaratne, Ngoc Duy Pham, Viet Vo, Shangqi Lai, Sharif Abuadbba, Hajime Suzuki, Xingliang Yuan, Carsten Rudolph

机构 * Monash University(莫纳什大学) Swinburne University of Technology(斯威本科技大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织(CSIRO)的数据61研究所) The University of Melbourne(墨尔本大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04152 2025-10-09 cs.CL 85%

Rethinking Multilingual Continual Pretraining: Data Mixing for Adapting LLMs Across Languages and Resources

Zihao Li, Shaoxiong Ji, Hengyu Luo, Jörg Tiedemann

机构 * University of Helsinki(赫尔辛基大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06673 2025-10-09 cs.CV cs.AI 79%

Heptapod: Language Modeling on Visual Signals

Yongxin Zhu, Jiawei Chen, Yuanzhe Chen, Zhuo Chen, Dongya Jia, Jian Cong, Xiaobin Zhuang, Yuping Wang, Yuxuan Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06280 2025-10-09 cs.CY cs.AI cs.CV 79%

Surgeons Are Indian Males and Speech Therapists Are White Females: Auditing Biases in Vision-Language Models for Healthcare Professionals

Zohaib Hasan Siddiqui, Dayam Nadeem, Mohammad Masudur Rahman, Mohammad Nadeem, Shahab Saquib Sohail, Beenish Moalla Chaudhry

机构 * University of Louisiana at Lafayette(路易斯安那大学拉斐特分校) Aligarh Muslim University(阿尔瓦格穆斯林大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07192 2025-10-09 cs.LG 77%

Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples

Alexandra Souly, Javier Rando, Ed Chapman, Xander Davies, Burak Hasircioglu, Ezzeldin Shereen, Carlos Mougan, Vasilios Mavroudis, Erik Jones, Chris Hicks, Nicholas Carlini, Yarin Gal, Robert Kirk

机构 * UK AI Security Institute(英国人工智能安全研究所) Anthropic Alan Turing Institute(艾伦·图灵研究所) OATML, University of Oxford(OATML,牛津大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06232 2025-10-09 q-bio.TO cs.LG 77%

Neu-RadBERT for Enhanced Diagnosis of Brain Injuries and Conditions

Manpreet Singh, Sean Macrae, Pierre-Marc Williams, Nicole Hung, Sabrina Araujo de Franca, Laurent Letourneau-Guillon, François-Martin Carrier, Bang Liu, Yiorgos Alexandros Cavayas

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

Comments Both Manpreet Singh and Sean Macrae contributed equally and should be considered co-first authors. Corresponding author: Yiorgos Alexandros Cavayas

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06635 2025-10-09 cs.LG cs.AI stat.ML 73%

Valid Inference with Imperfect Synthetic Data

Yewon Byun, Shantanu Gupta, Zachary C. Lipton, Rachel Leah Childers, Bryan Wilder

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) University of Zurich(苏黎世大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00656 2025-10-09 cs.CL cs.LG 73%

2 OLMo 2 Furious

Team OLMo, Pete Walsh, Luca Soldaini, Dirk Groeneveld, Kyle Lo, Shane Arora, Akshita Bhagia, Yuling Gu, Shengyi Huang, Matt Jordan, Nathan Lambert, Dustin Schwenk, Oyvind Tafjord, Taira Anderson, David Atkinson, Faeze Brahman, Christopher Clark, Pradeep Dasigi, Nouha Dziri, Allyson Ettinger, Michal Guerquin, David Heineman, Hamish Ivison, Pang Wei Koh, Jiacheng Liu, Saumya Malik, William Merrill, Lester James V. Miranda, Jacob Morrison, Tyler Murray, Crystal Nam, Jake Poznanski, Valentina Pyatkin, Aman Rangapur, Michael Schmitz, Sam Skjonsberg, David Wadden, Christopher Wilhelm, Michael Wilson, Luke Zettlemoyer, Ali Farhadi, Noah A. Smith, Hannaneh Hajishirzi

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) New York University(纽约大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Shorter version accepted to COLM 2025. Updated to include 32B results. Model demo available at playground.allenai.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06590 2025-10-09 cs.CV 67%

Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer

Ziyuan Huang, DanDan Zheng, Cheng Zou, Rui Liu, Xiaolong Wang, Kaixiang Ji, Weilong Chai, Jianxin Sun, Libin Wang, Yongjie Lv, Taozhi Huang, Jiajia Liu, Qingpei Guo, Ming Yang, Jingdong Chen, Jun Zhou

机构 * Inclusion AI Ant Group(Inclusion AI Ant集团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

Comments Code released at https://github.com/inclusionAI/Ming-UniVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00606 2025-10-09 cs.DC 67%

ElasWave: An Elastic-Native System for Scalable Hybrid-Parallel Training

Xueze Kang, Guangyu Xiang, Yuxin Wang, Hao Zhang, Yuchu Fang, Yuhang Zhou, Zhenheng Tang, Youhui Lv, Eliran Maman, Mark Wasserman, Alon Zameret, Zhipeng Bian, Shushu Chen, Zhiyou Yu, Jin Wang, Xiaoyu Wu, Yang Zheng, Chen Tian, Xiaowen Chu

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06949 2025-10-09 cs.LG cs.AI 62%

Grouped Differential Attention

Junghwan Lim, Sungmin Lee, Dongseok Kim, Wai Ting Cheung, Beomgyu Kim, Taehwan Kim, Haesol Lee, Junhyeok Lee, Dongpin Oh, Eunhwan Park

机构 * Motif Technologies(Motif科技)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15561 2025-10-09 cs.CL cs.IR 57%

Do RAG Systems Really Suffer From Positional Bias?

Florin Cuconasu, Simone Filice, Guy Horowitz, Yoelle Maarek, Fabrizio Silvestri

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Technology Innovation Institute(技术创新研究所)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16096 2025-10-09 cs.CV 50%

MarkushGrapher: Joint Visual and Textual Recognition of Markush Structures

Lucas Morin, Valéry Weber, Ahmed Nassar, Gerhard Ingmar Meijer, Luc Van Gool, Yawei Li, Peter Staar

专题命中 预训练与数据 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06504 2025-10-09 cs.CV 50%

Text2Interact: High-Fidelity and Diverse Text-to-Two-Person Interaction Generation

Qingxuan Wu, Zhiyang Dou, Chuan Guo, Yiming Huang, Qiao Feng, Bing Zhou, Jian Wang, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司)

专题命中 预训练与数据 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 18 篇

2404.12353 2025-10-09 cs.CV cs.AI 89%

V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning

Hang Hua, Yolo Yunlong Tang, Chenliang Xu, Jiebo Luo

专题命中 指令微调 :LLM(title,abstract);instruction tuning(title);large language model(abstract);language model(abstract)

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00280 2025-10-09 cs.CR cs.LG 89%

Advancing TTP Analysis: Harnessing the Power of Large Language Models with Retrieval Augmented Generation

Reza Fayyazi, Rozhina Taghdimi, Shanchieh Jay Yang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10354 2025-10-09 cs.CV cs.CL 89%

LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning

Yolo Yunlong Tang, Jinrui Zhang, Xiangchen Wang, Teng Wang, Feng Zheng

机构 * SUSTech VIP Lab(四川大学VIP实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Winner solution to Generic Event Boundary Captioning task in LOVEU Challenge (CVPR 2023 workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17967 2025-10-09 cs.LG cs.AI 88%

FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of Large Language Models

Ionut-Vlad Modoranu, Mher Safaryan, Erik Schultheis, Max Ryabinin, Artem Chumachenko, Dan Alistarh

机构 * ISTA(因斯托克科学与技术研究院) Together AI

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06847 2025-10-09 cs.CL cs.AI 88%

OpenJAI-v1.0: An Open Thai Large Language Model

Pontakorn Trakuekul, Attapol T. Rutherford, Jullajak Karnjanaekarin, Narongkorn Panitsrisit, Sumana Sumanakul

机构 * Jasmine Technology Solution(贾斯敏科技解决方案)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04481 2025-10-09 cs.CL cs.AI 84%

ECLM: Entity Level Language Model for Spoken Language Understanding with Chain of Intent

Shangjian Yin, Peijie Huang, Jiatian Chen, Haojing Huang, Yuhong Xu

机构 * College of Mathematics and Informatics, South China Agricultural University(数学与信息学学院,华南农业大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Published in ACL 2025

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025), pages 21851-21862

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18356 2025-10-09 cs.CL cs.AI cs.LG 83%

The Unreasonable Effectiveness of Model Merging for Cross-Lingual Transfer in LLMs

Lucas Bandarkar, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments MRL Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06354 2025-10-09 cs.CL 83%

LLM Bias Detection and Mitigation through the Lens of Desired Distributions

Ingroj Shrestha, Padmini Srinivasan

机构 * University of Iowa(爱荷华大学)

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06627 2025-10-09 cs.LG 81%

POME: Post Optimization Model Edit via Muon-style Projection

Yong Liu, Di Fu, Yang Luo, Zirui Zhu, Minhao Cheng, Cho-Jui Hsieh, Yang You

机构 * National University of Singapore(新加坡国立大学) Penn State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07319 2025-10-09 cs.CV 78%

Temporal Prompting Matters: Rethinking Referring Video Object Segmentation

Ci-Siang Lin, Min-Hung Chen, I-Jieh Liu, Chien-Yi Wang, Sifei Liu, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) NVIDIA

专题命中 指令微调 :prompting(title);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07277 2025-10-09 cs.CV 78%

Evaluating Fundus-Specific Foundation Models for Diabetic Macular Edema Detection

Franco Javier Arellano, José Ignacio Orlando

机构 * Yatiris Group(Yatiris集团) PLADEMA Institute(PLADEMA研究所) UNICEN(UNICEN大学) Tandil, Argentina(阿根廷坦迪尔)

专题命中 指令微调 :foundation model(title,abstract)

Comments Accepted for publication at SIPAIM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16276 2025-10-09 cs.CV cs.AI 77%

Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding

Yolo Yunlong Tang, Daiki Shimada, Jing Bi, Mingqian Feng, Hang Hua, Chenliang Xu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07105 2025-10-09 cs.CL cs.AI 73%

Opt-ICL at LeWiDi-2025: Maximizing In-Context Signal from Rater Examples via Meta-Learning

Taylor Sorensen, Yejin Choi

机构 * Department of Computer Science University of Washington(华盛顿大学计算机科学系) Department of Computer Science Stanford University(斯坦福大学计算机科学系)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

Comments NLPerspectives: The 4th Workshop on Perspectivist Approaches to Natural Language Processing at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06235 2025-10-09 eess.IV cs.AI cs.CV q-bio.NC 70%

Stacked Regression using Off-the-shelf, Stimulus-tuned and Fine-tuned Neural Networks for Predicting fMRI Brain Responses to Movies (Algonauts 2025 Report)

Robert Scholz, Kunal Bagga, Christine Ahrends, Carlo Alberto Barbano

机构 * Université Paris Cité(巴黎Cité大学) University of Oxford(牛津大学) University of Turin(都灵大学) Universität Leipzig(莱比锡大学) Max Planck School of Cognition(马克斯·普朗克认知科学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07092 2025-10-09 cs.LG cs.AI cs.RO 62%

Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report

Riccardo Mereu, Aidan Scannell, Yuxin Hou, Yi Zhao, Aditya Jitta, Antonio Dominguez, Luigi Acerbi, Amos Storkey, Paul Chang

机构 * Aalto University(阿alto大学) University of Edinburgh(爱丁堡大学) Deep Render(Deep Render公司) DataCrunch(DataCrunch公司) University of Helsinki(赫尔辛基大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

Comments 6 pages, 3 figures, 1X world model challenge technical report

详情

展开后加载摘要…

URL PDF HTML 收藏