arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-05 至 2025-08-05 共收录 292 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2412.16772 2025-08-05 cs.CY cs.AI cs.LG 91%

Assessing Social Alignment: Do Personality-Prompted Large Language Models Behave Like Humans?

Ivan Zakazov, Mikolaj Boronski, Lorenzo Drudi, Robert West

机构 * EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted to NeurIPS 2024 Workshop on Behavioral Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01908 2025-08-05 cs.LG cs.AI cs.CL 90%

Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models

Istabrak Abbes, Gopeshh Subbaraj, Matthew Riemer, Nizar Islah, Benjamin Therien, Tsuguchika Tabaru, Hiroaki Kingetsu, Sarath Chandar, Irina Rish

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究院) Chandar Research Lab(Chandar研究实验室) IBM Research(IBM研究院) Fujitsu Research(富士通研究院) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02532 2025-08-05 cs.CL cs.LG 88%

Contextual Graph Transformer: A Small Language Model for Enhanced Engineering Document Information Extraction

Karan Reddy, Mayukha Pal

专题命中 预训练与数据 :language model(title,abstract);small language model(title);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01245 2025-08-05 cs.CL 88%

WarriorMath: Enhancing the Mathematical Ability of Large Language Models with a Defect-aware Framework

Yue Chen, Minghua He, Fangkai Yang, Pu Zhao, Lu Wang, Yu Kang, Yifei Dong, Yuefeng Zhan, Hao Sun, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Peking University(北京大学) Microsoft(微软) KTH Royal Institute of Technology(皇家理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01892 2025-08-05 cs.LG cs.AI 87%

How Does Controllability Emerge In Language Models During Pretraining?

Jianshu She, Xinyue Li, Eric Xing, Zhengzhong Liu, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00965 2025-08-05 cs.LG cs.AI 81%

VAULT: Vigilant Adversarial Updates via LLM-Driven Retrieval-Augmented Generation for NLI

Roie Kazoom, Ofir Cohen, Rami Puzis, Asaf Shabtai, Ofer Hadar

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02601 2025-08-05 cs.LG cs.AI 79%

StructSynth: Leveraging LLMs for Structure-Aware Tabular Data Synthesis in Low-Data Regimes

Siyi Liu, Yujia Zheng, Yongqi Zhang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02209 2025-08-05 cs.LG cs.AI cs.IT cs.NI math.IT 79%

Balancing Information Accuracy and Response Timeliness in Networked LLMs

Yigit Turkmen, Baturalp Buyukates, Melih Bastopcu

机构 * School of Computer Science University of Birmingham Birmingham, UK(计算机科学学院 布拉姆斯希尔大学 布拉姆斯希尔英国)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01326 2025-08-05 cs.CL 77%

Large-Scale Diverse Synthesis for Mid-Training

Xuemiao Zhang, Chengying Tu, Can Ren, Rongxiang Weng, Hongfei Yan, Jingang Wang, Xunliang Cai

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10699 2025-08-05 cs.CL 77%

Thinker-DDM: Modeling Deliberation for Machine Translation with a Drift-Diffusion Process

Hongbin Na, Zimu Wang, Mieradilijiang Maimaiti, Tong Chen, Wei Wang, Tao Shen, Ling Chen

机构 * Australian AI Institute, University of Technology Sydney(澳大利亚人工智能研究院,悉尼技术大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Chinese Academy of Sciences(中国科学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00913 2025-08-05 cs.CV cs.LG 74%

TESPEC: Temporally-Enhanced Self-Supervised Pretraining for Event Cameras

Mohammad Mohammadi, Ziyi Wu, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

Comments Accepted at IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09251 2025-08-05 cs.CL cs.AI 73%

Extrapolation by Association: Length Generalization Transfer in Transformers

Ziyang Cai, Nayoung Lee, Avi Schwarzschild, Samet Oymak, Dimitris Papailiopoulos

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments 23 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02063 2025-08-05 cs.AI 70%

TRACEALIGN -- Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs

Amitava Das, Vinija Jain, Aman Chadha

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01211 2025-08-05 cs.LG 70%

Multi-Operator Few-Shot Learning for Generalization Across PDE Families

Yile Li, Shandian Zhe

专题命中 预训练与数据 :pretraining(abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17544 2025-08-05 cs.CV cs.AI 70%

PRIMAL: Physically Reactive and Interactive Motor Model for Avatar Learning

Yan Zhang, Yao Feng, Alpár Cseke, Nitin Saini, Nathan Bajandas, Nicolas Heron, Michael J. Black

机构 * Meshcapade Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Stanford University(斯坦福大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

Comments ICCV'25 camera ready; main paper and appendix; 19 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13395 2025-08-05 cs.CL cs.AI cs.HC cs.LG 67%

Enhancing Talk Moves Analysis in Mathematics Tutoring through Classroom Teaching Discourse

Jie Cao, Abhijit Suresh, Jennifer Jacobs, Charis Clevenger, Amanda Howard, Chelsea Brown, Brent Milne, Tom Fischaber, Tamara Sumner, James H. Martin

机构 * School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院) Institute of Cognitive Science, University of Colorado Boulder(科罗拉多大学博尔德分校认知科学研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to COLING'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01153 2025-08-05 cs.CV 67%

TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition

Xiahan Yang, Hui Zheng

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

Comments 9 pages (w/o ref), 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15542 2025-08-05 cs.CV 67%

HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation

Qinqian Lei, Bo Wang, Robby T. Tan

机构 * National University of Singapore(国立新加坡大学) University of Mississippi(密苏里大学) ASUS Intelligent Cloud Services (AICS)(ASUS智能云服务(AICS))

专题命中 预训练与数据 :LLM(abstract);language model(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23298 2025-08-05 cs.HC cs.SD eess.AS 50%

Real-time Generation of Various Types of Nodding for Avatar Attentive Listening System

Kazushi Kato, Koji Inoue, Divesh Lala, Keiko Ochi, Tatsuya Kawahara

机构 * Kyoto University(京都大学)

专题命中 预训练与数据 :pretraining(abstract)

Comments Accepted by 27th ACM International Conference on Multimodal Interaction (ICMI '25), Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 26 篇

2508.01198 2025-08-05 cs.CL cs.AI 91%

Adaptive Content Restriction for Large Language Models via Suffix Optimization

Yige Li, Peihai Jiang, Jun Sun, Peng Shu, Tianming Liu, Zhen Xiang

机构 * Singapore Management University(新加坡管理大学) The University of Georgia(佐治亚大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09805 2025-08-05 q-bio.QM cs.AI cs.CL cs.LG stat.AP 90%

Contextual Phenotyping of Pediatric Sepsis Cohort Using Large Language Models

Aditya Nagori, Ayush Gautam, Matthew O. Wiens, Vuong Nguyen, Nathan Kenya Mugisha, Jerome Kabakyenga, Niranjan Kissoon, John Mark Ansermino, Rishikesan Kamaleswaran

机构 * Department of Surgery, Duke university school of medicine(杜克大学医学学院外科部) Department of Anesthesiology, Duke university school of medicine(杜克大学医学学院麻醉科) Indian Institute of Technology, Goa(印度去邦理工学院) Institute for Global Health, BC Children’s Hospital and BC Women’s Hospital + Health Centre(全球健康研究所,BC儿童医院和BC妇女医院及健康中心) Department of Anesthesia, Pharmacology & Therapeutics, University of British Columbia(不列颠哥伦比亚大学麻醉学、药理学与治疗学系) BC Children’s Hospital Research Institute, BC Children’s Hospital(BC儿童医院研究学院,BC儿童医院) Department of Pediatrics, University of British Columbia(不列颠哥伦比亚大学儿科系) Walimu, Kampala, Uganda(乌干达坎帕拉沃尔imu) Department of Community Health, Mbarara University of Science and Technology(马巴拉拉大学科学与技术学院社区健康系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 2 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02020 2025-08-05 cs.IR 90%

Evaluating Position Bias in Large Language Model Recommendations

Ethan Bito, Yongli Ren, Estrid He

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05727 2025-08-05 cs.CL cs.AI cs.LG 90%

Self-Evolving Critique Abilities in Large Language Models

Zhengyang Tang, Ziniu Li, Zhenyang Xiao, Tian Ding, Ruoyu Sun, Benyou Wang, Dayiheng Liu, Fei Huang, Tianyu Liu, Bowen Yu, Junyang Lin

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Qwen Team, Alibaba Inc.(阿里云通义团队)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02525 2025-08-05 cs.AI 89%

Accurate and Interpretable Postmenstrual Age Prediction via Multimodal Large Language Model

Qifan Chen, Jin Cui, Cindy Duan, Yushuo Han, Yifei Shi

机构 * King’s College London(伦敦国王学院) Imperial College London(帝国理工学院) Columbia University(哥伦比亚大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.AI

Comments Submitted to the NeurIPS 2025 Workshop GenAI4Health. Conference website: https://aihealth.ischool.utexas.edu/GenAI4HealthNeurips2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02502 2025-08-05 cs.CL 89%

From Monolingual to Bilingual: Investigating Language Conditioning in Large Language Models for Psycholinguistic Tasks

Shuzhou Yuan, Zhan Qu, Mario Tawfelis, Michael Färber

机构 * ScaDS.AI and TU Dresden(ScaDS.AI 和 梵高大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14693 2025-08-05 cs.CL cs.AI 86%

Rethinking Table Instruction Tuning

Naihao Deng, Rada Mihalcea

机构 * University of Michigan(密歇根大学)

专题命中 指令微调 :instruction tuning(title);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to ACL 2025 Findings. Updates: 07/2025: We release the TAMA-QWen2.5 and TAMA-QWen3 models. 06/2025: We release our project page: https://lit.eecs.umich.edu/TAMA/, code: https://github.com/MichiganNLP/TAMA, huggingface models: https://huggingface.co/collections/MichiganNLP/tama-684eeb3e7f262362856eccd1, and data: https://huggingface.co/datasets/MichiganNLP/TAMA_Instruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12937 2025-08-05 cs.AI cs.CL cs.CV cs.LG 86%

R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization

Jingyi Zhang, Jiaxing Huang, Huanjin Yao, Shunyu Liu, Xikun Zhang, Shijian Lu, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Comments ICCV 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13795 2025-08-05 cs.LG cs.AI 85%

Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN

Pengxiang Li, Lu Yin, Shiwei Liu

机构 * Dalian University of Technology(大连理工大学) University of Surrey(Surrey大学) University of Oxford(牛津大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01308 2025-08-05 cs.CV 82%

Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks

Jiawei Wang, Yushen Zuo, Yuanjun Chai, Zhendong Liu, Yicheng Fu, Yichun Feng, Kin-Man Lam

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学) Nanjing University(南京大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15731 2025-08-05 cs.CV 82%

The Inter-Intra Modal Measure: A Predictive Lens on Fine-Tuning Outcomes in Vision-Language Models

Laura Niss, Kevin Vogt-Lowell, Theodoros Tsiligkaridis

机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 指令微调 :language model(title,abstract);foundation model(abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏