arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-03 至 2025-10-03 共收录 222 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 12 篇

2508.04677 2025-10-03 cs.CV 71%

Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise

Yansheng Gao, Yufei Zheng, Shengsheng Wang

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(计算机科学与技术学院、教育部符号计算与知识工程重点实验室、吉林大学) College of Software, Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(软件学院、教育部符号计算与知识工程重点实验室、吉林大学)

专题命中 指令微调 :language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 9 篇

2509.22558 2025-10-03 cs.AI 87%

StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models

Chenyu Zhou, Tianyi Xu, Jianghao Lin, Dongdong Ge

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23761 2025-10-03 cs.LG cs.AI cs.CL 85%

Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization

Yunjae Won, Hyunji Lee, Hyeonbin Hwang, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint, under review. 39 pages, 12 figures. Updates from v1: Added new theoretical results on DPO training dynamics and policy exploration, included experiments with Qwen3-4B, and refined the discussion of log-margin dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03206 2025-10-03 cs.CL cs.AI 82%

Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward

Yanming Wan, Jiaxing Wu, Marwa Abdulhai, Lior Shani, Natasha Jaques

机构 * Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学) Google Research(谷歌研究) University of California, Berkeley(伯克利加州大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01051 2025-10-03 cs.CV 82%

Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization

Tao Zhang, Cheng Da, Kun Ding, Huan Yang, Kun Jin, Yan Li, Tingting Gao, Di Zhang, Shiming Xiang, Chunhong Pan

机构 * MAIS, CASIA(中国科学院自动化研究所MAIS实验室) Kuaishou Technology(快手科技) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09350 2025-10-03 cs.CV cs.AI cs.LG 81%

Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation

Shanchuan Lin, Ceyuan Yang, Hao He, Jianwen Jiang, Yuxi Ren, Xin Xia, Yang Zhao, Xuefeng Xiao, Lu Jiang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08316 2025-10-03 cs.CV cs.AI cs.LG 81%

Diffusion Adversarial Post-Training for One-Step Video Generation

Shanchuan Lin, Xin Xia, Yuxi Ren, Ceyuan Yang, Xuefeng Xiao, Lu Jiang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01236 2025-10-03 cs.CL cs.LG 73%

GRPO++: Enhancing Dermatological Reasoning under Low Resource Settings

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque

机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology (BUET)(电气与电子工程系,孟加拉国工程与技术大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

Comments Will be submitted at IEEE JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01540 2025-10-03 cs.CV 67%

Towards Better Optimization For Listwise Preference in Diffusion Models

Jiamu Bai, Xin Yu, Meilong Xu, Weitao Lu, Xin Pan, Kiwan Maeng, Daniel Kifer, Jian Wang, Yu Wang

机构 * Penn State University(宾夕法尼亚州立大学) TikTok Inc.(TikTok公司) Stony Brook University(石溪大学)

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05606 2025-10-03 cs.CV 50%

Patch-Level Kernel Alignment for Dense Self-Supervised Learning

Juan Yeo, Ijun Jang, Taesup Kim

机构 * Gradudate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 后训练与偏好优化 :post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 2 篇

2411.01101 2025-10-03 cs.CL 70%

Self-Consistency Falls Short! The Adverse Effects of Positional Bias on Long-Context Problems

Adam Byerly, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 25 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01585 2025-10-03 cs.CL cs.NI 57%

ReSSFormer: A Recursive Sparse Structured Transformer for Scalable and Long-Context Reasoning

Haochen You, Baojing Liu

机构 * Columbia University(哥伦比亚大学) Hebei Institute of Communications(河北通信学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

Comments Accepted as a short paper at ACM Multimedia Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 44 篇

2505.11031 2025-10-03 cs.CL 89%

OntoURL: A Benchmark for Evaluating Large Language Models on Symbolic Ontological Understanding, Reasoning and Learning

Xiao Zhang, Huiyuan Lai, Qianru Meng, Johan Bos

机构 * University of Groningen(格罗宁根大学) Leiden University(莱顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02155 2025-10-03 cs.CV cs.AI 88%

Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting

Shu Zou, Xinyu Tian, Lukas Wesemann, Fabian Waschkowski, Zhaoyuan Yang, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) Maincode GE Research(通用电气研究)

专题命中 推理与问题求解 :language model(title,abstract);prompting(title,abstract);分类 cs.AI

Comments 14 pages, video anomaly detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24260 2025-10-03 cs.AI 88%

Rethinking and Benchmarking Large Language Models for Graph Reasoning

Yuwei Hu, Xinyi Huang, Zhewei Wei, Yongchao Liu, Chuntao Hong

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01391 2025-10-03 cs.CL 87%

TAG-EQA: Text-And-Graph for Event Question Answering via Structured Prompting Strategies

Maithili Kadam, Francis Ferraro

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted in *sem 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02230 2025-10-03 cs.AI cs.CL cs.CV 86%

The Reasoning Boundary Paradox: How Reinforcement Learning Constrains Language Models

Phuc Minh Nguyen, Chinh D. La, Duy M. H. Nguyen, Nitesh V. Chawla, Binh T. Nguyen, Khoa D. Doan

机构 * College of Engineering and Computer Science, VinUniversity(Vin大学工程与计算机科学学院) Center for Environmental Intelligence, VinUniversity(Vin大学环境智能中心) University of Stuttgart(斯图加特大学) University of Notre Dame(诺特难大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01428 2025-10-03 q-bio.QM cs.AI 84%

BioVERSE: Representation Alignment of Biomedical Modalities to LLMs for Multi-Modal Reasoning

Ching-Huei Tsou, Michal Ozery-Flato, Ella Barkan, Diwakar Mahajan, Ben Shapira

机构 * IBM T.J. Watson Research Center(IBM T.J. Watson研究所以) IBM Research(IBM研究所以)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01459 2025-10-03 cs.LG cs.CL 84%

LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning

Weizhe Chen, Sven Koenig, Bistra Dilkina

机构 * University of Southern California(南加州大学) University of California, Irvine(加州大学尔湾分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15153 2025-10-03 cs.CL 83%

When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements

Tianjie Ju, Bowen Wang, Hao Fei, Mong-Li Lee, Wynne Hsu, Yun Li, Qianren Wang, Pengzhou Cheng, Zongru Wu, Haodong Zhao, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Cognitive AI Lab(认知人工智能实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01218 2025-10-03 cs.LG cs.AI cs.CL 83%

Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs

Sergey Troshin, Wafaa Mohammed, Yan Meng, Christof Monz, Antske Fokkens, Vlad Niculae

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) Computational Linguistics and Text Mining Lab, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学计算语言学与文本挖掘实验室)

专题命中 推理与问题求解 :LLM(title);language model(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments Second Conference on Language Modeling, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01664 2025-10-03 cs.AI 79%

GuruAgents: Emulating Wise Investors with Prompt-Guided LLM Agents

Yejin Kim, Youngbin Lee, Juhyeong Kim, Yongjae Lee

机构 * AI Quant Lab, MODULABS(AI量化实验室,MODULABS) Ulsan National Institute of Science and Technology(乌山国立科学与技术研究所)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

Comments 7 Pages, 2 figures

Journal ref CIKM 2025 Workshop on Advances in Financial AI: Innovations, Risk, and Responsibility in the Era of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01246 2025-10-03 cs.CL 79%

A Comparative Analysis of Sparse Autoencoder and Activation Difference in Language Model Steering

Jiaqing Xie

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13449 2025-10-03 cs.LG physics.chem-ph 79%

Mol-LLaMA: Towards General Understanding of Molecules in Large Molecular Language Model

Dongki Kim, Wonbin Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16162 2025-10-03 cs.CV cs.CL 79%

Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning

Yihong Tang, Ao Qu, Zhaokai Wang, Dingyi Zhuang, Zhaofeng Wu, Wei Ma, Shenhao Wang, Yunhan Zheng, Zhan Zhao, Jinhua Zhao

机构 * McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Florida(佛罗里达大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01700 2025-10-03 cs.AI cs.CV cs.LG 79%

VaPR -- Vision-language Preference alignment for Reasoning

Rohan Wadhawan, Fabrice Y Harel-Canada, Zi-Yi Dou, Suhaila Shakiah, Robinson Piramuthu, Nanyun Peng

机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) Amazon.com, Inc.(亚马逊公司)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

Journal ref COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01531 2025-10-03 cs.AI cs.CL cs.RO 79%

Information Seeking for Robust Decision Making under Partial Observability

Djengo Cyun-Jyun Fang, Tsung-Wei Ke

机构 * National Taiwan University(台湾大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments The project page is available at https://infoseekerllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01279 2025-10-03 cs.CL cs.AI 79%

TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture

Yongchao Chen, Jiefeng Chen, Rui Meng, Ji Yin, Na Li, Chuchu Fan, Chi Wang, Tomas Pfister, Jinsung Yoon

机构 * MIT Harvard(麻省理工学院哈佛大学) Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind) MIT(麻省理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02961 2025-10-03 cs.AI cs.CL cs.CR 79%

Defend LLMs Through Self-Consciousness

Boshi Huang, Fabio Nonato de Paula

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments company requests to withdraw

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14245 2025-10-03 cs.AI cs.CL 79%

Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

Xumeng Wen, Zihan Liu, Shun Zheng, Shengyu Ye, Zhirong Wu, Yang Wang, Zhijian Xu, Xiao Liang, Junjie Li, Ziming Miao, Jiang Bian, Mao Yang

机构 * Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Update with more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏