arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-29 至 2025-09-29 共收录 243 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 27 篇

2509.06501 2025-09-29 cs.CL 70%

WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents

Junteng Liu, Yunji Li, Chi Zhang, Jingyang Li, Aili Chen, Ke Ji, Weiyu Cheng, Zijia Wu, Chengyu Du, Qidi Xu, Jiayuan Song, Zhengmao Zhu, Wenhu Chen, Pengyu Zhao, Junxian He

机构 * The Hong Kong University of Science and Technology(香港科技大学) MiniMax University of Waterloo(滑铁卢大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14538 2025-09-29 cs.CL 70%

LoRA-MGPO: Mitigating Double Descent in Low-Rank Adaptation via Momentum-Guided Perturbation Optimization

Yupeng Chang, Chenlu Guo, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19462 2025-09-29 cs.CL 70%

Constituency Parsing using LLMs

Xuefeng Bai, Jialong Wu, Yulong Chen, Zhongqing Wang, Kehai Chen, Min Zhang, Yue Zhang

机构 * School of Computer Science of Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所以及先进科技研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at IEEE Transactions on Audio, Speech, and Language Processing (TASLP). See https://ieeexplore.ieee.org/document/11130901/ for the official version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21336 2025-09-29 cs.IR cs.CL 70%

HetaRAG: Hybrid Deep Retrieval-Augmented Generation across Heterogeneous Data Stores

Guohang Yan, Yue Zhang, Pinlong Cai, Ding Wang, Song Mao, Hongwei Zhang, Yaoze Zhang, Hairong Zhang, Xinyu Cai, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22195 2025-09-29 cs.RO 67%

Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting

Asher J. Hancock, Xindi Wu, Lihan Zha, Olga Russakovsky, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 指令微调 :language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03255 2025-09-29 cs.CV 67%

DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation

Qingdong He, Jinlong Peng, Pengcheng Xu, Boyuan Jiang, Xiaobin Hu, Donghao Luo, Yong Liu, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Youtu Lab, Tencent(腾讯优图实验室) Western University(西部大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07032 2025-09-29 cs.LG cs.AI q-bio.QM 62%

Lightweight MSA Design Advances Protein Folding From Evolutionary Embeddings

Hanqun Cao, Xinyi Zhou, Zijun Gao, Chenyu Wang, Xin Gao, Zhi Zhang, Cesar de la Fuente-Nunez, Chunbin Gu, Ge Liu, Pheng-Ann Heng

机构 * CUHK(香港中文大学) MIT(麻省理工学院) UCSD(加州大学圣迭戈分校) UvA(乌得勒支大学) UPenn(宾夕法尼亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22635 2025-09-29 cs.CV cs.LG 57%

Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance

Luc Boudier, Loris Manganelli, Eleftherios Tsonis, Nicolas Dufour, Vicky Kalogeiton

机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等师范学院,IP巴黎,法国国家科学研究中心) LIGM École des Ponts, IP Paris, CNRS, UGE DIPSY(LIGM 巴黎综合理工学院,IP巴黎,法国国家科学研究中心,UGE DIPSY)

专题命中 指令微调 :prompting(abstract);分类 cs.LG

Comments BMVC 2025. Project page: https://www.lix.polytechnique.fr/vista/projects/2025_bmvc_dipsy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21582 2025-09-29 cs.CV cs.AI 57%

Large Pre-Training Datasets Don't Always Guarantee Robustness after Fine-Tuning

Jaedong Hwang, Brian Cheung, Zhang-Wei Hong, Akhilan Boopathy, Pulkit Agrawal, Ila Fiete

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 11 篇

2502.00666 2025-09-29 cs.LG cs.AI stat.ML 89%

Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration

Mingyu Chen, Yiding Chen, Wen Sun, Xuezhou Zhang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Boston University(波士顿大学) Department of Computer Science(计算机科学系) Cornell University(康奈尔大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21528 2025-09-29 cs.LG cs.AI 88%

Preemptive Detection and Steering of LLM Misalignment via Latent Reachability

Sathwik Karnik, Somil Bansal

机构 * Safe and Intelligent Autonomy Lab, Stanford University(斯坦福大学安全与智能自主实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21351 2025-09-29 cs.CV cs.AI cs.CL 86%

Random Direct Preference Optimization for Radiography Report Generation

Valentin Samokhin, Boris Shirokikh, Mikhail Goncharov, Dmitriy Umerenkov, Maksim Bobrin, Ivan Oseledets, Dmitry Dylov, Mikhail Belyaev

机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究院) Skolkovo Institute of Science and Technology(斯克罗夫学院) Institute for Information Transmission Problems(信息传输问题研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22624 2025-09-29 cs.CV cs.LG 84%

SPARK: Synergistic Policy And Reward Co-Evolving Framework

Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Project:https://github.com/InternLM/Spark

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07780 2025-09-29 cs.LG cs.CL 82%

A Critical Look At Tokenwise Reward-Guided Text Generation

Ahmad Rashid, Ruotian Wu, Julia Grosse, Agustinus Kristiadi, Pascal Poupart

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Western University(西方大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Work accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21718 2025-09-29 cs.AI cs.LG eess.AS 81%

Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization

Shehzeen Hussain, Paarth Neekhara, Xuesong Yang, Edresson Casanova, Subhankar Ghosh, Roy Fejgin, Ryan Langman, Mikyas Desta, Leili Tavabi, Jason Li

机构 * NVIDIA Corporation, USA(NVIDIA公司,美国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02588 2025-09-29 cs.CV 78%

Calibrated Multi-Preference Optimization for Aligning Diffusion Models

Kyungmin Lee, Xiaohang Li, Qifei Wang, Junfeng He, Junjie Ke, Ming-Hsuan Yang, Irfan Essa, Jinwoo Shin, Feng Yang, Yinxiao Li

机构 * Google DeepMind(谷歌DeepMind) KAIST(韩国科学技术院) Google(谷歌) Google Research(谷歌研究) Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

Comments CVPR 2025, Project page: https://kyungmnlee.github.io/capo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22099 2025-09-29 cs.CL 70%

S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models

Shaoning Sun, Jiachen Yu, Zongqi Wang, Xuewei Yang, Tianle Gu, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21828 2025-09-29 cs.LG cs.MA 70%

Preference-Guided Learning for Sparse-Reward Multi-Agent Reinforcement Learning

The Viet Bui, Tien Mai, Hong Thanh Nguyen

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学) University of Oregon(俄勒冈大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12663 2025-09-29 cs.CL 70%

Demystifying Multilingual Chain-of-Thought in Process Reward Modeling

Weixuan Wang, Minghao Wu, Barry Haddow, Alexandra Birch

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Monash University(墨尔本大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20725 2025-09-29 cs.GR cs.CV 67%

SeamCrafter: Enhancing Mesh Seam Generation for Artist UV Unwrapping via Reinforcement Learning

Duoteng Xu, Yuguang Chen, Jing Li, Xinhai Liu, Xueqi Ma, Zhuo Chen, Dongyu Zhang, Chunchao Guo

机构 * Tencent Hunyuan(腾讯文英) SYSU(南方科技大学) SZU(深圳大学) USTC(中国科学技术大学)

专题命中 后训练与偏好优化 :pretraining(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 9 篇

2509.21843 2025-09-29 cs.CR cs.CL cs.LG 90%

SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models

Jingkai Guo, Chaitali Chakrabarti, Deliang Fan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 4 figures, 5 tables, 2 equations. Topics: Bit-flip attacks, adversarial attacks, large language models (LLMs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15253 2025-09-29 cs.CL cs.AI 88%

Conflict-Aware Soft Prompting for Retrieval-Augmented Generation

Eunseong Choi, June Park, Hyeri Lee, Jongwuk Lee

专题命中 长上下文与记忆 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to EMNLP 2025; 15 pages; 5 figures, 11 tables; Code available at https://github.com/eunseongc/CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21884 2025-09-29 cs.CR cs.AI cs.CL 79%

You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors

Bochuan Cao, Changjiang Li, Yuanpu Cao, Yameng Ge, Ting Wang, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Stony Brook University(石溪大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 29 pages, 10 tables, 6figures, accepted by CCS 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21361 2025-09-29 cs.CL cs.AI 79%

Context Is What You Need: The Maximum Effective Context Window for Real World Limits of LLMs

Norman Paulsen

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 4 charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22170 2025-09-29 cs.SE 78%

Leveraging LLM Agents for Automated Video Game Testing

Chengjia Wang, Lanling Tang, Ming Yuan, Jiongchi Yu, Xiaofei Xie, Jiajun Bu

专题命中 长上下文与记忆 :LLM(title,abstract)

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09579 2025-09-29 cs.CL cs.AI cs.LG 75%

Cost-Optimal Grouped-Query Attention for Long-Context Modeling

Yingfa Chen, Yutong Wu, Chenyang Song, Zhen Leng Thai, Xingyu Shen, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(自然语言处理组、国防科技大学、人工智能院、北京理工大学、清华大学、北京、中国) SIST, University of Science and Technology Beijing, Beijing, China(软件学院、北京科技大学、北京、中国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21848 2025-09-29 cs.LG cs.AI 73%

Graph of Agents: Principled Long Context Modeling by Emergent Multi-Agent Collaboration

Taejong Joo, Shu Ishida, Ivan Sosnovik, Bryan Lim, Sahand Rezaei-Shoshtari, Adam Gaier, Robert Giaquinto

机构 * Department of Industrial Engineering & Management Sciences, Northwestern University(工业工程与管理科学系,西北大学) Autodesk Research(Autodesk研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20386 2025-09-29 cs.SE cs.AI cs.IR 70%

Dynamic ReAct: Scalable Tool Selection for Large-Scale MCP Environments

Nishant Gaurav, Adit Akarsh, Ankit Ranjan, Manoj Bajaj

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21969 2025-09-29 cs.RO cs.AI 57%

DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation

Tianjun Gu, Linfeng Li, Xuhong Wang, Chenghua Gong, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 54 篇

2509.17283 2025-09-29 cs.CV cs.AI cs.ET 89%

Automated Facility Enumeration for Building Compliance Checking using Door Detection and Large Language Models

Licheng Zhang, Bach Le, Naveed Akhtar, Tuan Ngo

机构 * The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Author name correction in the second version (same content as the first version)

详情

展开后加载摘要…

URL PDF HTML 收藏