arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-27 至 2025-10-27 共收录 214 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 17 篇

2502.12171 2025-10-27 cs.LG cs.AI cs.CL 75%

GoRA: Gradient-driven Adaptive Low Rank Adaptation

Haonan He, Peng Ye, Yuchen Ren, Yuan Yuan, Luyang Zhou, Shucun Ju, Lei Chen

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Intelligent Machines, HFIPS, Chinese Academy of Sciences(中国科学院智能机械研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Anhui Disaster Warning & Agrometeorological Information Center(安徽省灾害预警与农业气象信息中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14198 2025-10-27 cs.CL cs.AI 73%

Retention analysis of edited knowledge after fine-tuning

Fufang Wen, Shichang Zhang

机构 * Columbia University(哥伦比亚大学) Harvard University(哈佛大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18554 2025-10-27 cs.AI 70%

Extracting alignment data in open models

Federico Barbero, Xiangming Gu, Christopher A. Choquette-Choo, Chawin Sitawarin, Matthew Jagielski, Itay Yona, Petar Veličković, Ilia Shumailov, Jamie Hayes

机构 * University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind) Anthropic MentaLeap AI Sequrity Company(AI安全公司)

专题命中 指令微调 :post-training(abstract);SFT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21401 2025-10-27 cs.CR cs.SE 67%

FLAMES: Fine-tuning LLMs to Synthesize Invariants for Smart Contract Security

Mojtaba Eshghie, Gabriele Morello, Matteo Lauretano, Alexandre Bartel, Martin Monperrus

专题命中 指令微调 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11194 2025-10-27 cs.CE 67%

Prot2Text-V2: Protein Function Prediction with Multimodal Contrastive Alignment

Xiao Fei, Michail Chatzianastasis, Sarah Almeida Carneiro, Hadi Abdine, Lawrence P. Petalidis, Michalis Vazirgiannis

专题命中 指令微调 :LLM(abstract);language model(abstract)

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21188 2025-10-27 cs.LG cs.AI 62%

PLAN: Proactive Low-Rank Allocation for Continual Learning

Xiequn Wang, Zhan Zhuang, Yu Zhang

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

Comments accepted by ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, Honolulu, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18119 2025-10-27 cs.LG cs.AI 62%

MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents

Yifan Xu, Xiao Liu, Xinghan Liu, Jiaqi Fu, Hanchen Zhang, Bohao Jing, Shudan Zhang, Yuting Wang, Wenyi Zhao, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21531 2025-10-27 cs.LG 57%

Probe-based Fine-tuning for Reducing Toxicity

Jan Wehner, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全研究中心)

专题命中 指令微调 :preference optimization(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21114 2025-10-27 cs.CV 50%

Controllable-LPMoE: Adapting to Challenging Object Segmentation via Dynamic Local Priors from Mixture-of-Experts

Yanguang Sun, Jiawei Lian, Jian Yang, Lei Luo

机构 * PCA Lab, Nanjing University of Science and Technology, Nanjing, China(南京理工大学科学与工程学院实验室) PCA Lab, VCIP, College of Computer Science, Nankai University, Tianjin, China(南开大学计算机学院)

专题命中 指令微调 :foundation model(abstract)

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 10 篇

2510.21090 2025-10-27 cs.CL cs.AI cs.LG 90%

Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only

Qingru Zhang, Liang Qiu, Ilgee Hong, Zhenghao Xu, Tianyi Liu, Shiyang Li, Rongzhi Zhang, Zheng Li, Lihong Li, Bing Yin, Chao Zhang, Jianshu Chen, Haoming Jiang, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23022 2025-10-27 cs.LG cs.AI cs.CL cs.RO 90%

Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback

Qinqing Zheng, Mikael Henaff, Amy Zhang, Aditya Grover, Brandon Amos

机构 * \dagger(机构1)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments RLC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12854 2025-10-27 cs.CL cs.AI 90%

TPO: Aligning Large Language Models with Multi-branch & Multi-step Preference Trees

Weibin Liao, Xu Chu, Yasha Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Center on Frontiers of Computing Studies, Peking University(北京大学前沿计算研究中心) National Research and Engineering Center of Software Engineering, Peking University(北京大学软件工程研究中心)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18631 2025-10-27 cs.LG cs.AI cs.CL 87%

ReDit: Reward Dithering for Improved LLM Policy Optimization

Chenxing Wei, Jiarui Yu, Ying Tiffany He, Hande Dong, Yao Shu, Fei Yu

机构 * Guangdong Lab of AI and Digital Economy (SZ), China(广东人工智能与数字经济实验室(深圳)) College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)) Tencent, Shenzhen, China(腾讯(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息技术学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 34 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21798 2025-10-27 cs.CL cs.AI 84%

Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment

Hongbin Zhang, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能研究所,哈尔滨工业大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Under review;Work in progress;

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06020 2025-10-27 cs.AI cs.CL cs.LG 82%

Information-Theoretic Reward Decomposition for Generalizable RLHF

Liyuan Mao, Haoran Xu, Amy Zhang, Weinan Zhang, Chenjia Bai

机构 * Shanghai Jiao Tong University(上海交通大学) UT Austin(得克萨斯大学奥斯汀分校) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work done during internships at Institute of Artificial Intelligence (TeleAI), China Telecom

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11475 2025-10-27 cs.CL cs.AI cs.LG 80%

HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages

Zhilin Wang, Jiaqi Zeng, Olivier Delalleau, Hoo-Chang Shin, Felipe Soares, Alexander Bukharin, Ellie Evans, Yi Dong, Oleksii Kuchaiev

机构 * NVIDIA

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks Track Camera Ready, 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11080 2025-10-27 cs.CL cs.AI cs.LG 75%

BLEUBERI: BLEU is a surprisingly effective reward for instruction following

Yapei Chang, Yekyung Kim, Michael Krumdick, Amir Zadeh, Chuan Li, Chris Tanner, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments neurips cam-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17859 2025-10-27 cs.LG cs.AI stat.ML 73%

Scalable Valuation of Human Feedback through Provably Robust Model Alignment

Masahiro Fujisawa, Masaki Adachi, Michael A. Osborne

机构 * The University of Osaka(大阪大学) Lattice Lab, Toyota Motor Corporation(丰田公司Lattice实验室) Machine Learning Research Group, University of Oxford(牛津大学机器学习研究组) RIKEN AIP(理化学研究所AIP)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

Comments Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS2025), 49 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21223 2025-10-27 cs.LG 70%

Model Merging with Functional Dual Anchors

Kexuan Shi, Yandong Wen, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.LG

Comments Technical report (23 pages, 15 figures, project page: https://spherelab.ai/fda/)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 6 篇

2510.21408 2025-10-27 cs.LG cs.AI 88%

Large Language Models as Model Organisms for Human Associative Learning

Camila Kolling, Vy Ai Vo, Mariya Toneva

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21449 2025-10-27 cs.CV 88%

MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection

Shengtian Yang, Yue Feng, Yingshi Liu, Jingrou Zhang, Jie Qin

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(人工智能学院,南京航空航天大学) Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, China(脑机智能技术重点实验室,教育部,中国)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)

Comments Accepted to NeurIPS 2025. The first two authors hold equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21175 2025-10-27 cs.AI 79%

Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models

Yujin Jo, Taesup Kim

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15745 2025-10-27 eess.IV cs.LG 70%

InfiniPot-V: Memory-Constrained KV Cache Compression for Streaming Video Understanding

Minsoo Kim, Kyuhong Shim, Jungwook Choi, Simyung Chang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07524 2025-10-27 cs.SE cs.AI cs.CY 57%

TAI3: Testing Agent Integrity in Interpreting User Intent

Shiwei Feng, Xiangzhe Xu, Xuan Chen, Kaiyuan Zhang, Syed Yusuf Ahmed, Zian Su, Mingwei Zheng, Xiangyu Zhang

机构 * Purdue University(普渡大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12044 2025-10-27 cs.LG 57%

FlashBias: Fast Computation of Attention with Bias

Haixu Wu, Minghao Guo, Yuezhou Ma, Yuanxu Sun, Jianmin Wang, Wojciech Matusik, Mingsheng Long

机构 * School of Software, Tsinghua University(清华大学软件学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 36 篇

2504.20571 2025-10-27 cs.LG cs.AI cs.CL 89%

Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Yiping Wang, Qing Yang, Zhiyuan Zeng, Liliang Ren, Liyuan Liu, Baolin Peng, Hao Cheng, Xuehai He, Kuan Wang, Jianfeng Gao, Weizhu Chen, Shuohang Wang, Simon Shaolei Du, Yelong Shen

机构 * University of Washington(华盛顿大学) University of Southern California(南加州大学) Microsoft(微软) University of California, Santa Cruz(加州大学圣克鲁兹分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments link: https://github.com/ypwang61/One-Shot-RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18809 2025-10-27 cs.AI cs.LG 88%

Classical Planning with LLM-Generated Heuristics: Challenging the State of the Art with Python Code

Augusto B. Corrêa, André G. Pereira, Jendrik Seipp

机构 * University of Oxford(牛津大学) Federal University of Rio Grande do Sul(里约格兰德杜斯阿勒斯联邦大学) Linköping University(_linköping大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21111 2025-10-27 cs.CV 88%

PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments

Weijie Zhou, Xuantang Xiong, Yi Peng, Manli Tao, Chaoyang Zhao, Honghui Dong, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Tencent Robotics X & Futian Laboratory, Shenzhen(腾讯机器人X及福田实验室,深圳) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,中国科学院自动化研究所) ObjectEye Inc(ObjectEye公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

Comments 39th Conference on Neural Information Processing Systemss (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08508 2025-10-27 cs.RO 88%

LightPlanner: Unleashing the Reasoning Capabilities of Lightweight Large Language Models in Task Planning

Weijie Zhou, Manli Tao, Chaoyang Zhao, Honghui Dong, Ming Tang, Jinqiao Wang

机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

Comments The 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21148 2025-10-27 cs.AI 87%

How to Auto-optimize Prompts for Domain Tasks? Adaptive Prompting and Reasoning through Evolutionary Domain Knowledge Adaptation

Yang Zhao, Pu Wang, Hao Frank Yang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏