arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-07 至 2025-10-07 共收录 382 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 14 篇

2510.04089 2025-10-07 cs.AI 83%

SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows

Yitong Cui, Liu Liu, Baosheng Yu, Jiayan Qiu, Xikai Zhang, Likang Xiao, Yixing Liu, Quan Chen

机构 * Hangzhou International Innovation Institute and , Beihang University(杭州国际创新研究院和 北航) School of Artificial Intelligence, Beihang University(人工智能学院,北航) Nanyang Technological University(南洋理工大学) University of Leicester(莱斯特大学) China Mobile Communications Company Limited Research Institute(中国移动通信有限公司研究院)

专题命中 后训练与偏好优化 :preference optimization(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07510 2025-10-07 cs.CV cs.LG 83%

Divergence Minimization Preference Optimization for Diffusion Model Alignment

Binxu Li, Minkai Xu, Jiaqi Han, Meihua Dang, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17225 2025-10-07 cs.CL cs.AI 82%

SSFO: Self-Supervised Faithfulness Optimization for Retrieval-Augmented Generation

Xiaqiang Tang, Yi Wang, Keyu Hu, Rui Xu, Chuang Li, Weigao Sun, Jian Li, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Chinese Academy of Sciences(中国科学院) Shanghai AI Lab(上海人工智能实验室) Tencent Hunyuan(腾讯文英)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05095 2025-10-07 cs.LG cs.AI cs.CL 82%

From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models

Mingkang Zhu, Xi Chen, Bei Yu, Hengshuang Zhao, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01555 2025-10-07 cs.LG cs.AI 81%

Rethinking KL Regularization in RLHF: From Value Estimation to Gradient Optimization

Kezhao Liu, Jason Klein Liu, Mingtao Chen, Yiming Liu

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04139 2025-10-07 cs.CL cs.LG 79%

Fine Tuning Methods for Low-resource Languages

Tim Bakkenes, Daniel Wang, Anton Johansson

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19281 2025-10-07 cs.LG 77%

A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning

Yuzheng Hu, Fan Wu, Haotian Ye, David Forsyth, James Zou, Nan Jiang, Jiaqi W. Ma, Han Zhao

机构 * UIUC Urbana(伊利诺伊大学 Urbana分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025 as an oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03612 2025-10-07 cs.AI cs.CR 70%

Cross-Modal Content Optimization for Steering Web Agent Preferences

Tanqiu Jiang, Min Bai, Nikolaos Pappas, Yanjun Qi, Sandesh Swamy

机构 * Stony Brook University(石溪大学) AWS AI Labs(亚马逊人工智能实验室)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04392 2025-10-07 cs.CL cs.AI cs.CY cs.LG 67%

Improving Consistency in Retrieval-Augmented Systems with Group Similarity Rewards

Faisal Hamman, Chenyang Zhu, Anoop Kumar, Xujun Peng, Sanghamitra Dutta, Daben Liu, Alfy Samuel

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Capital One

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025 Workshop on Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04096 2025-10-07 cs.IR cs.GT cs.LG 57%

RLRF: Competitive Search Agent Design via Reinforcement Learning from Ranker Feedback

Tommy Mordo, Sagie Dekel, Omer Madmon, Moshe Tennenholtz, Oren Kurland

机构 * Faculty of Data and Decision Sciences(数据与决策科学学院) Technion – Israel Institute of Technology(技术学院–以色列理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03679 2025-10-07 cs.LG stat.ML 57%

Group Policy Gradient

Junhua Chen, Zixi Zhang, Hantao Zhong, Rika Antonova

机构 * University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 13 篇

2510.04851 2025-10-07 cs.AI cs.LG cs.MA 86%

LEGOMem: Modular Procedural Memory for Multi-agent LLM Systems for Workflow Automation

Dongge Han, Camille Couturier, Daniel Madrigal Diaz, Xuchao Zhang, Victor Rühle, Saravan Rajmohan

机构 * Microsoft(微软)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03611 2025-10-07 cs.CL cs.AI cs.LG 85%

Can an LLM Induce a Graph? Investigating Memory Drift and Context Length

Raquib Bin Yousuf, Aadyant Khatri, Shengzhe Xu, Mandar Sharma, Naren Ramakrishnan

机构 * Department of Computer Science, Virginia Tech, Alexandria, VA(计算机科学系,弗吉尼亚理工大学,亚历山大,VA)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 2025 IEEE International Conference on Knowledge Graph (ICKG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03978 2025-10-07 cs.CV cs.CL 83%

No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models

Min Woo Sun, Alejandro Lozano, Javier Gamazo Tejero, Vishwesh Nath, Xiao Xiao Sun, James Burgess, Yuhui Zhang, Kun Yuan, Robert Tibshirani, Sean Huver, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) NVIDIA USA(NVIDIA公司)

专题命中 长上下文与记忆 :language model(title,abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04678 2025-10-07 cs.CL 81%

Multi-Agent Tool-Integrated Policy Optimization

Zhanfeng Mo, Xingxuan Li, Yuntao Chen, Lidong Bing

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10610 2025-10-07 cs.CV cs.CL 79%

MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly

Zhaowei Wang, Wenhao Yu, Xiyu Ren, Jipeng Zhang, Yu Zhao, Rohit Saxena, Liang Cheng, Ginny Wong, Simon See, Pasquale Minervini, Yangqiu Song, Mark Steedman

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) Tencent AI Seattle Lab(腾讯AI西雅图实验室) University of Edinburgh(爱丁堡大学) NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达圣克拉拉人工智能技术中心)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

Comments Accepted as a spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14051 2025-10-07 cs.LG cs.CL 79%

CAOTE: KV Cache Selection for LLMs via Attention Output Error-Based Token Eviction

Raghavv Goel, Junyoung Park, Mukul Gagrani, Dalton Jones, Matthew Morse, Harper Langston, Mingu Lee, Chris Lott

机构 * Qualcomm Technologies, Inc.(高通技术公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

Comments 15 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01346 2025-10-07 cs.CL cs.IR cs.LG 79%

RAG over Tables: Hierarchical Memory Index, Multi-Stage Retrieval, and Benchmarking

Jiaru Zou, Dongqi Fu, Sirui Chen, Xinrui He, Zihao Li, Yada Zhu, Jiawei Han, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments Project Link: https://github.com/jiaruzouu/T-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04439 2025-10-07 cs.AI cs.CL cs.LG 78%

ArcMemo: Abstract Reasoning Composition with Lifelong LLM Memory

Matthew Ho, Chen Si, Zhaoxiang Feng, Fangxu Yu, Yichi Yang, Zhijian Liu, Zhiting Hu, Lianhui Qin

专题命中 长上下文与记忆 :LLM(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04568 2025-10-07 cs.AI cs.LG 73%

COSMIR: Chain Orchestrated Structured Memory for Iterative Reasoning over Long Context

Naman Gupta, Shreeyash Gowaikar, Arun Iyer, Kirankumar Shiragur, Ramakrishna B Bairi, Rishikesh Maurya, Ritabrata Maiti, Sankarshan Damle, Shachee Mishra Gupta

机构 * Microsoft(微软)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26030 2025-10-07 cs.LG cs.AI math.OC 73%

Muon Outperforms Adam in Tail-End Associative Memory Learning

Shuche Wang, Fengzhuo Zhang, Jiaxiang Li, Cunxiao Du, Chao Du, Tianyu Pang, Zhuoran Yang, Mingyi Hong, Vincent Y. F. Tan

机构 * National University of Singapore(新加坡国立大学) University of Minnesota(明尼苏达大学) Sea AI Lab(Sea AI 实验室) Yale University(耶鲁大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11465 2025-10-07 cs.CL cs.LG 73%

CEMTM: Contextual Embedding-based Multimodal Topic Modeling

Amirhossein Abaskohi, Raymond Li, Chuyuan Li, Shafiq Joty, Giuseppe Carenini

专题命中 长上下文与记忆 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04560 2025-10-07 cs.AI 70%

ContextNav: Towards Agentic Multimodal In-Context Learning

Honghao Fu, Yuan Ouyang, Kai-Wei Chang, Yiwei Wang, Zi Huang, Yujun Cai

机构 * The University of Queensland(昆士兰大学) Nanjing University(南京大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Merced(加州大学默塞德分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08870 2025-10-07 cs.LG cs.MA 57%

GUIDE: Towards Scalable Advising for Research Ideas

Yaowenqi Liu, Bingxu Meng, Rui Pan, Yuxing Liu, Jerry Huang, Jiaxuan You, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 55 篇

2412.01928 2025-10-07 cs.LG cs.AI 88%

MALT: Improving Reasoning with Multi-Agent LLM Training

Sumeet Ramesh Motwani, Chandler Smith, Rocktim Jyoti Das, Rafael Rafailov, Ivan Laptev, Philip H. S. Torr, Fabio Pizzati, Ronald Clark, Christian Schroeder de Witt

机构 * University of Oxford(牛津大学) Cooperative AI Foundation(合作人工智能基金会) MBZUAI(穆扎夫卡尔人工智能研究所) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18142 2025-10-07 cs.CV 88%

Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models

Jingming Liu, Yumeng Li, Boyuan Xiao, Yichang Jian, Ziang Qin, Tianjia Shao, Yao-Xiang Ding, Kun Zhou

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

Comments Published in TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04311 2025-10-07 cs.AI cs.LG 86%

On the Importance of Task Complexity in Evaluating LLM-Based Multi-Agent Systems

Bohan Tang, Huidong Liang, Keyue Jiang, Xiaowen Dong

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01713 2025-10-07 cs.CL 85%

SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning

Zhongwei Wan, Zhihao Dou, Che Liu, Yu Zhang, Dongfei Cui, Qinjian Zhao, Hui Shen, Jing Xiong, Yi Xin, Yifan Jiang, Chaofan Tao, Yangfan He, Mi Zhang, Shen Yan

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09614 2025-10-07 cs.AI cs.CL 84%

Language Agents Mirror Human Causal Reasoning Biases. How Can We Help Them Think Like Scientists?

Anthony GX-Chen, Dongyan Lin, Mandana Samiei, Doina Precup, Blake A. Richards, Rob Fergus, Kenneth Marino

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) CIFAR Learning in Machines and Brains Program(CIFAR 机器与大脑学习计划) The University of Utah(犹他大学)

专题命中 推理与问题求解 :language agent(title);language model(abstract,comments);prompting(abstract);分类 cs.CL、cs.AI

Comments Conference on Language Modelling (COLM) 2025, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05278 2025-10-07 cs.CL cs.AI 84%

Micro-Act: Mitigating Knowledge Conflict in LLM-based RAG via Actionable Self-Reasoning

Nan Huo, Jinyang Li, Bowen Qin, Ge Qu, Xiaolong Li, Xiaodong Li, Chenhao Ma, Reynold Cheng

机构 * The University of Hong Kong(香港大学) BAAI(百度人工智能研究院) Xiamen University(厦门大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏