arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-12 至 2025-11-12 共收录 211 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2511.08325 2025-11-12 cs.CL cs.IR cs.LG 86%

AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress

Zhiheng Xi, Chenyang Liao, Guanyu Li, Yajie Yang, Wenxiang Chen, Zhihao Zhang, Binghai Wang, Senjie Jin, Yuhao Zhou, Jian Guan, Wei Wu, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23349 2025-11-12 cs.LG cs.AI 86%

Towards Reward Fairness in RLHF: From a Resource Allocation Perspective

Sheng Ouyang, Yulan Hu, Ge Chen, Qingyang Li, Fuzheng Zhang, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07477 2025-11-12 cs.CY cs.AI cs.CL 86%

The Polite Liar: Epistemic Pathology in Language Models

Bentley DeVilling

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 2 tables, Preprint - under review at AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07896 2025-11-12 cs.AI cs.CL 82%

SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder

Dengcan Liu, Jiahao Li, Zheren Fu, Yi Tu, Jiajun Li, Zhendong Mao, Yongdong Zhang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 15pages,11figures,AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20995 2025-11-12 cs.CL 81%

ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models

Xiaomin Li, Xupeng Chen, Jingxuan Fan, Eric Hanchen Jiang, Mingye Gao

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08394 2025-11-12 cs.CL cs.AI cs.HC cs.LG 80%

Interaction Dynamics as a Reward Signal for LLMs

Sian Gooding, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07806 2025-11-12 cs.CV 50%

PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier

Shaomeng Wang, He Wang, Xiaolu Wei, Longquan Dai, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

Comments 10 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 9 篇

2502.17129 2025-11-12 cs.CL 89%

Thus Spake Long-Context Large Language Model

Xiaoran Liu, Ruixiao Li, Mianqiu Huang, Zhigeng Liu, Yuerong Song, Qipeng Guo, Siyang He, Qiqi Wang, Linlin Li, Qun Liu, Ziwei He, Yaqian Zhou, Xuanjing Huang, Xipeng Qiu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments a global picture of the lifecycle of long-context LLMs from four perspectives: architecture, infrastructure, training, and evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18515 2025-11-12 cs.MA 88%

Socialized Learning and Emergent Behaviors in Multi-Agent Systems based on Multimodal Large Language Models

Sureyya Akin, Shruti T. Tiwari, Ram Bhattacharya, Sagar A. Raman, Kiran Mohanty, Sita Krishnan

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)

Comments We have identified critical issues in the code implementation that severely deviate from Algorithm 1, invalidating all experimental results and conclusions. Despite exhaustive efforts to correct these issues, we find they fundamentally undermine the paper's core claims. To uphold academic integrity and prevent misinformation, we are withdrawing this manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07800 2025-11-12 cs.CL 87%

From Experience to Strategy: Empowering LLM Agents with Trainable Graph Memory

Siyu Xia, Zekun Xu, Jiajun Chai, Wentian Fan, Yan Song, Xiaohan Wang, Guojun Yin, Wei Lin, Haifeng Zhang, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) Nanjing University of Posts and Telecommunications(南京邮电大学) AI Centre, Department of Computer Science, University College London(伦敦大学学院计算机科学系人工智能中心)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03866 2025-11-12 cs.DC cs.AI cs.LG cs.PF cs.PL 73%

OMPILOT: Harnessing Transformer Models for Auto Parallelization to Shared Memory Computing Paradigms

Arijit Bhattacharjee, Ali TehraniJamsaz, Le Chen, Niranjan Hasabnis, Mihai Capota, Nesreen Ahmed, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(伊阿华州立大学计算机科学系) Mako AI, USA(Mako AI公司) Argonne National Laboratory, USA(阿贡国家实验室) Code Metal, USA(Code Metal公司) Intel Labs, USA(英特尔实验室) Cisco Outshift, USA(Cisco Outshift公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08128 2025-11-12 cs.CL 70%

Sentence-Anchored Gist Compression for Long-Context LLMs

Dmitrii Tarasov, Elizaveta Goncharova, Kuznetsov Andrey

机构 * FusionBrainLab(融合脑实验室) HSE University(俄罗斯高等经济大学) Innopolis University(伊诺波利斯大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23777 2025-11-12 cs.CL 70%

CONGRAD:Conflicting Gradient Filtering for Multilingual Preference Alignment

Jiangnan Li, Thuy-Trang Vu, Christian Herold, Amirhossein Tebbifakhr, Shahram Khadivi, Gholamreza Haffari

机构 * Department of Data Science and AI, Monash University, Australia(墨尔本大学数据科学与人工智能系) eBay Inc.(eBay公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11816 2025-11-12 cs.CV cs.LG 57%

Continuous Subspace Optimization for Continual Learning

Quan Cheng, Yuanyu Wan, Lingyu Wu, Chenping Hou, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) School of Software Technology, Zhejiang University(软件学院,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, China(杭州高新技术区(滨江)区块链与数据安全研究院,杭州,中国) College of Science, National University of Defense Technology(科学学院,国防科技大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08521 2025-11-12 cs.CV 50%

UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist

Zhengyang Liang, Daoan Zhang, Huichi Zhou, Rui Huang, Bobo Li, Yuechen Zhang, Shengqiong Wu, Xiaohan Wang, Jiebo Luo, Lizi Liao, Hao Fei

机构 * Singapore Management University(新加坡管理大学) University of Rochester(罗切斯特大学) University College London(伦敦大学学院) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :language model(abstract)

Comments Technical Report. 24 figures, 37 pages. Website: https://univa.online/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02609 2025-11-12 cs.SE 50%

RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents

Chengquan Guo, Chulin Xie, Yu Yang, Zhaorun Chen, Zinan Lin, Xander Davies, Yarin Gal, Dawn Song, Bo Li

专题命中 长上下文与记忆 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 26 篇

2509.21486 2025-11-12 cs.CV 92%

Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance

Zixuan Wang, Yu Sun, Hongwei Wang, Baoyu Jing, Xiang Shen, Xin Dong, Zhuolin Hao, Hongyu Xiong, Yang Song

机构 * TikTok Inc.(字节跳动公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);SFT(abstract)

Comments Camera Ready for EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07727 2025-11-12 cs.RO 90%

LLM-GROP: Visually Grounded Robot Task and Motion Planning with Large Language Models

Xiaohan Zhang, Yan Ding, Yohei Hayamizu, Zainab Altaweel, Yifeng Zhu, Yuke Zhu, Peter Stone, Chris Paxton, Shiqi Zhang

机构 * The State University of New York at Binghamton(纽约州立大学布林顿分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Sony AI(索尼人工智能) Hello Robot(Hello Robot公司) Shanghai AI Laboratory(上海人工智能实验室) OneStar Robotics(OneStar机器人)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title)

Journal ref The International Journal of Robotics Research, 2025, Vol. 0(0), pp. 1-19

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08392 2025-11-12 cs.CL 89%

PCRLLM: Proof-Carrying Reasoning with Large Language Models under Stepwise Logical Constraints

Tangrui Li, Pei Wang, Hongzheng Wang Christian Hahm, Matteo Spatola, Justin Shi

机构 * Temple University(特拉华大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08098 2025-11-12 cs.RO cs.AI cs.CL cs.HC 89%

PerspAct: Enhancing LLM Situated Collaboration Skills through Perspective Taking and Active Vision

Sabrina Patania, Luca Annese, Anita Pellegrini, Silvia Serino, Anna Lambiase, Luca Pallonetto, Silvia Rossi, Simone Colombani, Tom Foulsham, Azzurra Ruggeri, Dimitri Ognibene

机构 * University of Milan-Bicocca(米兰-比科卡大学) University of Naples Federico II(那不勒斯费德里科二世大学) Oversonic Robotics(Oversonic机器人公司) University of Essex(埃塞克斯大学) TUM School of Social Sciences and Technology(慕尼黑技术大学社会科学与技术学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at IAS19

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06888 2025-11-12 cs.CV 89%

A Two-Stage System for Layout-Controlled Image Generation using Large Language Models and Diffusion Models

Jan-Hendrik Koch, Jonas Krumme, Konrad Gadzicki

机构 * Cognitive Neuroinformatics University of Bremen(认知神经信息学不莱梅大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08043 2025-11-12 cs.LG cs.CL 88%

DynaAct: Large Language Model Reasoning with Dynamic Action Spaces

Xueliang Zhao, Wei Wu, Jian Guan, Qintong Li, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07932 2025-11-12 cs.AI 88%

Computational Blueprints: Generating Isomorphic Mathematics Problems with Large Language Models

Jeong-Hoon Kim, Jinwoo Nam, Geunsik Jo

机构 * Turing Co. Ltd.(图灵公司)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

Comments EMNLP2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07568 2025-11-12 cs.AI 85%

Procedural Knowledge Improves Agentic LLM Workflows

Vincent Hsiao, Mark Roberts, Leslie Smith

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07784 2025-11-12 cs.MA 85%

Can LLM Agents Really Debate? A Controlled Study of Multi-Agent Debate in Logical Reasoning

Haolun Wu, Zhenkun Li, Lingyao Li

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05784 2025-11-12 cs.CL cs.AI cs.LG 85%

DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning

Yaxuan Wang, Chris Yuhao Liu, Quan Liu, Jinglong Pang, Wei Wei, Yujia Bao, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Please refer to the NeurIPS 2025 submission: https://openreview.net/forum?id=FNuul0hlin The paper has been accepted to the ICML 2025 MUGen Workshop: https://openreview.net/forum?id=ET24oKP23c

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08022 2025-11-12 cs.AI 84%

Numerical Sensitivity and Robustness: Exploring the Flaws of Mathematical Reasoning in Large Language Models

Zhishen Sun, Guang Dai, Ivor Tsang, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室) A*STAR

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14359 2025-11-12 cs.CV cs.AI cs.CL 84%

A Multimodal Recaptioning Framework to Account for Perceptual Diversity Across Languages in Vision-Language Modeling

Kyle Buettner, Jacob T. Emmerson, Adriana Kovashka

机构 * Intelligent Systems Program(智能系统项目) Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at IJCNLP-AACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20810 2025-11-12 cs.CL 83%

Enrich-on-Graph: Query-Graph Alignment for Complex Reasoning with LLM Enriching

Songze Li, Zhiqiang Liu, Zhengke Gui, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Journal ref EMNLP 2025, pages 7683-7703

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07690 2025-11-12 cs.AI 81%

Towards AI-Assisted Generation of Military Training Scenarios

Soham Hans, Volkan Ustun, Benjamin Nye, James Sterrett, Matthew Green

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏