arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-30 至 2025-09-30 共收录 512 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 25 篇

2509.25190 2025-09-30 cs.CV 85%

Visual Jigsaw Post-Training Improves MLLMs

Penghao Wu, Yushan Zhang, Haiwen Diao, Bo Li, Lewei Lu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Linköping University(_linköping大学) SenseTime Research(商汤科技研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24713 2025-09-30 cs.LG cs.AI 84%

Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF

Jing Liu

机构 * ENS, Université PSL, EHESS, CNRS(高等科学研究所、巴黎国立大学、EHESS、国家科学研究中心)

专题命中 后训练与偏好优化 :RLHF(title,abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2025-09-30 cs.CR 82%

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

Haoran Li, Yulin Chen, Jingru Zeng, Hao Peng, Huihao Jing, Wenbin Hu, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25047 2025-09-30 cs.AI 81%

Scaling Synthetic Task Generation for Agents via Exploration

Ram Ramrakhya, Andrew Szot, Omar Attia, Yuhao Yang, Anh Nguyen, Bogdan Mazoure, Zhe Gan, Harsh Agrawal, Alexander Toshev

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19299 2025-09-30 cs.CL cs.AI 79%

A Necessary Step toward Faithfulness: Measuring and Improving Consistency in Free-Text Explanations

Lingjun Zhao, Hal Daumé

机构 * University of Maryland College Park(马里兰大学学院市)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03333 2025-09-30 cs.CL cs.AI 79%

CTTS: Collective Test-Time Scaling

Zhende Song, Shengji Tang, Peng Ye, Jiayuan Fan, Lei Bai, Tao Chen, Wanli Ouyang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23958 2025-09-30 cs.CV 78%

Reinforcement Learning with Inverse Rewards for World Model Post-training

Yang Ye, Tianyu He, Shuo Yang, Jiang Bian

专题命中 后训练与偏好优化 :post-training(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24375 2025-09-30 cs.CL 77%

Reinforcement Mid-Training

Yijun Tian, Shaoyu Chen, Zhichao Xu, Yawei Wang, Jinhe Bi, Peng Han, Wei Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19199 2025-09-30 cs.CL 77%

Agentic Reinforcement Learning with Implicit Step Rewards

Xiaoqian Liu, Ke Wang, Yuchuan Wu, Fei Huang, Yongbin Li, Junge Zhang, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab(通义实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23095 2025-09-30 cs.LG cs.AI cs.CL 75%

Causally-Enhanced Reinforcement Policy Optimization

Xiangqi Wang, Yue Huang, Yujun Zhou, Xiaonan Luo, Kehan Guo, Xiangliang Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Reinforcement learning publication of 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05183 2025-09-30 cs.LG cs.AI 73%

TreeRPO: Tree Relative Policy Optimization

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Xiaodan Liang, Yiwei Wang, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) University of California, Merced(加州大学梅德福分校) Sun Yat-sen University(中山大学) MBZUAI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 13pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24342 2025-09-30 cs.AI 70%

Fin-Ally: Pioneering the Development of an Advanced, Commonsense-Embedded Conversational AI for Money Matters

Sarmistha Das, Priya Mathur, Ishani Sharma, Sriparna Saha, Kitsuchart Pasupa, Alka Maurya

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(计算机科学与工程系,印度理工学院帕纳布分校) School of Information Technology, King Mongkut's Institute of Technology Ladkrabang, Thailand(信息科技学院,拉差班国王技术学院) CRISIL Limited, India(CRISIL有限公司)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16853 2025-09-30 cs.LG 70%

Reward-Agnostic Prompt Optimization for Text-to-Image Diffusion Models

Semin Kim, Yeonwoo Cha, Jaehoon Yoo, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 29 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17673 2025-09-30 cs.CL 70%

Cross-lingual Human-Preference Alignment for Neural Machine Translation with Direct Quality Optimization

Kaden Uhlig, Joern Wuebker, Raphael Reinauer, John DeNero

机构 * LILT Amazon(亚马逊)

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract);分类 cs.CL

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25137 2025-09-30 cs.AI cs.CL cs.LG 67%

The Era of Real-World Human Interaction: RL from User Conversations

Chuanyang Jin, Jing Xu, Bo Liu, Leitian Tao, Olga Golovneva, Tianmin Shu, Wenting Zhao, Xian Li, Jason Weston

机构 * FAIR at Meta(Meta 的 FAIR) Johns Hopkins University(约翰霍普金斯大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23082 2025-09-30 cs.CV 50%

Follow-Your-Preference: Towards Preference-Aligned Image Inpainting

Yutao Shen, Junkun Yuan, Toru Aonishi, Hideki Nakayama, Yue Ma

机构 * The University of Tokyo(东京大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

Comments 16 pages,9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 22 篇

2507.04607 2025-09-30 cs.CL cs.AI 90%

PRIME: Large Language Model Personalization with Cognitive Dual-Memory and Personalized Thought Process

Xinliang Frederick Zhang, Nick Beauchamp, Lu Wang

机构 * Computer Science and Engineering, University of Michigan, Ann Arbor, MI(计算机科学与工程系,密歇根大学,安娜堡分校) Department of Political Science, Northeastern University, Boston, MA(政治学系,东北大学,波士顿分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments EMNLP'25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16257 2025-09-30 cs.CV 88%

Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models

Keda Tao, Haoxuan You, Yang Sui, Can Qin, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Columbia University(哥伦比亚大学) Rice University(Rice大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22796 2025-09-30 cs.CR cs.LG 87%

What Do They Fix? LLM-Aided Categorization of Security Patches for Critical Memory Bugs

Xingyu Li, Juefei Pu, Yifan Wu, Xiaochen Zou, Shitong Zhu, Xiaochen Zou, Shitong Zhu, Qiushi Wu, Zheng Zhang, Joshua Hsu, Yue Dong, Zhiyun Qian, Kangjie Lu, Trent Jaeger, Michael De Lucia, Srikanth V. Krishnamurthy

机构 * UC Riverside(罗切斯特大学) University of Minnesota(明尼苏达大学) IBM(IBM公司)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24160 2025-09-30 cs.RO cs.AI cs.LG 86%

Memory Transfer Planning: LLM-driven Context-Aware Code Adaptation for Robot Manipulation

Tomoyuki Kagaya, Subramanian Lakshmi, Yuxuan Lou, Thong Jing Yuan, Jayashree Karlekar, Sugiri Pranata, Natsuki Murakami, Akira Kinose, Yang You

机构 * Panasonic Connect Co., Ltd.(松下电器(控股)公司) Panasonic R&D Center(松下研发中心) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23767 2025-09-30 cs.CL cs.AI 86%

From Personal to Collective: On the Role of Local and Global Memory in LLM Personalization

Zehong Wang, Junlin Wu, ZHaoxuan Tan, Bolian Li, Xianrui Zhong, Zheli Liu, Qingkai Zeng

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23113 2025-09-30 cs.AI cs.CY 85%

Exploring LLM-based Frameworks for Fault Diagnosis

Xian Yeow Lee, Lasitha Vidyaratne, Ahmed Farahat, Chetan Gupta

机构 * Hitachi America Ltd.(日立美国有限公司)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09081 2025-09-30 cs.SI cs.AI cs.MA 85%

SALM: A Multi-Agent Framework for Language Model-Driven Social Network Simulation

Gaurav Koley

机构 * Boston University(波士顿大学)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24219 2025-09-30 cs.RO cs.AI cs.LG 84%

ViReSkill: Vision-Grounded Replanning with Skill Memory for LLM-Based Planning in Lifelong Robot Learning

Tomoyuki Kagaya, Subramanian Lakshmi, Anbang Ye, Thong Jing Yuan, Jayashree Karlekar, Sugiri Pranata, Natsuki Murakami, Akira Kinose, Yang You

机构 * Panasonic Connect Co., Ltd.(松下电器(株式会社)) Panasonic R&D Center(松下研发中心) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24930 2025-09-30 cs.CL cs.CY 81%

How Well Do LLMs Imitate Human Writing Style?

Rebira Jemama, Rajesh Kumar

机构 * Lewisburg Area High School, Lewisburg, USA(刘易斯堡区高中) Bucknell University, Lewisburg, USA(巴克内尔大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments IEEE UEMCON 2025, 11 pages, 4 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05414 2025-09-30 cs.CL 79%

LongProc: Benchmarking Long-Context Language Models on Long Procedural Generation

Xi Ye, Fangcong Yin, Yinghui He, Joie Zhang, Howard Yen, Tianyu Gao, Greg Durrett, Danqi Chen

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

Comments COLM 2025. Data and code available at: https://princeton-pli.github.io/LongProc

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23614 2025-09-30 cs.AI 79%

PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents

Yaozu Wu, Jizhou Guo, Dongyuan Li, Henry Peng Zou, Wei-Chieh Huang, Yankai Chen, Zhen Wang, Weizhi Zhang, Yangning Li, Meng Zhang, Renhe Jiang, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24357 2025-09-30 cs.LG cs.AI 79%

ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration

Xianglong Yan, Zhiteng Li, Tianao Zhang, Haotong Qin, Linghe Kong, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19549 2025-09-30 cs.CL 77%

From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents

Derong Xu, Yi Wen, Pengyue Jia, Yingyi Zhang, wenlin zhang, Yichao Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04664 2025-09-30 cs.CL cs.AI cs.LG 75%

Sculptor: Empowering LLMs with Cognitive Agency via Active Context Management

Mo Li, L. H. Xu, Qitai Tan, Long Ma, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学) Peking University(北京大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏