arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-23 至 2025-09-23 共收录 350 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 17 篇

2509.16990 2025-09-23 cs.CL cs.AI cs.LG cs.SD eess.AS 87%

Advancing Speech Understanding in Speech-Aware Language Models with GRPO

Avishai Elmakies, Hagai Aronowitz, Nimrod Shabtay, Eli Schwartz, Ron Hoory, Avihu Dekel

机构 * IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16560 2025-09-23 cs.CV 85%

Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization

Ji Soo Lee, Byungoh Ko, Jaewon Cho, Howoong Lee, Jaewoon Byun, Hyunwoo J. Kim

机构 * Korea University(韩国大学) Hanwha Vision(翰威英航) KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16399 2025-09-23 cs.AI 83%

VORTEX: Aligning Task Utility and Human Preferences through LLM-Guided Reward Shaping

Guojun Xiong, Milind Tambe

机构 * Department of Computer Science, Harvard University(计算机科学系,哈佛大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 28pages, 19figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17407 2025-09-23 cs.AI cs.CL 82%

Post-hoc Reward Calibration: A Case Study on Length Bias

Zeyu Huang, Zihan Qiu, Zili Wang, Edoardo M. Ponti, Ivan Titov

机构 * University of Edinburgh(爱丁堡大学) Alibaba Group(阿里巴巴集团) INF Technology(INF技术) University of Amsterdam(阿姆斯特丹大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09696 2025-09-23 cs.CL 74%

GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models

Jixiao Zhang, Chunsheng Zuo

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 后训练与偏好优化 :language model(title);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00707 2025-09-23 cs.CL cs.AI 73%

Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMs

Daehoon Gwak, Minseo Jung, Junwoo Park, Minho Park, ChaeHun Park, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Main Paper (Long)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17105 2025-09-23 cs.LG 70%

GRPOformer: Advancing Hyperparameter Optimization via Group Relative Policy Optimization

Haoxin Guo, Jiawen Pan, Weixin Zhai

机构 * 1College of Information Electrical Engineering, \ Agricultural University, Beijing 100083, China Electrical Engineering, \ Agricultural University, Beijing 100083, China 2Key Laboratory of Agricultural Machinery Monitoring

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16965 2025-09-23 cs.CL 70%

Preference Distillation via Value based Reinforcement Learning

Minchan Kwon, Junwon Ko, Kangil Kim, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学技术研究院) Gwangju Institute of Science and Technology (GIST)(全州科学技术院)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL

Comments 20 page

Journal ref NIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16246 2025-09-23 cs.PL cs.AR 67%

VerilogMonkey: Exploring Parallel Scaling for Automated Verilog Code Generation with LLMs

Juxin Niu, Yuxin Du, Dan Niu, Xi Wang, Zhe Jiang, Nan Guan

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13388 2025-09-23 cs.CL cs.AI cs.LG 67%

R3: Robust Rubric-Agnostic Reward Models

David Anugraha, Zilu Tang, Lester James V. Miranda, Hanyang Zhao, Mohammad Rifqi Farhansyah, Garry Kuwanto, Derry Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) Boston University(波士顿大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学) Institut Teknologi Bandung(Bandung 工程技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17917 2025-09-23 cs.AI 57%

Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent

Junyu Lu, Songxin Zhang, Zejian Xie, Zhuoyang Song, Jiaxing Zhang

机构 * Lionrock AI Lab(狮岩人工智能实验室) China Merchants Research Institute of Advanced Technology(中国商人先进科技研究院)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04615 2025-09-23 cs.CL 57%

On the Low-Rank Parametrization of Reward Models for Controlled Language Generation

Sergey Troshin, Vlad Niculae, Antske Fokkens

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17940 2025-09-23 cs.RO cs.CV 50%

DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving

Shuyao Shang, Yuntao Chen, Yuqi Wang, Yingyan Li, Zhaoxiang Zhang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所神经网络与模式识别实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17627 2025-09-23 cs.CV 50%

OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models

Jinshu Chen, Xinghui Li, Xu Bai, Tianxiang Ma, Pengze Zhang, Zhuowei Chen, Gen Li, Lijie Liu, Songtao Zhao, Bingchuan Li, Qian He

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract)

Comments Github Page: https://phantom-video.github.io/OmniInsert/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 8 篇

2509.14223 2025-09-23 cs.LG cs.AI cs.CL 82%

Fresh in memory: Training-order recency is linearly encoded in language model activations

Dmitrii Krasheninnikov, Richard E. Turner, David Krueger

机构 * University of Cambridge(剑桥大学) Mila, University of Montreal(蒙特利尔大学米尔研究所)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16713 2025-09-23 cs.CL 79%

OPEN-THEATRE: An Open-Source Toolkit for LLM-based Interactive Drama

Tianyang Xu, Hongqiu Wu, Weiqi Wu, Hai Zhao

机构 * UM–SJTU Joint Institute, Shanghai Jiao Tong University(上海交通大学与UM联合研究所) AGI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学人工智能研究所) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University(上海教育委员会智能交互与认知工程重点实验室) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(上海Web3可信数据流通与治理重点实验室)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17010 2025-09-23 cs.CL cs.AI 79%

MindRef: Mimicking Human Memory for Hierarchical Reference Retrieval with Fine-Grained Location Awareness

Ye Wang, Xinrun Xu, Zhiming Ding

机构 * Renmin University of China(中国人民大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00919 2025-09-23 cs.CL cs.AI cs.LG 75%

Attention Sinks: A 'Catch, Tag, Release' Mechanism for Embeddings

Stephen Zhang, Mustafa Khan, Vardan Papyan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20276 2025-09-23 cs.CL cs.AI 73%

Does quantization affect models' performance on long-context tasks?

Anmol Mekala, Anirudh Atmakuru, Yixiao Song, Marzena Karpinska, Mohit Iyyer

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments to appear in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17042 2025-09-23 cs.RO 67%

Orchestrate, Generate, Reflect: A VLM-Based Multi-Agent Collaboration Framework for Automated Driving Policy Learning

Zengqi Peng, Yusen Xie, Yubin Wang, Rui Yang, Qifeng Chen, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州)) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Cheng Kar-Shun Robotics Institute, The Hong Kong University of Science and Technology(陈家骏机器人研究所,香港科学与技术大学)

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16857 2025-09-23 cs.DC cs.AI cs.LG 62%

ShadowServe: Interference-Free KV Cache Fetching for Distributed Prefix Caching

Xingyu Xiang, Raj Joshi, Yuhan Liu, Jiayi Yao, Chenxingyu Zhao, Junchen Jiang, Yang Zhou, Eddie Kohler, Minlan Yu

机构 * Harvard University(哈佛大学) University of Chicago(芝加哥大学) University of Washington(华盛顿大学) UC Davis(加州大学戴维斯分校)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01475 2025-09-23 cs.SE cs.AI 57%

CodeSSM: Towards State Space Models for Code Understanding

Shweta Verma, Abhinav Anand, Mira Mezini

机构 * TU Darmstadt(图宾根大学) Hessian Center for Artificial Intelligence(黑森人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 68 篇

2507.02954 2025-09-23 cs.CL cs.AI 91%

Advanced Financial Reasoning at Scale: A Comprehensive Evaluation of Large Language Models on CFA Level III

Pranam Shetty, Abhisek Upadhayaya, Parth Mitesh Shah, Srikanth Jagabathula, Shilpi Nayak, Anna Joo Fee

机构 * Rochester Institute of Technology(罗切斯特理工学院) GoodFin, Inc(GoodFin公司) New York University(纽约大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted at FinLLM @ IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16895 2025-09-23 cs.IR 90%

Temporal-Aware User Behaviour Simulation with Large Language Models for Recommender Systems

Xinye Wanyan, Danula Hettiachchi, Chenglong Ma, Ziqi Xu, Jeffrey Chan

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07343 2025-09-23 cs.SE 90%

Code Generation with Small Language Models: A Codeforces-Based Study

Débora Souza, Rohit Gheyi, Lucas Albuquerque, Gustavo Soares, Márcio Ribeiro

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

Comments Accepted at International Conference on Machine Learning and Applications (ICMLA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16887 2025-09-23 cs.AI cs.MA cs.RO 90%

A Large Language Model-based multi-agent manufacturing system for intelligent shopfloor

Zhen Zhao, Dunbing Tang, Changchun Liu, Liping Wang, Zequn Zhang, Haihua Zhu, Kai Chen, Qingwei Nie, Yuchen Ji

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Journal ref Zhao Z, Tang D, Liu C, et al. A Large language model-based multi-agent manufacturing system for intelligent shopfloors[J]. Advanced Engineering Informatics, 2026, 69: 103888

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17616 2025-09-23 cs.CL cs.AI 90%

Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments

Qingyu Lu, Liang Ding, Siyi Cao, Xuebo Liu, Kanjian Zhang, Jinxia Zhang, Dacheng Tao

机构 * Southeast University(东南大学) The University of Sydney(悉尼大学) Southeast University Shenzhen Research Institute(东南大学深圳研究院) Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学计算机与智能信息学院,深圳,中国) College of Computing and Data Science at Nanyang Technological University, Singapore 639798(南洋理工大学计算机与数据科学学院,新加坡)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 - Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16502 2025-09-23 cs.LG 89%

GRIL: Knowledge Graph Retrieval-Integrated Learning with Large Language Models

Jialin Chen, Houyu Zhang, Seongjun Yun, Alejandro Mottini, Rex Ying, Xiang Song, Vassilis N. Ioannidis, Zheng Li, Qingjun Cui

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12466 2025-09-23 cs.LG cs.AI cs.CL cs.PL cs.SE 89%

EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking

Anjiang Wei, Jiannan Cao, Ran Li, Hongyu Chen, Yuhui Zhang, Ziheng Wang, Yuan Liu, Thiago S. F. X. Teixeira, Diyi Yang, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Google(谷歌) Nanjing University(南京大学) Intel(英特尔)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14979 2025-09-23 cs.AI cs.CL cs.LG 89%

Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology

Wei Xie, Shuoyoucheng Ma, Zhenhua Wang, Enze Wang, Kai Chen, Xiaobing Sun, Baosheng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科学、技术和研究局高性能计算研究所) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Thank you for your attention. This paper was accepted by the CogSci 2025 conference in April and published in August. The location in the proceedings is: https://escholarship.org/uc/item/24x9t7s1

详情

展开后加载摘要…

URL PDF HTML 收藏