arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-24 至 2025-10-24 共收录 194 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 19 篇

2505.14483 2025-10-24 cs.CL 70%

MoMoE: Mixture of Moderation Experts Framework for AI-Assisted Online Governance

Agam Goyal, Xianyang Zhan, Yilun Chen, Koustuv Saha, Eshwar Chandrasekharan

机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06863 2025-10-24 cs.LG cs.AI 62%

floq: Training Critics via Flow-Matching for Scaling Compute in Value-Based RL

Bhavya Agrawalla, Michal Nauman, Khush Agrawal, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Warsaw(华沙大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

Comments Added new experiments, fixed typos. Code -- https://github.com/CMU-AIRe/floq

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19953 2025-10-24 cs.LG cs.AI math.OC 62%

On the Optimal Construction of Unbiased Gradient Estimators for Zeroth-Order Optimization

Shaocong Ma, Heng Huang

机构 * Department of Computer Science University of Maryland College Park(计算机科学系大学马里兰大学学院公园)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19782 2025-10-24 cs.CL 57%

Adapting Multilingual Models to Code-Mixed Tasks via Model Merging

Prashant Kodali, Vaishnavi Shivkumar, Swarang Joshi, Monojit Choudhary, Ponnurangam Kumaraguru, Manish Shrivastava

机构 * IIIT Hyderabad MBZUAI

专题命中 指令微调 :prompting(abstract);分类 cs.CL

Comments 9 pages, 5 tables, CODS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22264 2025-10-24 cs.LG 57%

Provable Meta-Learning with Low-Rank Adaptations

Jacob L. Block, Sundararajan Srinivasan, Liam Collins, Aryan Mokhtari, Sanjay Shakkottai

机构 * Chandra Family Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, TX, USA(Chandra Family 电子与计算机工程系,德克萨斯大学奥斯汀分校) Snap, Inc.(Snap公司) Google Research(Google研究)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02408 2025-10-24 cs.CV 50%

Revisiting End-to-End Learning with Slide-level Supervision in Computational Pathology

Wenhao Tang, Rong Qin, Heng Fang, Fengtao Zhou, Hao Chen, Xiang Li, Ming-Ming Cheng

机构 * Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田)) VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :foundation model(abstract)

Comments published on NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16761 2025-10-24 cs.CV 50%

Mesh-RFT: Enhancing Mesh Generation via Fine-grained Reinforcement Fine-Tuning

Jian Liu, Jing Xu, Song Guo, Jing Li, Jingfeng Guo, Jiaao Yu, Haohan Weng, Biwen Lei, Xianghui Yang, Zhuo Chen, Fangqi Zhu, Tao Han, Chunchao Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文元) University of Science and Technology of China(中国科学技术大学) South China University of Technology(华南理工大学)

专题命中 指令微调 :preference optimization(abstract)

Comments NeurIPS 2025, Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19856 2025-10-24 cs.CR 50%

Model Context Contracts - MCP-Enabled Framework to Integrate LLMs With Blockchain Smart Contracts

Eranga Bandara, Sachin Shetty, Ravi Mukkamala, Ross Gore, Peter Foytik, Safdar H. Bouk, Abdul Rahman, Xueping Liang, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

专题命中 指令微调 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 8 篇

2510.20369 2025-10-24 cs.LG 87%

Ask a Strong LLM Judge when Your Reward Model is Uncertain

Zhenghao Xu, Qin Lu, Qingru Zhang, Liang Qiu, Ilgee Hong, Changlong Yu, Wenlin Yao, Yao Liu, Haoming Jiang, Lihong Li, Hyokun Yun, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments NeurIPS 2025, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04346 2025-10-24 cs.CL 84%

Permutative Preference Alignment from Listwise Ranking of Human Judgments

Yang Zhao, Yixin Wang, Mingzhang Yin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Florida(佛罗里达大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Published at EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07520 2025-10-24 cs.SD cs.AI eess.AS 81%

LeVo: High-Quality Song Generation with Multi-Preference Alignment

Shun Lei, Yaoxun Xu, Zhiwei Lin, Huaicheng Zhang, Wei Tan, Hangting Chen, Jianwei Yu, Yixuan Zhang, Chenyu Yang, Haina Zhu, Shuai Wang, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院) Tencent AI Lab(腾讯AI实验室) Wuhan University(武汉大学) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) X-LANCE Lab, Shanghai Jiao Tong University, Shanghai(上海交通大学X-LANCE实验室) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18458 2025-10-24 cs.CL cs.AI cs.CV 81%

Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning

Wenyi Xiao, Leilei Gan

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12961 2025-10-24 cs.LG cs.AI physics.chem-ph q-bio.QM 79%

Aligning Transformers with Continuous Feedback via Energy Rank Alignment

Shriram Chennakesavalu, Frank Hu, Sebastian Ibarraran, Grant M. Rotskoff

机构 * Department of Chemistry Stanford University(化学系 斯坦福大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20413 2025-10-24 cs.LG 77%

Why DPO is a Misspecified Estimator and How to Fix It

Aditya Gopalan, Sayak Ray Chowdhury, Debangshu Banerjee

机构 * IISc Bangalore(班加罗尔IISc) IIT Kanpur(坎purIIT) HP AI Research(HP人工智能研究)

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);preference optimization(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20022 2025-10-24 cs.LG 77%

SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph

Jiazheng Li, Yawei Wang, David Yan, Yijun Tian, Zhichao Xu, Huan Song, Panpan Xu, Lin Lee Cheong

机构 * University of Connecticut(康涅狄格大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20411 2025-10-24 cs.CL 57%

Teacher Demonstrations in a BabyLM's Zone of Proximal Development for Contingent Multi-Turn Interaction

Suchir Salhan, Hongyi Gu, Donya Rooein, Diana Galvan-Sosa, Gabrielle Gaudeau, Andrew Caines, Zheng Yuan, Paula Buttery

机构 * ALTA Institute(ALTA研究所) Dept. of Computer Science & Technology, Cambridge University(计算机科学与技术系,剑桥大学) Bocconi University(博科尼大学) Sheffield University(谢菲尔德大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

Comments Outstanding Paper Award, EMNLP 2025 BabyLM Workshop - Oral presentation, Suzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 5 篇

2508.09874 2025-10-24 cs.CL cs.AI 90%

Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models

Jiaqi Cao, Jiarui Wang, Rubin Wei, Qipeng Guo, Kai Chen, Bowen Zhou, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英技术学院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19258 2025-10-24 cs.CL cs.AI 73%

Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and Reasoning

Yu Fu, Zefan Cai, Abedelkadir Asi, Wayne Xiong, Yue Dong, Wen Xiao

机构 * University of California, Riverside(加州大学河滨分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft(微软公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11145 2025-10-24 cs.CL cs.PL 70%

Text2Mem: A Unified Memory Operation Language for Memory Operating System

Yi Wang, Lihai Yang, Boyu Chen, Gongyi Zou, Kerun Xu, Bo Tang, Feiyu Xiong, Siheng Chen, Zhiyu Li

机构 * MemTensor (Shanghai) Technology(MemTensor(上海)技术有限公司) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 12 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18795 2025-10-24 cs.CL 70%

Rope to Nope and Back Again: A New Hybrid Attention Strategy

Bowen Yang, Bharat Venkitesh, Dwarak Talupuru, Hangyu Lin, David Cairuz, Phil Blunsom, Acyr Locatelli

机构 * Cohere

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00744 2025-10-24 cs.LG 57%

Blending Complementary Memory Systems in Hybrid Quadratic-Linear Transformers

Kazuki Irie, Morris Yau, Samuel J. Gershman

机构 * Harvard University(哈佛大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 41 篇

2505.15293 2025-10-24 cs.LG cs.AI 92%

LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models

Qianyue Hao, Yiwen Song, Qingmin Liao, Jian Yuan, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、北京理工大学、清华大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18254 2025-10-24 cs.AI cs.LG 90%

Illusions of reflection: open-ended task reveals systematic failures in Large Language Models' reflective reasoning

Sion Weatherhead, Flora Salim, Aaron Belbasis

机构 * University of New South Wales Sydney(新南威尔士大学悉尼分校) Aurecon Group(Aurecon集团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19895 2025-10-24 cs.CL cs.AI 90%

Large Language Model enabled Mathematical Modeling

Guoyun Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20188 2025-10-24 cs.AI 89%

TRUST: A Decentralized Framework for Auditing Large Language Model Reasoning

Morris Yu-Chao Huang, Zhen Tan, Mohan Zhang, Pingzhi Li, Zhuo Zhang, Tianlong Chen

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20198 2025-10-24 cs.CL cs.AI 88%

Stuck in the Matrix: Probing Spatial Reasoning in Large Language Models

Maggie Bai, Ava Kim Cohen, Eleanor Koss, Charlie Lichtenbaum

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 20 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20258 2025-10-24 cs.AI 88%

Using Large Language Models for Abstraction of Planning Domains - Extended Version

Bita Banihashemi, Megh Patel, Yves Lespérance

机构 * York University(约克大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17536 2025-10-24 cs.CL cs.MA 88%

Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?

Hyeong Kyu Choi, Xiaojin Zhu, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09933 2025-10-24 cs.AI cs.CL cs.LG 87%

MIR-Bench: Can Your LLM Recognize Complicated Patterns via Many-Shot In-Context Reasoning?

Kai Yan, Zhan Ling, Kang Liu, Yifan Yang, Ting-Han Fan, Lingfeng Shen, Zhengyin Du, Jiecao Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 39 pages, 11 figures. The paper is accepted at NeurIPS 2025 Datasets & Benchmarks Track, and the latest version adds modifications in camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19988 2025-10-24 cs.CL cs.AI 86%

LLM-Augmented Symbolic NLU System for More Reliable Continuous Causal Statement Interpretation

Xin Lian, Kenneth D. Forbus

机构 * Department of Computer Science, McCormick School of Engineering Applied Science, \ University, Evanston, IL 60208

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 2 figures

Journal ref Proceedings of the Twelfth Annual Conference on Advances in Cognitive Systems, Poster Collection (2025) 66-83

详情

展开后加载摘要…

URL PDF HTML 收藏