arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-01 至 2025-10-01 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2509.26462 2025-10-01 cs.AI cs.CV cs.LG 73%

Zero-Shot Decentralized Federated Learning

Alessio Masano, Matteo Pennisi, Federica Proietto Salanitri, Concetto Spampinato, Giovanni Bellitto

机构 * University of Catania(卡塔尼亚大学) PeRCeiVe Lab, University of Catania(PeRCeiVe实验室,卡塔尼亚大学)

专题命中 指令微调 :language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

Comments Accepted at International Joint Conference on Neural Networks (IJCNN) 2025. Code available at https://github.com/perceivelab/ZeroDFL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07966 2025-10-01 cs.CV cs.AI cs.CL 73%

Scaling RL to Long Videos

Yukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, Sifei Liu, Hongxu Yin, Yao Lu, Song Han

机构 * NVIDIA MIT(麻省理工学院) HKU(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26641 2025-10-01 cs.CV 67%

Query-Kontext: An Unified Multimodal Model for Image Generation and Editing

Yuxin Song, Wenkai Dong, Shizun Wang, Qi Zhang, Song Xue, Tao Yuan, Hu Yang, Haocheng Feng, Hang Zhou, Xinyan Xiao, Jingdong Wang

机构 * Baidu VIS(百度视觉) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract)

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26231 2025-10-01 cs.CV 67%

IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance

Jiayi Guo, Chuanhao Yan, Xingqian Xu, Yulin Wang, Kai Wang, Gao Huang, Humphrey Shi

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24304 2025-10-01 cs.CV 67%

FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting

Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 指令微调 :language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12649 2025-10-01 cs.LG cs.AI 62%

FW-Merging: Scaling Model Merging with Frank-Wolfe Optimization

Hao Mark Chen, Shell Xu Hu, Wayne Luk, Timothy Hospedales, Hongxiang Fan

机构 * Imperial College London, UK(伦敦帝国学院) Samsung AI Center, Cambridge, UK(三星AI研究中心)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 10 篇

2509.26114 2025-10-01 cs.LG 89%

Clip-Low Increases Entropy and Clip-High Decreases Entropy in Reinforcement Learning of Large Language Models

Jaesung R. Park, Junsu Kim, Gyeongman Kim, Jinyoung Jo, Sean Choi, Jaewoong Cho, Ernest K. Ryu

机构 * Department of Mathematics, UCLA(UCLA数学系) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系) KRAFTON Department of Linguistics, Stanford University(斯坦福大学语言学系) Department of Computer Science and Engineering, Santa Clara University(圣克拉拉大学计算机科学与工程系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25509 2025-10-01 cs.LG q-bio.QM 89%

Can Molecular Foundation Models Know What They Don't Know? A Simple Remedy with Preference Optimization

Langzhou He, Junyou Zhu, Fangxin Wang, Junhua Liu, Haoyan Xu, Yue Zhao, Philip S. Yu, Qitian Wu

专题命中 后训练与偏好优化 :foundation model(title,abstract);preference optimization(title,abstract);post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25717 2025-10-01 cs.CV cs.CL cs.LG 86%

Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization

Xintong Li, Chuhan Wang, Junda Wu, Rohan Surana, Tong Yu, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣迭戈分校) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26514 2025-10-01 cs.CL 81%

BatonVoice: An Operationalist Framework for Enhancing Controllable Speech Synthesis with Linguistic Intelligence from LLMs

Yue Wang, Ruotian Ma, Xingyu Chen, Zhengliang Shi, Wanshun Chen, Huang Liu, Jiadi Yao, Qu Yang, Qingxuan Jiang, Fanghua Ye, Juntao Li, Min Zhang, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25771 2025-10-01 cs.CV cs.AI 81%

Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs

Jia Jun Cheng Xian, Muchen Li, Haotian Yang, Xin Tao, Pengfei Wan, Leonid Sigal, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Kling Team, Kuaishou Technology(快手科技 Kling 团队) NSERC CRC Chair(加拿大NSERC CRC主席)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24610 2025-10-01 cs.LG cs.CL 79%

OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment

Liang Lin, Zhihao Xu, Junhao Dong, Jian Zhao, Yuchen Yuan, Guibin Zhang, Miao Yu, Yiming Zhang, Zhengtao Yao, Huahui Yi, Dongrui Liu, Xinfeng Li, Kun Wang

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) RUC(中国人民大学) USTC(University of Science and Technology of China) NTU(National University of Technology) NUS(National University of Singapore) USC(University of Southern California) SCU(Sichuan University) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25196 2025-10-01 cs.SE cs.AI cs.LG cs.PL 79%

APRIL: API Synthesis with Automatic Prompt Optimization and Reinforcement Learning

Hua Zhong, Shan Jiang, Sarfraz Khurshid

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25718 2025-10-01 cs.RO 78%

VLA Model Post-Training via Action-Chunked PPO and Self Behavior Cloning

Si-Cheng Wang, Tian-Yu Xiang, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Ao-Qun Jin, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25849 2025-10-01 cs.LG cs.AI cs.CL 75%

Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation

Ziniu Li, Congliang Chen, Tianyun Yang, Tian Ding, Ruoyu Sun, Ge Zhang, Wenhao Huang, Zhi-Quan Luo

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25409 2025-10-01 cs.CL cs.AI cs.LG 75%

From Faithfulness to Correctness: Generative Reward Models that Think Critically

Qiyao Ma, Yunsheng Shi, Hongtao Tian, Chao Wang, Weiming Chang, Ting Yao

机构 * University of California, Davis(加州大学戴维斯分校) WeChat, Tencent(微信、腾讯) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 12 篇

2509.26340 2025-10-01 cs.LG 89%

Memory-Driven Self-Improvement for Decision Making with Large Language Models

Xue Yan, Zijing Ou, Mengyue Yang, Yan Song, Haifeng Zhang, Yingzhen Li, Jun Wang

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Imperial College London(伦敦帝国学院) University of Bristol(布里斯托大学) AI Centre, Department of Computer Science, University College London(伦敦大学学院计算机科学系人工智能中心)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25370 2025-10-01 cs.AI 85%

Where LLM Agents Fail and How They can Learn From Failures

Kunlun Zhu, Zijia Liu, Bingxuan Li, Muxin Tian, Yingxuan Yang, Jiaxun Zhang, Pengrui Han, Qipeng Xie, Fuyang Cui, Weijia Zhang, Xiaoteng Ma, Xiaodong Yu, Gowtham Ramesh, Jialian Wu, Zicheng Liu, Pan Lu, James Zou, Jiaxuan You

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01996 2025-10-01 cs.CL 79%

One ruler to measure them all: Benchmarking multilingual long-context language models

Yekyung Kim, Jenna Russell, Marzena Karpinska, Mohit Iyyer

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08479 2025-10-01 cs.CL cs.AI cs.IR 79%

Efficient Context Selection for Long-Context QA: No Tuning, No Iteration, Just Adaptive-$k$

Chihiro Taguchi, Seiji Maekawa, Nikita Bhutani

机构 * University of Notre Dame(内布拉斯加大学达灵顿分校) Megagon Labs(梅加贡实验室)

专题命中 长上下文与记忆 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 16 tables, 5 figures. Accepted at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25911 2025-10-01 cs.CL 77%

Mem-α: Learning Memory Construction via Reinforcement Learning

Yu Wang, Ryuichi Takanobu, Zhiqi Liang, Yuzhen Mao, Yuanzhe Hu, Julian McAuley, Xiaojian Wu

机构 * Anuttacon University of California San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23416 2025-10-01 cs.DB cs.LG 77%

KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction

Jang-Hyun Kim, Jinuk Kim, Sangwoo Kwon, Jae W. Lee, Sangdoo Yun, Hyun Oh Song

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments NeurIPS 2025 Oral. Code: https://github.com/snu-mllab/KVzip

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25874 2025-10-01 cs.SE 75%

LogPilot: Intent-aware and Scalable Alert Diagnosis for Large-scale Online Service Systems

Zhihan Jiang, Jinyang Liu, Yichen Li, Haiyu Huang, Xiao He, Tieying Zhang, Jianjun Chen, Yi Li, Rui Shi, Michael R. Lyu

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25558 2025-10-01 cs.AI cs.HC cs.MA cs.MM 70%

A(I)nimism: Re-enchanting the World Through AI-Mediated Object Interaction

Diana Mykhaylychenko, Maisha Thasin, Dunya Baradari, Charmelle Mhungu

机构 * Department of Architecture(建筑系) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院) University of Waterloo(滑铁卢大学) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12379 2025-10-01 cs.AI 70%

GraphCogent: Mitigating LLMs' Working Memory Constraints via Multi-Agent Collaboration in Complex Graph Understanding

Rongzheng Wang, Shuang Liang, Qizhi Chen, Yihong Huang, Muquan Li, Yizhuo Ma, Dongyang Zhang, Ke Qin, Man-Fai Leung

机构 * University of Electronic Science and Technology of China(电子科技大学) Anglia Ruskin University(安格利亚 Ruskin 大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25223 2025-10-01 cs.LG cs.AI 62%

Enhancing Linear Attention with Residual Learning

Xunhao Lai, Jialiang Kang, Jianqiao Lu, Tong Lin, Pengyu Zhao

机构 * Peking University(北京大学) The University of Hong Kong(香港大学) Minimax

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25299 2025-10-01 cs.AI cs.HC cs.MA 61%

ID-RAG: Identity Retrieval-Augmented Generation for Long-Horizon Persona Coherence in Generative Agents

Daniel Platnick, Mohamed E. Bengueddache, Marjan Alirezaie, Dava J. Newman, Alex ''Sandy'' Pentland, Hossein Rahnama

机构 * Flybits Labs, Creative Ai Hub(Flybits实验室,创意人工智能中心) Toronto Metropolitan University(多伦多 Metropolitan 大学) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI;LLM(comments)

Comments Accepted to LLAIS 2025: Workshop on LLM-Based Agents for Intelligent Systems, at ECAI 2025, 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22820 2025-10-01 cs.CV cs.AI 57%

MMPB: It's Time for Multi-Modal Personalization

Jaeik Kim, Woojin Kim, Woohyeon Park, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) IPAI ECE(电子工程系) Seoul National University(首尔国立大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 58 篇

2509.25604 2025-10-01 cs.CL cs.LG 91%

RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance

Tianlang Chen, Minkai Xu, Jure Leskovec, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);SFT(abstract)

Comments 27 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01413 2025-10-01 cs.CV cs.AI cs.CL cs.LG 90%

Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models

Yulei Qin, Gang Li, Zongyi Li, Zihan Xu, Yuchen Shi, Zhekai Lin, Xiao Cui, Ke Li, Xing Sun

机构 * Youtu-Agent Team(YouTu-Agent团队)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2025; 15 pages of main body, 5 tables, 5 figures, 42 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏