arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 313 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 17 篇

2512.01267 2025-12-02 cs.MM cs.SD 78%

ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation

ZO-ASR: 无需反向传播的语音基础模型零阶微调

Yuezhang Peng, Yuxin Liu, Yao Li, Sheng Wang, Fei Wen, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(X-LANCE实验室、计算机科学学院、人工智能重点实验室、上海交通大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 ZO-ASR通过零阶方法无需反向传播实现高效语音模型微调,有效降低内存消耗并在领域适应和测试时间适应任务中取得优于现有方法的性能。

Comments 2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00670 2025-12-02 cs.AI 77%

EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients

EDIT:基于训练梯度动态的早期扩散推理终止用于dLLMs

He-Yen Hsieh, Hong Wang, H. T. Kung

机构 * CISPA Harvard University(哈佛大学) Intel Corporation(英特尔公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 EDIT通过利用训练梯度动态,在保持准确性的同时减少dLLM推理步骤,提升效率。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13908 2025-12-02 cs.HC cs.AI stat.AP 70%

AI-Assisted Conversational Interviewing: Effects on Data Quality and Respondent Experience

AI辅助的对话访谈:对数据质量和受访者体验的影响

Soubhik Barari, Jarret Angbazo, Natalie Wang, Leah M. Christian, Elizabeth Dean, Zoe Slowinski, Brandon Sepulvado

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出AI辅助对话访谈框架,通过聊天机器人提升开放式数据收集质量,发现其在编码准确性上表现良好,但需平衡受访者体验与数据详细度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11569 2025-12-02 cs.LG cs.IT eess.SP math.IT 70%

Pre-Training and Personalized Fine-Tuning via Over-the-Air Federated Meta-Learning: Convergence-Generalization Trade-Offs

通过空中联邦元学习进行预训练和个性化微调:泛化与收敛的权衡

Haifeng Wen, Hong Xing, Osvaldo Simeone

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Department of ECE, The Hong Kong University of Science and Technology(香港科学与技术大学电子工程系) Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了无线环境下基于元学习的个性化联邦学习在泛化与收敛之间的权衡,通过空中计算分析了信道损伤对泛化和收敛的影响。

Comments 40 pages, 10 figures, to appear in IEEE Trans. Cogn. Commun. Netw

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01141 2025-12-02 cs.SE cs.LG 70%

Neural Variable Name Repair: Learning to Rename Identifiers for Readability

神经变量名修复:学习为可读性重命名标识符

Muhammad Yousuf, Akshat Bagade, Chhittebbayi Penugonda, Maanas Baraya

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出神经变量名修复方法,通过微调和重排技术提升代码可读性,实验显示其在精确匹配和部分相似度评分上显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20793 2025-12-02 cs.CV cs.AI 70%

Rendering-Aware Reinforcement Learning for Vector Graphics Generation

面向渲染的强化学习用于矢量图形生成

Juan A. Rodriguez, Haotian Zhang, Abhay Puri, Aarash Feizi, Rishav Pramanik, Pascal Wichmann, Arnab Mondal, Mohammad Reza Samsami, Rabiul Awal, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

机构 * ServiceNow Research(ServiceNow研究机构) Mila ÉTS Montréal(蒙特利尔ÉTS) Polytechnique Montréal(蒙特利尔Polytechnique) Columbia University(哥伦比亚大学) Stony Brook University(石溪大学) Apple(苹果公司) Google Research(谷歌研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) McGill University(麦吉尔大学)

专题命中 指令微调 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出RLRF方法,通过利用渲染反馈提升自回归VLMs中SVG生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00902 2025-12-02 cs.DC 67%

Elastic Mixture of Rank-Wise Experts for Knowledge Reuse in Federated Fine-Tuning

弹性秩专家混合用于联邦微调中的知识重用

Yebo Wu, Jingguang Li, Zhijiang Guo, Li Li

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 SmartFed通过弹性秩专家混合和弹性专家配额分配,实现了高效的联邦微调,有效重用已有知识以提升模型性能和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01993 2025-12-02 cs.RO cs.AI cs.CV cs.LG 62%

RoaD: Rollouts as Demonstrations for Closed-Loop Supervised Fine-Tuning of Autonomous Driving Policies

RoaD: 通过回滚作为演示实现自动驾驶策略的闭环监督微调

Guillermo Garcia-Cobo, Maximilian Igl, Peter Karkus, Zhejun Zhang, Michael Watson, Yuxiao Chen, Boris Ivanovic, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究部) Huawei VN Research Center(华为越南研究中心) Stanford University(斯坦福大学)

专题命中 指令微调 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 RoaD通过利用自动驾驶策略自身的闭环回滚作为额外训练数据,有效缓解协变量偏移问题,提升闭环监督微调性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01460 2025-12-02 cs.CL cs.LG 62%

Enhancing BERT Fine-Tuning for Sentiment Analysis in Lower-Resourced Languages

增强低资源语言情感分析中的BERT微调

Jozef Kubík, Marek Šuppa, Martin Takáč

机构 * Faculty of Mathematics Physics and Informatics(数学物理系) Comenius University in Bratislava(布拉迪斯拉发康门大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过结合主动学习与数据聚类策略,提升低资源语言情感分析中BERT模型的微调效果,实现标注节省和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15605 2025-12-02 cs.RO cs.CL cs.CV 57%

SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models

SRPO:用于视觉-语言-动作模型的自指政策优化

Senyu Fei, Siyin Wang, Li Ji, Ao Li, Shiduo Zhang, Liming Liu, Jinlong Hou, Jingjing Gong, Xianzhong Zhao, Xipeng Qiu

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :post-training(abstract);分类 cs.CL

AI总结 SRPO通过自指政策优化方法,利用模型自身生成的成功轨迹作为参考,有效解决VLA-RL中的奖励稀疏问题,实现高成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 13 篇

2512.00709 2025-12-02 cs.AI 89%

When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHF

当人类偏好翻转时:面向RLHF的实例依赖性鲁棒损失

Yifan Xu, Xichen Ye, Yifan Chen, Qiaosheng Zhang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种面向RLHF的实例依赖性鲁棒损失算法,通过建模偏好翻转机制和引入实例依赖的翻转概率,提升对齐算法的鲁棒性。

Comments Accepted by AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03492 2025-12-02 cs.LG cs.AI cs.CL 87%

Teaching Language Models to Critique via Reinforcement Learning

通过强化学习教学语言模型进行批评

Zhihui Xie, Jie Chen, Liyu Chen, Weichao Mao, Jingjing Xu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CTRL框架,通过强化学习训练批评模型以提升代码生成的准确性和性能,实现迭代改进和误差缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01775 2025-12-02 cs.LG 85%

How Does RL Post-training Induce Skill Composition? A Case Study on Countdown

强化学习后训练如何诱导技能组合?一个倒计时案例研究

Simon Park, Simran Kaur, Sanjeev Arora

机构 * Princeton Language and Intelligence (PLI), Princeton University(普林斯顿语言与智能研究所(PLI)、普林斯顿大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过倒计时任务分析强化学习后训练如何诱导技能组合,揭示了模型在不同树结构上的学习顺序和泛化能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12934 2025-12-02 cs.AI 83%

The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features

对齐的解剖:通过引导稀疏特征分解偏好优化

Jeremias Ferrao, Matthijs van der Lende, Ilija Lichkovski, Clement Neo

机构 * University of Groningen(格罗宁根大学) AI Safety Initiative Groningen(格罗宁根人工智能安全倡议) Apart Research(Apart研究)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出FSRL框架,通过引导稀疏特征来实现透明的偏好优化,揭示模型在风格化呈现上的偏倚,提供可解释的对齐控制方法。

Comments Spotlight at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01331 2025-12-02 cs.RO cs.LG 79%

RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models

RobustVLA: 为视觉-语言-动作模型引入鲁棒性感知的强化学习后训练

Hongyin Zhang, Shuo Zhang, Junxi Jin, Qixin Zeng, Runze Li, Donglin Wang

机构 * Westlake University(西湖大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 RobustVLA通过引入鲁棒性感知的强化学习后训练方法,提升视觉-语言-动作模型在环境不确定性下的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18624 2025-12-02 cs.CL 79%

Checklists Are Better Than Reward Models For Aligning Language Models

检查表比奖励模型更能对齐语言模型

Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。

Comments Presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00425 2025-12-02 cs.CV 78%

What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards

视频生成中重力的作用:基于可验证奖励的后训练牛顿定律

Minh-Quan Le, Yuanzhi Zhu, Vicky Kalogeiton, Dimitris Samaras

机构 * Stony Brook University(石溪大学) LIX, École Polytechnique, CNRS, IPP(巴黎政治学院LIX研究所、法国国家科学研究中心、IPPP)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 NewtonRewards通过可验证奖励机制提升视频生成的物理合理性与运动流畅度。

Comments Project page: https://cvlab-stonybrook.github.io/NewtonRewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23525 2025-12-02 cs.CV 78%

Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization

Hallo4: 通过直接偏好优化实现高保真的动态肖像动画

Jiahao Cui, Yan Chen, Mingwang Xu, Hanlin Shang, Yuxuan Chen, Yun Zhan, Zilong Dong, Yao Yao, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Baidu Inc.(百度公司) Shanghai Innovative Institute(上海创新研究院) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 Hallo4通过直接偏好优化和时空运动调制,实现高保真的动态肖像动画生成,提升唇部同步、表情自然性和身体运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20347 2025-12-02 cs.LG cs.AI cs.CL 75%

Soft Adaptive Policy Optimization

软适应策略优化

Chang Gao, Chujie Zheng, Xiong-Hui Chen, Kai Dang, Shixuan Liu, Bowen Yu, An Yang, Shuai Bai, Jingren Zhou, Junyang Lin

机构 * Qwen Team, Alibaba Inc(阿里巴巴公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAPO通过软门替代硬剪裁,提升大语言模型强化学习的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08364 2025-12-02 cs.CL cs.AI 73%

DPRM: A Dual Implicit Process Reward Model in Multi-Hop Question Answering

DPRM: 多跳问答任务中的双隐式过程奖励模型

Xinyi Wang, Yiping Song, Zhiliang Tian, Bo Liu, Tingjin Luo, Minlie Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DPRM通过双隐式过程奖励模型提升多跳问答任务的推理准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20358 2025-12-02 cs.CL 70%

Dialogue Is Not Enough to Make a Communicative BabyLM (But Neither Is Developmentally Inspired Reinforcement Learning)

对话不足以造就一个交际性的婴儿语言模型(但也不如发展启发式强化学习)

Francesca Padovani, Bastian Bunzeck, Manar Ali, Omar Momen, Arianna Bisazza, Hendrik Buschmeier, Sina Zarrieß

机构 * Center for Language and Cognition (CLCG), University of Groningen(语言与认知中心(CLCG)、格罗宁根大学) CRC 1646 – Linguistic Creativity in Communication, Bielefeld University(语言交流创造性研究(CRC 1646)、比尔特诺夫大学)

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文探讨了仅通过对话数据预训练是否能生成有效的小型语言模型,并通过多种微调策略提升模型的交际能力,发现DPO微调在自定义对话基准测试中表现更优。

Journal ref Proceedings of the First BabyLM Workshop (2025), pp. 421-435

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08068 2025-12-02 cs.LG 70%

Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions

分位数奖励策略优化:与点估计回归和精确分区函数对齐

Simon Matrenok, Skander Moalla, Caglar Gulcehre

机构 * CLAIRE, EPFL(CLAIRE,瑞士联邦理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 QRPO通过分位数奖励实现点绝对奖励学习,保留DPO的简单性和离线适用性,同时提升在聊天和编码任务中的性能。

Comments 58 pages, NeurIPS2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00050 2025-12-02 cs.RO cs.AI 57%

Reinforcement Learning from Implicit Neural Feedback for Human-Aligned Robot Control

从隐式神经反馈强化学习实现人对齐的机器人控制

Suzie Kim

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 本文提出利用隐式神经反馈的强化学习框架,通过脑电图信号实现人对齐的机器人控制,实验表明其在复杂任务中表现与人工设计奖励相当。

Comments Master's thesis, Korea University, 2025. arXiv admin note: substantial text overlap with arXiv:2507.13171

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 7 篇

2512.01541 2025-12-02 cs.AR 89%

RoMe: Row Granularity Access Memory System for Large Language Models

RoMe:面向大语言模型的行粒度访问内存系统

Hwayong Nam, Seungmin Baek, Jumin Kim, Michael Jaemin Kim, Jung Ho Ahn

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 RoMe通过行粒度访问DRAM并移除冗余结构,简化内存调度并提升带宽,适用于大语言模型的高效内存系统。

Comments 15 pages, 14 figures, accepted at HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01357 2025-12-02 cs.DC cs.AI cs.AR 85%

Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity

Tangram: 通过GPU内存重用和亲和力加速无服务器LLM加载

Wenbin Zhu, Zhaoyan Shen, Zili Shao, Hongjun Dai, Feng Chen

机构 * Shandong University(山东大学) The Chinese University of Hong Kong(香港中文大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Tangram通过GPU内存重用和亲和力调度技术,显著提升无服务器LLM的加载速度和冷启动性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00504 2025-12-02 cs.CL cs.AI 79%

G-KV: Decoding-Time KV Cache Eviction with Global Attention

G-KV:基于全局注意力的解码时间KV缓存淘汰

Mengqi Liao, Lu Wang, Chaoyun Zhang, Zekai Shen, Xiaowei Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Huaiyu Wan

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) MicroSoft(微软) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 G-KV通过结合局部和历史注意力分数的全局评分机制,改进KV缓存淘汰,提升大语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01591 2025-12-02 cs.LG q-bio.NC 77%

Scaling and context steer LLMs along the same computational path as the human brain

按计算路径扩展和引导大语言模型,使其与人脑一致

Joséphine Raugel, Stéphane d'Ascoli, Jérémy Rapin, Valentin Wyart, Jean-Rémi King

机构 * Meta AI Laboratoire de Neurosciences Cognitives et Computationnelles (Inserm U960)(神经认知与计算实验室) Ecole Normale Supérieure - PSL(巴黎高等师范学院 - PSL)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过分析人脑和LLM的表示对齐性,发现两者在计算顺序上一致,但受模型大小和上下文长度影响。

Journal ref Neurips Proceedings 2025 - Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00059 2025-12-02 cs.AR cs.LG 77%

SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators

SafeCiM: 探究混合浮点计算内存深度学习加速器的鲁棒性

Swastik Bhattacharya, Sanjay Das, Anand Menon, Shamik Kundu, Arnab Raha, Kanad Basu

机构 * Department of Electrical and Computer Engineering, University of Texas at Dallas(得克萨斯大学达拉斯分校电气与计算机工程系) Advanced Architecture Research Group at Intel Corporation(英特尔公司先进架构研究组) Department of Electrical, Computer and Systems Engineering, Rensselaer Polytechnic Institute(拉特格斯理工学院电气、计算机与系统工程系)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SafeCiM通过引入位翻转故障分析,提升了混合浮点计算内存加速器在硬件故障下的鲁棒性,显著降低了LLM推理准确性下降的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00325 2025-12-02 cs.SE cs.AI cs.CL 62%

Progressive Code Integration for Abstractive Bug Report Summarization

渐进式代码集成用于抽象式bug报告摘要

Shaira Sadia Karim, Abrar Mahmud Rahim, Lamia Alam, Ishmam Tashdeed, Lutfun Nahar Lota, Md. Abu Raihan M. Kamal, Md. Azam Hossain

机构 * Islamic University of Technology(伊斯兰技术大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出渐进式代码集成框架,通过整合长代码片段和文本内容,提升基于LLM的bug报告摘要效果,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11165 2025-12-02 cs.CV 50%

Explainable Deep Convolutional Multi-Type Anomaly Detection

可解释的深度卷积多类型异常检测

Alex George, Lyudmila Mihaylova, Sean Anderson

机构 * School of Electrical and Electronic Engineering(电子工程学院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出 MultiTypeFCDD 框架,通过图像级别标签生成多通道热图,实现多类型异常检测,有效解决传统方法的计算和内存限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏