arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 455 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 22 篇

2602.08439 2026-02-10 cs.CV 75%

Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

Demo-ICL: 用于过程视频知识获取的上下文学习

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Lab(上海人工智能实验室) CUHK-MMLab(香港大学多媒体实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 Demo-ICL通过两阶段训练策略提升模型从上下文示例中学习的能力,针对视频理解中的新挑战提出Demo-ICL-Bench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14185 2026-02-10 cs.LG cs.AI cs.CL 75%

Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study

安全子空间并非线性区分:一项微调案例研究

Kaustubh Ponkshe, Shaan Shah, Raghav Singhal, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of California San Diego(加州大学圣地亚哥分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过微调案例发现,安全行为与通用学习组件高度交织,基于子空间的防御策略存在根本限制。

Comments ICLR 2026. Kaustubh Ponkshe, Shaan Shah, and Raghav Singhal contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16289 2026-02-10 stat.ML cs.LG 72%

The Condition Number as a Scale-Invariant Proxy for Information Encoding in Neural Units

条件数作为神经元信息编码的尺度不变代理

Oswaldo Ludwig

机构 * Oswaldo Ludwig(奥沃尔多·路易斯)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG;LLM(comments)

AI总结 本文提出条件数作为神经元信息编码的代理,通过分析线性单元和熵界,展示其在缓解灾难性遗忘中的有效性。

Comments This version includes a new experiment using a larger LLM and introducing KappaTune-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01227 2026-02-10 cs.CL cs.AI cs.LG 67%

Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority

监督微调需要解锁标记优先的潜力

Zhanming Shen, Zeyu Qin, Jiaqi Hu, Wentao Ye, Hao Chen, Xiaomeng Hu, Haokai Xu, Gang Chen, Yi R. Fung, Haobo Wang

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出标记优先作为监督微调的关键桥梁,通过分布重塑过程实现数据与理想对齐流形的匹配,并分析了噪声过滤和有毒模式卸载两种不同的研究领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23278 2026-02-10 cs.CV 67%

UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing

UniLiP: 适配CLIP以实现统一的多模态理解、生成与编辑

Hao Tang, Chenwei Xie, Xiaoyi Bao, Tingyu Weng, Pandeng Li, Yun Zheng, Liwei Wang

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Alibaba Group(阿里巴巴集团) CASIA Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 UniLIP通过两阶段训练和双条件架构,提升CLIP在多模态理解、生成和编辑任务中的性能,实现高效参数下的高表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16982 2026-02-10 cs.CL cs.AI cs.LG 67%

Language Bottleneck Models for Qualitative Knowledge State Modeling

用于定性知识状态建模的语言瓶颈模型

Antonin Berthon, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 语言瓶颈模型通过编码器和解码器LLM生成可解释的知识状态摘要,提升教育场景中对学习者知识状态的定性分析与预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02841 2026-02-10 cs.LG cs.AI 62%

Semantics-Aware Generative Latent Data Augmentation for Learning in Low-Resource Domains

语义感知的生成潜在数据增强用于低资源领域的学习

Jaesung Bae, Minje Kim

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, Illinois, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,伊利诺伊州,美国)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 GeLDA通过语义感知的生成潜在数据增强方法,在低资源领域提升语音情绪识别和图像分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01105 2026-02-10 cs.LG cs.AI 62%

OLion: Approaching the Hadamard Ideal by Intersecting Spectral and $\ell_{\infty}$ Implicit Biases

OLion:通过谱和ℓ∞隐偏见的交集接近Hadamard理想

Zixiao Wang, Yifei Shen, Huishuai Zhang

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 指令微调 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 OLion通过结合谱控制与ℓ∞隐偏见,高效近似在Hadamard-like集上取最大步长,提升大规模语言和视觉任务的优化性能。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07670 2026-02-10 cs.LG cs.AI 62%

Surprisal-Guided Selection: Compute-Optimal Test-Time Strategies for Execution-Grounded Code Generation

惊讶引导的选择:为执行导向代码生成的计算最优测试时间策略

Jarrod Barnes

机构 * Arc Intelligence(Arc智能)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出惊讶引导选择策略,通过提升样本多样性和智能选择,优化执行导向代码生成任务的测试时间策略,实现计算最优的高成功率。

Comments 13 pages, 7 figures, 11 tables. Preprint. Code: https://github.com/jbarnes850/test-time-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06993 2026-02-10 cs.LG cs.CL 62%

Attractor Patch Networks: Reducing Catastrophic Forgetting with Routed Low-Rank Patch Experts

吸引子补丁网络:通过路由低秩补丁专家减少灾难性遗忘

Shashank

机构 * Shashank

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 吸引子补丁网络通过路由低秩补丁专家减少灾难性遗忘,提升持续学习的适应能力。

Comments 9 pages. Code (APN implementation in nanoGPT transformer): https://github.com/shankch/nanoGPT-apn (baseline: https://github.com/karpathy/nanoGPT) Data prep: https://github.com/karpathy/nanoGPT/tree/master/data/shakespeare_char and https://github.com/karpathy/nanoGPT/tree/master/data/shakespeare

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08793 2026-02-10 cs.CL cs.DB 57%

LakeHopper: Cross Data Lakes Column Type Annotation through Model Adaptation

LakeHopper: 通过模型适应实现跨数据湖列类型注释

Yushi Sun, Xujia Li, Nan Tang, Quanqing Xu, Chuanhui Yang, Lei Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Ant Group(蚂蚁集团) HKUST(GZ)/HKUST(香港科技大学(广州)/香港科技大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 LakeHopper通过模型适应技术,有效解决跨数据湖列类型注释问题,减少注释需求并提升适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08713 2026-02-10 cs.CV cs.LG 57%

Towards Understanding Multimodal Fine-Tuning: Spatial Features

迈向多模态微调的理解:空间特征

Lachin Naghashyar, Hunar Batra, Ashkan Khakzar, Philip Torr, Ronald Clark, Christian Schroeder de Witt, Constantin Venhoff

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文通过分阶段模型差分技术,揭示了多模态微调过程中视觉特征如何形成及空间关系编码,提升了多模态训练的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07274 2026-02-10 cs.AI 57%

TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents

TermiGen: 为终端智能体提供高保真的环境和鲁棒轨迹合成

Kaijie Zhu, Yuzhou Nie, Yijiang Li, Yiming Huang, Jialian Wu, Jiang Liu, Ximeng Sun, Zhenfei Yin, Lun Wang, Zicheng Liu, Emad Barsoum, William Yang Wang, Wenbo Guo

机构 * google(谷歌) University of Oxford(牛津大学)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.AI

AI总结 TermiGen通过生成高保真的环境和鲁棒轨迹,提升终端智能体在复杂任务中的表现,达到31.3%的通过率,超越现有基线和专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 19 篇

2512.23126 2026-02-10 cs.AI cs.LG 91%

InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization

InSPO:解锁LLM偏好优化的内在自反思

Yu Li, Tian Lan, Zhengling Qi

机构 * George Washington University(乔治·华盛顿大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 InSPO通过解锁LLM的内在自反思能力,提升偏好优化的鲁棒性和人类对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08136 2026-02-10 cs.CV cs.AI 89%

Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

视觉语言模型对分裂图像有害输入攻击的鲁棒性

Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 后训练与偏好优化 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);RLHF(abstract)

AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。

Comments 22 Pages, long conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 85%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08847 2026-02-10 cs.LG cs.AI 84%

Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems

Dr. MAS:多智能体大语言模型系统的稳定强化学习

Lang Feng, Longtao Zheng, Shuo He, Fuxiang Zhang, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Dr. MAS通过智能体级归一化方法稳定多智能体大语言模型的强化学习训练,提升性能并减少梯度不稳定问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01952 2026-02-10 cs.CV cs.AI cs.LG cs.RO 82%

GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment

GrndCtrl: 通过自监督奖励对齐实现世界模型的 grounding

Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 GrndCtrl通过自监督奖励对齐提升世界模型的几何 grounding,实现更稳定的空间一致性与导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08259 2026-02-10 stat.ML cs.LG 81%

A Statistical Framework for Alignment with Biased AI Feedback

带有偏见AI反馈的统计框架

Xintao Xia, Zhiqiu Xia, Linjun Zhang, Zhanrui Cai

机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) Department of Electrical and Computer Engineering, Rutgers University(罗格斯大学电气与计算机工程系) Department of Statistics, Rutgers University(罗格斯大学统计学系) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出两种去偏对齐方法,DDPO通过残差修正和密度比重加权提升效率,DIPO直接估计人类偏好概率,实验证明其在情感生成、摘要和对话任务中提升了对齐效率并接近全人类标注数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08041 2026-02-10 cs.LG cs.AI cs.CL 80%

Implicit Strategic Optimization: Rethinking Long-Horizon Decision-Making in Adversarial Poker Environments

隐式策略优化:重新思考对抗扑克环境中的长 horizon 决策

Boyang Xia, Weiyou Tian, Qingnan Ren, Jiaqi Huang, Jie Xiao, Shuo Lu, Kai Wang, Lynn Ai, Eric Yang, Bill Shi

机构 * Gradient

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出隐式策略优化(ISO)框架,通过预测战略环境和结合战略奖励模型与乐观学习规则,提升对抗性扑克环境中的长 horizon 决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04651 2026-02-10 cs.LG 79%

SAFE: Stable Alignment Finetuning with Entropy-Aware Predictive Control for Reinforcement Learning from Human Feedback (RLHF)

SAFE:基于熵感知预测控制的稳定对齐微调用于人类反馈的强化学习(RLHF)

Dipan Maity

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

AI总结 SAFE通过熵感知预测控制提升RLHF稳定性,实现更高的训练奖励和更稳定的优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-02-10 cs.LG cs.AI 79%

Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08829 2026-02-10 cs.CL cs.AI 73%

WildReward: Learning Reward Models from In-the-Wild Human Interactions

WildReward: 从真实世界的人类交互中学习奖励模型

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildReward,通过真实世界用户交互直接学习奖励模型,无需偏好对,实现更优的校准和一致性,并在多种任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07422 2026-02-10 cs.CR cs.AI cs.CL 73%

Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model

通过在线强化学习与漏洞奖励模型实现安全代码生成

Tianyi Wu, Mingzhe Du, Yue Liu, Chengran Yang, Terry Yue Zhuo, Jiaheng Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SecCoderX通过在线强化学习与漏洞奖励模型提升代码安全性,实现功能与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05494 2026-02-10 cs.LG cs.AI 73%

A Unified Framework for Rethinking Policy Divergence Measures in GRPO

在GRPO中重新思考策略分歧度度量的统一框架

Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra Habchi, Qi Zhu, Matthias Gallé, Chao Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的裁剪框架,通过KL3估计器改进GRPO,提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25416 2026-02-10 cs.CL cs.AI cs.SD 73%

Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization

通过偏好引导优化实现扩散文本到语音模型的情感对齐生成

Jiacheng Shi, Hongfei Du, Yangfan He, Y. Alicia Hong, Ye Gao

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EASPO框架,通过偏好引导优化实现扩散文本到语音模型的情感对齐生成,提升语音的表达性和自然度。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12844 2026-02-10 cs.AI cs.LG 62%

Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance

迈向基于神经反馈的强化学习:将fNIRS信号映射到智能体表现

Julia Santaniello, Matthew Russell, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过fNIRS信号预测智能体表现,利用分类器和回归器提升RLHF性能,并验证了跨受试者泛化能力。

Comments Accepted to the Association for the Advancement of Artificial Intelligence (AAAI) 2026. To appear in the AAAI 2026 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07799 2026-02-10 cs.LG cs.AI 62%

Fairness Aware Reward Optimization

公平感知的奖励优化

Ching Lam Choi, Vighnesh Subramaniam, Phillip Isola, Antonio Torralba, Stefanie Jegelka

机构 * CSAIL, Department of EECS, Massachusetts Institute of Technology(计算机科学与人工智能实验室,电气工程与计算机科学系,麻省理工学院) School of CIT, MCML, MDSI, Technical University of Munich(信息科技学院,MCML,MDSI,慕尼黑技术大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Faro通过在处理过程中训练奖励模型,实现公平性、准确性与校准性的平衡,减少偏见并提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07595 2026-02-10 cs.CV cs.AI 57%

TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation

TeleBoost:一种系统对齐框架,用于高保真、可控且稳健的视频生成

Yuanzhi Liang, Xuan'er Wu, Yirui Liu, Yijie Fang, Yizhen Fan, Ke Hao, Rui Li, Ruiying Liu, Ziqi Ni, Peng Yu, Yanbo Wang, Haibin Huang, Qizhen Weng, Chi Zhang, Xuelong Li

机构 * TeleBoost Team(TeleBoost团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 TeleBoost提出了一种系统化的训练后框架,通过整合监督策略塑造、奖励驱动强化学习和偏好细化,提升视频生成的保真度、时间连续性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08346 2026-02-10 cs.CV 50%

What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning

什么是、是否以及如何?揭示图像推理中的过程奖励模型

Yujin Zhou, Pengcheng Wen, Jiale Chen, Boqin Yin, Han Zhu, Jiaming Ji, Juntao Dai, Chi-Min Chan, Sirui Han

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 本研究提出首个图像推理范式下的PRMs综合基准,定义7种细粒度错误类型,揭示当前LVLMs在视觉推理评估中的不足,为改进PRMs提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏