arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2601.19750 2026-01-29 cs.MM cs.CV cs.IR 88%

Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues

在电子商务目录中评估多模态大语言模型用于缺失模态补全

Junchen Fu, Wenhao Deng, Kaiwen Zheng, Ioannis Arapakis, Yu Ye, Yongxin Ni, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Telefónica Scientific Research(电信科研机构) National University of Singapore(新加坡国立大学) Shandong University(山东大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19225 2026-01-29 cs.CL cs.AI 86%

RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering

RPO-RAG: 通过关系感知的偏好优化对齐小型LLM以实现知识图谱问答

Kaehyun Um, KyuHwan Yeom, Haerim Yang, Minyoung Choi, Hyeongjun Yang, Kyong-Ho Lee

机构 * Yonsei University(延世大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RPO-RAG通过关系感知的偏好优化和以答案为中心的提示设计,提升小型LLM在知识图谱问答中的推理能力,实现性能提升。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02180 2026-01-29 cs.LG cs.AI 84%

GRACE: A Language Model Framework for Explainable Inverse Reinforcement Learning

GRACE:一种用于可解释逆强化学习的语言模型框架

Silvia Sapora, Devon Hjelm, Alexander Toshev, Omar Attia, Bogdan Mazoure

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 GRACE通过大型语言模型和进化搜索,从专家轨迹中逆向工程可解释的代码奖励函数,实现高效准确的奖励学习并生成强大策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20848 2026-01-29 cs.LG cs.AI cs.CY cs.IR 81%

Post-Training Fairness Control: A Single-Train Framework for Dynamic Fairness in Recommendation

训练后公平性控制:一个用于推荐中动态公平性的单一训练框架

Weixin Chen, Li Chen, Yuhan Zhao

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 Cofair提出一个单一训练框架,通过共享表示层和公平性条件适配器模块,在推荐系统中实现动态公平性控制,无需重新训练即可适应不同公平性需求。

Comments Accepted to WWW 2026 Workshop on HCRS (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10077 2026-01-29 cs.CL 79%

A-IPO: Adaptive Intent-driven Preference Optimization

A-IPO:自适应意图驱动偏好优化

Wenqing Wang, Muhammad Asif Ali, Ali Shoker, Ruohan Yang, Junyang Chen, Ying Sha, Huan Wang

机构 * Huazhong Agricultural University(华中农业大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学) Shenzhen University(深圳大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

AI总结 A-IPO通过引入意图模块,提升偏好对齐的鲁棒性和多样性,实验证明其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05301 2026-01-29 cs.CV 78%

SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training

SeedVR2: 通过扩散对抗后训练实现一步视频修复

Jianyi Wang, Shanchuan Lin, Zhijie Lin, Yuxi Ren, Meng Wei, Zongsheng Yue, Shangchen Zhou, Hao Chen, Yang Zhao, Ceyuan Yang, Xuefeng Xiao, Chen Change Loy, Lu Jiang

机构 * Nanyang Technological University(南洋理工大学) ByteDance Seed(字节跳动实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 SeedVR2通过引入自适应窗口注意力机制和改进的损失函数,实现高分辨率视频修复的一步式高效修复方法。

Comments Camera Ready of ICLR2026. Project page: https://iceclear.github.io/projects/seedvr2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20439 2026-01-29 cs.CL 77%

PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use

PEARL:多跳工具使用中的计划探索与自适应强化学习

Qihao Wang, Mingzhe Lu, Jiayue Wu, Yue Hu, Yanbing Liu

机构 * Institute of Information Engineering, China(信息工程研究所,中国) School of Cyber Security, University of Chinese Academy of Sciences, China(中国科学院大学网络安全学院,中国)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PEARL通过两阶段方法提升LLM在多跳工具使用中的规划与执行能力,实现ToolHop 56.5%的成功率。

Comments Accepted to PRICAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20162 2026-01-29 cs.CL 77%

Me-Agent: A Personalized Mobile Agent with Two-Level User Habit Learning for Enhanced Interaction

Me-Agent:一种具有两级用户习惯学习的个性化移动代理以增强交互

Shuoxin Wang, Chang Liu, Gowen Loo, Lifan Zheng, Kaiwen Wei, Xinyi Zeng, Jingyuan Zhang, Yu Tian

机构 * Yunnan University(云南大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Southeast University(东南大学) Chongqing University(重庆大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Me-Agent通过两级用户习惯学习方法,提升移动代理在个性化交互中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14616 2026-01-29 cs.CL cs.AI 73%

Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures

超越正确性:跨文化的主观写作偏好评估

Shuangshuang Ying, Yunwen Li, Xingwei Qu, Xin Li, Sheng Jin, Minghao Liu, Zhoufutu Wen, Xeron Du, Tianyu Zheng, Yichi Zhang, Letian Ni, Yuyang Cheng, Zhenzhu Yang, Qiguang Chen, Jingzhe Ding, Shengda Long, Wangchunshu Zhou, Jiazhan Feng, Wanjun Zhong, Libo Qin, Ge Zhang, Wenhao Huang, Wanxiang Che, Chenghua Lin

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WritingPreferenceBench数据集,发现基于序列的奖励模型在评估主观写作偏好时表现不佳,而生成奖励模型通过推理链达到更高准确率,揭示了当前RLHF方法在捕捉主观偏好方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06165 2026-01-29 cs.LG eess.SP math.ST stat.ML stat.TH 57%

Higher-Order Feature Attribution: Bridging Statistics, Explainable AI, and Topological Signal Processing

高阶特征归因:连接统计学、可解释AI与拓扑信号处理

Kurt Butler, Guanchao Feng, Petar Djuric

机构 * School of Engineering, The University of Edinburgh(爱丁堡大学工程学院) Causality in Healthcare AI Hub (CHAI)(医疗AI因果性研究中心) Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出高阶特征归因理论,基于集成梯度方法,连接统计学与拓扑信号处理,扩展可解释AI框架并验证其有效性。

Comments 5 pages, 3 figures, to be published in the Proceedings of ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20760 2026-01-29 cs.HC 50%

Exploring Re-inforcement Learning via Human Feedback under User Heterogeneity

通过用户异质性探索基于人类反馈的强化学习

Sarvesh Shashidhar, Abhishek Mishra, Madhav Kotecha

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本研究通过聚类和个性化奖励模型处理用户异质性,提升强化学习模型的胜率。

详情

展开后加载摘要…

URL PDF HTML 收藏