arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2605.10784 2026-05-12 cs.LG 57%

MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization

MASS-DPO:多负样本主动采样用于直接策略优化

Rohan Surana, Xintong Li, Sheldon Yu, Yiran Jenny Shen, Chuhan Wang, Tong Yu, Prithviraj Ammanabrolu, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 MASS-DPO通过多负样本主动采样方法,在Plackett-Luce模型下扩展直接偏好优化,通过选择信息丰富的负样本子集提升策略更新效率,减少冗余梯度,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09422 2026-05-12 cs.CL cs.CV 57%

Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

无参与的感知:LMMs中因果发现缺陷的剖析

Jiafeng Liang, Zhihao Zhu, Zihan Zhang, Baoqi Ren, Shixin Jiang, Runxuan Liu, Tao Ren, Ming Liu, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 本文探讨了大型多模态模型在因果发现中的缺陷,提出ProCauEval评估协议和ADPO框架,通过扰动分析揭示模型在视觉和文本模态间的依赖关系,提升视觉推理能力。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03652 2026-05-12 cs.CV cs.AI 57%

AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics

AniMatrix:一个以艺术而非物理思考的动画视频生成模型

Tencent HY Team

机构 * Tencent HY Team(腾讯HY团队)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 AniMatrix通过双通道条件机制和三步过渡,以艺术正确性替代物理正确性,实现动画视频生成,其在五个动画生产维度上获得专业动画师的认可。

Comments 37 pages, 1 main figure (qualitative comparison), 1 TikZ architecture diagram; technical report. Model weights and inference code to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00918 2026-05-12 cs.CV cs.AI 57%

Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

通过内在自信心奖励改进文本到图像生成

Seungwook Kim, Minsu Cho

机构 * POSTECH(POSTECH大学) RLWRLD(RLWRLD实验室) GenGenAI(GenGenAI研究院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出SOLACE框架,通过模型自身输出的重建误差生成自信心信号,用于强化学习,提升生成内容的组成、文本渲染和文本图像对齐能力。

Comments 22 pages, accepted to CVPR 2026. Project page https://wookiekim.github.io/SOLACE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08873 2026-05-12 cs.LG stat.AP stat.ML 57%

CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization

CoDistill-GRPO:一种高效的群体相对策略优化共蒸馏方法

Soo Min Kwon, Ziteng Sun, Ananda Theertha Suresh, Himanshu Jain, Sanjiv Kumar

机构 * University of Michigan, Ann Arbor(密歇根大学,安阿伯分校) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文提出CoDistill-GRPO,通过同时训练大模型和小模型,利用精心设计的GRPO目标提升小模型性能,减少计算开销,在数学基准上显著优于标准GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08574 2026-05-12 cs.CV cs.LG 57%

Post-hoc Selective Classification for Reliable Synthetic Image Detection

事后选择性分类用于可靠合成图像检测

Kaixiang Zheng, Jacob H. Seidman

机构 * University of Waterloo(滑铁卢大学) Reality Defender

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出ReSIDe框架,通过改进选择性分类策略提升合成图像检测在协变量偏移下的可靠性,实验显示其在常见偏移下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13224 2026-05-12 cs.CV cs.AI 57%

Visual-ERM: Reward Modeling for Visual Equivalence

视觉-ERM:用于视觉等价性的奖励建模

Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) CUHK(香港中文大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出视觉-ERM模型,通过细粒度的视觉反馈提升视觉到代码任务的奖励学习效果,实验显示其在图表到代码、表格和SVG解析任务中均取得显著提升。

Comments Project: https://github.com/InternLM/Visual-ERM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05802 2026-05-08 cs.LG 57%

Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL

选择性回放:多样本代理强化学习中的中程轨迹终止

Zhiyuan Zhai, Xin Wang

机构 * Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 本文提出一种中程轨迹终止方法,通过在轨迹中途检测行动序列的编辑距离来提前停止无方差组,从而减少计算开销并提升测试任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20825 2026-05-08 cs.CL 57%

Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation

强化信息量优化用于长文本检索增强生成

Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学公安学院人工智能学院) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出RioRAG框架,通过 nugget-centric 验证实现可验证的信息量优化,提升长文本检索增强生成的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28102 2026-05-01 cs.LG 57%

FiLMMeD: Feature-wise Linear Modulation for Cross-Problem Multi-Depot Vehicle Routing

FiLMMeD:基于跨问题多仓库车辆路径问题的特征级线性调制

Arthur Corrêa, Paulo Nascimento, Samuel Moniz

机构 * University of Coimbra, CEMMPRE, ARISE(科英布拉大学,CEMMPRE,ARISE)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出FiLMMeD模型,通过特征级线性调制提升多仓库车辆路径问题的泛化能力,引入偏好优化和课程学习策略,有效解决多仓库约束下的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12759 2026-04-29 cs.CL 57%

RAG-RL: Advancing Retrieval-Augmented Generation via RL and Curriculum Learning

RAG-RL:通过强化学习和课程学习推进检索增强生成

Jerry Huang, Siddarth Madala, Risham Sidhu, Cheng Niu, Hao Peng, Julia Hockenmaier, Tong Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 RAG-RL通过强化学习和课程学习提升检索增强生成性能,使生成模型能识别并引用相关信息,提高样本效率和泛化能力,实验显示在多跳问答任务中准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24395 2026-04-28 cs.AI 57%

Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs

以自身声音对齐:用于减轻大型视觉-语言模型幻觉的自我纠正偏好学习

Byeonggeuk Lim, JungMin Yun, Junehyoung Kwon, Kyeonghyun Kim, YoungBin Kim

机构 * Graduate School of Advanced Imaging Sciences, Multimedia and Film(高级影像科学研究生院,多媒体与电影系) Department of Artificial Intelligence(人工智能系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出AVES-DPO框架,通过内在知识生成分布数据,利用共识验证机制诊断幻觉并引导模型自我纠正,有效缓解LVLMs的幻觉问题,仅需5200样本即优于现有基线。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14978 2026-04-28 cs.CV cs.LG 57%

Learning an Image Editing Model without Image Editing Pairs

无需图像编辑配对学习图像编辑模型

Nupur Kumari, Sheng-Yu Wang, Nanxuan Zhao, Yotam Nitzan, Yuheng Li, Krishna Kumar Singh, Richard Zhang, Eli Shechtman, Jun-Yan Zhu, Xun Huang

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文提出无需配对数据的图像编辑模型训练方法,通过扩散模型解卷积和视觉语言模型反馈实现端到端优化,同时结合分布匹配损失提升视觉真实性。

Comments project page: https://nupurkmr9.github.io/npedit/ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20332 2026-04-28 cs.AI 57%

Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training

Mobile-R1: 通过系统性训练提升基于视觉语言模型的移动代理的交互能力

Jihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang, Bo Zheng

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出Mobile-R1系统性训练方法,通过分层课程学习提升移动代理的探索与自我纠正能力,并构建中文移动数据集和基准测试。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20733 2026-04-23 cs.LG 57%

Near-Future Policy Optimization

近未来策略优化

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学院大学网络安全学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出NPO方法,通过策略自身近未来状态作为辅助轨迹,平衡轨迹质量和方差成本,提升学习信号。AutoNPO自动触发干预,提升性能至63.15。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16890 2026-04-21 cs.AI 57%

Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning

Step-GRPO:内化动态早期退出以实现高效推理

Benteng Chen, Weida Wang, Shufei Zhang, Mingbao Lin, Min Zhang

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Rakuten Singapore(乐天新加坡)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 Step-GRPO通过内化动态早期退出机制,优化推理过程,提升效率与准确性,在不同模型规模上实现更优的准确率与效率平衡。

Comments This paper has been accepted for publication at the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14967 2026-04-20 cs.CV cs.AI 57%

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

UniDoc-RL: 基于分层动作和密集奖励的粗到细视觉RAG

Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Zhiwu Lu

机构 * DeepGlint-AI

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 UniDoc-RL通过分层动作空间和密集奖励方案,提升视觉RAG系统的细粒度视觉语义处理能力,实现端到端训练,实验显示优于现有方法。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14920 2026-04-17 cs.AI 57%

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

双轴生成奖励模型:面向交互口语对话模型中语义和轮流鲁棒性的研究

Yifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen, Wen Wang, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) Beijing University of Technology(北京理工大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出双轴生成奖励模型,通过详细分类和标注数据集理解复杂交互动态,提供语义质量和交互时间的独立评估,提升口语对话模型的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07069 2026-04-17 cs.CV cs.AI 57%

Bird-SR: Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution

Bird-SR:双向奖励引导扩散用于现实世界图像超分辨率

Zihao Fan, Xin Lu, Yidi Liu, Jie Huang, Dong Li, Xueyang Fu, Baocai Yin

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, School of Information Science and Technology, University of Science and Technology of China(脑启发智能感知与认知MoE实验室,信息科学与技术学院,中国科学技术大学) iFlytek Research, iFlytek Co., Ltd., Hefei, China(科大讯飞研究院,科大讯飞股份有限公司,合肥,中国)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 Bird-SR通过双向奖励引导扩散框架,结合合成和真实图像数据,提升现实世界超分辨率的结构一致性与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26109 2026-04-17 cs.LG 57%

Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error

不要踏进同一条河两次:从试错中学习推理

Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department, Tencent(腾讯LLM部门)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文提出LTE方法,通过提示模型自身之前的错误来提升推理能力,优于传统方法并在多个数学推理基准上表现更佳。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11521 2026-04-14 cs.LG cs.CV 57%

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06159 2026-04-08 cs.LG 57%

Target Policy Optimization

目标策略优化

Jean Kaddour

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 TPO通过分离策略更新与目标分布构建,改进了策略梯度方法在稀疏奖励下的性能,适用于表格任务、Transformer序列任务和大模型强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24936 2026-04-07 cs.CV cs.AI 57%

TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization

TIGFlow-GRPO:通过交互感知的流匹配和奖励引导优化进行轨迹预测

Xuepeng Jing, Wenhuan Lu, Hao Meng, Zhizhi Yu, Jianguo Wei

机构 * Tianjin University(天津大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出TIGFlow-GRPO,通过交互感知的流匹配和奖励引导优化,提升复杂环境下的轨迹预测准确性与稳定性,生成更符合社会规范和物理可行的轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02869 2026-04-06 cs.AI 57%

Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration

多轮强化学习用于工具调用代理的迭代奖励校准

Wachiravit Modecrua, Krittanon Kaewtawee, Krittin Pachtrachai, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(Amity研究与应用中心(ARAC))

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 本文提出MT-GRPO与GTPO结合的方法,通过迭代奖励校准提升工具调用代理性能,在真实客服任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20453 2026-04-03 cs.LG 57%

Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences

基于多源不完美偏好的强化学习遗憾界

Ming Shi, Yingbin Liang, Ness B. Shroff, Ananthram Swami

机构 * University at Buffalo(纽约州立大学布法罗分校) The Ohio State University(俄亥俄州立大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本文研究多源不完美偏好下的强化学习,提出统一算法,其遗憾界为~O(√(K/M)+ω),并给出下限和反例,揭示多源反馈如何提升RLHF及累积不完美对其的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28673 2026-03-31 cs.LG cs.CR cs.DC 57%

FL-PBM: Pre-Training Backdoor Mitigation for Federated Learning

FL-PBM:联邦学习中的预训练后门缓解

Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok, Jamal Bentahar

机构 * Polytechnique Montréal(蒙特利尔理工学院) Khalifa University(哈利法大学) Concordia Institute for Information Systems Engineering, Concordia University(康考迪亚大学康考迪亚信息系统工程研究所)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出FL-PBM,一种在联邦学习中预训练阶段主动过滤恶意数据的机制,通过PCA提取特征、GMM聚类识别恶意样本及针对性模糊技术,有效降低后门攻击成功率,同时保持模型准确率。

Comments 12 pages, 3 figures, 1 table, 2 algorithms, Regular Journal Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28069 2026-03-31 cs.CV cs.AI 57%

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

MolmoPoint:通过接地标记提升VLMs的指针能力

Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出MolmoPoint,通过直接选择包含目标概念的视觉标记来改进VLMs的指针机制,提升图像、GUI和视频指针任务性能,并提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 57%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25183 2026-03-27 cs.CL 57%

Cross-Preference Learning for Sentence-Level and Context-Aware Machine Translation

跨偏好学习用于句子级和上下文感知机器翻译

Ying Li, Xinglin Lyu, Junhui Li, Jinlong Yang, Hengchao Shang, Min Zhang, Shimin Tao, Daimeng Wei

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Huawei Translation Services Center(华为翻译服务中心)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL

AI总结 本文提出跨偏好学习框架,通过整合内在和跨条件偏好,提升句子级和上下文感知机器翻译的互补效益,实验显示在多个任务中翻译质量与鲁棒性均有提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 57%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 后训练与偏好优化 :SFT(abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏