arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2605.05680 2026-05-13 cs.CV 50%

MotionGRPO: Overcoming Low Intra-Group Diversity in GRPO-Based Egocentric Motion Recovery

MotionGRPO: 克服基于GRPO的自主运动恢复中组内多样性低的问题

Nanjie Yao, Junlong Ren, Wenhao Shen, Hao Wang

机构 * The Hong Kong University of Science(香港科学与技术大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出MotionGRPO框架,通过强化学习后训练注入细粒度指导,解决自主运动恢复中组内多样性低的问题,提升局部关节精度和全局视觉合理性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01743 2026-05-12 cs.CV 50%

Action-Guided Attention for Video Action Anticipation

基于动作的注意力机制用于视频动作预见

Tsung-Ming Tai, Sofia Casarin, Andrea Pilzer, Werner Nutt, Oswald Lanz

机构 * Free University of Bozen-Bolzano(博泽自由大学) NVIDIA(NVIDIA公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出Action-Guided Attention机制,通过预测动作序列引导注意力,提升视频动作预见的泛化能力与可解释性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 50%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07069 2026-05-08 cs.RO cs.SY eess.SY 50%

Optimal Gait Control for a Tendon-driven Soft Quadruped Robot by Model-based Reinforcement Learning

基于模型强化学习的腱驱动软四足机器人类最优步态控制

Xuezhi Niu, Kaige Tan, Lei Feng

机构 * Department of Engineering Design, KTH Royal Institute of Technology, Stockholm 10044, Sweden(工程设计系,皇家理工学院,斯德哥尔摩)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出一种基于模型强化学习的软四足机器人最优步态控制方法,通过多阶段方法提升步态控制器性能,实现快速稳定运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25291 2026-04-29 cs.IR 50%

From Local Indices to Global Identifiers: Generative Reranking for Recommender Systems via Global Action Space

从局部索引到全局标识符:通过全局动作空间实现生成式重排序的推荐系统

Pengyue Jia, Xiaobei Wang, Yingyi Zhang, Shuchang Liu, Yupeng Hou, Hailan Yang, Xu Gao, Xiaopeng Li, Yejing Wang, Julian McAuley, Xiang Li, Lantao Hu, Yongqi Liu, Kaiqiao Zhan, Han Li, Kun Gai, Xiangyu Zhao

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出GloRank框架,通过生成全局标识符替代局部索引选择,解决推荐系统重排序中动作空间语义不一致的问题,实验表明其在基准和工业数据上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19234 2026-04-28 cs.CV 50%

Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation

学习正确的步骤:面向视觉生成的客观感知过程优化

Rui Li, Ke Hao, Yuanzhi Liang, Haibin Huang, Chi Zhang, Yun Gu, XueLong Li

机构 * University of Science and Technology of China(科学技术大学) Shanghai Jiao Tong University(交通大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出OTCA框架,通过细粒度奖励分配提升视觉生成质量,解决传统GRPO在奖励分配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21587 2026-04-24 cs.IT math.IT 50%

Generative Learning Enhanced Intelligent Resource Management for Cell-Free Delay Deterministic Communications

生成学习增强的智能资源管理用于无基站确定性通信

Shuangbo Xiong, Cheng Zhang, Wen Wang, Wenwu Yu, Yongming Huang

专题命中 后训练与偏好优化 :pretraining(abstract)

AI总结 本文研究了无基站MIMO系统中的资源分配问题,提出基于虚拟约束马尔可夫决策过程的离线预训练框架,通过证据感知条件高斯混合模型提升效率和安全性,实验表明其在能效和延迟约束方面表现优异。

Comments The paper has been submitted to IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14585 2026-04-21 math.NA cs.NA math.PR stat.CO stat.ML 50%

A convergent scheme for the Bayesian filtering problem based on the Fokker--Planck equation and deep splitting

基于福克-平面方程和深度分裂的贝叶斯滤波问题收敛方案

Kasper Bågmark, Adam Andersson, Stig Larsson, Filip Rydin

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出了一种近似非线性滤波密度的数值方案,并在理论和数值例子中建立了其收敛速率。通过深度分裂方案近似福克-平面方程,结合贝叶斯公式进行精确更新,实现在线滤波算法。采用基于采样的费曼-卡茨方法以缓解维度灾难。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09386 2026-04-13 cs.CV 50%

Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing

区域约束的群相对策略优化用于基于流的图像编辑

Zhuohan Ouyang, Zhe Qian, Wenhuo Cui, Chaoqun Wang

机构 * South China Normal University(华南师范大学) South China Agricultural University(华南农业大学) Monash University(莫纳什大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出RC-GRPO-Editing框架,通过区域约束的GRPO后训练提升流基图像编辑中目标区域指令遵循和非目标区域保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22437 2026-04-13 cs.CV 50%

EmoCtrl: Controllable Emotional Image Content Generation

EmoCtrl:可控的情感图像内容生成

Jingyuan Yang, Weibin Luo, Hui Huang

机构 * CSSE, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 EmoCtrl通过结合内容描述与目标情绪生成图像,实现内容忠实与情绪表达的平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07210 2026-04-09 cs.CV 50%

VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis

VersaVogue: 视觉专家协作与偏好对齐的统一时尚合成

Jian Yu, Fei Shen, Cong Wang, Yi Xin, Si Shen, Xiaoyu Du, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Nanjing Forestry University(南京林业大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出VersaVogue框架,通过 trait-routing attention 模块和自动化多视角偏好优化管道,实现多条件可控的时尚合成,提升视觉真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22647 2026-04-07 cs.CV 50%

FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution

FinPercep-RM:一种细粒度奖励模型和协同进化课程用于基于强化学习的现实世界超分辨率

Yidi Liu, Zihao Fan, Jie Huang, Jie Xiao, Dong Li, Wenlong Zhang, Lei Bai, Xueyang Fu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文提出FinPercep-RM细粒度奖励模型和协同进化课程学习机制,通过生成感知退化图提升超分辨率模型的感知质量,解决传统IQA模型对局部细粒度失真不敏感的问题。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03941 2026-04-07 cs.CV 50%

SafeCtrl: Region-Aware Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress

SafeCtrl: 通过检测-然后抑制方法实现区域感知的安全控制

Lingyun Zhang, Yu Xie, Zhongli Fang, Yu Liu, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 SafeCtrl通过检测-然后抑制方法实现区域感知的安全控制,精准定位风险区域并局部抑制有害内容,提升安全性与生成质量。

Comments 6 pages, 5 figures, accepted to 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02088 2026-04-03 cs.CV 50%

FlowSlider: Training-Free Continuous Image Editing via Fidelity-Steering Decomposition

FlowSlider: 无训练的连续图像编辑通过保真度引导分解

Taichi Endo, Guoqing Hao, Kazuhiko Sumi

机构 * Aoyama Gakuin University(青山学院大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 FlowSlider通过保真度引导分解实现无训练连续图像编辑,通过几何分析和实证测量证明其稳定性,提升编辑质量。

Comments HuggingFace Space: https://huggingface.co/spaces/dominoer/FlowSlider

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01188 2026-04-02 eess.SY cs.SY 50%

Learning Neural Network Controllers with Certified Robust Performance via Adversarial Training

通过对抗训练学习具有认证鲁棒性能的神经网络控制器

Neelay Junnarkar, Yasin Sonmez, Murat Arcak

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出通过对抗训练联合合成神经网络控制器和鲁棒性证书,以保证闭环系统的鲁棒性能,利用反例指导训练,并通过alpha,beta-CROWN验证非线性动态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29886 2026-04-01 cs.HC cs.CY 50%

AI Empathy Erodes Cognitive Autonomy in Younger Users

人工智能共情削弱年轻用户的认知自主性

Junfeng Jiao, Abhejay Murali, Saleh Afroogh

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文研究人工智能共情对年轻用户认知自主性的影响,指出情感共鸣可能强化用户情绪状态,削弱独立情绪管理和批判性思维能力,提出以功能中性为核心的斯多葛式架构以保护用户自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25968 2026-04-01 cs.CV 50%

Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Control

神经认知奖励建模用于以人为中心的自动驾驶控制

Zhuoli Zhuang, Yu-Cheng Chang, Yu-Kai Wang, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文提出基于EEG的决策框架,将人类认知信息整合到强化学习中,提升自动驾驶的避障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV 50%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28162 2026-03-31 cs.CV 50%

ColorFLUX: A Structure-Color Decoupling Framework for Old Photo Colorization

ColorFLUX:一种用于旧照片着色的结构-颜色解耦框架

Bingchen Li, Zhixin Wang, Fan Li, Jiaqi Xu, Jiaming Guo, Renjing Pei, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出基于生成扩散模型FLUX的新型旧照片着色框架,通过结构-颜色解耦策略和改进的直接偏好优化策略,提升旧照片着色的准确性与质量。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25685 2026-03-27 cs.RO cs.CV 50%

Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning

持久的机器人世界模型:通过强化学习稳定多步 rollout

Jai Bardhan, Patrik Drozdik, Josef Sivic, Vladimir Petrik

机构 * Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University in Prague(捷克理工大学,捷克信息学、机器人学与控制论研究所)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文通过强化学习方法改进机器人世界模型,解决多步预测中误差累积问题,提出自回归rollout训练方案和多视角视觉反馈奖励,提升预测精度和稳定性,实现在DROID数据集上的state-of-the-art表现。

Comments 34 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04033 2026-03-27 cs.CV 50%

Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model

基于框架的思考:通过帧奖励模型生成视频失真评估

Yuan Wang, Borui Liao, Huijuan Huang, Jinda Lu, Ouxiang Li, Kuien Liu, Meng Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出REACT框架,通过帧级奖励模型评估生成视频的结构性失真,结合人类偏好数据集和高效合成流程,提升视频生成质量评估的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19370 2026-03-23 cs.RO 50%

VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models

VAMPO:通过改进视频动作模型的视觉动态进行策略优化

Zirui Ge, Pengxiang Ding, Baohua Yin, Qishen Wang, Zhiyong Xie, Yemin Wang, Jinbo Wang, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Zhaoxin Fan, Haoang Li, Ran Cheng, Cheng Chi, Huibin Ge, Yaozhi Luo, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) University of Sussex(Sussex大学) Tianjin University(天津大学) Wuhan University(武汉大学) Hebei University of Technology(河北工业大学) Nanjing University(南京大学) Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) South China University of Technology(华南理工大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 VAMPO通过策略优化直接提升视频动作模型的视觉动态,结合GRPO和非对抗性奖励,在多种模拟和真实任务中提升任务相关视觉动态,增强下游动作生成和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV 50%

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22179 2026-03-19 cs.CV 50%

High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning

高保真扩散面部交换与ID约束面部条件化

Dailan He, Xiahong Wang, Shulun Wang, Guanglu Song, Bingqi Ma, Hao Shao, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Vivix Group Limited(Vivix集团有限公司) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出了一种ID约束的面部条件化框架,通过解耦条件注入确保身份保持并优化属性对齐,结合身份和对抗损失提升生成质量,在定性和定量评估中均优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16542 2026-03-18 cs.RO 50%

Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting

通过后过渡重加权实现保守的离线机器人策略学习

Wanpeng Zhang, Hao Luo, Sipeng Zheng, Yicheng Feng, Haiweng Xu, Ziheng Xi, Chaoyi Xu, Haoqi Yuan, Zongqing Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) BeingBeyond

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出PTR方法,通过后验过渡重加权实现保守的离线机器人策略学习,根据样本后作用后果的可归因性分配信用,提升对异质机器人数据的适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13911 2026-03-18 cs.CV 50%

PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis

PhysGM:用于前馈4D合成的大型物理高斯模型

Chunji Lv, Zequn Chen, Donglin Di, Weinan Zhang, Hao Li, Wei Chen, Yinjie Lei, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学) Li Auto(利汽车) Harbin Institute of Technology(哈尔滨工业大学) Sichuan University(四川大学) Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 PhysGM通过单图像联合预测3D高斯表示和物理属性,实现高效4D渲染。该方法采用物理感知重建模型和直接偏好优化,提升模拟精度并降低计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20325 2026-03-12 cs.CV 50%

AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zhesng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) Li Auto Inc. Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08476 2026-03-10 cs.RO 50%

LAR-MoE: Latent-Aligned Routing for Mixture of Experts in Robotic Imitation Learning

LAR-MoE:用于机器人模仿学习中专家混合的潜在对齐路由

Ariel Rodriguez, Chenpan Li, Lorenzo Mazza, Rayan Younis, Ortrun Hellig, Sebastian Bodenstedt, Martin Wagner, Stefanie Speidel

机构 * Department of Translational Surgical Oncology, NCT/UCC Dresden(转化外科肿瘤学系) Cluster of Excellence-CeTI, TUD, Germany(卓越中心-CeTI) Department of Visceral, Thoracic and Vascular Surgery, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD, Germany(visceral、胸腔和血管外科系)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 LAR-MoE通过潜在对齐路由在机器人模仿学习中实现无监督的专家混合,提升任务适应性和效率。

Comments Submitted to iROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08030 2026-03-10 cs.CV 50%

QualiTeacher: Quality-Conditioned Pseudo-Labeling for Real-World Image Restoration

QualiTeacher: 基于质量条件的伪标签用于现实世界图像恢复

Fengyang Xiao, Jingjia Feng, Peng Hu, Dingming Zhang, Lei Xu, Guanyi Qin, Lu Li, Chunming He, Sina Farsiu

机构 * Duke University Tsinghua University \'Ecole Polytechnique F\'ed\'erale de Lausanne (EPFL) National University of Singapore Sun Yat - sen University or

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 QualiTeacher通过条件化伪标签质量提升图像恢复质量,解决传统方法中伪标签质量与模型泛化能力的矛盾。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05236 2026-02-26 cs.CV 50%

Unified Reward Model for Multimodal Understanding and Generation

多模态理解和生成的统一奖励模型

Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出统一奖励模型,通过联合学习多种视觉任务提升多模态理解和生成的性能。

Comments project page: https://codegoat24.github.io/UnifiedReward/

详情

展开后加载摘要…

URL PDF HTML 收藏