arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Baidu(百度)

2026-03-09 至 2026-03-09 共收录 4
2509.02123 2026-03-09 cs.CL

CMRAG: Co-modality-based visual document retrieval and question answering

CMRAG:基于共模的视觉文档检索与问答

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学)

AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。

Comments Published at ICLR 2026 Workshop on Multimodal Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06048 2026-03-09 cs.CV

GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injection

GenHOI:面向对象一致性的手-物体交互方法,采用时间平衡和空间选择性的对象注入

Xuan Huang, Mochu Xiang, Zhelun Shen, Jinbo Wu, Chenming Wu, Chen Zhao, Kaisiyuan Wang, Hang Zhou, Shanshan Liu, Haocheng Feng, Wei He, Jingdong Wang

机构 * Department of Computer Vision Technology(VIS), Baidu Inc.(百度公司计算机视觉技术部) Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Northwestern Polytechnical University(西北工业大学)

AI总结 GenHOI通过时间平衡和空间选择性的对象注入方法,提升手-物体交互在现实场景中的生成一致性与保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17830 2026-03-09 cs.CV

SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training

SRA 2: 变分自编码器自表示对齐用于高效的扩散训练

Mengmeng Wang, Dengyang Jiang, Liuzhuozheng Li, Yucheng Lin, Guojiang Shen, Xiangjie Kong, Yong Liu, Guang Dai, Jingdong Wang

机构 * Zhejiang University of Technology(浙江工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Zhejiang University(浙江大学) Baidu(百度)

AI总结 SRA 2通过利用预训练变分自编码器特征,提供一种轻量级的内在引导框架,提升扩散模型的生成质量和训练效率,仅增加4%的计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏