机构
*
Inria(法国国家信息与自动化技术研究院)
;
Département d’informatique de l’ENS, CNRS, PSL Research University(巴黎高等师范学院计算机科学系、国家科学研究中心、巴黎综合理工研究学院)
;
Institut du développement et des ressources en informatique scientifique, CNRS(科学信息发展与资源研究所、国家科学研究中心)
;
Sorbonne Université(索邦大学)
;
Common Crawl Foundation(Common Crawl基金会)
;
Université Paris-Saclay(巴黎萨克雷大学)
专题命中
文档图表理解
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Wenbin Wang, Yongcheng Jing, Liang Ding, Yingjie Wang, Li Shen, Yong Luo, Bo Du, Dacheng Tao
机构
*
Wuhan University(武汉大学)
;
Nanyang Technological University(南洋理工大学)
;
The University of Sydney(悉尼大学)
;
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
专题命中
文档图表理解
:LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation
解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线
Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang
机构
*
School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)
;
School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval
解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿
Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Alibaba Cloud Computing(阿里云计算)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中
文档图表理解
:multimodal large language model(abstract);MLLM(abstract)