Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
Ji Ma, Wei Suo, Peng Wang, Yanning Zhang
机构
*
Northwestern Polytechnical University(西北工业大学)
;
National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室)
Learning Arbitrary-Scale RAW Image Downscaling with Wavelet-based Recurrent Reconstruction
Yang Ren, Hai Jiang, Wei Li, Menglong Yang, Heng Zhang, Zehua Sheng, Qingsheng Ye, Shuaicheng Liu
机构
*
School of Aeronautics and Astronautics, Sichuan University(四川大学航空宇航学院)
;
Xiaomi Inc.(小米公司)
;
University of Electronic Science and Technology of China(电子科技大学)
机构
*
Tsinghua University(清华大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Southeast University(东南大学)
;
University of Liverpool(利物浦大学)
;
Beijing Institute of Technology(北京理工大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
HER2 Expression Prediction with Flexible Multi-Modal Inputs via Dynamic Bidirectional Reconstruction
Jie Qin, Wei Yang, Yan Su, Yiran Zhu, Weizhen Li, Yunyue Pan, Chengchang Pan, Honggang Qi
机构
*
School of Computer Science and Technology, University of the Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
;
School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
;
Institute for Clarity in Documentation(清晰文档研究所)
;
Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化所)
;
Rajiv Gandhi University(拉贾·甘地大学)
;
Tsinghua University(清华大学)
;
Palmer Research Laboratories(帕勒实验室)
Comments8 pages,6 figures,3 tables,accepted by the 33rd ACM International Conference on Multimedia(ACM MM 2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
Yudong Zhang, Ruobing Xie, Xingwu Sun, Yiqing Huang, Jiansheng Chen, Zhanhui Kang, Di Wang, Yu Wang
机构
*
Tsinghua University, Tencent(清华大学、腾讯)
;
Tencent(腾讯)
;
Tencent, University of Macau(腾讯、澳门大学)
;
University of Science and Technology Beijing(北京科技大学)
;
Tsinghua University(清华大学)