From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM
从通用到专用:基于冻结视觉语言模型(VLM)的内窥镜息肉报告上下文融合框架
Ruijie Yang, Yan Zhu, Peiyao Fu, Siyuan Li, Te Luo, Zhihua Wang, Quanlin Li, Pinghong Zhou, Xian Yang, Shuo Wang
机构
*
Zhejiang University(浙江大学)
;
Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院)
;
Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室)
;
Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心)
;
Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所)
;
Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心)
;
Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)
Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance
通过格罗莫夫-瓦瑟斯坦距离重新思考VLM中的模型选择
Muyang Li, Yucheng Liu, Jianbo Ma, Elliot Osborne, Bo Han, Tongliang Liu
机构
*
Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学)
;
Dolby Laboratories(杜比实验室)
;
TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)
Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression
消息而非令牌:用于忠实VLM压缩的基础核心集
Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Wuhan AI Research(武汉人工智能研究院)
;
Cardiff University(卡迪夫大学)
专题命中
VLM训练与架构
:VLM(title,title_cn);vision language model(abstract);分类 cs.CV
MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion
MGDT:具有关系自适应专家混合的MLLM引导扩散变压器用于多模态知识图谱补全
Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Zhejiang University(浙江大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Communication University of China(中国传媒大学)
专题命中
VLM训练与架构
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI
TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
TOPS:通过构建令牌最优保留集实现高效多模态大语言模型推理的第一性原理视觉令牌剪枝
Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Nanyang Technological University(南洋理工大学)
;
Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)
专题命中
VLM训练与架构
:MLLM(title,abstract);LLaVA(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI
Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design
Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架
Yuxuan Yang, Xiaotong Mao, Jingyao Wang
机构
*
National Jiangsu University of Finance(江苏财经大学)
;
University of Lorraine(洛林大学)
;
Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所)
;
Tsinghua University(清华大学)
专题命中
VLM训练与架构
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.LG
TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning
TCAP: 面向MLLM微调中无监督后门检测的三组件注意力分析
Mingzu Liu, Hao Fang, Runmin Cong
机构
*
School of Control Science and Engineering, Shandong University, Jinan, China(控制科学与工程学院,山东大学,济南,中国)
;
Key Laboratory of Industrial Intelligent Systems, Shandong Province, China(山东省工业智能系统重点实验室,中国)
专题命中
VLM训练与架构
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI