机构
*
National Yang Ming Chiao Tung University(国立阳明交通大学)
;
Institute of Computer Science and Engineering(工程与计算机科学学院)
;
College of Artificial Intelligence(人工智能学院)
AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring
AVA-VLM:用于野外建筑工地监测的自适应视觉注意力视觉语言模型
Younggun Kim, Taeheon Kim, Youngseo Kim, Seunghee Park
机构
*
University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
;
AI+KCIR Global Resilience Research Center(人工智能与韩国气候变化影响韧性研究中心)
;
SmartInside AI Co., Ltd.(思玛特因赛德人工智能有限公司)
;
Sungkyunkwan University(成均馆大学)
专题命中
VLM训练与架构
:VLM(title,title_cn);vision language model(title,abstract);vision-language model(abstract);分类 cs.CV
Comments21 pages, 7 figures, 5 tables. Preprint. An earlier version of this work was presented at the 105th Annual Meeting of the Transportation Research Board (TRB), January 2026
机构
*
Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系)
;
Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)
专题命中
VLM训练与架构
:MLLM(title,title_cn);LLaVA(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments18 pages, 12 figures, 2 tables. This manuscript has been accepted for publication in Artificial Life and Robotics following peer review
Journal refShota Miyazaki, Takaya Arita and Reiji Suzuki: An evolutionary model of animats with VLM-based subjective evaluation, Artificial Life and Robotics (2026). https://link.springer.com/article/10.1007/s10015-026-01135-4
From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM
从通用到专用:基于冻结视觉语言模型(VLM)的内窥镜息肉报告上下文融合框架
Ruijie Yang, Yan Zhu, Peiyao Fu, Siyuan Li, Te Luo, Zhihua Wang, Quanlin Li, Pinghong Zhou, Xian Yang, Shuo Wang
机构
*
Zhejiang University(浙江大学)
;
Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院)
;
Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室)
;
Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心)
;
Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所)
;
Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心)
;
Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)
Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression
消息而非令牌:用于忠实VLM压缩的基础核心集
Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Wuhan AI Research(武汉人工智能研究院)
;
Cardiff University(卡迪夫大学)
专题命中
VLM训练与架构
:VLM(title,title_cn);vision language model(abstract);分类 cs.CV
MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion
MGDT:具有关系自适应专家混合的MLLM引导扩散变压器用于多模态知识图谱补全
Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Zhejiang University(浙江大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Communication University of China(中国传媒大学)
专题命中
VLM训练与架构
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI
TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
TOPS:通过构建令牌最优保留集实现高效多模态大语言模型推理的第一性原理视觉令牌剪枝
Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Nanyang Technological University(南洋理工大学)
;
Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)
专题命中
VLM训练与架构
:MLLM(title,abstract);LLaVA(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI
CommentsAccepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables
Journal refProceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026