Mitigating Object Hallucinations via Sentence-Level Early Intervention
通过句子级早期干预缓解对象幻觉
Shangpin Peng, Senqiao Yang, Li Jiang, Zhuotao Tian
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
The Chinese University of Hong Kong(香港中文大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
视觉定位与Grounding
:multimodal large language model(abstract);分类 cs.CV
IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction
IntentionNav: 一种基于隐式人类指令的意图驱动目标导航基准
Lin Qian, Shijie Li, Sihao Lin, Xuan Zhang, Bangya Liu, Yanran Li, Hujun Yin
机构
*
The University of Manchester(曼彻斯特大学)
;
A*STAR
;
Responsible AI Research Centre, Adelaide University(阿德莱德大学负责任人工智能研究中心)
;
University of Bedfordshire(贝福德郡大学)
Benchmarking and Enhancing VLM for Compressed Image Understanding
基准测试与增强VLM对压缩图像的理解
Zifu Zhang, Tongda Xu, Siqi Li, Shengxi Li, Yue Zhang, Mai Xu, Yan Wang
机构
*
Institute for AI Industry Research, Tsinghua University, Beijing, China(清华人工智能产业研究院)
;
Beihang University, Beijing, China(北京航空航天大学)
;
Beijing University of Technology, Beijing, China(北京理工大学)
CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像
Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang
机构
*
Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))
;
Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)
专题命中
幻觉与鲁棒性
:multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning
TCAP: 面向MLLM微调中无监督后门检测的三组件注意力分析
Mingzu Liu, Hao Fang, Runmin Cong
机构
*
School of Control Science and Engineering, Shandong University, Jinan, China(控制科学与工程学院,山东大学,济南,中国)
;
Key Laboratory of Industrial Intelligent Systems, Shandong Province, China(山东省工业智能系统重点实验室,中国)
专题命中
VLM训练与架构
:MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI
Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo
机构
*
The Hong Kong University of Science
;
Huawei Hong Kong AI Framework \& Data Technologies Lab
;
Tsinghua University
;
The Australian National University
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Tencent(腾讯)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beijing Film Academy(北京电影学院)
;
Stanford University(斯坦福大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Singapore Institute of Technology(新加坡理工学院)
Scaling-Aware Adapter for Structure-Grounded LLM Reasoning
Scaling-Aware Adapter for Structure-Grounded LLM Reasoning
Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Yi Li, Yan Sun, Boyu Wang, Pingzhao Hu
机构
*
Department of Computer Science, Western University, London, Canada(加拿大伦敦西方大学计算机科学系)
;
Department of Biochemistry, Western University, London, Canada(加拿大伦敦西方大学生物化学系)
机构
*
College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China.(深圳大学计算机科学与软件工程学院,中国深圳)
;
Guangming Laboratory, Shenzhen, China.(深圳广明实验室,中国深圳)
;
School of Informatics, Xiamen University, Xiamen, China.(厦门大学信息学院,中国厦门)
;
School of Computer Science and Technology, Guangdong University of Technology, Guangzhou, China(广东工业大学计算机科学与技术学院,中国广州)
Training-Free Multimodal Large Language Model Orchestration
免训练的多模态大语言模型编排
Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji
机构
*
Media Analytics and Computing Lab, Xiamen University, Xiamen, China(厦门大学媒体分析与计算实验室)
;
Institute of Artificial Intelligence, Xiamen University, Xiamen, China(厦门大学人工智能研究院)
;
School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院)
;
Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)
;
Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)
专题命中
VLM训练与架构
:multimodal large language model(title)