SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions
SnapBench:面向移动交互的抓拍提问多模态检索基准测试
Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Jin Ma, Yongqi Zhang
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tencent Yuanbao(腾讯元宝)
;
Tsinghua University(清华大学)
;
ARC Lab, Tencent(腾讯ARC实验室)
;
The University of Hong Kong(香港大学)
机构
*
Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系)
;
School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)
Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models
检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头
Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song
机构
*
HKUST(香港科技大学)
;
University of Edinburgh(爱丁堡大学)
;
CUHK(香港中文大学)
;
NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司)
;
Tsinghua University(清华大学)
R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation
R3G: 一种面向以视觉为中心的答案生成的推理-检索-重排序框架
Zhuohong Chen, Zhengxian Wu, Zirui Liao, Shenao Jiang, Hangrui Xu, Yang Chen, Chaokui Su, Xiaoyu Liu, Haoqian Wang
机构
*
The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)
;
State Key Laboratory of Nuclear Power Safety Technology and Equipment, China(核能安全技术与装备国家重点实验室)
;
School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)