机构
*
Nanjing University(南京大学)
;
Tencent Youtu Lab(腾讯优图实验室)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
University of Washington(华盛顿大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Australian National University(澳大利亚国立大学)
机构
*
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息科技学院)
;
Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息处理重点实验室)
;
Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)
;
Tencent Youtu Lab(腾讯优图实验室)
;
School of Psychology, Shanghai Jiao Tong University(上海交通大学心理学院)
;
Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院)
;
The Chinese University of Hong Kong(香港中文大学)
Multimodal Mathematical Reasoning with Diverse Solving Perspective
多模态数学推理与多样化的解题视角
Wenhao Shi, Zhiqiang Hu, Yi Bin, Guoqing Wang, Xing Xu, Yang Yang, See-Kiong Ng
机构
*
Tongji University(同济大学)
;
National University of Singapore(新加坡国立大学)
;
Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)
;
Tencent(腾讯)
;
Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)
Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language
更少步骤,更优性能:基于语言的高效跨模态视频片段修剪用于视频时刻检索
Xiang Fang, Daizong Liu, Wanlong Fang, Pan Zhou, Zichuan Xu, Wenzheng Xu, Junyang Chen, Renfu Li
机构
*
Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science of Technology(湖北大数据安全工程研究中心,网络安全学院,华中科技大学)
;
Peking University(北京大学)
;
Henan University(河南大学)
;
Dalian University of Technology(大连理工大学)
;
Sichuan University(四川大学)
;
Shenzhen University(深圳大学)
;
Huazhong University of Science and Technology(华中科技大学)
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
如何以及想象什么?统一多模态模型中的视觉思维用于跨视角空间推理
Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal
机构
*
Mila - Québec AI Institute(蒙特利尔AI研究所)
;
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
ServiceNow AI Research(ServiceNow人工智能研究)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
MAIL++: 视觉语言模型的多模态双向智能体层
Kaixiang Chen, Pengfei Fang, Hui Xue
机构
*
School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国)
机构
*
Sun Yat-sen University(中山大学)
;
Shandong Normal University(山东师范大学)
;
University of the Chinese Academy of Sciences(中国科学院大学)
;
Southeast University(东南大学)
Cattle-CLIP: A Multimodal Framework for Cattle Behaviour Recognition from Video
Cattle-CLIP:一种用于从视频中识别牛行为的多模态框架
Huimin Liu, Jing Gao, Daria Baran, AxelX Montout, Neill W Campbell, Andrew W Dowsey
机构
*
Bristol Veterinary School, University of Bristol(布里斯托尔大学布里斯托尔兽医学院)
;
School of Computer Science, University of Bristol(布里斯托尔大学计算机科学学院)
;
Joint Institute of Qingdao Huanghai University and WeITec, Qingdao Huanghai University(青岛黄海学院与WeITec联合学院,青岛黄海学院)
Camouflage-aware Image-Text Retrieval via Expert Collaboration
通过专家协作实现伪装意识的图像-文本检索
Yao Jiang, Zhongkuan Mao, Xuan Wu, Keren Fu, Qijun Zhao
机构
*
College of Computer Science, Sichuan University(四川大学计算机科学学院)
;
National Key Lab of Fundamental Science on Synthetic Vision, Sichuan University(四川大学视觉合成图形图像技术国家级重点实验室)
Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Tobias Glück, Anke Schmeink, Andreas Kugi
机构
*
AIT Austrian Institute of Technology(奥地利理工学院)
;
Automation & Control Institute, Technical University of Vienna(维也纳技术大学自动化与控制研究所)
;
Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席)