机构
*
State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)
;
School of Information Science and Engineering(信息科学与工程学院)
;
School of Mathematics(数学学院)
;
Purple Mountain Laboratories(紫金山实验室)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
Ziang Yan, Xinhao Li, Yinan He, Zhengrong Yue, Xiangyu Zeng, Yali Wang, Yu Qiao, Limin Wang, Yi Wang
机构
*
Zhejiang University(浙江大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Nanjing University(南京大学)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
IntuiTF: MLLM-Guided Transfer Function Optimization for Direct Volume Rendering
Yiyao Wang, Bo Pan, Ke Wang, Han Liu, Jinyuan Mao, Yuxin Liu, Minfeng Zhu, Xiuqi Huang, Weifeng Chen, Bo Zhang, Wei Chen
机构
*
State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室)
;
Laboratory of Art and Archaeology Image (Zhejiang University), Ministry of Education, China(浙江大学艺术与考古图像实验室(教育部,中国))
;
Zhejiang University of Finance&Economics(浙江财经大学)
;
Zhejiang University(浙江大学)
PhysioSync: Temporal and Cross-Modal Contrastive Learning Inspired by Physiological Synchronization for EEG-Based Emotion Recognition
Kai Cui, Jia Li, Yu Liu, Xuesong Zhang, Zhenzhen Hu, Meng Wang
机构
*
School of Instrument Science and Opto-electronics Engineering, Hefei University of Technology(仪器科学与光电工程学院,合肥工业大学)
;
School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学)
A Multimodal Deviation Perceiving Framework for Weakly-Supervised Temporal Forgery Localization
Wenbo Xu, Junyan Wu, Wei Lu, Xiangyang Luo, Qian Wang
机构
*
School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)
;
State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)
;
School of Cyber Science and Engineering, Wuhan University(网络科学与工程学院,武汉大学)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Alibaba Group(阿里巴巴集团)
;
Peking University(北京大学)
;
Luoyang Institute for Robot and Intelligent Equipment(洛阳机器人与智能装备研究所)
CINeMA: Conditional Implicit Neural Multi-Modal Atlas for a Spatio-Temporal Representation of the Perinatal Brain
Maik Dannecker, Vasiliki Sideri-Lampretsa, Sophie Starck, Angeline Mihailov, Mathieu Milh, Nadine Girard, Guillaume Auzias, Daniel Rueckert
机构
*
School of Computation, Information and Technology, and the School of Medicine and Health(计算信息学院及医学健康学院)
;
Technical University of Munich(慕尼黑技术大学)
;
Department of Computing(计算系)
;
Institut de Neurosciences de la Timone, UMR 7289, CNRS, Aix-Marseille Université(神经科学研究所,UMR 7289,CNRS,艾克斯-马赛大学)
;
Aix-Marseille Univ, APHM, Service de Neuroradiologie Diagnostique et Interventionnelle, Hôpital de la Timone(艾克斯-马赛大学,APHM,诊断与介入神经放射科,泰米翁医院)
;
Aix-Marseille Univ, APHM, service de neurologie pédiatrique, Hôpital de la Timone(艾克斯-马赛大学,APHM,儿童神经科,泰米翁医院)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
Hongyu Li, Jinyu Chen, Ziyu Wei, Shaofei Huang, Tianrui Hui, Jialin Gao, Xiaoming Wei, Si Liu
机构
*
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Meituan(美团)
机构
*
The Hong Kong University of Science & Technology (Guangzhou)(香港科技大学(广州))
;
The Hong Kong University of Science & Technology(香港科技大学)
;
Zhejiang University(浙江大学)
;
Lappeenranta-Lahti University of Technology(拉佩兰塔-拉赫蒂技术大学)
From Image to Video, what do we need in multimodal LLMs?
Suyuan Huang, Haoxin Zhang, Linqing Zhong, Honggu Chen, Yan Gao, Yao Hu, Zengchang Qin
机构
*
Intelligent Computing and Machine Learning Lab, School of ASEE, Beihang University(北京航空航天大学自动化学院智能计算与机器学习实验室)
;
Xiaohongshu(小红书)
;
School of Sino-French Engineer, Beihang University(北京航空航天大学中法工程师学院)
;
College of Engineering and Computer Science, VinUniversity(Vin大学工程与计算机科学学院)
TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries
Jinze Lv, Jian Chen, Zi Long, Xianghua Fu, Yin Chen
机构
*
College of Application and Technology, Shenzhen University, China(应用技术学院,深圳大学,中国)
;
College of Big Data and Internet, Shenzhen Technology University, China(大数据与互联网学院,深圳科技大学,中国)