SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
Zheng Liu, Hao Liang, Bozhou Li, Wentao Xiong, Chong Chen, Conghui He, Wentao Zhang, Bin Cui
机构
*
Peking University Beijing China
;
Huawei Technologies Ltd. Beijing China
;
Shanghai AI Laboratory Shanghai China
;
Peking University Center for Machine Learning Research Beijing China
;
Peking University School of Computer Science \& Key Lab of High Confidence Software Technologies (MOE) Beijing China
;
Peking University
;
Huawei Technologies Ltd.
;
Shanghai AI Laboratory
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
Xuecheng Wu, Dingkang Yang, Danlei Huang, Xinyi Yin, Yifan Wang, Jia Zhang, Jiayu Nie, Liangyu Fu, Yang Liu, Junxiao Xue, Hadi Amirpour, Wei Zhou
机构
*
School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学)
;
College of Intelligent Robotics and Advanced Manufacturing, Fudan University & ByteDance(智能机器人与先进制造学院,复旦大学 & 字节跳动)
;
School of Cyber Science and Engineering, Zhengzhou University(网络科学与工程学院,郑州大学)
;
Institute of Advanced Technology, University of Science and Technology of China(先进技术研究院,中国科学技术大学)
;
Inspur Electronic Information Industry Co., Ltd(Inspur电子信息产业有限公司)
;
Department of Computer Science, The University of Toronto(计算机科学系,多伦多大学)
;
Research Center for Space Computing System, Zhejiang Lab(空间计算系统研究中心,浙江实验室)
;
Institute of Information Technology, University of Klagenfurt(信息技术学院,克雷格福特大学)
;
School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)
机构
*
East China Normal University(华东师范大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
City University of Hong Kong(香港城市大学)
;
Shanghai University of Electric Power(上海电力大学)
专题命中
音频语音多模态
:multimodal(title,abstract);分类 cs.CV
CommentsThe proposed method achieves first place in the ICCV VQualA 2025 EVQA-SnapUGC Challenge on short-form video engagement prediction
AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning
Dejie Yang, Zijing Zhao, Yang Liu
机构
*
Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)
;
State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
MobileViCLIP: An Efficient Video-Text Model for Mobile Devices
Min Yang, Zihan Jia, Zhilin Dai, Sheng Guo, Limin Wang
机构
*
State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
;
MyBank, Ant Group(蚂蚁集团MyBank)
;
Shanghai AI Lab(上海AI实验室)
Inference-Time Gaze Refinement for Micro-Expression Recognition: Enhancing Event-Based Eye Tracking with Motion-Aware Post-Processing
Nuwan Bandara, Thivya Kandappu, Archan Misra
机构
*
School of Computing(计算学院)
;
Information Systems, Singapore Management University, Singapore(信息系统,新加坡管理大学,新加坡)
专题命中
视频多模态
:multimodal(abstract);分类 cs.CV
CommentsAccepted at 4DMR@IJCAI25: International IJCAI Workshop on 1st Challenge and Workshop for 4D Micro-Expression Recognition for Mind Reading, August 29, 2025, Guangzhou, China
Role of Large Language Models and Retrieval-Augmented Generation for Accelerating Crystalline Material Discovery: A Systematic Review
Agada Joseph Oche, Arpan Biswas
机构
*
Bredesen Center for Interdisciplinary Research, University of Tennessee, Knoxville, USA(跨学科研究中心,田纳西大学,诺克斯维尔,美国)
;
University of Tennessee-Oak Ridge Innovation Institute, University of Tennessee, Knoxville, USA(田纳西大学橡树岭创新研究所,田纳西大学,诺克斯维尔,美国)