SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model
SyncVoice:面向视频配音的视觉增强预训练TTS模型
Kaidi Wang, Yi He, Wenhao Guan, Weijie Wu, Hongwu Ding, Xiong Zhang, Di Wu, Meng Meng, Jian Luan, Lin Li, Qingyang Hong
机构
*
School of Informatics, Xiamen University, China(厦门大学信息学院)
;
MiLM Plus, Xiaomi Inc., China(小米公司)
;
School of Electronic Science and Engineering, Xiamen University, China(厦门大学电子科学与技术学院)
Lyrics Matter: Exploiting the Power of Learnt Representations for Music Popularity Prediction
歌词很重要:利用学习到的表示力预测音乐流行度
Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya
机构
*
Indian Institute of Technology Bombay(印度理工学院班加罗尔)
;
Department of Electrical Engineering, IIT Bombay(印度理工学院班加罗尔电气工程系)
;
CFILT, Department of Computer Science, IIT Bombay(印度理工学院班加罗尔计算机科学系)
SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
SAT:多模态语言模型的动态空间能力训练
Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko
机构
*
Boston University(波士顿大学)
;
University of Washington(华盛顿大学)
;
Allen Institute for AI(人工智能研究院)
;
Microsoft Research(微软研究院)
;
New York University(纽约大学)
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Baidu Inc.(百度公司)
RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering
RAG-IGBench: 用于开放领域问答中基于检索增强生成的交错生成的创新评估
Rongyang Zhang, Yuqing Huang, Chengqiang Lu, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Yin Xu, Wei Wang, Hao Wang, Enhong Chen
机构
*
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
;
Xiaohongshu Inc.(小红书公司)
;
Xi’an Jiaotong University(西安交通大学)
A Strong View-Free Baseline Approach for Single-View Image Guided Point Cloud Completion
一种强视图无关的单视图图像引导点云补全基线方法
Fangzhou Lin, Zilin Dai, Rigved Sanku, Songlin Hou, Kazunori D Yamada, Haichong K. Zhang, Ziming Zhang
机构
*
Department of Robotics Engineering, Worcester Polytechnic Institute(机器人工程系,沃斯特理工学院)
;
Dell Technologies(戴尔技术)
;
Graduate School of Information Sciences, Tohoku University(信息科学研究生院,东北大学)
;
Department of Computer Science, Worcester Polytechnic Institute(计算机科学系,沃斯特理工学院)
;
Harvard Kenneth C. Griffin Graduate School of Arts and Sciences(哈佛肯尼斯·C·格里芬艺术与科学研究生院)
;
Department of Biomedical Engineering, Worcester Polytechnic Institute(生物医学工程系,沃斯特理工学院)
;
Department of Electrical & Computer Engineering, Worcester Polytechnic Institute(电气与计算机工程系,沃斯特理工学院)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
基于动态视觉搜索和缩放的自适应聚焦推理方法用于高效VLMs
Xintong Zhang, Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaowen Zhang, Yang Liu, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li
机构
*
organization= School of Computer Science \& Technology, Beijing Institute of Technology , city= Beijing , country= China
;
organization= State Key Laboratory of General Artificial Intelligence, BIGAI , city= Beijing , country= China
;
organization= School of Intelligence Science
;
Technology, Peking University , city= Beijing , country= China
;
organization= Guangdong Laboratory of Machine Perception
;
Intelligent Computing, Shenzhen MSU--BIT University , city= Shenzhen , country= China
;
organization= Department of Automation, Tsinghua University , city= Beijing , country= China
Multimodal Oncology Agent for IDH1 Mutation Prediction in Low-Grade Glioma
多模态肿瘤代理用于低级别胶质瘤IDH1突变预测
Hafsa Akebli, Adam Shephard, Vincenzo Della Mea, Nasir Rajpoot
机构
*
Department of Mathematics, Computer Science and Physics, University of Udine(乌迪大学数学、计算机科学与物理系)
;
Tissue Image Analytics Centre, Department of Computer Science, University of Warwick(沃里克大学计算机科学系组织图像分析中心)
;
Histofy Ltd(Histofy有限公司)