Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation
Embodied4C: 评估具身视觉-语言导航中至关重要的因素
Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax
机构
*
Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
;
UAS Esslingen(埃森嫩大学)
;
TU Wien(维也纳技术大学)
;
Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司)
;
University of Michigan(密歇根大学)
;
Voxel51 Inc.(Voxel51公司)
Modality-Dependent Memory Mechanisms in Cross-Modal Neuromorphic Computing
跨模态类脑计算中的模态依赖性记忆机制
Effiong Blessing, Chiung-Yi Tseng, Somshubhra Roy, Junaid Rehman, Isaac Nkrumah
机构
*
1 Department of Computer Science, Saint Louis University, St. Louis, MO, USA 2 Luxmuse AI, USA 3 Department of Electrical
;
Computer Engineering, North Carolina State University, Raleigh, NC, USA 4 Independent Researcher 5 Department of Computer Science, Saint Louis University, St. Louis, MO, USA Email
Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning
推动音频视觉感知前沿:大规模多模态对应学习
Apoorv Vyas, Heng-Jui Chang, Cheng-Fu Yang, Po-Yao Huang, Luya Gao, Julius Richter, Sanyuan Chen, Matt Le, Piotr Dollár, Christoph Feichtenhofer, Ann Lee, Wei-Ning Hsu
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
超级编码网络:多模态编码器的递归关联用于视频理解
Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang
机构
*
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Shanghai AI Laboratory(上海人工智能实验室)
专题命中
视频多模态
:multi-modal(title);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
LVAgent: 通过多轮动态协作的MLLM代理实现长视频理解
Boyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang
机构
*
Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院)
;
Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国)
;
Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
Asynchronous Pipeline Parallelism for Real-Time Multilingual Lip Synchronization in Video Communication Systems
异步流水线并行用于实时多语言唇同步视频通信系统
Eren Caglar, Amirkia Rafiei Oskooei, Mehmet Kutanoglu, Mustafa Keles, Mehmet S. Aktas
机构
*
Department of Data Science
;
Big Data Yildiz Technical University Istanbul, Turkey
;
Department of Computer Engineering Yildiz Technical University Istanbul, Turkey
;
R\&D Center Aktif Investment Bank Inc. Istanbul, Turkey
;
3.5cm R\&D Center 3.5cm Aktif Investment Bank Inc. 3.5cm Istanbul, Turkey 3.5cm
;
0.25cm Department of Computer Engineering 0.25cm Yildiz Technical University 0.25cm Istanbul, Turkey 0.25cm
Bobo Li, Xudong Han, Jiang Liu, Yuzhe Ding, Liqiang Jing, Zhaoqi Zhang, Jinheng Li, Xinya Du, Fei Li, Meishan Zhang, Min Zhang, Aixin Sun, Philip S. Yu, Hao Fei
机构
*
National University of Singapore(新加坡国立大学)
;
University of Sussex(苏塞克斯大学)
;
Wuhan University(武汉大学)
;
University of Texas at Dallas(德克萨斯大学达拉斯分校)
;
Nanyang Technological University(南洋理工大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
University of Illinois at Chicago(伊利诺伊大学香槟分校)
Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization
通过理论一致的对称多模态偏好优化缓解幻觉
Wenqi Liu, Xuemeng Song, Jiaxi Li, Yinwei Wei, Na Zheng, Jianhua Yin, Liqiang Nie
机构
*
Shandong University(山东大学)
;
Southern University of Science and Technology(南方科技大学)
;
University of Georgia(佐治亚大学)
;
National University of Singapore(新加坡国立大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
机构
*
East China Normal University(华东师范大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
School of Computer Science and Technology(计算机科学与技术学院)