Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)
;
School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学)
;
Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院)
;
Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院)
;
School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学)
;
State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)
What Can RL Bring to VLA Generalization? An Empirical Study
RL能为VLA泛化带来什么?一项实证研究
Jijia Liu, Feng Gao, Bingwen Wei, Xinlei Chen, Qingmin Liao, Yi Wu, Chao Yu, Yu Wang
机构
*
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)
;
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
机构
*
Baichuan Inc.(百川公司)
;
Department of Dermatology Peking University First Hospital(北京大学第一医院皮肤科)
;
Beijing Key Laboratory of Molecular Diagnosis on Dermatoses(北京分子皮肤病诊断重点实验室)
;
National Clinical Research Center for Skin and Sexually Transmitted Diseases(国家皮肤及性传播疾病临床医学研究中心)
;
NMPA Key Laboratory for Quality Control and Evaluation of Cosmetics(国家药监局化妆品质量控制与评价重点实验室)
;
School of Biomedical Engineering Tsinghua University(清华大学生物医学工程学院)
;
University of Hong Kong(香港大学)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
残差跨模态融合网络用于音频视觉导航
Yi Wang, Yinfeng Yu, Bin Ren
机构
*
School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive(丝绸之路多语认知联合国际实验室)
;
School of Mechatronic Engineering and Automation Shanghai University, Shanghai, China(上海大学机电工程与自动化学院)
专题命中
安全评测
:alignment(abstract);分类 cs.AI
AI总结
本文提出残差跨模态融合网络,通过双向残差交互实现音频视觉信息互补建模,提升跨域导航性能。
CommentsMain paper (10 pages). Accepted for publication by the 14th international conference on Computational Visual Media (CVM 2026)