Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
通过教师引导的双路径实现语义噪声削减
Linge Wang, Yingying Chen, Bingke Zhu, Lu Zhou, Jinqiao Wang
机构
*
Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Objecteye Inc.(北京眼神科技有限公司)
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
爱我,爱我的标签:重新思考标签在视觉上下文学习中的提示检索中的作用
Tianci Luo, Haohao Pan, Jinpeng Wang, Niu Lian, Xinrui Chen, Bin Chen, Shu-Tao Xia, Chun Yuan
机构
*
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery
通过半监督率减少实现多模态表示学习的通用类别发现
Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li
机构
*
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)
Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation
Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作
Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao
机构
*
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
;
The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院)
;
Yuanpei College, Peking University(北京大学元培学院)
;
Department of Automation, Tsinghua University(清华大学自动化系)
GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
GUIDED: 通过识别、检测和辨别实现细粒度理解的细粒度开放词汇物体检测
Jiaming Li, Zhijia Liang, Weikai Chen, Lin Ma, Guanbin Li
机构
*
School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
;
Meituan(美团)
;
GuangDong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室)
;
Research Institute, Sun Yat-sen University(中山大学深圳研究院)
ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
ParaUni: 通过强化驱动的分层并行信息交互增强统一多模态模型的生成
Jiangtong Tan, Lin Liu, Jie Huanng, Xiaopeng Zhang, Qi Tian, Feng Zhao
机构
*
MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部类脑智能感知与认知重点实验室)
;
Huawei Inc.(华为技术有限公司)
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
三次离散扩散:高维表示上的离散视觉生成
Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu
机构
*
University of Hong Kong(香港大学)
;
ByteDance Seed(字节跳动种子)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Nanjing University(南京大学)
;
The Chinese University of Hong Kong(香港中文大学)