机构
*
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心)
;
School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
;
School of Software, Beihang University(北京航空航天大学软件学院)
;
School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐
Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Sichuan University(四川大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
University of Macau(澳门大学)
机构
*
School of Computer Science and Artificial Intelligence, Guangdong University of Education(广东第二师范学院计算机科学与人工智能学院)
;
School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)
Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding
用于长视频理解中事件感知视觉分配的高斯混合模型
Yifan Lu, Ziqi Zhang, Chunfeng Yuan, Jun Gao, Bing Li, Weiming Hu
机构
*
Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information, CASIA(中国科学院自动化所多模态信息超智能安全北京市重点实验室)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化所多模态人工智能系统国家重点实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Hello Group(未知(保留英文))
;
School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)
TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues
TextGaze:利用文本场景线索提示注视目标估计
Junhui She, Fei Wang, Kun Li, Yiqi Nie, Yuxin Liu, Zhangling Duan, Xun Yang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Hefei University of Technology(合肥工业大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
;
Anhui University(安徽大学)
;
United Arab Emirates University(阿联酋大学)
Creativity from Friction: Human-AI Interaction for Exploratory Structural Design
摩擦产生创造力:用于探索性结构设计的人机交互
Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady
机构
*
Block Research Group, Department of Architecture, ETH Zurich(建筑系,苏黎世联邦理工学院)
;
IVIA Lab, Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院)
机构
*
Institute for Natural Language Processing, University of Stuttgart(语言处理研究所,斯图加特大学)
;
Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思论坛,斯图加特大学)
ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs
ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型
Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu
机构
*
School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院)
;
S-Lab, Nanyang Technological University(南洋理工大学S-Lab)
;
OPPO Research Institute(OPPO研究院)
;
Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV
AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation
AC3S: 面向3D感知合成数据生成的自适应条件控制
Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Johns Hopkins University(约翰霍普金斯大学)
;
College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)
专题命中
VLM训练与架构
:vision language model(abstract);分类 cs.CV