Toward Real-Time Surgical Scene Segmentation via a Spike-Driven Video Transformer with Spike-Informed Pretraining
迈向实时手术场景分割的脉冲驱动视频变换器及其基于脉冲的预训练
Shihao Zou, Jingjing Li, Wei Ji, Jincai Huang, Kai Wang, Guo Dan, Weixin Si, Yi Pan
机构
*
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
University of Alberta(阿尔伯塔大学)
;
School of Medicine, Yale University(耶鲁大学医学院)
;
Southern University of Science and Technology(南方科技大学)
;
Nanfang Hospital Southern Medical University(南方医科大学南华医院)
;
School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)
;
Faculty of Computer Science and Control Engineering, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机科学与控制工程学院)
GraphiContact: Pose-aware Human-Scene Robust Contact Perception for Interactive Systems
GraphiContact: 人体-场景鲁棒接触感知用于交互系统
Xiaojian Lin, Yaomin Shen, Junyuan Ma, Yujie Sun, Chengqing Bu, Wenxin Zhang, Zongzheng Zhang, Hao Fei, Lei Jin, Hao Zhao
机构
*
Tsinghua University, China(清华大学, 中国)
;
XR System Application Research Center, Nanchang Research Institute, Zhejiang University, China(浙江大学南昌研究院XR系统应用研究中心, 中国)
;
Beijing University of Posts and Telecommunications, China(北京邮电大学, 中国)
;
University of Chinese Academy of Sciences, China(中国科学院大学, 中国)
;
National University of Singapore, Singapore(新加坡国立大学, 新加坡)
CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning
CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能
Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras
机构
*
Queen Mary, University of London(伦敦大学玛丽女王学院)
;
Centre for Research and Technology Hellas(希腊研究中心)
;
City St George’s, University of London(伦敦大学圣乔治学院)
Reconstruction Matters: Learning Geometry-Aligned BEV Representation through 3D Gaussian Splatting
重建至关重要:通过3D高斯点云学习几何对齐的鸟瞰图表示
Yiren Lu, Xin Ye, Burhaneddin Yaman, Jingru Luo, Zhexiao Xiong, Liu Ren, Yu Yin
机构
*
Bosch Research North America \& Bosch Center for Artificial Intelligence (BCAI) Case Western Reserve University Washington University in St. Louis
Video Understanding: From Geometry and Semantics to Unified Models
视频理解:从几何与语义到统一模型
Zhaochong An, Zirui Li, Mingqiao Ye, Feng Qiao, Jiaang Li, Zongwei Wu, Vishal Thengane, Chengzu Li, Lei Li, Luc Van Gool, Guolei Sun, Serge Belongie
机构
*
Department of Computer Science(计算机科学系)
;
University of Copenhagen(哥本哈根大学)
;
College of Computer Science(计算机科学学院)
;
Nankai University(南开大学)
;
School of Computer and Communication Sciences(计算机与通信科学学校)
;
EPFL(苏黎世联邦理工学院)
;
Department of Computer Science & Engineering(计算机科学与工程系)
;
Washington University in St. Louis(圣路易斯华盛顿大学)
;
Computer Vision Lab(计算机视觉实验室)
;
University of Würzburg(乌尔姆大学)
;
Computer Science Research Centre(计算机科学研究中心)
;
University of Surrey(萨里大学)
;
School of Electrical, Computer and Telecommunications Engineering(电气、计算机和电信工程学院)
;
University of Wollongong(沃林根大学)
;
Language Technology Lab(语言技术实验室)
;
University of Cambridge(剑桥大学)
;
School of Artificial Intelligence(人工智能学院)
;
Beijing Institute of Technology(北京理工大学)
;
Institute for Computer Science(计算机科学研究所)
;
INSAIT
AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation
AERR-Nav:面向零样本物体导航的自适应探索-恢复-回忆策略
Jingzhi Huang, Junkai Huang, Haoyang Yang, Haoang Li, Yi Wang
机构
*
Hong Kong Polytechnic University(香港理工大学)
;
Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation
DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作
Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li
机构
*
Institute for Artificial Intelligence(人工智能研究院)
;
School of Integrated Circuits, Peking University(集成电路学院,北京大学)
;
Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所)
;
School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)
;
Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)
Spectral Rectification for Parameter-Efficient Adaptation of Foundation Models in Colonoscopy Depth Estimation
光谱校正用于结肠镜深度估计中基础模型的参数高效适应
Xiaoxian Zhang, Minghai Shi, Lei Li
机构
*
Department of Biomedical Engineering, National University of Singapore, Singapore(新加坡国立大学生物医学工程系)
;
Department of Radiotherapy, The First Affiliated Hospital of Xi'an Jiaotong University, Xi'an, China(西安交通大学第一附属医院放疗科)