The Autonomy-Alignment Problem in Open-Ended Learning Robots: Formalising the Purpose Framework
开放性学习机器人中的自主性-对齐问题:目的框架的正式化
Gianluca Baldassarre, Richard J. Duro, Emilio Cartoni, Mehdi Khamassi, Alejandro Romero, Vieri Giuliano Santucci
机构
*
Institute of Cognitive Sciences and Technologies, National Research Council(认知科学与技术研究所,国家研究理事会)
;
Integrated Group for Engineering Research, CITIC, Universidade da Coruña(工程研究联合组,CITIC,科鲁纳大学)
;
Institute of Intelligent Systems and Robotics, Sorbonne University / CNRS(智能系统与机器人研究所,索邦大学 / CNRS)
Boosting Medical Vision-Language Pretraining via Momentum Self-Distillation under Limited Computing Resources
通过有限计算资源下的动量自蒸馏提升医学视觉-语言预训练
Phuc Pham, Nhu Pham, Ngoc Quoc Ly
机构
*
Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南)
;
Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)
Progressive Image Restoration via Text-Conditioned Video Generation
通过文本条件视频生成实现渐进式图像修复
Peng Kang, Xijun Wang, Yu Yuan
机构
*
Department of Computer Science, University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校计算机科学系)
;
School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院)
Adhiraj Ghosh, Vishaal Udandarao, Thao Nguyen, Matteo Farina, Mehdi Cherti, Jenia Jitsev, Sewoong Oh, Elisa Ricci, Ludwig Schmidt, Matthias Bethge
机构
*
Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)
;
University of Cambridge(剑桥大学)
;
University of Washington(华盛顿大学)
;
University of Trento(特伦托大学)
;
LAION
;
Stanford University(斯坦福大学)
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型
Xinliang Zhang, Lei Zhu, Hangzhou He, Shuang Zeng, Ourui Fu, Jiakui Hu, Zhengjian Yao, Yanye Lu
机构
*
Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所)
;
Department of Biomedical Engineering, Peking University(北京大学生物医学工程系)
;
National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV、cs.AI
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
Xiangyang Wu, Liu Liu, Baosheng Yu, Jiayan Qiu, Zhenwei Shi
机构
*
Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
;
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
Nanyang Technological University(南洋理工大学)
;
University of Leicester(莱斯特大学)
;
School of Astronautics, Beihang University(北京航空航天大学航天学院)
Abn-BLIP: Abnormality-aligned Bootstrapping Language-Image Pre-training for Pulmonary Embolism Diagnosis and Report Generation from CTPA
Zhusi Zhong, Yuli Wang, Lulu Bi, Zhuoqi Ma, Sun Ho Ahn, Christopher J. Mullin, Colin F. Greineder, Michael K. Atalay, Scott Collins, Grayson L. Baird, Cheng Ting Lin, Webster Stayman, Todd M. Kolb, Ihab Kamel, Harrison X. Bai, Zhicheng Jiao
机构
*
Department of Diagnostic Imaging, Brown University Health(布朗大学健康中心诊断影像科)
;
Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学院)
;
Department of Biomedical Engineering, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院生物医学工程系)
;
Department of Radiology and Radiological Sciences, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院放射科)
;
Johns Hopkins University Division of Pulmonary and Critical Care Medicine(约翰霍普金斯大学肺科与重症医学科)
;
Department of Radiology, University of Colorado School of Medicine(科罗拉多大学医学院放射科)
LGCA: Enhancing Semantic Representation via Progressive Expansion
Thanh Hieu Cao, Trung Khang Tran, Gia Thinh Pham, Tuong Nghiem Diep, Thanh Binh Nguyen
机构
*
University of Science, Vietnam National University Ho Chi Minh City, Vietnam(越南胡志明市国家大学科学大学)
;
National University of Singapore, Singapore(新加坡国立大学)
;
AISIA Lab, Ho Chi Minh City, Vietnam(越南胡志明市AISIA实验室)
Semantic Relation-Enhanced CLIP Adapter for Domain Adaptive Zero-Shot Learning
Jiaao Yu, Mingjie Han, Jinkun Jiang, Junyu Dong, Tao Gong, Man Lan
机构
*
School of Computer Science and Technology, East China Normal University, China(东华大学计算机科学与技术学院)
;
College of Computer Science and Technology, Ocean University of China, China(中国海洋大学计算机科学与技术学院)
Frame-Difference Guided Dynamic Region Perception for CLIP Adaptation in Text-Video Retrieval
Jiaao Yu, Mingjie Han, Tao Gong, Jian Zhang, Man Lan
机构
*
School of Computer Science and Technology, East China Normal University, China(上海师范大学计算机科学与技术学院)
;
School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)