CheXPO-v2: Preference Optimization for Chest X-ray VLMs with Knowledge Graph Consistency
CheXPO-v2:基于知识图谱一致性的胸片视觉-语言模型偏好优化
Xiao Liang, Yuxuan An, Di Wang, Jiawei Hu, Zhicheng Jiao, Bin Jing, Quan Wang
机构
*
School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
;
Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学学院)
;
School of Biomedical Engineering, Capital Medical University(首都医科大学生物医学工程学院)
EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测
Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang
机构
*
Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学)
;
School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学)
;
Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)
专题命中
视觉定位与Grounding
:multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI
Vidarc: Embodied Video Diffusion Model for Closed-loop Control
Vidarc:用于闭环控制的具身视频扩散模型
Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, Jun Zhu
机构
*
Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)
SynergyWarpNet: Attention-Guided Cooperative Warping for Neural Portrait Animation
SynergyWarpNet:基于注意力的协同形变用于神经肖像动画
Shihang Li, Zhiqiang Gong, Minming Ye, Yue Gao, Wen Yao
机构
*
MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学)
;
Defense Innovation Institute, Academy of Military Science(国防创新研究院,军事科学院)
;
Intelligent Game and Decision Laboratory(智能游戏与决策实验室)
On the dynamic evolution of CLIP texture-shape bias and its relationship to human alignment and model robustness
CLIP纹理-形状偏倚的动态演变及其与人类对齐和模型鲁棒性的关系
Pablo Hernández-Cámara, Jose Manuel Jaén-Lorites, Alexandra Gómez-Villa, Jorge Vila-Tomás, Valero Laparra, Jesus Malo
机构
*
Image Processing Lab, Universitat de Valencia, Spain(瓦伦西亚大学图像处理实验室)
;
Centro de Biomateriales e Ingenieria Tisular, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心)
;
Computer Vision Center, Spain(西班牙计算机视觉中心)
;
Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学)