HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming
HiVid: 基于大语言模型的视频显著性识别用于内容感知点播与直播
Jiahui Chen, Bo Peng, Lianchen Jia, Zeyu Zhang, Tianchi Huang, Lifeng Sun
机构
*
Tsinghua University(清华大学)
;
The Australian National University(澳大利亚国立大学)
;
Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)
机构
*
The Bartlett Centre for Advanced Spatial Analysis, Faculty of the Built Environment, University College London(大学学院)
;
Centre for Biodiversity and Environment Research, Department of Genetics, Evolution and Environment, University College London(大学学院)
Orthogonalized Multimodal Contrastive Learning with Asymmetric Masking for Structured Representations
正交化多模态对比学习与不对称掩码用于结构化表示
Carolin Cissee, Raneen Younis, Zahra Ahmadi
机构
*
Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(图林根工业大学和汉诺威医学院医学信息学研究所)
;
Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森人工智能与因果医学中心(CAIMed))
Towards Spatial Transcriptomics-driven Pathology Foundation Models
迈向基于空间转录组的病理基础模型
Konstantin Hemker, Andrew H. Song, Cristina Almagro-Pérez, Guillaume Jaume, Sophia J. Wagner, Anurag Vaidya, Nikola Simidjievski, Mateja Jamnik, Faisal Mahmood
机构
*
Department of Pathology, Mass General Brigham, Harvard Medical School, Boston, MA, USA(病理学系,马萨诸塞州总医院与哈佛医学院,波士顿,马萨诸塞州,美国)
;
Department of Computer Science & Technology, University of Cambridge, Cambridge, UK(计算机科学与技术系,剑桥大学,剑桥,英国)
;
Cancer Program, Broad Institute of Harvard and MIT, Cambridge, MA, USA(癌症计划,哈佛与麻省理工联合学院,剑桥,马萨诸塞州,美国)
;
Data Science Program, Dana-Farber Cancer Institute, Boston, MA, USA(数据科学计划,达纳-法伯癌症研究所,波士顿,马萨诸塞州,美国)
;
Harvard-MIT Division of Health Sciences and Technology, Massachusetts Institute of Technology, Cambridge, MA, USA(哈佛-麻省理工健康科学与技术 division,麻省理工学院,剑桥,马萨诸塞州,美国)
;
Télécom Paris, Institut Polytechnique de Paris, Paris, France(巴黎电信学院,巴黎理工学院,巴黎,法国)
;
Harvard Data Science Initiative, Harvard University, Cambridge, MA, USA(哈佛大学数据科学倡议,哈佛大学,剑桥,马萨诸塞州,美国)
专题命中
跨模态检索
:multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
图像能帮你找回记忆:一种新颖的多模态引导攻击对抗图像生成模型去学习
Renyang Liu, Guanlin Li, Tianwei Zhang, See-Kiong Ng
机构
*
Institute of Data Science, National University of Singapore(数据科学研究所,新加坡国立大学)
;
S-Lab, Nanyang Technological University(南洋理工大学S实验室)
;
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
训练多模态大推理模型需要更优质的思考:一种用于长链式思考合成与选择的三阶段框架
Yizhi Wang, Linan Yue, Min-Ling Zhang
机构
*
School of Computer Science and Engineering(计算机科学与工程学院)
;
Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education(计算机网络与信息集成重点实验室(SEU))
Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models
基于CLIP引导的多模态扩散模型的图像到脑信号生成用于视觉假体
Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Guoxu Zhou, Boyu wang, Jian Zhu, Jinyi Long
机构
*
Jinan University, Guangzhou, China
;
Department of Rehabilitation Medicine, The First Affiliated Hospital of Jinan University, Guangzhou, China
;
Western University, Ontario, Canada
;
Guangdong University of Technology, Guangzhou, China
;
Tsinghua University, Beijing, China
Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis
自动驾驶中的基础模型:场景生成与场景分析的综述
Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz
专题命中
多模态生成
:multimodal(abstract);分类 cs.AI
AI总结
本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。
CommentsIEEE Open Journal of Intelligent Transportation Systems
Journal refIEEE Open Journal of Intelligent Transportation Systems, 03 February 2026
FMMD: A multimodal open peer review dataset based on F1000Research
FMMD:基于F1000Research的多模态开放同行评审数据集
Zhenzhen Zhuang, Yuqing Fu, Jing Zhu, Zhangping Zhou, Jialiang Lin
机构
*
School of Computer Science and Engineering, Guangzhou Institute of Science and Technology(计算机科学与工程学院,广州科学与技术研究所)
;
College of Foreign Languages and Cultures, Xiamen University(外语学院,厦门大学)
;
Science and Education Evaluation Lab, Guangzhou Institute of Science and Technology(科学与教育评估实验室,广州科学与技术研究所)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
RAVENEA:多模态检索增强视觉文化理解的基准
Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, Paul Pu Liang, Yang Deng, Serge Belongie
机构
*
University of Copenhagen(哥本哈根大学)
;
ETH Zürich(苏黎世联邦理工学院)
;
University of Amsterdam(阿姆斯特丹大学)
;
University of Cambridge(剑桥大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
Singapore Management University(新加坡管理大学)
Unsupervised MR-US Multimodal Image Registration with Multilevel Correlation Pyramidal Optimization
无监督的MR-US多模态图像配准与多级相关金字塔优化
Jiazheng Wang, Zeyu Liu, Min Liu, Xiang Chen, Xinyao Yu, Yaonan Wang, Hang Zhang
机构
*
School of Artificial Intelligence and Robotics, Hunan University, Changsha, Hunan, China(人工智能与机器人学院,湖南大学,长沙,湖南,中国)
;
National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University, Changsha, Hunan, China(机器人视觉感知与控制技术国家工程研究中心,湖南大学,长沙,湖南,中国)
;
National University of Singapore(新加坡国立大学)
;
Cornell University(康奈尔大学)
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
PRISMM-Bench: 一种基于同行评审的多模态不一致基准
Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin
机构
*
Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校)
;
Interdisciplinary Transformation University Austria(跨学科转型大学奥地利)
;
MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
;
Stanford University(斯坦福大学)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)