arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-17 至 2026-02-17 共收录 101 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 13 篇

2602.14214 2026-02-17 cs.CV 57%

HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming

HiVid: 基于大语言模型的视频显著性识别用于内容感知点播与直播

Jiahui Chen, Bo Peng, Lianchen Jia, Zeyu Zhang, Tianchi Huang, Lifeng Sun

机构 * Tsinghua University(清华大学) The Australian National University(澳大利亚国立大学) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 HiVid利用大语言模型生成内容感知的视频显著性权重,提升点播和直播的QoE性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13496 2026-02-17 cs.CY cs.AI 57%

Future of Edge AI in biodiversity monitoring

边缘AI在生物多样性监测中的未来

Aude Vuilliomenet, Kate E. Jones, Duncan Wilson

机构 * The Bartlett Centre for Advanced Spatial Analysis, Faculty of the Built Environment, University College London(大学学院) Centre for Biodiversity and Environment Research, Department of Genetics, Evolution and Environment, University College London(大学学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文研究了边缘AI在生物多样性监测中的应用,分析了不同系统类型及其权衡,强调了跨学科合作的重要性。

Comments 41 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14255 2026-02-17 cs.RO 50%

A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots

面向工业机器人视觉-运动策略学习的延迟感知框架

Daniel Ruan, Salma Mozaffari, Sigrid Adriaenssens, Arash Adel

机构 * Princeton University(普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种面向工业机器人视觉-运动策略学习的延迟感知框架,通过优化执行策略以应对延迟问题,提升策略在现实环境中的可靠性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02456 2026-02-17 cs.RO 50%

InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation

InternVLA-A1:统一理解、生成和行动以实现机器人操作

Junhao Cai, Zetao Cai, Jiafei Cao, Yilun Chen, Zeyu He, Lei Jiang, Hang Li, Hengjie Li, Yang Li, Yufei Liu, Yanan Lu, Qi Lv, Haoxiang Ma, Jiangmiao Pang, Yu Qiao, Zherui Qiu, Yanqing Shen, Xu Shi, Yang Tian, Bolun Wang, Hanqing Wang, Jiaheng Wang, Tai Wang, Xueyuan Wei, Chao Wu, Yiman Xie, Boyang Xing, Yuqiang Yang, Yuyin Yang, Qiaojun Yu, Feng Yuan, Jia Zeng, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Zhuoma Zhaxi, Bowen Zhou, Yuanzhen Zhou, Yunsong Zhou, Hongrui Zhu, Yangkun Zhu, Yuchen Zhu

机构 * InternVLA-A1 Team(InternVLA-A1团队)

专题命中 视频多模态 :multimodal(abstract)

AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。

Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 9 篇

2507.14902 2026-02-17 cs.IR cs.CV 83%

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

通过嵌入学习与大语言模型揭示通用多模态检索的关键因素:U-MARVEL

Xiaojie Li, Chu Li, Shi-Zhe Chen, Xi Chen

机构 * Tencent PCG(腾讯PCG) Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 U-MARVEL通过嵌入学习与大语言模型揭示通用多模态检索的关键因素,实现超越现有方法的性能。

Comments Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14983 2026-02-17 cs.LG 82%

Orthogonalized Multimodal Contrastive Learning with Asymmetric Masking for Structured Representations

正交化多模态对比学习与不对称掩码用于结构化表示

Carolin Cissee, Raneen Younis, Zahra Ahmadi

机构 * Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(图林根工业大学和汉诺威医学院医学信息学研究所) Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森人工智能与因果医学中心(CAIMed))

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 COrAL通过正交化多模态对比学习与不对称掩码,显式保留冗余、独特和协同信息,提升多模态表示的稳定性与全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14107 2026-02-17 cs.DC 82%

ML-ECS: A Collaborative Multimodal Learning Framework for Edge-Cloud Synergies

ML-ECS: 一种用于边缘-云协同的协同多模态学习框架

Yuze Liu, Shibo Chu, Tiehua Zhang, Hao Zhou, Zhishu Shen, Jinze Wang, Jianzhong Qi, Feng Xia

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 ML-ECS提出了一种协同多模态学习框架,通过跨模态对比学习、自适应多模态调节、模态感知聚合和SLM增强的CCL,实现边缘-云协同中的高效知识转移与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09510 2026-02-17 cs.IR 82%

MRMR: A Realistic and Expert-Level Multidisciplinary Benchmark for Reasoning-Intensive Multimodal Retrieval

MRMR:一个面向推理密集型多模态检索的现实且专家级多学科基准

Siyue Zhang, Yuan Gao, Xiao Zhou, Yilun Zhao, Tingyu Song, Arman Cohan, Anh Tuan Luu, Chen Zhao

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract)

AI总结 MRMR是一个面向推理密集型多模态检索的现实且专家级多学科基准,通过多领域查询和混合模态数据推动检索模型的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14177 2026-02-17 cs.CV cs.AI 79%

Towards Spatial Transcriptomics-driven Pathology Foundation Models

迈向基于空间转录组的病理基础模型

Konstantin Hemker, Andrew H. Song, Cristina Almagro-Pérez, Guillaume Jaume, Sophia J. Wagner, Anurag Vaidya, Nikola Simidjievski, Mateja Jamnik, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School, Boston, MA, USA(病理学系,马萨诸塞州总医院与哈佛医学院,波士顿,马萨诸塞州,美国) Department of Computer Science & Technology, University of Cambridge, Cambridge, UK(计算机科学与技术系,剑桥大学,剑桥,英国) Cancer Program, Broad Institute of Harvard and MIT, Cambridge, MA, USA(癌症计划,哈佛与麻省理工联合学院,剑桥,马萨诸塞州,美国) Data Science Program, Dana-Farber Cancer Institute, Boston, MA, USA(数据科学计划,达纳-法伯癌症研究所,波士顿,马萨诸塞州,美国) Harvard-MIT Division of Health Sciences and Technology, Massachusetts Institute of Technology, Cambridge, MA, USA(哈佛-麻省理工健康科学与技术 division,麻省理工学院,剑桥,马萨诸塞州,美国) Télécom Paris, Institut Polytechnique de Paris, Paris, France(巴黎电信学院,巴黎理工学院,巴黎,法国) Harvard Data Science Initiative, Harvard University, Cambridge, MA, USA(哈佛大学数据科学倡议,哈佛大学,剑桥,马萨诸塞州,美国)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 SEAL通过整合局部分子信息提升病理基础模型性能,实现跨模态应用与领域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13345 2026-02-17 cs.LG cs.IR cs.MA 78%

BLUEPRINT Rebuilding a Legacy: Multimodal Retrieval for Complex Engineering Drawings and Documents

BLUEPRINT 重筑遗产:面向复杂工程图纸和文档的多模态检索

Ethan Seefried, Ran Eldegaway, Sanjay Das, Nathaniel Blanchard, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Colorado State University(科罗拉多州立大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 Blueprint通过布局感知的多模态检索系统,提升对复杂工程图纸和文档的自动化检索能力,实现结构化元数据生成与跨设施搜索效率提升。

Comments 20 pages 8 main + 12 appendix + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13961 2026-02-17 cs.CV astro-ph.IM cs.CL 73%

MarsRetrieval: Benchmarking Vision-Language Models for Planetary-Scale Geospatial Retrieval on Mars

MarsRetrieval: 用于火星尺度地理空间检索的视觉-语言模型基准测试

Shuoyuan Wang, Yiran Wang, Hongxin Wei

机构 * Department of Statistics and Data Science(统计与数据科学系) Department of Earth and Space Sciences(地球与空间科学系)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 MarsRetrieval提出了一种用于评估视觉-语言模型在火星地理空间发现中检索能力的基准测试,强调领域特定微调对可推广发现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13944 2026-02-17 cs.CV 57%

Fusing Pixels and Genes: Spatially-Aware Learning in Computational Pathology

融合像素与基因:计算病理学中的空间感知学习

Minghao Han, Dingkang Yang, Linhao Qu, Zizhi Chen, Gang Li, Han Wang, Jiacong Wang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲茨斯智能科技有限公司(菲茨斯AI)) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Tencent Youtu Lab(腾讯优图实验室) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 STAMP通过整合空间解析基因表达数据,提升计算病理学中多模态学习的性能与泛化能力。

Comments accepted by ICLR 2026, 34 pages, 10 figures, 7tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14170 2026-02-17 eess.SP 50%

Explainable Interictal Epileptiform Discharge Detection Method Based on Scalp EEG and Retrieval-Augmented Generation

基于头皮 EEG 和检索增强生成的可解释性癫痫发作前放电检测方法

Yu Zhu, Jiayang Guo, Jun Jiang, Peipei Gu, Xin Shu, Duo Chen

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出了一种基于头皮 EEG 和检索增强生成的可解释性癫痫发作前放电检测方法,通过双编码器和对比学习提升诊断性能和临床可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 9 篇

2504.20630 2026-02-17 eess.AS cs.MM cs.SD 81%

ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting

ISDrama: 通过多模态提示生成沉浸式空间戏剧

Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Tao Jin, Zhou Zhao

机构 * Zhejiang University, Shanghai AI Lab(浙江大学上海人工智能实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.MM、eess.AS

AI总结 ISDrama通过多模态提示生成沉浸式空间戏剧,首次结合多模态数据建模和戏剧语调生成。

Comments Accepted by ACM Multimedia 2025

Journal ref MM '2025: Proceedings of the 33rd ACM International Conference on Multimedia Pages 9618 - 9627

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07139 2026-02-17 cs.CV cs.CR cs.LG 79%

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

图像能帮你找回记忆:一种新颖的多模态引导攻击对抗图像生成模型去学习

Renyang Liu, Guanlin Li, Tianwei Zhang, See-Kiong Ng

机构 * Institute of Data Science, National University of Singapore(数据科学研究所,新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 Recall提出一种新颖的多模态引导攻击框架,针对图像生成模型去学习的鲁棒性进行攻击,展示其在对抗有效性、计算效率和语义保真度上的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18956 2026-02-17 cs.AI cs.LG 79%

Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection

训练多模态大推理模型需要更优质的思考:一种用于长链式思考合成与选择的三阶段框架

Yizhi Wang, Linan Yue, Min-Ling Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education(计算机网络与信息集成重点实验室(SEU))

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SynSelect框架,通过三阶段合成与选择生成高质量多模态推理数据,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00787 2026-02-17 cs.CV 79%

Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models

基于CLIP引导的多模态扩散模型的图像到脑信号生成用于视觉假体

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Guoxu Zhou, Boyu wang, Jian Zhu, Jinyi Long

机构 * Jinan University, Guangzhou, China Department of Rehabilitation Medicine, The First Affiliated Hospital of Jinan University, Guangzhou, China Western University, Ontario, Canada Guangdong University of Technology, Guangzhou, China Tsinghua University, Beijing, China

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于CLIP引导的多模态扩散模型,实现图像到脑信号的转换,通过交叉注意力机制和空间-时间位置编码生成生物合理的脑信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11526 2026-02-17 cs.RO cs.AI 57%

Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis

自动驾驶中的基础模型:场景生成与场景分析的综述

Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。

Comments IEEE Open Journal of Intelligent Transportation Systems

Journal ref IEEE Open Journal of Intelligent Transportation Systems, 03 February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14534 2026-02-17 cs.CV 57%

MoRL: Reinforced Reasoning for Unified Motion Understanding and Generation

MoRL: 用于统一运动理解与生成的强化推理

Hongpeng Wang, Zeyu Zhang, Wenhao Li, Hao Tang

机构 * The University of Sydney(悉尼大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MoRL通过结合监督微调和强化学习,提升运动理解与生成的推理能力和现实感,并引入链式运动方法和大规模CoT数据集以增强推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14186 2026-02-17 cs.CV 57%

UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing

UniRef-Image-Edit: 向可扩展和一致的多参考图像编辑迈进

Hongyang Wei, Bin Wen, Yancheng Long, Yankai Yang, Yuhang Hu, Tianke Zhang, Wei Chen, Haonan Fan, Kaiyu Jiang, Jiankang Chen, Changyi Liu, Kaiyu Tang, Haojie Ding, Xiao Yang, Jia Sun, Huaiqing Wang, Zhenyu Yang, Xinyu Wei, Xianglong He, Yangguang Li, Fan Yang, Tingting Gao, Lei Zhang, Guorui Zhou, Han Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) CUHK MMLab(香港中文大学MMLab)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 UniRef-Image-Edit通过统一的输入表示和两阶段训练框架,提升多参考图像编辑的一致性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05039 2026-02-17 cs.CV 57%

Semantic-Guided Two-Stage GAN for Face Inpainting with Hybrid Perceptual Encoding

基于语义引导的两阶段GAN用于面部修复的混合感知编码

Abhigyan Bhattacharya, Hiranmoy Roy, Debotosh Bhattacharjee

机构 * RCC Institute of Information Technology(RCC信息科技学院) Jadavpur University(贾瓦德普尔大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于语义引导的两阶段GAN模型,通过混合感知编码提升面部修复的语义一致性和图像质量。

Comments The paper is under consideration at Elsevier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15026 2026-02-17 cs.CE 50%

Deep Generative Models in Condition and Structural Health Monitoring: Opportunities, Limitations and Future Outlook

深度生成模型在条件与结构健康监测中的应用:机遇、局限与未来展望

Xin Yang, Chen Fang, Yunlai Liao, Jian Yang, Konstantinos Gryllias, Dimitrios Chronopoulos

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文探讨深度生成模型在条件与结构健康监测中的应用,分析其优势与局限,并提出未来研究方向。

Comments 70 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态评测 21 篇

2509.18053 2026-02-17 cs.RO 82%

V2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughts

V2V-GoT: 基于多模态大语言模型和思维图的车对车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Yu-Chiang Frank Wang, Min-Hung Chen, Stephen F. Smith

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出V2V-GoT框架,结合多模态大语言模型和图-思维方法,提升车对车协同自动驾驶的感知、预测和规划能力。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vgot.github.io/ Code: https://github.com/eddyhkchiu/V2V-GoT Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13650 2026-02-17 cs.CV cs.AI cs.CL 82%

KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination

KorMedMCQA-V: 一种用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试

Byungjin Choi, Seongsu Bae, Sunjun Kweon, Edward Choi

机构 * Ajou University School of Medicine(阿乔大学医学院) KAIST(韩国科学技术院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 KorMedMCQA-V是一个用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试,展示了不同模型在医疗领域中的表现差异。

Comments 17 pages, 2 figures, 6 tables. (Includes appendix.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14285 2026-02-17 cs.DL cs.AI cs.CL cs.LG 81%

FMMD: A multimodal open peer review dataset based on F1000Research

FMMD:基于F1000Research的多模态开放同行评审数据集

Zhenzhen Zhuang, Yuqing Fu, Jing Zhu, Zhangping Zhou, Jialiang Lin

机构 * School of Computer Science and Engineering, Guangzhou Institute of Science and Technology(计算机科学与工程学院,广州科学与技术研究所) College of Foreign Languages and Cultures, Xiamen University(外语学院,厦门大学) Science and Education Evaluation Lab, Guangzhou Institute of Science and Technology(科学与教育评估实验室,广州科学与技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 FMMD是一个基于F1000Research的多模态开放同行评审数据集,旨在通过整合多模态数据和版本特定的评审信息,填补现有数据集在同行评审与稿件演变关系上的空白。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14462 2026-02-17 cs.CV cs.CL 81%

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

RAVENEA:多模态检索增强视觉文化理解的基准

Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, Paul Pu Liang, Yang Deng, Serge Belongie

机构 * University of Copenhagen(哥本哈根大学) ETH Zürich(苏黎世联邦理工学院) University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 RAVENEA通过多模态检索增强方法提升视觉文化理解,验证了文化注释对多模态检索和下游任务的增强效果,并揭示了不同国家间性能差异。

Comments ICLR 2026; Project page: https://jiaangli.github.io/ravenea/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06288 2026-02-17 cs.CV 79%

Unsupervised MR-US Multimodal Image Registration with Multilevel Correlation Pyramidal Optimization

无监督的MR-US多模态图像配准与多级相关金字塔优化

Jiazheng Wang, Zeyu Liu, Min Liu, Xiang Chen, Xinyao Yu, Yaonan Wang, Hang Zhang

机构 * School of Artificial Intelligence and Robotics, Hunan University, Changsha, Hunan, China(人工智能与机器人学院,湖南大学,长沙,湖南,中国) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University, Changsha, Hunan, China(机器人视觉感知与控制技术国家工程研究中心,湖南大学,长沙,湖南,中国) National University of Singapore(新加坡国立大学) Cornell University(康奈尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出基于多级相关金字塔优化的无监督多模态图像配准方法,以解决术前与术中多模态图像的配准问题,实现了在ReMIND2Reg任务中的优异表现。

Comments first-place method of ReMIND2Reg Learn2Reg MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16505 2026-02-17 cs.CV 79%

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

PRISMM-Bench: 一种基于同行评审的多模态不一致基准

Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校) Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 PRISMM-Bench是首个基于同行评审标记的多模态不一致基准,通过整理384个不一致点,设计三个任务评估模型跨模态检测和推理能力,揭示了多模态科学推理的挑战。

Comments Accepted at ICLR 2026. Project page https://da-luggas.github.io/prismm-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23522 2026-02-17 cs.CV cs.LG 79%

OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data

OmniEarth-Bench: 向全面评估地球六大球体及跨球体交互的多模态观测地球数据迈进

Fengxiang Wang, Mingshuo Chen, Xuming He, Yi-Fan Zhang, Yueying Li, Feng Liu, Zijie Guo, Zhenghao Hu, Jiong Wang, Jingyi Xu, Zhangrui Li, Junchao Gong, Di Wang, Fenghua Ling, Ben Fei, Weijia Li, Long Lan, Wenjing Yang

机构 * National University of Defense Technology, China(国防科技大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Beijing University of Posts and Telecommunications, China(北京邮电大学) Zhejiang University, China(浙江大学) Shanghai Jiao Tong University, China(上海交通大学) Fudan University, China(复旦大学) Sun Yat-sen University, China(中山大学) Nanjing University, China(南京大学) University of Science and Technology of China(中国科学技术大学) Wuhan University, China(武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 OmniEarth-Bench是首个全面评估地球六大球体及跨球体交互的多模态基准测试,通过29,855个标准化注释揭示了地球系统认知能力的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09980 2026-02-17 cs.CV cs.RO 79%

V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models

V2V-LLM:基于多模态大语言模型的车与车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Stephen F. Smith, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于多模态大语言模型的V2V-LLM,通过车与车协同感知提升自动驾驶安全性和性能。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vllm.github.io/ Code: https://github.com/eddyhkchiu/V2V-LLM Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏