arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-26 至 2025-11-26 共收录 87 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2511.20227 2025-11-26 cs.IR 50%

HKRAG: Holistic Knowledge Retrieval-Augmented Generation Over Visually-Rich Documents

HKRAG:面向视觉丰富文档的综合知识检索增强生成

Anyang Tong, Xiang Niu, ZhiPing Liu, Chang Tian, Yanyan Wei, Zenglin Shi, Meng Wang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 HKRAG通过综合检索和生成机制,提升视觉丰富文档中显著与细节知识的检索与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 8 篇

2511.20520 2025-11-26 cs.CV 83%

HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation

HBridge: 通过非对称H形架构桥接异构专家以实现统一的多模态理解和生成

Xiang Wang, Zhifei Zhang, He Zhang, Zhe Lin, Yuqian Zhou, Qing Liu, Shiwei Zhang, Yijun Li, Shaoteng Liu, Haitian Zheng, Jason Kuen, Yuehuan Wang, Changxin Gao, Nong Sang

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 HBridge通过非对称H形架构,优化异构专家的模态先验利用,提升多模态生成效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18428 2025-11-26 cs.AI cs.CL 81%

Multi-Modal Data Exploration via Language Agents

通过语言代理进行多模态数据探索

Farhad Nooralahzadeh, Yi Zhang, Jonathan Furst, Kurt Stockinger

机构 * Zurich University of Applied Sciences(瑞士应用科学大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出M$^2$EX系统,通过语言代理实现多模态数据探索,优于现有系统在准确性和性能指标上

Comments Accepted to the IJCNLP AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14993 2025-11-26 cs.AI cs.CV 81%

Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification

多模态生成式AI:多模态大语言模型、扩散模型与统一

Xin Wang, Yuwei Zhou, Bin Huang, Hong Chen, Wenwu Zhu

机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。

Comments 21 pages, 10 figures, 3 tables

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18685 2025-11-26 cs.CL 79%

From Generation to Detection: A Multimodal Multi-Task Dataset for Benchmarking Health Misinformation

从生成到检测:一个多模态多任务数据集用于基准测试健康误信息

Zhihao Zhang, Yiran Zhang, Xiyue Zhou, Liting Huang, Imran Razzak, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) University of Sydney(悉尼大学) UTS(UTS大学) MBZUAI

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MM Health数据集,包含人类和AI生成的多模态健康误信息,用于基准测试可靠性检查、原创性检查和细粒度AI检测。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pp. 24245-24260, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19835 2025-11-26 cs.CV cs.AI 62%

Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation

校正SpaAttn:重新审视注意力稀疏性以实现高效的视频生成

Xuewen Liu, Zhikai Li, Jing Zhang, Mengjuan Chen, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Rectified SpaAttn,通过校正注意力分配提升视频生成效率,实现显著速度提升且保持生成质量。

Comments Code at https://github.com/BienLuky/Rectified-SpaAttn

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06250 2025-11-26 cs.CV cs.AI cs.HC 62%

Generative AI for Cel-Animation: A Survey

生成式AI用于动画:一种调查

Yolo Y. Tang, Junjia Guo, Pinxin Liu, Zhiyuan Wang, Hang Hua, Jia-Xing Zhong, Yunzhong Xiao, Chao Huang, Luchuan Song, Susan Liang, Yizhi Song, Liu He, Jing Bi, Mingqian Feng, Xinyang Li, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) UCSB University of Oxford(牛津大学) CMU(卡内基梅隆大学) Purdue University(普渡大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文调查生成式AI如何通过自动化任务革新传统动画流程,降低技术门槛,扩大创作者群体,并促进艺术创新。

Comments Accepted by ICCV 2025 AISTORY Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20280 2025-11-26 cs.CV 57%

Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement

通过VLM引导的迭代自优化提升物理导向的视频生成

Yang Liu, Xilin Zhao, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。

Comments ICCV 2025 Physics-IQ Challenge Third Place Solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16655 2025-11-26 cs.CV 57%

MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence

MovieDreamer:用于生成连贯长视觉序列的分层生成

Canyu Zhao, Mingyu Liu, Wen Wang, Weihua Chen, Fan Wang, Hao Chen, Bo Zhang, Chunhua Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。

Comments 30 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 20 篇

2511.20422 2025-11-26 cs.AI cs.CV cs.GR cs.RO 84%

VibraVerse: A Large-Scale Geometry-Acoustics Alignment Dataset for Physically-Consistent Multimodal Learning

VibraVerse: 一个大规模的几何-声学对齐数据集,用于物理一致的多模态学习

Bo Pang, Chenxi Xu, Jierui Ren, Guoping Wang, Sheng Li

机构 * Peking University(北京大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 VibraVerse通过构建几何-声学对齐数据集,实现了物理一致的多模态学习,支持几何到声音预测、声音引导的形状重建等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 83%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19537 2025-11-26 cs.CV cs.AI cs.LG eess.IV 81%

Cross-Domain Generalization of Multimodal LLMs for Global Photovoltaic Assessment

多领域泛化用于全球光伏评估的多模态大语言模型

Muhao Guo, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出利用多模态大语言模型实现跨领域泛化,用于全球光伏评估,通过结构化提示和微调在统一框架内整合检测、定位和量化,优于传统CV和Transformer基线。

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19470 2025-11-26 cs.LG cs.AI cs.CL 81%

Quantifying Modality Contributions via Disentangling Multimodal Representations

通过解构多模态表示量化模态贡献

Padegal Amit, Omkar Mahesh Kashyap, Namitha Rayasam, Nidhi Shekhar, Surabhi Narayan

机构 * PES University(PES大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于部分信息分解的框架,通过分解多模态表示中的预测信息,量化各模态的贡献,提供更清晰的多模态行为分析。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19830 2025-11-26 cs.DB cs.AI 79%

Beyond Relational: Semantic-Aware Multi-Modal Analytics with LLM-Native Query Optimization

超越关系:基于语义的多模态分析与LLM原生查询优化

Junhao Zhu, Lu Chen, Xiangyu Ke, Ziquan Fang, Tianyi Li, Yunjun Gao, Christian S. Jensen

机构 * Zhejiang University(浙江大学) Aalborg University(奥胡斯大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 Nirvana通过结合可编程语义运算符和LLM原生查询优化,实现多模态数据分析,显著提升效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19667 2025-11-26 cs.CV 79%

OncoVision: Integrating Mammography and Clinical Data through Attention-Driven Multimodal AI for Enhanced Breast Cancer Diagnosis

OncoVision:通过注意力驱动的多模态AI整合乳腺X线和临床数据以提升乳腺癌诊断

Istiak Ahmed, Galib Ahmed, K. Shahriar Sanjid, Md. Tanzim Hossain, Md. Nishan Khan, Md. Misbah Khan, Md. Arifur Rahman, Sheikh Anisul Haque, Sharmin Akhtar Rupa, Mohammed Mejbahuddin Mia, Mahmud Hasan Mostofa Kamal, Md. Mostafa Kamal Sarker, M. Monir Uddin

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 OncoVision通过注意力驱动的多模态AI整合乳腺X线和临床数据,提升乳腺癌诊断的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10068 2025-11-26 cs.CV 79%

Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning

基于多随机掩码自编码器的概率超图用于半监督多模态多任务学习

Pîrvu Mihai-Cristian, Marius Leordeanu

机构 * Faculty of Automatic Control and Computer Science, Politehnica University of Bucharest(自动化控制与计算机科学系,布加勒斯特理工大学) Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出PHG-MAE模型,结合神经图和掩码自编码器,通过随机掩码多模态数据提升多任务学习性能,并公开了相关工具和数据集。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15509 2025-11-26 eess.IV 78%

Multimodal Optical Imaging Platform for Quantitative Burn Assessment

多模光学成像平台用于定量烧伤评估

Nathaniel Hanson, Mateusz Wolak, Jonathan Richardson, Patrick Walker, David M. Burmeister, Chakameh Jafari

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种多模光学成像平台,结合高光谱成像与激光散斑成像,用于快速准确评估烧伤严重程度,适用于战场等恶劣环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV 77%

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15947 2025-11-26 q-bio.QM cs.LG 71%

Mamba-based Deep Learning Approach for Sleep Staging on a Wireless Multimodal Wearable System without Electroencephalography

基于Mamba的深度学习方法用于无线多模态可穿戴系统中的睡眠分期(无脑电图)

Andrew H. Zhang, Alex He-Mo, Richard Fei Yin, Chunlin Li, Yuzhi Tang, Dharmendra Gurve, Veronique van der Horst, Aron S. Buchman, Nasim Montazeri Ghahjaverestan, Maged Goubran, Bo Wang, Andrew S. P. Lim

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出基于Mamba的深度学习方法,用于无脑电图的无线多模态可穿戴系统中实现睡眠分期,通过整合多种生物信号提升睡眠阶段识别的准确性。

Comments 40 pages, 24 figures. Authors Andrew H. Zhang, Alex He-Mo, and Richard Fei Yin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19988 2025-11-26 cs.CV 70%

GazeProphetV2: Head-Movement-Based Gaze Prediction Enabling Efficient Foveated Rendering on Mobile VR

GazeProphetV2:基于头部运动的注视预测,实现移动VR中的高效视网膜渲染

Farhaan Ebadulla, Chiraag Mudlpaur, Shreya Chaurasia, Gaurav BV

机构 * PES University(PES大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 GazeProphetV2通过结合头部运动和视觉信息,提升移动VR中的注视预测准确性,为高效视网膜渲染和用户体验优化提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20650 2025-11-26 cs.CV cs.AI 62%

MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities

MedROV:面向跨多种医学影像模态的实时开放词汇检测

Tooba Tehreem Sheikh, Jean Lahoud, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MedROV是首个实时开放词汇医学影像检测模型,通过大规模数据集和伪标签策略提升检测性能,实现40 mAP50的提升并达到70 FPS的实时处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20116 2025-11-26 cs.CV cs.AI 62%

LungEvaty: A Scalable, Open-Source Transformer-based Deep Learning Model for Lung Cancer Risk Prediction in LDCT Screening

LungEvaty: 一种可扩展、开源的基于Transformer的深度学习模型,用于LDCT筛查中的肺癌风险预测

Johannes Brandt, Maulik Chevli, Rickmer Braren, Georgios Kaissis, Philip Müller, Daniel Rueckert

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) TUM University Hospital(慕尼黑技术大学医院) Imperial College London(伦敦帝国学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LungEvaty是一种基于Transformer的深度学习模型,利用LDCT扫描预测肺癌风险,通过全肺输入和解剖学指导注意力实现高效且准确的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19684 2025-11-26 cs.CV cs.AI cs.HC cs.RO 62%

IndEgo: A Dataset of Industrial Scenarios and Collaborative Work for Egocentric Assistants

IndEgo:工业场景及协作工作的人际助理数据集

Vivek Chavan, Yasmina Imgrund, Tung Dao, Sanwantri Bai, Bosong Wang, Ze Lu, Oliver Heimann, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫研究所) Technical University of Berlin(柏林技术大学) University of Tübingen(图宾根大学) RWTH Aachen University(亚琛工业大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 IndEgo数据集旨在通过工业场景中的协作工作提升人机交互助理的多模态理解与错误检测能力。

Comments Accepted to NeurIPS 2025 D&B Track. Project Page: https://indego-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10979 2025-11-26 cs.CV cs.AI 62%

VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?

VidComposition: MLLMs能否分析编译视频中的构成?

Yolo Y. Tang, Junjia Guo, Hang Hua, Susan Liang, Mingqian Feng, Xinyang Li, Rui Mao, Chao Huang, Jing Bi, Zeliang Zhang, Pooyan Fazli, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VidComposition通过编排视频和电影级注释评估MLLMs对视频构成的理解能力,揭示了当前模型在复杂编译视频分析中的局限性。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20573 2025-11-26 cs.CV 57%

VQ-VA World: Towards High-Quality Visual Question-Visual Answering

VQ-VA世界:迈向高质量的视觉问题-视觉回答

Chenhui Gou, Zilong Chen, Zeyu Wang, Feng Li, Deyao Zhu, Zicheng Duan, Kunchang Li, Chaorui Deng, Hongyi Yuan, Haoqi Fan, Cihang Xie, Jianfei Cai, Hamid Rezatofighi

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20169 2025-11-26 cs.CV 57%

ADNet: A Large-Scale and Extensible Multi-Domain Benchmark for Anomaly Detection Across 380 Real-World Categories

ADNet: 一个大规模且可扩展的多领域异常检测基准,涵盖380个现实世界类别

Hai Ling, Jia Guo, Zhulin Tao, Yunkang Cao, Donglin Di, Hongyan Xu, Xiu Su, Yang Song, Lei Fan

机构 * Communication University of China(中国通信大学) DZ Matrix(DZ矩阵) Tsinghua University(清华大学) Hunan University(湖南大学) Central South University(中南大学) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ADNet是一个大规模多领域异常检测基准,涵盖380个现实世界类别,通过多模态数据支持异常检测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10007 2025-11-26 cs.AI 57%

Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning

深度隐式认知促进可靠推理链推理

Zijun Chen, Wenbo Hu, Richang Hong

机构 * Zijun Chen, Wenbo Hu, Richang Hong Corresponding Author(对应作者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用模型内在真实性编码提升CoT推理的可靠性,通过置信度预测器和束搜索优化推理路径,显著提高数学、符号和常识推理任务的准确性和可靠性。

Comments This paper has been accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16383 2025-11-26 cs.CL 57%

Large Language Models in Argument Mining: A Survey

大型语言模型在论证挖掘中的应用:综述

Hao Li, Viktor Schlegel, Yizheng Sun, Riza Batista-Navarro, Goran Nenadic

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型对论证挖掘领域的影响,分析了LLM如何改变任务设计、数据集构建和评估方法,并提出了未来研究方向。

Comments Work draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20426 2025-11-26 cs.CV 57%

MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准

Yolo Y. Tang, Pinxin Liu, Zhangyun Tan, Mingqian Feng, Rui Mao, Chao Huang, Jing Bi, Yunzhong Xiao, Susan Liang, Hang Hua, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。

Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态Agent 10 篇

2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏