arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-25 至 2025-11-25 共收录 134 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2511.18516 2025-11-25 cs.CV 57%

Breaking Forgetting: Training-Free Few-Shot Class-Incremental Learning via Conditional Diffusion

打破遗忘:通过条件扩散实现无训练的少样本类增量学习

Haidong Kang, Ketong Qian, Yi Lu

机构 * Northeastern University(东北大学) School of Information and Intelligent Science(信息与智能科学学院) Whiting School of Engineering(工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出无训练的少样本类增量学习方法,通过条件扩散过程替代梯度优化,缓解灾难性遗忘并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10353 2025-11-25 cs.CV 57%

Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding

Motion-R1: 通过分解的链式推理与RL绑定增强运动生成

Runqi Ouyang, Haoyun Li, Zhenyuan Zhang, Xiaofeng Wang, Zeyu Zhang, Zheng Zhu, Guan Huang, Sirui Han, Xingang Wang

机构 * GigaAI CASIA HKUST(香港科技大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Motion-R1通过结合分解的链式推理与强化学习,提升运动生成的质量和可解释性,实现多项指标的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03596 2025-11-25 cs.CV 57%

ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning

ControlThinker: 通过视觉推理揭示潜在语义以实现可控图像生成

Feng Han, Yang Jiao, Shaoxiang Chen, Junhao Xu, Jingjing Chen, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center on Intelligent Visual Computing(上海智能视觉计算协同创新中心) MiniMax

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 ControlThinker通过视觉推理挖掘潜在语义,提升可控图像生成的语义一致性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03931 2025-11-25 cs.CV 57%

MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers

MagicMirror: 视频扩散变换器中的身份保留视频生成

Yuechen Zhang, Yaoyang Liu, Bin Xia, Bohao Peng, Zexin Yan, Eric Lo, Jiaya Jia

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。

Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 32 篇

2511.17909 2025-11-25 cs.AI 85%

ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry

ChemVTS-Bench: 评估多模态大语言模型在化学中的视觉-文本-符号推理能力

Zhiyuan Huang, Baichuan Yang, Zikun He, Yanhong Wu, Fang Hongyu, Zhenhe Liu, Lin Dongsheng, Bing Su

机构 * Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) South China University of Technology(华南理工大学) Gaotu Techedu Inc(高图科技公司)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 ChemVTS-Bench通过多模态输入评估大语言模型在化学中的视觉-文本-符号推理能力,揭示了结构化学的挑战及多模态融合的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19199 2025-11-25 cs.CV cs.AI cs.LG 84%

CLASH: A Benchmark for Cross-Modal Contradiction Detection

CLASH:跨模态矛盾检测的基准

Teodora Popordanoska, Jiameng Li, Matthew B. Blaschko

机构 * ESAT-PSI, KU Leuven(ESAT-PSI,根特大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CLASH是一个用于评估跨模态矛盾检测的新型基准,通过包含矛盾描述的图像和问题,揭示现有模型在识别跨模态冲突方面的局限性,并通过针对性微调提升检测能力。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18385 2025-11-25 cs.CV cs.AI 84%

Can a Second-View Image Be a Language? Geometric and Semantic Cross-Modal Reasoning for X-ray Prohibited Item Detection

第二视角图像可以成为一种语言吗?用于X射线禁止物品检测的几何和语义跨模态推理

Chuang Peng, Renshuai Tao, Zhongwei Ren, Xianglong Liu, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) State Key Laboratory of Complex & Critical Software Environment, Beihang University(北航复杂与关键软件环境国家重点实验室)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GSR模型,通过几何与语义跨模态推理,利用双视角图像作为语言模态,提升X射线禁止物品检测的准确性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15165 2025-11-25 cs.CR cs.AI 83%

Can MLLMs Detect Phishing? A Comprehensive Security Benchmark Suite Focusing on Dynamic Threats and Multimodal Evaluation in Academic Environments

MLLMs能否检测钓鱼?一个全面的安全基准套件,聚焦于动态威胁和学术环境中的多模态评估

Jingzhuo Zhou

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出AdapT-Bench,一个针对学术环境动态钓鱼攻击的多模态安全基准套件,旨在评估MLLM的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18874 2025-11-25 cs.AI cs.CV cs.LG cs.MA cs.RO cs.SI 81%

GContextFormer: A global context-aware hybrid multi-head attention approach with scaled additive aggregation for multimodal trajectory prediction

GContextFormer: 一种基于全局上下文的混合多头注意力方法,通过缩放加法聚合实现多模态轨迹预测

Yuzhi Chen, Yuanchang Xie, Lei Zhao, Pan Liu, Yajie Zou, Chen Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GContextFormer通过全局上下文感知的混合多头注意力和缩放加法聚合,实现无地图依赖的多模态轨迹预测,提升鲁棒性和预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17576 2025-11-25 cs.CV cs.AI cs.LG 81%

Multimodal AI for Body Fat Estimation: Computer Vision and Anthropometry with DEXA Benchmarks

多模态AI用于脂肪率估计:计算机视觉与体态测量结合DEXA基准测试

Rayan Aldajani

机构 * Dept. of Electrical Engineering and Computer Science(电气工程与计算机科学系) York University(约克大学) Toronto, Canada(加拿大多伦多)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出利用多模态AI结合计算机视觉和体态测量数据,通过DEXA基准测试验证了低成本脂肪率估计方法的有效性。

Comments 2 pages, 2 figures, accepted at IEEE CASCON 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18902 2025-11-25 cs.LG cs.AI 79%

VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL

VADE:基于在线样本级难度估计的方差感知动态采样用于多模态强化学习

Zengjie Hu, Jiantao Qiu, Tianyi Bai, Haojin Yang, Binhang Yuan, Qi Jing, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) HKUST(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 VADE通过在线样本级难度估计实现方差感知动态采样,提升多模态强化学习的性能与样本效率,减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 79%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18399 2025-11-25 cs.CV 79%

ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering

ChineseVideoBench: 多模态大模型在中文视频问答中的基准测试

Yuxiang Nie, Han Wang, Yongjie Ye, Haiyang Yu, Weitao Jia, Tao Zeng, Hao Feng, Xiang Fei, Yang Li, Xiaohui Lv, Guozhi Tang, Jingqun Tang, Jinghui Lu, Zehui Dai, Jiacong Wang, Dingkang Yang, An-Lan Wang, Can Huang

机构 * Bytedance Inc.(字节跳动公司)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 ChineseVideoBench通过提供中文视频问答的基准测试,评估多模态大语言模型的性能,揭示了当前模型在复杂中文视频内容上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18208 2025-11-25 cs.CV 79%

Large-Scale Pre-training Enables Multimodal AI Differentiation of Radiation Necrosis from Brain Metastasis Progression on Routine MRI

大规模预训练使多模态AI能够区分放射性坏死与脑转移瘤进展的常规MRI

Ahmed Gomaa, Annette Schwarz, Ludwig Singer, Arnd Dörfler, Matthias Stefan May, Pluvio Stephan, Ishita Sheth, Juliane Szkitsak, Katharina Breininger, Yixing Huang, Benjamin Frey, Oliver Schnell, Daniel Delev, Roland Coras, Daniel Höfler, Philipp Schubert, Jenny Stritzelberger, Sabine Semrau, Andreas Maier, Dieter H Heiland, Udo S. Gaipl, Andrea Wittig, Rainer Fietkau, Christoph Bert, Stefanie Corradini, Florian Putz

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究通过大规模预训练和多模态深度学习策略,利用常规MRI区分放射性坏死与肿瘤进展,实现高准确率的可解释AI解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17635 2025-11-25 cs.CV cs.LG 79%

Upstream Probabilistic Meta-Imputation for Multimodal Pediatric Pancreatitis Classification

上游概率元填补用于多模态儿童胰腺炎分类

Max A. Nelson, Elif Keles, Eminenur Sen Tasci, Merve Yazol, Halil Ertugrul Aktas, Ziliang Hong, Andrea Mia Bejar, Gorkem Durak, Oznur Leman Boyunaga, Ulas Bagci

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出UPMI方法,通过元特征空间中的概率元填补提升多模态儿童胰腺炎分类性能,实现AUC提升5%。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07852 2025-11-25 cs.AI 79%

FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning

FinMR:面向高级金融推理的知识密集型多模态基准

Shuangyan Deng, Haizhou Peng, Jiachen Xu, Rui Mao, Ciprian Doru Giurcăneanu, Jiamou Liu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 FinMR是一个面向高级金融推理的知识密集型多模态基准,通过精心设计的问题-答案对和多样化的金融主题,评估专业分析师级别的金融推理能力。

Comments The methodology section contains inaccuracies that may lead to misleading interpretations. The authors have withdrawn this version for correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06908 2025-11-25 cs.CV cs.AI 79%

Find Them All: Unveiling MLLMs for Versatile Person Re-identification

找到它们全部:揭示MLLMs用于多功能人物重识别

Jinhao Li, Zijian Chen, Lirong Deng, Guangtao Zhai, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究所) Macao Polytechnic University(澳门 polytechnic 大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VP-ReID基准,利用MLLMs提升人物重识别的多功能性和有效性,同时揭示其在处理某些模态时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18477 2025-11-25 astro-ph.IM astro-ph.SR 78%

A Deep Multimodal Multi--Head Neural Network for Joint Estimation of Stellar Age, Lifetime, and Evolutionary Stage

一种深度多模态多头神经网络用于恒星年龄、寿命和演化的联合估计

Jing Rou Puah, Sasa Arsovski

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种深度多模态多头神经网络,用于联合估计恒星年龄、寿命和演化阶段,通过结合光谱和光度数据,提高了恒星参数估计的精度和物理合理性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18320 2025-11-25 physics.med-ph physics.bio-ph physics.optics 78%

Comprehensive Multimodal and Multiscale Analysis of Alzheimer Disease in 5xFAD Mice: Optical Spectroscopies, TEM, Neuropathological, and Behavioral Investigations

5xFAD小鼠阿尔茨海默病的综合多模态和多尺度分析:光学光谱学、TEM、神经病理学和行为研究

Dhruvil Solanki, Ishmael Apachigawo, Sazzad Khan, Santanu Maity, Fatemah Alharthi, Samia Nasim, Mohammad Alizadeh Poshtiri, Fnu Sweety, Jiangfeng Xiao, Mohammad Moshahid Khan, Prabhakar Pradhan

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文通过多模态和多尺度分析,利用光谱学、TEM、神经病理学和行为研究,揭示了5xFAD小鼠中阿尔茨海默病的早期生物标志物和病理机制。

Comments 27 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17675 2025-11-25 cs.LG quant-ph 78%

Lane-Frame Quantum Multimodal Driving Forecasts for the Trajectory of Autonomous Vehicles

车道框架量子多模态轨迹预测用于自动驾驶车辆轨迹

Navneet Singh, Shiva Raj Pokhrel

机构 * IoT & Software Engineering Research Lab, School of Information Technology, Deakin University(物联网与软件工程研究实验室,信息科技学院,德金大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract)

AI总结 本文提出基于量子架构的车道框架多模态轨迹预测方法,在自动驾驶基准中实现高精度轨迹预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08438 2025-11-25 cs.CL cs.MM cs.SD eess.AS 67%

CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework

CommonVoice-SpeechRE 和 RPG-MoGe:通过新数据集和多阶生成框架推进语音关系抽取

Jinzhong Ning, Paerhati Tulajiang, Yingying Le, Yijia Zhang, Yuanyuan Sun, Hongfei Lin, Haifeng Liu

机构 * School of Information Science and Technology, Dalian Maritime University(信息科学与技术学院,大连海事大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学) College of Computer Science and Technology, Xinjiang Normal University(计算机科学与技术学院,新疆师范大学) School of Computer and Electronic Information, Nanjing Normal University(计算机与电子信息学院,南京师范大学) Adolescent Education and Intelligence Support Lab of Nanjing Normal University, Laboratory of Philosophy and Social Sciences at Universities in Jiangsu Province(南京师范大学青少年教育与智能支持实验室,江苏省高校哲学社会科学实验室)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL、cs.MM、eess.AS

AI总结 本文提出CommonVoice-SpeechRE数据集和RPG-MoGe框架,通过多阶生成策略提升语音关系抽取的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18434 2025-11-25 cs.CV cs.AI 62%

DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation

DocPTBench: 用于照片文档解析与翻译的基准测试

Yongkun Du, Pinxuan Chen, Xuye Ying, Zhineng Chen

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Institute of Trustworthy Embodied AI(可信具身人工智能研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DocPTBench是一个针对真实拍摄文档解析与翻译的基准测试,揭示了从数字生成文档到真实拍摄文档的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17962 2025-11-25 cs.CV cs.AI 62%

VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment

VITAL:面向视觉质量评估的LMMs视觉编码器预训练

Ziheng Jia, Linhan Cao, Jinliang Han, Zicheng Zhang, Jiaying Qian, Jiarui Wang, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 VITAL提出了一种以视觉编码器为中心的生成预训练流程,通过构建大规模训练数据集和多任务训练流程,提升了视觉质量评估LMMs的通用性和可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17881 2025-11-25 cs.CV cs.AI 62%

MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use

MGA-VQA:具有记忆引导保护的图增强视觉问答系统,以防止未经授权的知识使用

Ahmad Mohammadshirazi, Pinaki Prasad Guha Neogi, Dheeraj Kulshrestha, Rajiv Ramnath

机构 * Ohio State University(俄亥俄州立大学) Flairsoft(Flairsoft公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MGA-VQA通过整合图增强推理和记忆引导机制,实现了更安全且可解释的文档视觉问答系统,提升了准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11025 2025-11-25 cs.CV cs.AI 62%

AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning

AirCopBench: 多无人机协作具身感知与推理的基准测试

Jirong Zha, Yuxuan Fan, Tianyu Zhang, Geng Chen, Yingfeng Chen, Chen Gao, Xinlei Chen

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 AirCopBench是一个针对多无人机协作具身感知与推理的首个全面基准测试,通过模拟与现实数据生成14600+问题,评估MLLMs在复杂协作场景中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 62%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19134 2025-11-25 cs.CV 57%

MambaRefine-YOLO: A Dual-Modality Small Object Detector for UAV Imagery

MambaRefine-YOLO: 一种双模态小目标检测器用于无人机图像

Shuyu Cao, Minxin Chen, Yucheng Song, Zhaozhong Chen, Xinyou Zhang

机构 * SWJTU-Leeds Joint School, Southwest Jiaotong University(西南交通大学-利兹联合学院,西南交通大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 MambaRefine-YOLO通过双模态融合和分层特征聚合提升无人机图像中小目标检测的精度与效率。

Comments Submitted to IEEE Geoscience and Remote Sensing Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18827 2025-11-25 cs.CV 57%

Leveraging Metaheuristic Approaches to Improve Deep Learning Systems for Anxiety Disorder Detection

利用元启发式方法改进深度学习系统以检测焦虑障碍

Mohammadreza Amiri, Monireh Hosseini

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出结合元启发式优化与深度学习的混合模型,用于更准确地检测焦虑障碍。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18448 2025-11-25 cs.CV 57%

EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs

EventBench: 向事件驱动的大语言模型全面评估迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 EventBench通过八个任务指标和大规模数据集全面评估事件驱动MLLMs的能力,揭示其在细粒度识别和空间推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17755 2025-11-25 cs.CV 57%

CORA: Consistency-Guided Semi-Supervised Framework for Reasoning Segmentation

CORA: 一致性引导的半监督框架用于推理分割

Prantik Howlader, Hoang Nguyen-Canh, Srijan Das, Jingyi Xu, Hieu Le, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CORA通过一致性引导的半监督方法实现高效推理分割,在Cityscapes和PanNuke数据集上分别提升2.3%和2.4%

Comments WACV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏