arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-23 至 2026-02-23 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2602.18006 2026-02-23 cs.CV 79%

MUOT_3M: A 3 Million Frame Multimodal Underwater Benchmark and the MUTrack Tracking Method

MUOT_3M: 300万帧多模态水下基准及MUTrack跟踪方法

Ahsan Baidar Bakht, Mohamad Alansari, Muhayy Ud Din, Muzammal Naseer, Sajid Javed, Irfan Hussain, Jiri Matas, Arif Mahmood

机构 * Khalifa University(卡利法大学) Czech Technical University(捷克技术大学) Information Technology University(信息科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MUOT_3M是首个包含300万帧的多模态水下目标跟踪基准,结合MUTrack方法提升水下跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05826 2026-02-23 cs.HC cs.CV 79%

HaDR: Applying Domain Randomization for Generating Synthetic Multimodal Dataset for Hand Instance Segmentation in Cluttered Industrial Environments

HaDR:利用领域随机化生成合成多模态数据集用于 cluttered 工业环境中的手实例分割

Stefan Grushko, Aleš Vysocký, Jakub Chlebek, Petr Prokop

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 HaDR通过领域随机化生成合成多模态数据集,提升工业环境中手部实例分割的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18083 2026-02-23 cs.CV cs.LG 74%

Comparative Assessment of Multimodal Earth Observation Data for Soil Moisture Estimation

多模态地球观测数据在土壤含水量估计中的比较评估

Ioannis Kontogiorgakis, Athanasios Askitopoulos, Iason Tsardanidis, Dimitrios Bormpoudakis, Ilias Tsoumas, Fotios Balampanis, Charalampos Kontoes

机构 * BEYOND EO Centre, IAASARS, National Observatory of Athens(BEYOND EO中心、IAASARS、雅典国家天文台) Artificial Intelligence, Wageningen University & Research(人工智能,瓦赫宁根大学与研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本研究通过多模态地球观测数据结合机器学习,提出高分辨率土壤含水量估计框架,验证了传统特征工程在稀疏数据回归任务中的有效性。

Comments This paper has been submitted to IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14201 2026-02-23 cs.CV cs.AI 62%

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery

GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Shanghai Jiao Tong University, China(上海交通大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Renmin University of China, China(中国人民大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GeoEyes通过分阶段训练框架,结合冷启动数据集和代理强化学习方法,解决超高清遥感影像中证据获取不足的问题,提升视觉问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13662 2026-02-23 cs.CV cs.AI 62%

LeafNet: A Large-Scale Dataset and Comprehensive Benchmark for Foundational Vision-Language Understanding of Plant Diseases

LeafNet:一个大规模数据集和全面基准,用于植物病害的基础视觉-语言理解

Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Integrative Biology, The University of Texas at Austin(德克萨斯大学奥斯汀分校整合生物学系) Department of Software Engineering, FPT University(FPT大学软件工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LeafNet通过大规模多模态数据集和基准测试,揭示了VLMs在植物疾病理解中的性能差异,强调了多模态架构在提升诊断精度中的关键作用。

Comments 26 pages, 13 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18015 2026-02-23 cs.LG cs.AI 57%

Flow Actor-Critic for Offline Reinforcement Learning

流Actor-Critic用于离线强化学习

Jongseong Chae, Jongeui Park, Yongjae Shin, Gyeongmin Kim, Seungyul Han, Youngchul Sung

机构 * KAIST(韩国科学技术院) UNIST(全南大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出流Actor-Critic方法,通过结合流模型提升离线强化学习中策略的表达能力,以应对复杂多模式数据分布,实现新的性能突破。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17793 2026-02-23 cs.CV eess.IV 57%

LGD-Net: Latent-Guided Dual-Stream Network for HER2 Scoring with Task-Specific Domain Knowledge

LGD-Net:基于任务特定领域知识的HER2评分潜变量引导双流网络

Peide Zhu, Linbin Lu, Zhiqin Chen, Xiong Chen

机构 * School of Mathematics and Statistics, Fujian Normal University(福建师范大学数学与统计学学院) Department of Oncology, Mengchao Hepatobiliary Hospital of Fujian Medical University(福建医科大学 Mengchao 肝胆医院肿瘤科)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 LGD-Net通过跨模态特征幻觉替代显式像素生成,利用任务特定领域知识提升HER2评分的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05208 2026-02-23 eess.IV cs.CV 57%

Context-Aware Asymmetric Ensembling for Interpretable Retinopathy of Prematurity Screening via Active Query and Vascular Attention

具备上下文感知的非对称集成用于通过主动查询和血管注意力的可解释早产视网膜病变筛查

Md. Mehedi Hassan, Taufiq Hasan

机构 * m-Health Lab, Department of Biomedical Engineering, Bangladesh University of Engineering(m-Health实验室,生物医学工程系,孟加拉国工程大学) Center for Bioengineering Innovation(生物工程创新中心) Design, Department of Biomedical Engineering, Johns Hopkins University, Baltimore, MD, USA(设计,生物医学工程系,约翰霍普金斯大学,巴尔的摩,MD,美国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出具备上下文感知的非对称集成模型,通过主动查询和血管注意力技术,实现早产视网膜病变筛查的高准确率和可解释性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17926 2026-02-23 cs.RO 50%

Homotopic information gain for sparse active target tracking

同伦信息增益用于稀疏主动目标跟踪

Jennifer Wakulicz, Ki Myung Brian Lee, Teresa Vidal-Calleja, Robert Fitch

机构 * Australian Centre for Robotics, School of Aerospace, Mechanical and Mechatronic Engineering, University of Sydney(澳大利亚机器人中心,航空航天、机械与机电工程学院,悉尼大学) Department of Electrical and Computer Engineering, UC San Diego(电气与计算机工程系,UC圣地亚哥大学) School of Mechanical and Mechatronics Engineering, University of Technology Sydney(机械与机电工程学院,技术大学悉尼)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出同伦信息增益方法,通过最大化目标高层运动信息实现更高效的稀疏主动目标跟踪。

Comments 12 pages, 12 figures, accepted to Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏