arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-06 至 2026-01-06 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 8 篇

2601.01870 2026-01-06 cs.CV 57%

Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion

实体引导的多任务学习用于红外和可见图像融合

Wenyu Shao, Hongbo Liu, Yunchuan Ma, Ruili Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 6 篇

2508.10294 2026-01-06 cs.CV 83%

A Mutual-Structure Weighted Sub-Pixel Multimodal Optical Remote Sensing Image Matching Method

一种互结构加权的子像素多模光学遥感图像匹配方法

Tao Huang, Hongbo Pan, Nanxi Zhou, Siyuan Zou, Shun Zhou

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于相位一致性互结构加权的子像素多模光学遥感图像匹配方法,通过粗到细的框架提升匹配精度,实测平均精度达0.4像素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01424 2026-01-06 cs.LG q-bio.NC 67%

Unveiling the Heart-Brain Connection: An Analysis of ECG in Cognitive Performance

揭示心脑联系:对认知表现中ECG的分析

Akshay Sasi, Malavika Pradeep, Nusaibah Farrukh, Rahul Venugopal, Elizabeth Sherly

机构 * Digital University Kerala(数字大学凯拉尔) Centre for Consciousness Studies, NIMHANS(意识研究中心,NIMHANS)

专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文通过ECG信号分析认知负荷,提出跨模态XGBoost框架实现EEG代表性认知空间投影,验证ECG在日常认知监测中的可行性。

Comments 6 pages, 6 figures. Code available at https://github.com/AkshaySasi/Unveiling-the-Heart-Brain-Connection-An-Analysis-of-ECG-in-Cognitive-Performance. Presented at AIHC (not published)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17607 2026-01-06 cs.CV cs.CL cs.LG 62%

Robustness of Structured Data Extraction from Perspectively Distorted Documents

从透视变形文档中提取结构化数据的鲁棒性

Hyakka Nakada, Yoshiyasu Tanaka

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究探讨了透视变形对多模态LLMs提取文档数据准确性的影响,发现结构识别准确性显著下降,但可通过旋转校正提升。

Comments 8 pages, 12 figures

Journal ref 2025 10th International Conference on Intelligent Informatics and Biomedical Sciences (ICIIBMS), Okinawa, Japan, 2025, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02201 2026-01-06 cs.LG cs.CV 57%

CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents

CORE: 基于代码的逆向自训练框架与图扩展用于虚拟代理

Keyu Wang, Bingchen Miao, Wendong Bu, Yu Wu, Juncheng Li, Shengyu Zhang, Wenqiao Zhang, Siliang Tang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 CORE提出一种基于代码的逆向自训练框架,通过语义代码抽象和策略图扩展,提升虚拟代理的行为多样性和泛化能力。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01526 2026-01-06 cs.CV 57%

BARE: Towards Bias-Aware and Reasoning-Enhanced One-Tower Visual Grounding

BARE:面向偏见意识和推理增强的单塔视觉定位

Hongbing Li, Linhui Xiao, Zihan Zhao, Qi Shen, Yixiang Huang, Bo Xiao, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Pengcheng Laboratory(鹏城实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 BARE通过引入三个新模块,提升单塔视觉定位任务中对偏见的意识和推理能力,实现更高效和准确的多模态理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16262 2026-01-06 cs.RO cs.CV 57%

How Robot Dogs See the Unseeable: Improving Visual Interpretability via Peering for Exploratory Robots

机器人如何看见不可见之物:通过窥视提升探索机器人视觉可解释性

Oliver Bimber, Karl Dietrich von Ellenrieder, Michael Haller, Rakesh John Amala Arokia Nathan, Gianni Lunardi, Mohamed Youssef, Marco Camurri, Santos Miguel Orozco Soto, Jeremy E. Niven

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 通过模仿昆虫的窥视动作,提升探索机器人在部分遮挡下的视觉推理能力,实现高分辨率、实时感知,适用于复杂环境导航与场景理解。

详情

展开后加载摘要…

URL PDF HTML 收藏