arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-22 至 2026-01-22 共收录 48 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2601.15016 2026-01-22 cs.CV 70%

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

LiViBench:面向交互式直播视频理解的多模态基准测试

Xiaodong Wang, Langling Huang, Zhirong Wu, Xu Zhao, Teng Xu, Xuhong Xia, Peixi Peng

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。

Comments AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15129 2026-01-22 cs.CL 57%

RSNA Large Language Model Benchmark Dataset for Chest Radiographs of Cardiothoracic Disease: Radiologist Evaluation and Validation Enhanced by AI Labels (REVEAL-CXR)

用于心胸疾病胸部X光影像的RSNA大语言模型基准数据集:通过AI标签增强的放射科评估和验证(REVEAL-CXR)

Yishu Wei, Adam E. Flanders, Errol Colak, John Mongan, Luciano M Prevedello, Po-Hao Chen, Henrique Min Ho Lee, Gilberto Szarf, Hamilton Shoji, Jason Sho, Katherine Andriole, Tessa Cook, Lisa C. Adams, Linda C. Chu, Maggie Chung, Geraldine Brusca-Augello, Djeven P. Deva, Navneet Singh, Felipe Sanchez Tijmes, Jeffrey B. Alpert, Elsie T. Nguyen, Drew A. Torigian, Kate Hanneman, Lauren K Groner, Alexander Phan, Ali Islam, Matias F. Callejas, Gustavo Borges da Silva Teles, Faisal Jamal, Maryam Vazirabad, Ali Tejani, Hari Trivedi, Paulo Kuriki, Rajesh Bhayana, Elana T. Benishay, Yi Lin, Yifan Peng, George Shih

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本研究通过AI辅助标注流程,创建了包含200张胸部影像的基准数据集,用于评估不同模型,同时帮助放射科医生更高效地标注影像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14978 2026-01-22 cs.CV 57%

Unified Multi-Dataset Training for TBPS

多数据集统一训练用于TBPS

Nilanjana Chatterjee, Sidharatha Garg, A V Subramanyam, Brejesh Lall

机构 * IIIT Delhi(德里印度理工学院) IIT Delhi(德里理工学院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 本文提出Scale-TBPS方法,通过统一数据集编纂和可扩展身份学习框架,在多个数据集上训练出单一TBPS模型,提升了行人检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14672 2026-01-22 cs.NE cs.AI 57%

GEGO: A Hybrid Golden Eagle and Genetic Optimization Algorithm for Efficient Hyperparameter Tuning in Resource-Constrained Environments

GEGO:一种融合黄金鹰和遗传优化算法的混合算法,用于资源受限环境中的高效超参数调优

Amaras Nazarians, Sachin Kumar

机构 * Sonia Akian College of Science and Engineering(索尼亚·阿基安科学与工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 GEGO通过融合黄金鹰优化与遗传算法,实现了在资源受限环境下高效超参数调优,提升了搜索的多样性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13753 2026-01-22 eess.SY cs.SY 50%

Research on Adaptive Inertial Control in Synchronization Systems: Based on Variational Optimization Methods and Their Applications in the Stability of Complex Networks

复杂网络同步系统中自适应惯性控制的研究:基于变分优化方法及其在复杂网络稳定性中的应用

Yiwei Zhou, Zhongcheng Lei, Xiaoran Dai, Wenshan Hu, Hong Zhou

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出基于变分优化的自适应惯性控制策略,用于提升复杂网络同步系统的稳定性与控制精度。

Comments 36 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09516 2026-01-22 stat.ME cs.LG stat.AP 50%

Depth-Based Local Center Clustering: A Framework for Handling Different Clustering Scenarios

基于深度的局部中心聚类:一种处理不同聚类场景的框架

Siyi Wang, Alexandre Leblanc, Paul D. McNicholas

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出基于深度的局部中心聚类方法,通过局部数据深度识别多模态数据的局部中心和非凸聚类,提升聚类分析的灵活性和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 1 篇

2601.11833 2026-01-22 q-bio.QM cs.CV cs.LG eess.IV 57%

Karhunen-Loève Expansion-Based Residual Anomaly Map for Resource-Efficient Glioma MRI Segmentation

基于Karhunen-Loève展开的残差异常图用于资源高效的胶质瘤MRI分割

Anthony Hur

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于KLE的残差异常图方法,实现资源高效的胶质瘤MRI分割,显著提升性能并降低计算与数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 7 篇

2407.19030 2026-01-22 stat.ME math.ST stat.TH 86%

Multimodal data integration and cross-modal querying via orchestrated approximate message passing

多模态数据整合与跨模态查询 via 协调近似消息传递

Sagnik Nandy, Zongming Ma

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title)

AI总结 本文提出了一种协调近似消息传递算法,用于多模态数据整合与跨模态查询,通过统计最优信号恢复和渐近有效的预测集构建,提升单细胞数据的分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14274 2026-01-22 cs.LG cs.AI 83%

Divide and Refine: Enhancing Multimodal Representation and Explainability for Emotion Recognition in Conversation

分割与精炼:提升对话中情感识别的多模态表示与可解释性

Anh-Tuan Mai, Cam-Van Thi Nguyen, Duc-Trong Le

机构 * VNU University of Engineering and Technology(越南工程大学) FPT Software AI Center(FPT软件人工智能中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出DnR框架,通过分割和精炼多模态表示提升对话中情感识别的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14448 2026-01-22 cs.CV 79%

Gaussian Based Adaptive Multi-Modal 3D Semantic Occupancy Prediction

基于高斯的自适应多模态3D语义占位预测

A. Enes Doruk

机构 * Abdullah Enes Doruk (2025)(Abdullah Enes Doruk)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于高斯的自适应多模态3D语义占位预测模型,通过高效3D高斯模型融合相机与激光雷达数据,提升自动驾驶安全性能。

Comments Master Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14942 2026-01-22 cs.LG eess.SP 78%

Communication-Efficient Multi-Modal Edge Inference via Uncertainty-Aware Distributed Learning

通过不确定性感知的分布式学习实现高效的多模态边缘推断

Hang Zhao, Hongru Li, Dongfang Xu, Shenghui Song, Khaled B. Letaief

机构 * Dept. of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种三阶段通信感知分布式学习框架,通过减少通信开销和提升稳健性,实现高效的多模态边缘推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14697 2026-01-22 cs.IR cs.AI 70%

When Text-as-Vision Meets Semantic IDs in Generative Recommendation: An Empirical Study

当文本作为视觉信号与语义ID在生成推荐中相遇:一项实证研究

Shutong Qiao, Wei Yuan, Tong Chen, Xiangyu Zhao, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) City University of Hong Kong(香港城市大学) Griffith University(格里菲斯大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出将文本视为视觉信号,通过OCR技术提升生成推荐中语义ID学习的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14797 2026-01-22 cs.CV 57%

UniRoute: Unified Routing Mixture-of-Experts for Modality-Adaptive Remote Sensing Change Detection

UniRoute: 一种统一的路由混合专家模型用于模态自适应的遥感变化检测

Qingling Shu, Sibao Chen, Wei Lu, Zhihui You, Chengzhuang Liu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 UniRoute通过统一的路由混合专家框架,实现模态自适应的遥感变化检测,提升异质数据下的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13664 2026-01-22 cs.CV 57%

VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement

VIAFormer:用于高保真体素细化的体素-图像对齐变换器

Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lyu, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 VIAFormer通过体素-图像对齐变换器实现高保真体素细化,结合图像索引、校正流目标和混合流变换器,提升多视角条件下体素修复的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2601.14641 2026-01-22 cs.HC 78%

MIND: Empowering Mental Health Clinicians with Multimodal Data Insights through a Narrative Dashboard

MIND:通过叙述仪表板赋能心理健康临床医生的多模态数据洞察

Ruishi Zou, Shiyu Xu, Margaret E Morris, Jihan Ryu, Timothy D. Becker, Nicholas Allen, Anne Marie Albano, Randy Auerbach, Dan Adler, Varun Mishra, Lace Padilla, Dakuo Wang, Ryan Sultan, Xuhai "Orson" Xu

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 MIND通过叙述仪表板为心理健康临床医生提供多模态数据洞察,提升临床决策支持和数据洞察发现能力。

Comments Conditionally accepted to CHI Conference on Human Factors in Computing Systems (CHI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10111 2026-01-22 cs.CV cs.AI cs.CR 73%

Training-Free In-Context Forensic Chain for Image Manipulation Detection and Localization

无需训练的上下文取证链用于图像篡改检测与定位

Rui Chen, Bin Liu, Changtao Miao, Xinghao Wang, Yi Li, Tao Gong, Qi Chu, Nenghai Yu

专题命中 其他多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 ICFC提出一种无需训练的多模态大语言模型框架,用于图像篡改检测与定位,通过可解释的推理流程实现高效且准确的图像分析。

Comments This version was uploaded in error and contains misleading information found in an early draft. The manuscript requires extensive and long-term revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14971 2026-01-22 cs.LG 50%

Fine-Grained Traceability for Transparent ML Pipelines

细粒度透明机器学习流水线追溯

Liping Chen, Mujie Liu, Haytham Fayek

机构 * RMIT University(皇家墨尔本理工大学) Federation University Australia(联邦大学澳大利亚)

专题命中 其他多模态 :multimodal(abstract)

AI总结 FG-Trac是一个模型无关的框架,通过可验证的细粒度样本追溯提升机器学习流水线的透明度和可审计性。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14474 2026-01-22 cond-mat.mtrl-sci physics.optics 50%

Nanoscopy of Excitons in Atomically Thin In-Plane Heterostructures with Nanointerfaces

原子薄平面异质结构中激子的纳米成像与纳米界面

Mahdi Ghafariasl, Tianyi Zhang, Sampath Gamage, Da Zhou, Muhammad Asjad, Sarabpreet Singh, Antonio Gomez-Rodriguez, Diego M. Solis, Venkataraman Swaminathan, Mauricio Terrones, Yohannes Abate

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究通过纳米光谱和PL映射揭示原子薄异质结构中激子与介电响应的纳米尺度关联,建立多模式近场光谱学框架。

Comments 24 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏