arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-29 至 2026-01-29 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2511.20258 2026-01-29 cs.CV cs.LG 83%

Modality-Balanced Collaborative Distillation for Multi-Modal Domain Generalization

模态平衡的协同蒸馏用于多模态领域泛化

Xiaohan Wang, Zhangtao Cheng, Ting Zhong, Leiting Chen, Fan Zhou

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MBCD框架,通过自适应模态丢弃、梯度一致性约束和跨模态蒸馏,解决多模态领域泛化中模态不平衡问题,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20305 2026-01-29 cs.AI 79%

Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models

内生再提示:面向统一多模态模型的自进化认知对齐

Zhenchen Tang, Songlin Yang, Zichuan Wang, Bo Peng, Yang Li, Beibei Dong, Jing Dong

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 内生再提示通过自进化框架提升统一多模态模型的认知对齐能力,有效解决生成过程引导问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20206 2026-01-29 cs.AI 79%

Towards Intelligent Urban Park Development Monitoring: LLM Agents for Multi-Modal Information Fusion and Analysis

面向智能城市公园发展监测:LLM代理用于多模态信息融合与分析

Zixuan Xiao, Chunguang Hu, Jun Ma

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究提出基于LLM的多模态代理框架,用于提升城市公园发展监测中多模态数据的融合与分析能力,解决传统方法在高级分析和灵活适应性方面的不足。

Journal ref IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025, Aug 3-8 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19908 2026-01-29 cs.AR cs.LG 78%

CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference

基于芯片组的异构近内存加速用于边缘多模态大语言模型推理

Yanru Chen, Runyang Tian, Yue Pan, Zheyu Li, Weihong Xu, Tajana Rosing

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 CHIME通过异构近内存加速方案,提升边缘多模态大语言模型推理的效率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04655 2026-01-29 cs.CV cs.AI 73%

X-SAM: From Segment Anything to Any Segmentation

X-SAM:从Segment Anything到Any Segmentation

Hao Wang, Limeng Qiao, Zequn Jie, Zhijian Huang, Chengjian Feng, Qingfang Zheng, Lin Ma, Xiangyuan Lan, Xiaodan Liang

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 X-SAM通过引入统一框架和VGD分割任务,提升多模态大语言模型的像素级视觉理解能力,实现更广泛的分割任务整合。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20742 2026-01-29 cs.CV 70%

Compression Tells Intelligence: Visual Coding, Visual Token Technology, and the Unification

压缩揭示智能:视觉编码、视觉令牌技术与统一

Xin Jin, Jinming Liu, Yuntao Wei, Junyan Lin, Zhicheng Wang, Jianguo Huang, Xudong Yang, Yanxiao Liu, Wenjun Zeng

机构 * Eastern Institute of Technology, Ningbo(宁波东部技术研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文探讨了视觉编码与视觉令牌技术的统一,揭示压缩效率与模型性能的权衡,并预测了下一代视觉编解码器和令牌技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20168 2026-01-29 cs.CV 70%

Efficient Token Pruning for LLaDA-V

LLaDA-V的高效令牌修剪

Zhewen Wan, Tianchen Song, Chen Lin, Zhiyong Zhao, Xianpeng Lang

机构 * Li Auto Inc.(利自动公司) SJTU(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种针对LLaDA-V的结构化令牌修剪方法,通过在中层到后期层移除部分视觉令牌,减少计算开销并保持95%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12603 2026-01-29 cs.CV cs.AI cs.CL 67%

Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space

在暗中推理:在潜在空间中交织的视觉-文本推理

Chao Chen, Zhixin Ma, Yongqi Li, Yupeng Hu, Yinwei Wei, Wenjie Li, Liqiang Nie

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡管理学院) Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出IVT-LR方法,通过在潜在空间中交织视觉和文本信息,提升多模态推理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03461 2026-01-29 eess.IV cs.CV 57%

Evaluating the Predictive Value of Preoperative MRI for Erectile Dysfunction Following Radical Prostatectomy

术前MRI对根治性前列腺切除术后勃起功能障碍预测价值的评估

Gideon N. L. Rouwendaal, Daniël Boeke, Inge L. Cox, Henk G. van der Poel, Margriet C. van Dijk-de Haan, Regina G. H. Beets-Tan, Thierry N. Boellaard, Wilson Silva

机构 * University of Amsterdam(阿姆斯特丹大学) Antoni van Leeuwenhoek-Netherlands Cancer Institute(安托尼·范·列文霍克-荷兰癌症研究所) Department of Urology(泌尿科部) AI Technology for Life(人工智能技术生命) Utrecht University(乌特勒支大学) GROW School for Oncology and Developmental Biology(GROW肿瘤学与发育生物学学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本研究评估了术前MRI对根治性前列腺切除术后勃起功能障碍预测价值,发现MRI模型在某些方面略优于传统方法,但未超越临床特征。

Comments 13 pages, 5 figures, 2 tables. Accepted at PRedictive Intelligence in MEdicine workshop @ MICCAI 2025 (PRIME-MICCAI). This is the submitted manuscript with added link to github repo, funding acknowledgements and authors' names and affiliations. No further post submission improvements or corrections were integrated. Final version not published yet

详情

展开后加载摘要…

URL PDF HTML 收藏