arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6918 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6918 篇

2512.24284 2026-01-01 cs.RO cs.AI 57%

DRL-TH: Jointly Utilizing Temporal Graph Attention and Hierarchical Fusion for UGV Navigation in Crowded Environments

DRL-TH:联合利用时序图注意力和层次融合用于拥挤环境下的无人地面车辆导航

Ruitong Li, Lin Zhang, Yuenan Zhao, Chengxin Liu, Ran Song, Wei Zhang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 DRL-TH通过结合时序图注意力和层次融合,提升无人地面车辆在拥挤环境中的导航性能和动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23335 2026-01-01 cs.CV cs.LG 57%

Visual Language Hypothesis

视觉语言假说

Xiu Li

机构 * Independent Researcher(独立研究者)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出视觉理解依赖于语义语言的假说,并通过拓扑结构解释语义抽象和不变性的实现机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22981 2025-12-30 cs.CV 57%

Spatial-aware Symmetric Alignment for Text-guided Medical Image Segmentation

具有空间意识的对称对齐用于文本引导的医学图像分割

Linglin Liao, Qichuan Geng, Yu Liu

机构 * School of Information Engineering, Capital Normal University Beijing, China(信息工程学院,首都师范大学北京,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SSA框架,通过空间感知对称对齐机制和复合方向引导策略,提升文本引导的医学图像分割性能,尤其在准确分割具有空间约束的病变方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22800 2025-12-30 cs.CV 57%

Medical Scene Reconstruction and Segmentation based on 3D Gaussian Representation

基于3D高斯表示的医学场景重建与分割

Bin Liu, Wenyan Tian, Huangxin Fu, Zizheng Li, Zhifen He, Bo Li

机构 * Nanchang Hangkong University(南昌航空大学) Guilin University Of Electronic Technology(桂林电子科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于3D高斯和三平面表示的医学图像重建方法,解决传统方法在稀疏切片中的结构不连续和细节丢失问题,提升重建效率和图像质量。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22135 2025-12-30 cs.DC cs.AI cs.HC cs.MA 57%

SoDA: An Efficient Interaction Paradigm for the Agentic Web

SoDA:面向代理网络的高效交互范式

Zicai Cui, Zhouyuan Jian, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 SoDA提出了一种面向代理网络的高效交互范式,通过解耦记忆与应用逻辑,降低数据锁定和认知过载,提升信息处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21863 2025-12-29 cs.IR cs.MM 57%

Frozen LVLMs for Micro-Video Recommendation: A Systematic Study of Feature Extraction and Fusion

冻结的大型视频语言模型用于微视频推荐:特征提取与融合的系统研究

Huatuan Sun, Yunshan Ma, Changguang Wu, Yanxin Zhang, Pengfei Wang, Xiaoyu Du

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.MM

AI总结 本文通过系统研究冻结LVLMs的特征提取与融合策略,提出DFF框架,证明中间隐藏状态优于标题表示,ID嵌入融合优于替换,并在微视频推荐中取得最佳性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21856 2025-12-29 cs.CV 57%

Breaking Alignment Barriers: TPS-Driven Semantic Correlation Learning for Alignment-Free RGB-T Salient Object Detection

突破对齐障碍:TPS驱动的语义相关性学习用于无对齐RGB-T显著目标检测

Lupiao Hu, Fasheng Wang, Fangmei Chen, Fuming Sun, Haojie Li

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出TPS-SCL网络,通过双流MobileViT和高效Mamba机制,结合语义相关性约束和薄板样条对齐模块,有效解决未对齐RGB-T图像对中的显著目标检测问题。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21264 2025-12-25 cs.CV 57%

AnyAD: Unified Any-Modality Anomaly Detection in Incomplete Multi-Sequence MRI

AnyAD:统一的多序列MRI任意模态异常检测

Changwei Wu, Yifei Chen, Yuxin Du, Mingxuan Liu, Jinying Zong, Beining Wu, Jie Dong, Feiwei Qin, Yunkang Cao, Qiyuan Tian

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) School of Biomedical Engineering, Tsinghua University(生物医学工程学院,清华大学) HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子科技大学-ITMO联合研究所) School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 AnyAD提出了一种统一的多模态MRI异常检测框架,通过双路径编码器和特征对齐机制实现任意模态下的稳健检测,实验表明其在多种模态组合中优于现有基线方法。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21065 2025-12-25 cs.RO cs.CV 57%

Language-Guided Grasp Detection with Coarse-to-Fine Learning for Robotic Manipulation

基于粗到细学习的语言引导抓取检测用于机器人操作

Zebin Jiang, Tianle Jin, Xiangtong Yao, Alois Knoll, Hu Cao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于粗到细学习的语言引导抓取检测方法,通过跨模态融合和动态卷积头提升抓取精度与鲁棒性,实验证明其在复杂环境中的有效性。

Comments Submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20921 2025-12-25 cs.CV 57%

Self-supervised Multiplex Consensus Mamba for General Image Fusion

自监督多乘共识Mamba用于通用图像融合

Yingying Wang, Rongjin Zhuang, Hui Zheng, Xuanhua He, Ke Cao, Xiaotong Tu, Xinghao Ding

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 SMC-Mamba通过自监督多乘共识机制提升通用图像融合性能,有效整合多模态信息并优化下游任务表现。

Comments Accepted by AAAI 2026, 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20633 2025-12-25 cs.LG cs.AI 57%

Enhancing Lung Cancer Treatment Outcome Prediction through Semantic Feature Engineering Using Large Language Models

通过大语言模型进行语义特征工程提升肺癌治疗预后预测

MunHwan Lee, Shaika Chowdhury, Xiaodi Li, Sivaraman Rajaganapathy, Eric W Klee, Ping Yang, Terence Sio, Liewei Wang, James Cerhan, Nansu NA Zong

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用大语言模型进行语义特征工程,提升肺癌治疗预后预测的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20556 2025-12-24 cs.CV 57%

Multi-Grained Text-Guided Image Fusion for Multi-Exposure and Multi-Focus Scenarios

多粒度文本引导图像融合用于多曝光和多聚焦场景

Mingwei Tang, Jiahao Nie, Guang Yang, Ziqing Cui, Jie Li

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(新加坡国立大学) Xi’an University of Technology(西安理工大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出MTIF方法,通过多粒度文本描述和跨模态调节模块提升多曝光和多聚焦图像融合性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19390 2025-12-23 cs.RO cs.CV cs.GR 57%

TwinAligner: Visual-Dynamic Alignment Empowers Physics-aware Real2Sim2Real for Robotic Manipulation

TwinAligner: 视觉-动态对齐赋能物理感知的实境到仿真到现实的机器人操控

Hongwei Fan, Hang Dai, Jiyao Zhang, Jinzhou Li, Qiyang Yan, Yujie Zhao, Mingju Gao, Jinghang Wu, Hao Tang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学CFCS) PKU-AgiBot Lab(北京大学AgiBot实验室) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TwinAligner通过视觉和动态对齐技术,解决仿真与现实之间的差距,提升机器人操控的可扩展学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19180 2025-12-23 cs.LG cs.AI 57%

Practical Quantum-Classical Feature Fusion for complex data Classification

实用量子-经典特征融合用于复杂数据分类

Azadeh Alavi, Fatemeh Kouchmeshki, Abdolrahman Alavi

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种交叉注意中融合架构,通过多模态融合提升复杂数据分类性能,证明了量子信息与经典特征结合的重要性。

Comments 16 pages, 3 figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18910 2025-12-23 cs.CV 57%

Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models

Delta-LLaVA: 基于令牌效率的视觉-语言模型对齐方法

Mohamad Zamini, Diksha Shukla

机构 * University of Wyoming(怀俄明大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 Delta-LLaVA通过低秩Delta投影和轻量级Transformer块实现视觉-语言模型的高效对齐,提升推理速度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17436 2025-12-23 cs.CV 57%

Xiaomi MiMo-VL-Miloco Technical Report

小米 MiMo-VL-Miloco 技术报告

Jiaze Li, Jingyang Chen, Yuxun Qu, Shijie Xu, Zhenru Lin, Junyou Zhu, Boshen Xu, Wenhui Tan, Pei Fu, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Xiaomi(小米)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 小米提出 MiMo-VL-Miloco 模型,专为家庭场景设计,通过两阶段训练提升多模态推理与家庭场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18267 2025-12-19 cs.LG cs.AI 57%

ARD-LoRA: Dynamic Rank Allocation for Parameter-Efficient Fine-Tuning of Foundation Models with Heterogeneous Adaptation Needs

ARD-LoRA:动态秩分配用于具有异质适应需求的基础模型参数高效微调

Haseeb Ullah Khan Shinwari, Muhammad Usama

机构 * Newton AI Lab(牛顿人工智能实验室) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 ARD-LoRA通过动态秩分配提升基础模型微调效率,实现参数高效且适应性更强的模型调整。

Journal ref IEEE Transactions on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14026 2025-12-17 cs.CV 57%

Unleashing the Power of Image-Tabular Self-Supervised Learning via Breaking Cross-Tabular Barriers

通过打破跨表格障碍释放图像-表格自监督学习的潜力

Yibing Fu, Yunpeng Zhao, Zhitao Zeng, Cheng Chen, Yueming Jin

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CITab框架,通过跨表格学习提升医学图像与表格数据的多模态自监督学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19981 2025-12-17 cs.CV 57%

FutrTrack: A Camera-LiDAR Fusion Transformer for 3D Multiple Object Tracking

FutrTrack: 一种基于相机与激光雷达融合的变压器用于三维多目标跟踪

Martha Teiko Teye, Ori Maoz, Matthias Rottmann

机构 * University of Wuppertal(乌珀塔尔大学) Institute of Computer Science, Osnabrück University(计算机科学研究所,奥斯纳布鲁克大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 FutrTrack通过融合相机与激光雷达数据,利用基于变压器的跟踪框架,在多目标跟踪中实现了高效且鲁棒的跟踪性能。

Comments Accepted to VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13240 2025-12-16 cs.AI cs.LG 57%

Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection

反射偏好优化(RPO):通过提示引导的反思增强策略对齐

Zihui Zhao, Zechang Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 RPO通过提示引导的反思增强策略对齐,减少幻觉并提升多模态基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12658 2025-12-16 cs.CV 57%

CogDoc: Towards Unified thinking in Documents

CogDoc: 向文档中的统一思维迈进

Qixin Xu, Haozhe Wang, Che Liu, Fangzhen Lin, Wenhu Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) University of Waterloo(滑铁卢大学) Imperial College London(伦敦帝国学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 CogDoc提出一种统一的粗到细思维框架,通过直接强化学习提升文档推理性能,优于现有方法并在视觉丰富任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09350 2025-12-16 cs.CV 57%

TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment

TextGuider: 通过注意力对齐实现文本渲染的无训练指导

Kanghyun Baek, Sangyub Lee, Jin Young Choi, Jaewoo Song, Daemin Park, Jooyoung Choi, Chaehun Shin, Bohyung Han, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Global Technology Research, Samsung Electronics(三星电子全球技术研究) AIIS, ASRI, INMC, ISRC, Seoul National University(AIIS、ASRI、INMC、ISRC、首尔国立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 TextGuider通过注意力对齐实现文本渲染的无训练指导,提升文本生成的准确性和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09580 2025-12-11 cs.CV 57%

Content-Adaptive Image Retouching Guided by Attribute-Based Text Representation

基于属性文本表示的内容自适应图像润色

Hancheng Zhu, Xinyu Liu, Rui Yao, Kunyang Sun, Leida Li, Abdulmotaleb El Saddik

机构 * School of Computer Science and Technology/School of Artificial Intelligence, China University of Mining and Technology(计算机科学与技术学院/人工智能学院,中国矿业大学) Mine Digitization Engineering Research Center of the Ministry of Education, China University of Mining and Technology(教育部矿山数字化工程研究中心,中国矿业大学) School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学) School of Electrical Engineering and Computer Science, University of Ottawa(电气与计算机工程学院,多伦多大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于属性文本表示的内容自适应图像润色方法,通过结合内容感知的颜色调整和用户定义的风格偏好,实现高质量的图像润色效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08572 2025-12-10 cs.CV 57%

From Cells to Survival: Hierarchical Analysis of Cell Inter-Relations in Multiplex Microscopy for Lung Cancer Prognosis

从细胞到生存:多乘 microscopy 中细胞互相关系的分层分析用于肺癌预后

Olle Edgren Schüllerqvist, Jens Baumann, Joakim Lindblad, Love Nordling, Artur Mezheyeuski, Patrick Micke, Nataša Sladoje

机构 * Department of Information Technology, SciLifeLab, Uppsala University(信息科技系、SciLifeLab、乌普萨拉大学) PAICON GmbH(PAICON公司) Department of Immunology, Genetics and Pathology, Uppsala University(免疫学、遗传学和病理学系、乌普萨拉大学) Molecular Oncology Group, Vall d'Hebron Institute of Oncology(分子肿瘤学组、瓦伦·德·霍布伦肿瘤研究所) Vall d'Hebron Institute of Research(瓦伦·德·霍布伦研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 HiGINE通过多光谱免疫荧光图像分析肿瘤微环境,利用分层图方法预测肺癌患者生存并提升风险分层。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07021 2025-12-09 cs.LG cs.AI 57%

Transferring Clinical Knowledge into ECGs Representation

将临床知识转移到ECG表示中

Jose Geraldo Fernandes, Luiz Facury de Souza, Pedro Robles Dutenhefner, Gisele L. Pappa, Wagner Meira

机构 * Department of Computer Science(计算机科学系) Universidade Federal de Minas Gerais(巴西矿务联邦大学) Depart. of Math. and Comp. Sc.(数学与计算机科学系) Albion College(阿尔比恩学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种三阶段训练方法,将多模态临床数据转化为ECG表示,提升分类模型的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06662 2025-12-09 cs.CV 57%

Personalized Image Descriptions from Attention Sequences

基于注意力序列的个性化图像描述

Ruoyu Xue, Hieu Le, Jingyi Xu, Sounak Mondal, Abe Leite, Gregory Zelinsky, Minh Hoai, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校) The University of Adelaide(阿德莱德大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 DEPER通过建模个性化注意力序列,实现了基于视觉-语言模型的个性化图像描述生成,提升了描述质量与人类对齐性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05979 2025-12-09 physics.chem-ph cs.AI cs.DM cs.LG 57%

Accelerating Materials Discovery: Learning a Universal Representation of Chemical Processes for Cross-Domain Property Prediction

加速材料发现:学习化学过程的通用表示以实现跨领域性质预测

Mikhail Tsitsvero, Atsuyuki Nakao, Hisaki Ikebata

机构 * CrowdChem, Inc.(CrowdChem公司)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种通用的过程图表示,通过多模态图神经网络实现跨领域性质预测,展示了大规模学习的通用表示在专门任务中的高效迁移能力。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14670 2025-12-09 cs.CV 57%

Gene-DML: Dual-Pathway Multi-Level Discrimination for Gene Expression Prediction from Histopathology Images

Gene-DML:双路径多级判别用于从组织病理图像预测基因表达

Yaxuan Song, Jianan Fan, Hang Chang, Weidong Cai

机构 * The University of Sydney, Australia(悉尼大学) Lawrence Berkeley National Laboratory, USA(伯克利国家实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 Gene-DML通过双路径多级判别方法,提升组织病理图像与基因表达谱的跨模态对齐,实现高精度的基因表达预测。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision 2026 (WACV2026). Code and data available at https://github.com/YXSong000/Gene-DML

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05593 2025-12-08 cs.CV 57%

Learning High-Fidelity Cloth Animation via Skinning-Free Image Transfer

通过无骨骼绑定图像传输学习高保真布料动画

Rong Wang, Wei Mao, Changsheng Lu, Hongdong Li

机构 * The Australian National University(澳大利亚国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出无骨骼绑定图像传输方法,通过独立估计顶点位置和法线以生成高保真布料动画,提升动画质量和细节恢复能力。

Comments Accepted to 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03747 2025-12-04 cs.CV 57%

LoRA Patching: Exposing the Fragility of Proactive Defenses against Deepfakes

LoRA Patching: 暴露对抗深度伪造的主动防御的脆弱性

Zuomin Qu, Yimao Guo, Qianyue Hu, Wei Lu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Electric Power Research Institute, China Southern Power Grid Company Ltd.(中国南方电网有限责任公司电力科学研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 LoRA Patching通过注入LoRA修补块绕过深度伪造防御,并引入MMFA损失提升对抗性输出特征对齐,揭示现有防御的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏