arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2603.05537 2026-04-02 cs.CV eess.IV 79%

Sketch It Out: Exploring Label-Free Structural Cues for Multimodal Gait Recognition

Sketch It Out: 探索无标签的结构线索用于多模态步态识别

Chao Zhang, Zhuang Zheng, Ruixin Li, Zhanyong Mei

机构 * Chengdu University of Technology(成都理工大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出SKETCH作为新的步态识别模态,通过无标签的结构线索提升多模态步态识别性能,实验表明其在SUSTech1K和CCPG数据集上取得优异效果。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24680 2026-04-01 cs.CV 79%

ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs

ReDiPrune:基于相关性与多样性的预投影令牌剪枝用于高效的多模态大语言模型

An Yu, Ting Yu Tsai, Zhenfei Zhang, Weiheng Lu, Felix X. -F. Ye, Ming-Ching Chang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 ReDiPrune是一种无需训练的预投影令牌剪枝方法,通过选择信息丰富的视觉令牌提升多模态大语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22779 2026-04-01 cs.IR cs.AI cs.LG 79%

KARMA: Knowledge-Action Regularized Multimodal Alignment for Personalized Search at Taobao

KARMA:面向淘宝个性化搜索的知识-行动正则化多模态对齐

Zhi Sun, Wenming Zhang, Yi Wei, Liren Yu, Zhixuan Zhang, Dan Ou, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 KARMA通过知识-行动正则化多模态对齐框架,解决个性化搜索中知识与行动冲突问题,提升语义可解性与行动指标,实现GMV增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 79%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28058 2026-03-31 cs.MM 79%

Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?

在情境学习中选择数据是否有助于多模态大语言模型任务特定微调中的数据选择?

Xiao An, Jiaxing Sun, Ting Hu, Wei He

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出CLIPPER方法,通过情境学习选择数据,提高多模态大语言模型任务特定微调的效率,实验表明其在数据效率和计算成本上优于现有方法。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17209 2026-03-31 cs.CV 79%

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

基于体素CT的自监督与跨模态预训练的扩展

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) ARIA Lab(ARIA实验室) AIMS Lab(AIMS实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 SPECTRE通过可扩展的3D视觉Transformer架构和现代自监督与视觉-语言预训练策略,学习通用CT表示,克服了体素CT的极端标记扩展、几何各向异性及临床监督弱的问题,实现了大规模3D注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27744 2026-03-31 cs.CV 79%

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

多模态指令微调中数据组织的重要性:能力取舍的受控研究

Guowei Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究探讨了数据组织对多模态指令微调中通用理解、结构化推理和细粒度OCR文档理解能力取舍的影响,发现课程训练在整体表现和结构推理上最佳,平衡采样更利于OCR能力但削弱整体平衡。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20451 2026-03-31 cs.CL 79%

MuVaC: A Variational Causal Framework for Multimodal Sarcasm Understanding in Dialogues

MuVaC:一种用于对话中多模态讽刺理解的变分因果框架

Diandian Guo, Fangfang Yuan, Cong Cao, Xixun Lin, Chuan Zhou, Hao Peng, Yanan Cao, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Beihang University(北京航空航天大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MuVaC框架,通过变分因果推理实现多模态讽刺检测与解释的联合优化,提升对话中讽刺理解的鲁棒性。

Comments 12 pages, 7 figures. Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24968 2026-03-31 cs.CV 79%

Event-based Facial Keypoint Alignment via Cross-Modal Fusion Attention and Self-Supervised Multi-Event Representation Learning

基于跨模态融合注意力和自监督多事件表征学习的事件面部关键点对齐

Donghwa Kang, Junho Kim, Dongwoo Kang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出基于跨模态融合注意力和自监督多事件表征学习的事件面部关键点对齐框架,解决事件数据中空间信息有限和标注数据不足的问题,通过实验验证其在多个评估指标上优于现有方法。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26393 2026-03-30 eess.IV cs.CV 79%

Adapting Frozen Mono-modal Backbones for Multi-modal Registration via Contrast-Agnostic Instance Optimization

通过对比无关实例优化适应冻结的单模背骨以实现多模注册

Yi Zhang, Yidong Zhao, Qian Tao

机构 * Department of Imaging Physics, Delft University of Technology, The Netherlands(荷兰代尔夫特理工大学成像物理系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种结合冻结预训练单模注册模型与轻量级适应流程的多模图像注册框架,通过对比无关的表示生成与优化模块在测试时桥接模态与领域差距,提升注册鲁棒性。

Comments MICCAI Learn2Reg Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26126 2026-03-30 cs.CV 79%

Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR

超越寻找范围:用于多模态RLVR的轨迹引导强化学习

Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Mingzhu Chen, Jiancan Wu, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Pecking University(北京大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出轨迹引导强化学习(TGRL),通过专家推理轨迹引导策略模型整合视觉证据进行精细推理,提升多模态推理性能,弥合视觉感知与逻辑推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12760 2026-03-30 cs.CV 79%

HIFICL: High-Fidelity In-Context Learning for Multimodal Tasks

HIFICL:多模态任务的高保真上下文学习

Xiaoyu Li, Yuhang Liu, Xuanshuo Kang, Zheng Luo, Fangqi Lou, Xiaohua Wu, Zihan Xiong

机构 * University of Electronic Science and Technology of China(电子科技大学) Institute of Electronics and Information Industry Technology of Kashgar(喀什电子信息产业技术研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 HIFICL通过引入虚拟键值对、低秩分解和端到端训练目标,改进多模态任务的上下文学习机制,实验表明其在多个基准上优于现有近似方法。

Comments Accepted to CVPR 2026. Code available at https://github.com/bbbandari/HiFICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12944 2026-03-30 cs.CV 79%

AMFD: Distillation via Adaptive Multimodal Fusion for Multispectral Pedestrian Detection

AMFD:基于自适应多模态融合的多光谱行人检测知识蒸馏

Zizhao Chen, Yeqiang Qian, Xiaoxiao Yang, Chunxiang Wang, Ming Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理教育部重点实验室)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出AMFD框架,通过自适应多模态融合模块有效利用教师网络的原始模态特征,提升学生网络性能,实验表明其在减少漏检率和提升平均精度方面优于现有方法。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25963 2026-03-30 cs.CV 79%

BEVMAPMATCH: Multimodal BEV Neural Map Matching for Robust Re-Localization of Autonomous Vehicles

BEVMapMatch:多模态鸟瞰神经地图匹配用于自动驾驶车辆的鲁棒重定位

Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BEVMapMatch框架,利用多模态传感器融合生成鸟瞰图分割,通过交叉注意力机制检索地图片段,实现无需GNSS的鲁棒重定位,实验表明其在GNSS受限环境下的召回率显著提升。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25573 2026-03-27 cs.CV cs.LG 79%

Hierarchy-Guided Multimodal Representation Learning for Taxonomic Inference

层级引导的多模态表示学习用于分类推断

Sk Miraj Ahmed, Xi Yu, Yunqi Li, Yuewei Lin, Wei Xu

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室) Rutgers University(罗格斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出两种端到端的多模态学习方法,通过编码生物分类层级结构提升分类鲁棒性,在大规模生物多样性基准上实现超过14%的准确率提升。

Comments Accepted at the ICLR 2026 Workshop on Foundation Models for Science (FM4Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20749 2026-03-27 cs.LG cs.AI 79%

Stabilizing Multimodal Autoencoders: A Theoretical and Empirical Analysis of Fusion Strategies

稳定多模态自编码器:融合策略的理论和经验分析

Diyar Altinses, Andreas Schwung

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究多模态自编码器的稳定性与鲁棒性,提出基于理论分析的正则化注意力融合方法,通过实验验证其在一致性、收敛速度和精度上的优势。

Journal ref Expert Systems with Applications, Volume 310, 10 May 2026, 131270

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 79%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24528 2026-03-26 cs.CV 79%

Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification

跨模态原型对齐与混合用于无训练少样本分类

Dipam Goswami, Simone Magistri, Gido M. van de Ven, Bartłomiej Twardowski, Andrew D. Bagdanov, Tinne Tuytelaars, Joost van de Weijer

机构 * Department of Computer Science, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机科学系) Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Media Integration and Communication Center, University of Florence, Italy(佛罗伦萨大学媒体整合与传播中心) Bernoulli Institute, University of Groningen, the Netherlands(格罗宁根大学伯努利学院) IDEAS Research Institute, Poland(波兰IDEAS研究所) ESAT-PSI, KU Leuven, Belgium(比利时KU莱顿大学ESAT-PSI)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文研究了直接混合图像与文本原型对少样本分类的影响,提出通过投影获取语义对齐的图像子空间,结合文本嵌入和图像特定LDA分类器提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23650 2026-03-26 cs.CV 79%

Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge

基础模型嵌入与混合情感:一种多模态融合方法用于BLEMORE挑战

Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

机构 * Department of Computational Linguistics, University of Zürich(苏黎世大学计算语言学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种多模态融合方法,结合六个编码器家族进行后期概率融合,通过选择冻结的Wav2Vec2的语调编码层和Gemini Embedding 2.0,提升了混合情感识别的性能,最终在测试集上获得0.279的分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22847 2026-03-25 cs.CV 79%

Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought

重新思考多模态链式推理的令牌级策略优化

Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PEPO方法,通过令牌级分析多模态推理轨迹,结合感知先验和熵整合机制,提升多模态推理性能,实验显示在多种基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22757 2026-03-25 cs.CV 79%

Multimodal Industrial Anomaly Detection via Geometric Prior

基于几何先验的多模态工业异常检测

Min Li, Jinghui He, Gang Li, Jiachen Li, Jin Wan, Delong Han

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算功率网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于几何先验的异常检测网络GPAD,通过点云专家模型提取细粒度几何特征,并结合两阶段融合策略和几何先验实现高效多模态数据融合,提升几何缺陷检测精度。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22369 2026-03-25 q-bio.GN cs.AI cs.LG 79%

SynLeaF: A Dual-Stage Multimodal Fusion Framework for Synthetic Lethality Prediction Across Pan- and Single-Cancer Contexts

SynLeaF:一种用于跨泛癌和单癌情境的合成致死性预测双阶段多模态融合框架

Zheming Xing, Siyuan Zhou, Ruinan Wang, Rui Han, Shiming Zhang, Shiqu Chen, Yurui Huang, Jiahao Ma, Yifan Chen, Xuan Wang, Yadong Wang, Junyi Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 SynLeaF通过双阶段多模态融合框架,有效整合基因表达、突变、甲基化和拷贝数变异等多组学数据,并利用关系图卷积网络捕捉生物医学知识图谱中的结构化基因表示,从而在17/19种场景中实现优于现有方法的性能。

Comments 29 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22345 2026-03-25 cs.AI 79%

Dynamic Fusion-Aware Graph Convolutional Neural Network for Multimodal Emotion Recognition in Conversations

动态融合感知图卷积神经网络用于对话中的多模态情绪识别

Tao Meng, Weilun Tang, Yuntao Shou, Yilong Tan, Jun Zhou, Wei Ai, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz, New York, 12561, USA(纽约州立大学新帕尔兹分校计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DF-GCN,通过整合微分方程和全局信息向量,动态融合多模态特征,提升对话中情绪识别的灵活性和泛化能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21562 2026-03-24 cs.CV 79%

Exploring Multimodal Prompts For Unsupervised Continuous Anomaly Detection

探索多模态提示用于无监督连续异常检测

Mingle Zhou, Jiahui Liu, Jin Wan, Gang Li, Min Li

机构 * Key Laboratory of Computing Power Network(计算能力网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet(山东省计算能力互联网重点实验室) Service Computing, Shandong Fundamental Research Center for Computer Science(服务计算,山东省计算机基础研究中心) Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于多模态提示的无监督连续异常检测框架,通过持续多模态提示记忆库和缺陷语义引导自适应融合机制提升检测精度与鲁棒性,实验表明在MVTec AD和VisA数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21108 2026-03-24 cs.LG cs.AI 79%

DMMRL: Disentangled Multi-Modal Representation Learning via Variational Autoencoders for Molecular Property Prediction

DMMRL:通过变分自编码器进行解耦多模态表示学习以进行分子性质预测

Long Xu, Junping Guo, Jianbo Zhao, Jianbo Lu, Yuzhong Peng

机构 * Guangxi Key Lab of Human-machine Interaction and Intelligent Decision(广西人机交互与智能决策重点实验室) Nanning Normal University(南宁师范大学) College of Big Data and Software Engineering(大数据与软件工程学院) Zhejiang Wanli University(浙江万里大学)

专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);分类 cs.AI

AI总结 本文提出DMMRL,通过变分自编码器解耦分子表示为共享和私有潜在空间,提升可解释性和预测性能,实验验证其在七个基准数据集上的优越表现。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19718 2026-03-23 cs.CV 79%

BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates

BALM:一种面向不平衡缺失率下平衡多模态学习的模型无关框架

Phuong-Anh Nguyen, Tien Anh Pham, Duc-Trong Le, Cam-Van Thi Nguyen

机构 * VNU University of Engineering and Technology(越南工程与技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BALM框架,通过特征校准模块和梯度重平衡模块解决多模态学习中因不平衡缺失率导致的不平衡问题,提升模型鲁棒性和性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19681 2026-03-23 cs.CV 79%

Unbiased Dynamic Multimodal Fusion

无偏动态多模态融合

Shicai Wei, Kaijie Zhang, Luyi Chen, Tao He, Guiduo Duan

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出UDML框架,通过引入噪声感知不确定性估计器和模态dropout量化模态依赖偏置,解决动态多模态融合中模态质量评估不准确和模态贡献分配不合理的问题。

Comments CVPR2026 Findings, 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15164 2026-03-23 cs.CV 79%

Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance

多模态持续指令微调与动态梯度指导

Songze Li, Mingyu Gao, Tonghua Su, Xu-Yao Zhang, Zhongjie Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济发展实验室) Chongqing Research Institute of HIT(重庆哈工大研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过几何参数空间方向向量近似缺失梯度,结合有限回放缓冲区和伯努利采样策略,有效缓解多模态持续指令微调中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18660 2026-03-20 cs.CV 79%

Multimodal Model for Computational Pathology:Representation Learning and Image Compression

多模态模型用于计算病理学:表示学习与图像压缩

Peihang Wu, Zehong Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨了多模态计算病理学中的表示学习和图像压缩技术,分析了自监督学习、多模态数据生成、参数高效适应及多代理协作推理等方向,旨在提升病理诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13032 2026-03-20 cs.CV 79%

Multimodal OCR: Parse Anything from Documents

多模态OCR:从文档中解析一切

Handong Zheng, Yumeng Li, Kaile Zhang, Liang Xin, Guangwei Zhao, Hao Liu, Jiayu Chen, Jie Lou, Qi Fu, Rui Yang, Shuo Jiang, Weijian Luo, Weijie Su, Weijun Zhang, Xingyu Zhu, Yabin Li, Yiwei ma, Yu Chen, Yuqiu Ji, Zhaohui Yu, Guang Yang, Colin Zhang, Lei Zhang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) hi lab, Xiaohongshu Inc(小红书实验室,小红书公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态OCR(MOCR),通过联合解析文本和图形,生成统一的文本表示。方法将图表、表格等视觉元素作为解析目标,提升文档重建的准确性,并通过端到端训练实现跨模态监督,最终在文档和结构化图形解析任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏