Chunking Strategies for Multimodal AI Systems
多模态AI系统中的分块策略
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 本文综述了多模态系统中分块策略的分类和技术分析,探讨了不同模态的数据处理方法及挑战。
Comments 50 pages, 5 figure
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态AI系统中的分块策略
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 本文综述了多模态系统中分块策略的分类和技术分析,探讨了不同模态的数据处理方法及挑战。
Comments 50 pages, 5 figure
超越单个词对齐:通过令牌交互蒸馏多模态大语言模型
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所信息与智能系统研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Zhejiang University(浙江大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
AI总结 Align-TI通过令牌交互改进知识蒸馏,实现多模态大语言模型的高效压缩与性能提升
UniFit: 向基于多模态大语言模型引导的语义对齐的通用虚拟试衣迈进
专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 UniFit通过多模态大语言模型引导的语义对齐模块,解决虚拟试衣中语义差距和数据稀缺问题,实现通用且高性能的试衣框架。
Comments accepted to AAAI-2026
面向多模态推荐的个性化参数高效微调
专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)
AI总结 本文提出PerPEFT,一种面向多模态推荐的个性化参数高效微调策略,通过按兴趣分组并为每个组分配独立模块,提升推荐效果。
Comments To be published at The Web Conference 2026 (WWW 2026)
VersaViT: 通过任务引导优化增强MLLM视觉骨干
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) ; CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) ; WeChat AI, Tencent Inc., China(腾讯公司)
专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV
AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。
连接效率与透明性:可解释的CoT压缩在多模态大推理模型中
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education, China(计算机网络与信息集成重点实验室(SEU))
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI
AI总结 XMCC通过强化学习优化的顺序决策过程,实现多模态大推理模型中可解释的CoT压缩,同时保持推理正确性和生成可解释的压缩解释。
基于图的多模态和多视角对齐用于按键识别
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于图的多模态和多视角对齐框架,用于提高egocentric视频中按键识别的准确率,通过构建稀疏图结构并利用多模态特征提升性能。
Comments We expanded the paper and resubmitted as a separate submission to arXiv. This submission is outdated and readers can refer to arXiv:2506.01102
迈向多模态表示学习的统一性与对齐
机构 * University of Amsterdam(阿姆斯特丹大学) ; The Netherlands Cancer Institute(荷兰癌症研究所) ; The Arctic University of Norway(挪威北极大学) ; Singapore Management University(新加坡管理大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本文提出了一种多模态表示学习的方法,通过分离对齐和统一性以解决冲突,提升模型在检索和生成任务中的性能。
Scalpel: 通过混合高斯桥梁实现细粒度注意力激活流形对齐以缓解多模态幻觉
机构 * Fujitsu Research & Development Center Co.,LTD.(Fujitsu 研究与开发中心有限公司) ; Fujitsu Limited(Fujitsu 有限公司)
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV
AI总结 Scalpel通过高斯混合模型和熵最优传输减少多模态幻觉,实现注意力激活流形的细粒度对齐,提升视觉-语言模型的输出一致性。
Comments WACV 2026 (It was accepted in the first round, with an acceptance rate of 6%.)
多专家学习框架与状态空间模型用于光学和SAR图像配准
机构 * Key Laboratory of Intelligent Perception and Image Understanding of Ministry of Education of China(教育部智能感知与图像理解重点实验室) ; Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州学院) ; School of Computer Science, Xidian University(西安电子科技大学计算机学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出ME-SSM框架,通过多专家学习和状态空间模型提升光学与SAR图像配准的精度与效率。
谱解耦与增强:一种双域对比框架用于表示学习
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 SDE通过双域对比损失和谱增强策略,提升多模态表示学习的鲁棒性和泛化能力。
TTA:跨语言语音表示的转录、翻译与对齐
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 eess.AS
AI总结 TTA通过大规模训练生成跨语言语音表示,提升语音识别与翻译任务的性能,优于Whisper模型。
Comments Accepted by ICASSP2026
实例层面神经表示的重心对齐
机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) ; School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院) ; Department of Electrical and Computer Engineering, UCSD(UCSD电子与计算机工程系) ; Cognitive Science Department, UCSD(UCSD认知科学系) ; Department of Computer Science(计算机科学系)
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 通过实例层面的神经表示重心对齐,揭示了跨视觉和语言模型的表示收敛与发散特性,并展示了人类对齐的跨模态比较能力。