Feature Level Fusion of Biometrics Cues: Human Identification with Doddingtons Caricature
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 3 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 3 figures
Simon-SR:用于文本增强超分辨率的空间自适应调制和视觉提示适配
机构 * College of Electronic Science and Engineering, Jilin University(吉林大学电子科学与工程学院)
专题命中 多模态训练与对齐 :multi-modal(abstract,comments);分类 cs.CV
AI总结 针对单图像超分辨率问题,提出Simon-SR框架,利用可学习提示进行语义挖掘和文本-图像融合,结合对比提示学习与空间自适应细化,实验证明该方法超越现有技术,在多项指标上有明显提升。
Comments Multi-modal Single Image Super-Resolution
令牌扭曲帮助多模态大语言模型从近处视角观察
机构 * KAIST(韩国科学技术院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV;MLLM(comments)
AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。
Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io
多模态分析在视觉目标跟踪中的全方位调研
机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) ; School of Computer Science and Technology, China University of Mining and Technology(中国矿业大学计算机科学与技术学院) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey 大学视觉、语音与信号处理中心)
专题命中 多模态训练与对齐 :multi-modal(abstract,comments);分类 cs.CV
AI总结 本文从多模态分析角度调研了多模态视觉目标跟踪(MMVOT)的关键问题,涵盖数据收集、模态对齐、标注、模型设计与评估,分析了现有方法的分类及挑战,并首次探讨了多模态跟踪的适用性及数据集中的类别分布。
Comments The first comprehensive survey for multi-modal visual object tracking; 6 multi-modal tasks; 338 references
机构 * Department of Radiology, Antoni van Leeuwenhoek-Netherlands Cancer Institute, Amsterdam, The Netherlands(放射科,Antoni van Leeuwenhoek荷兰癌症研究所,阿姆斯特丹,荷兰) ; University of Amsterdam(阿姆斯特丹大学) ; AI Technology for Life, Department of Information and Computing Sciences, Department of Biology, Utrecht University(AI技术生命,信息与计算科学系,生物学系,乌得勒支大学) ; GROW Oncology, Maastricht University(GROW肿瘤学,马斯特里赫特大学) ; Department of Oncology, University of Cambridge(肿瘤科,剑桥大学) ; Cancer Research UK Cambridge Centre, University of Cambridge(英国癌症研究会剑桥中心,剑桥大学) ; Early Cancer Institute, University of Cambridge(早期癌症研究所,剑桥大学) ; Cambridge University Hospitals NHS Foundation Trust(剑桥大学医院 NHS 基础信托)
专题命中 多模态训练与对齐 :multimodal(abstract,comments);分类 cs.CV
Comments 12 pages, 2 figures, 1 table. Accepted at the Multimodal Learning and Fusion Across Scales for Clinical Decision Support (ML-CDS) Workshop, MICCAI 2025. This is the submitted version with authors, affiliations, and acknowledgements included; it has not undergone peer review or revisions. The final version will appear in the Springer Lecture Notes in Computer Science (LNCS) proceedings
专题命中 多模态训练与对齐 :multimodal(abstract,comments);分类 cs.AI
Comments preprint revised; to appear In Proceedings of the IEEE International Conference on Big Data 2023/ 3rd Workshop on Multimodal AI (MMAI 2023)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV;multimodal(comments)
Comments IJCNN workshop on Multimodal Synthetic Data for Deep Neural Networks (MSynD), 2023
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV;multimodal(comments)
Comments Accepted to ECCVW on International Challenge on Compositional and Multimodal Perception
专题命中 多模态训练与对齐 :multimodal(abstract,comments);分类 cs.CV
Comments Accepted for publication at Multimodal Learning for Clinical Decision Support Workshop at MICCAI 2020 (edit: corrected typos and model name in Fig. 3, added missing circles in Table 1)
ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐
机构 * Northeastern University(东北大学) ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。
通过显著性正则化调优优化多模态跟踪器
机构 * School of Artificial Intelligence, Xidian University(电子科技大学人工智能学院) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出显著性正则化微调框架,通过引入参数显著性提升多模态跟踪器的跨模态可迁移性。
MOSAIC:面向客户端特定缺失模态的联邦图像级弱监督肿瘤分割的模态无关频谱对齐方法
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本研究针对客户端特定缺失模态的联邦图像级弱监督肿瘤分割问题,提出MOSAIC框架,通过模态对齐模块、频谱原型对齐损失及联邦优化网络,在三个脑肿瘤基准上取得显著优于基线的性能,仅用图像级标签接近全监督精度,且支持动态客户端加入。
重新标记,而非替换:扩散大语言模型中的令牌到标记细化
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Zhongguancun Academy(中关村学院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。
虚拟传感实现不可达位置与不可测参数的实时监测
机构 * Plasma & Radiological Engineering Department, Grainger College of Engineering, Nuclear, University of Illinois Urbana-Champaign(等离子体与辐射工程系,格拉inger工程学院,核能,伊利诺伊大学厄巴纳-香槟分校) ; Mechanical Science and Engineering Department, Grainger College of Engineering, University of Illinois Urbana-Champaign(机械科学与工程系,格拉inger工程学院,伊利诺伊大学厄巴纳-香槟分校) ; National Center for Supercomputing Applications, Urbana, IL, USA(国家超级计算应用中心,伊利诺伊州厄巴纳,美国) ; Department of Applied Mechanics, Indian Institute of Technology Delhi, New Delhi, India(应用力学系,印度理工学院德里,新德里,印度) ; Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI
AI总结 针对能量系统中物理传感器无法部署的实时监测问题,提出基于神经算子的虚拟传感框架MIMONet,将稀疏边界测量映射到内部场,在多种热流体系统中实现亚毫秒级高精度推理。
Comments New analysis and results are added
USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。
GSToken:用于紧凑三维医学图像表示的几何结构化高斯令牌
机构 * Taiyuan University of Technology(太原理工大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出GSToken,一种带显式几何信息的高斯令牌,通过冻结令牌生成器的评估协议验证其在多模态脑肿瘤分割中,比容量匹配基线更优,可提升三维医学图像表示的信息密度。
LAVA:面向大规模财务文档审计的逻辑感知验证与增强框架
机构 * BMO Financial Group(蒙特利尔银行金融集团)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 针对财务文档验证的异构性与业务规则处理难题,提出基于多模态大语言模型的LAVA框架,通过四阶段设计提升幻觉控制与边缘案例处理能力,适用于高风险财务审计场景。
Journal ref Proceedings of The 10th Workshop on Financial Technology and Natural Language Processing (FinNLP 2025), Association for Computational Linguistics, pp. 75-92, 2025
面向人体状态转换的生理世界模型
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。
从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。
Comments Under Review
SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制型令牌剪枝
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文针对遥感大视觉语言模型高分辨率处理效率低的问题,提出SA-GEM即插即用剪枝框架,通过尺度自适应与地理空间证据调制实现效率与精度提升,在XLRS-Bench上超GeoLLaVA-8K 2.3%且推理提速2.4倍。
GSBF:面向环境感知波束成形的高斯溅射
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI
AI总结 该研究针对传统波束成形依赖瞬时CSI导致开销高的问题,提出GSBF方法,通过3D高斯表示刻画环境,利用Bi-SG核与电磁光栅化合成波束,仿真显示其性能优于EBA且延迟更低。
CRAFT:无需组合目标的主题个性化的注意力微调约束奖励
机构 * DGIST(大邱科技研究院) ; Baidu, Inc.(百度公司) ; KAIST(韩国科学技术院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文提出无需组合目标监督的CRAFT框架,通过LoRA适配器微调参考感知MMDiT,仅用1万张参考样本,在XVerseBench上实现图像主题个性化的最先进性能,且可迁移至其他骨干网络。
Comments 20 pages, 8 figures, ACM SIGGRAPH Asia 2026
CodeOCR: 关于视觉语言模型在代码理解中的有效性
机构 * Shanghai Jiao Tong University China ; Hohai University China ; Singapore Management University Singapore ; Imperial College London United Kingdom ; East China Normal University \& Shanghai Innovation Institute China ; Chongqing University China ; Shanghai Jiao Tong University ; Hohai University ; Singapore Management University ; Imperial College London ; East China Normal University \& Shanghai Innovation Institute ; Chongqing University
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 本文探讨多模态大语言模型在代码理解中的有效性,发现其可通过图像压缩显著提升效率,并在代码克隆检测等任务中表现出更强的抗压缩能力。
Comments ISSTA 2026 camera ready. Code and data are available at https://github.com/YerbaPage/CodeOCR
P2Fusion:基于提示的双先验蒸馏红外-可见光图像渐进融合
机构 * Northwestern Polytechnical University(西北工业大学) ; Hefei University of Technology(合肥工业大学) ; Rocket Force University of Engineering(火箭军工程大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 针对红外-可见光图像融合的信息差异挑战,提出基于双固有提示的P2Fusion框架,结合Teach-to-Fuse机制与GDER模块,在多数据集上实现SOTA性能并提升下游感知鲁棒性。
Comments Accepted by ECCV 2026. Website: https://p2fusion.github.io
宪法性在策略安全蒸馏
机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; City University of Hong Kong(香港城市大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。
AWARe:基于激活加权的自适应保留缓解灾难性遗忘
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) ; Graduate School of Information Science, Hokkaido University(北海道大学信息科学研究院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 针对多模态大语言模型微调时的灾难性遗忘问题,提出无需修改架构的AWARe方法,通过激活加权控制参数更新,在保留上游能力的同时提升下游性能。
FM-LLM:一种用于适配大语言模型(LLMs)进行时间序列预测的频率增强型混合专家框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; China Telecom Research Institute(中国电信研究院)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI
AI总结 本研究提出FM-LLM框架,通过频谱标记对齐器与非对称MoE解码器等设计,在11个基准的多数指标上优于现有LLM基线,且具备良好迁移性。
Journal ref R. Gu, Y. Ding, J. Li, Y. Ding, W. Sang, X. Huo, X. Qin, and Y. Ji, Knowl.-Based Syst., vol.341, p.115776, 2026
ProtoHGF-Net:用于RGBT目标检测的模态内校准原型超图融合网络
机构 * Zhejiang Normal University(浙江师范大学) ; National University of Defense Technology(国防科技大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 针对现有RGBT目标检测方法密集跨模态交互易引入背景干扰的问题,提出ProtoHGF-Net框架,通过原型级语义交互与教师掩码校准蒸馏技术,在三个公开数据集上取得最优性能。
Comments Accepted to ACM MM 2026
UniSemAlign:基于基础编码器的文本-原型对齐用于半监督病理分割
机构 * AI VIETNAM Lab, Vietnam(AI VIETNAM实验室,越南) ; Hanoi University of Science and Technology, Vietnam(河内科技大学,越南)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 UniSemAlign通过引入显式类别结构提升视觉分割,利用共享嵌入空间中的原型和文本对齐分支,减少类别模糊性并稳定伪标签优化,实验表明其在有限标注下显著优于现有半监督方法。
Comments Accepted at CVPR 2026 Workshop. 11 pages, 5 figures, 4 tables
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6803--6813
BooST:桥接语义与运动以实现高效的技能迁移
机构 * Seoul National University(首尔大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 BooST是桥接语义与运动的两阶段框架,通过跨模态VQ-VAE生成统一技能表示并蒸馏为轻量级策略,在仿真与真实机器人场景下实现了更优的少样本适配、跨领域技能迁移及鲁棒性。
Comments Project page: https://boost-robots.github.io/