TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory
TRAM:利用轨迹衍生辅助记忆增强多模态推理
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
TRAM:利用轨迹衍生辅助记忆增强多模态推理
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。
地图作为提示:学习用于跨场景无线定位的多模态空间信号基础模型
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Pengcheng Laboratory(鹏城实验室) ; Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)
专题命中 其他多模态 :multi-modal(title);multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 针对无线定位在不同环境中面临的挑战及现有方法的局限,提出多模态基础模型SigMap,通过循环自适应掩码策略和“地图即提示”框架学习无线表示并实现跨场景适应,实验证明其性能领先且零样本泛化能力强。
Comments 17pages, 9 figures, poster in International Conference on Learning Representations (ICLR), 2026
BVS:用于细粒度感知的基于多模态大语言模型的贝叶斯视觉搜索
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 针对多模态大语言模型在超高分辨率图像细粒度感知的难题,提出BVS框架,将感知设为连续空间尺度流形上的全局优化问题,通过先验引导与后验校正提升性能。
Comments Accepted by ICML 2026. Project page with code: https://github.com/PKU-ICST-MIPL/BVS_ICML2026
MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Zhongguancun Academy(中关村学院)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。
Comments 18 pages, 8 figures
TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。
Comments ICML2026
通过链式模态优化提升多模态联邦学习
机构 * School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China(天津理工大学计算机科学与工程学院) ; Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) ; College of Computer Science, Inner Mongolia University, Hohhot, Inner Mongolia, China(内蒙古大学计算机学院)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对多模态联邦学习中模态竞争导致全局模型次优的问题,提出FedMChain框架,通过分阶段优化、误差补偿正则化和稀疏符号引导聚合,提升预测性能并降低通信开销。
AnomSeer: 增强多模态大语言模型进行时间序列异常检测的推理能力
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 提出AnomSeer,通过专家思维链和基于最优传输的时间序列接地策略优化,增强多模态大语言模型在时间序列异常检测中的细粒度推理能力,统一异常分类、定位和解释。
Comments ICML 2026
通过标签空间重塑平衡多模态学习
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对多模态学习中模态不平衡问题,提出基于标签空间重塑的BMLR方法,通过均衡各模态映射难度来提升多模态性能。
Comments In process
RAVE: 重新分配大型多模态模型中的视觉注意力
机构 * Qwen Business Unit of Alibaba(阿里巴巴文勤业务部) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Beijing Institute of Technology(北京理工大学)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对大型多模态模型中标准注意力机制存在的跨模态误分配和视觉内不平衡问题,提出轻量级成对门控机制RAVE,通过学习查询-键偏置重新分配视觉注意力,在多个多模态基准上平均提升3个百分点,尤其对感知密集型任务效果显著。
解析多模态上下文学习:现代Transformer中的模态不对称性与电路动力学
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; DeepMind(深Mind) ; Beijing University of Posts(北京邮电大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 通过可控实验,研究现代Transformer中多模态上下文学习的基本机制,发现模态间学习不对称性,并揭示其背后的归纳式电路机制。
Comments ICML 2026 Spotlight
模态感知的身份构建与反事实结构学习用于无ID多模态推荐
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 本文提出了一种名为MAIL的新型方法,通过模态感知的身份构建模块和反事实结构学习范式,解决无ID多模态推荐中身份表示静态和图学习不足的问题,提升了推荐准确率。
Comments 11 pages, 5 figures, submitted to IEEE Transactions on Multimedia
多模态引导的多源领域适应用于目标检测
机构 * Sejong University(世宗大学) ; NAVER LABS(NAVER实验室) ; Artificial Intelligence and Robotics Institute (AIRI)(人工智能与机器人研究所(AIRI))
专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出MS-DePro方法,通过深度引导定位和多模态引导提示学习,提升多源领域适应性能,实现目标检测的最优效果。
多模态PFN:扩展先验数据拟合网络以进行多模态表格学习
机构 * Samsung Electronics(三星电子) ; Seoul National University of Science and Technology(首尔科学技术大学)
专题命中 其他多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
AI总结 本文提出MMPFN,通过引入多头门控MLP和跨注意力池化器,扩展TabPFN以处理表格和非表格模态,实验证明其在医疗和通用多模态数据集上优于现有方法。
Comments Accepted to CVPR 2026
基于表格的思考:通过神经符号推理增强多模态表格理解
机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) ; School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国)
专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL
AI总结 本文提出TWT框架,通过神经符号推理解决表格数据结构多样性、特征依赖复杂性及任务异质性问题,在八个数据集上验证了其在多模态表格理解任务中的优越性能。
Comments 20 pages, 6 figures
Group3D: 基于多模态大语言模型的开放词汇3D目标检测语义分组
机构 * Department of Artificial Intelligence, Sungkyunkwan University(成均馆大学人工智能系) ; Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)
专题命中 其他多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 Group3D通过将语义约束整合到实例构建过程中,解决多视角开放词汇3D目标检测中的几何过合并问题,实现语义与几何一致性融合的检测框架。
Comments 24 pages, 7 figures, Project page: https://ubin108.github.io/Group3D/
当视觉隐私保护与多模态大语言模型相遇
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文研究多模态大语言模型在提供便利性的同时如何保护视觉隐私,提出基于黑盒模型的优化框架,通过帕累托最优和关键历史增强优化实现隐私与性能的平衡。
Journal ref Int J Comput Vis (IJCV) 134, 167 (2026)
UniMMAD: 一种基于MoE驱动特征解压的多模态多类别异常检测统一框架
专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 UniMMAD通过MoE驱动的特征解压机制,实现多模态和多类别异常检测的统一,解决传统方法在领域变化和内存占用上的不足,提升检测效率与准确性。
Comments Accepted by CVPR 2026
混合策略强化学习可调节探索用于多模态推理
机构 * Aberystwyth University(阿伯里斯特维斯大学) ; Institute of Artificial Intelligence (TeleAl)(人工智能研究所) ; China Telecom(中国电信) ; Tsinghua University(清华大学)
专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。
Comments Published as a conference paper at ICLR 2026
OrchMLLM: 通过批量后平衡 orchestrate 多模态数据以加速多模态大语言模型训练
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 OrchMLLM通过批量后平衡调度器和全局协调器解决多模态数据训练中的模态不一致问题,提升训练效率和可扩展性。
基于图的多模态轻量网络用于自适应脑肿瘤分割
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Peking University(北京大学)
专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于图的多模态轻量网络GMLN-BTS,通过多尺度语义提取、图结构建模和体素细化上采样模块,实现高精度且资源高效的脑肿瘤分割。
PositionOCR: 通过混合专家整合增强多模态模型的位置意识
专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 PositionOCR通过整合文本定位专家与LLM的上下文能力,提升多模态模型在文本定位和定位任务中的位置准确性。
多模态大语言模型如何支持视障人士获取视觉信息:一项与盲人和低视力人士的日记研究
机构 * Cornell University(康奈尔大学)
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 本研究探讨了多模态大语言模型如何通过视觉助手技能支持视障人士获取视觉信息,并发现其在实际应用中的表现及改进方向。
Comments 24 pages, 17 figures, 7 tables, appendix section, to appear main track CHI 2026
视觉如何转化为语言:多模态推理的逐层信息论分析
机构 * Duke kunshan University, Duke University(杜克昆山大学、杜克大学) ; The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) ; Fudan University, Shanghai, China(复旦大学)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 本研究通过逐层信息论分析揭示多模态Transformer中视觉信息如何转化为语言,发现视觉独特信息早期峰值,语言独特信息在晚期层主导预测,跨模态协同较低,且任务依赖性强。
超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学)
专题命中 其他多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL
AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。
Comments GMNER
从缓解分类能力失衡角度重新思考多模态学习
机构 * Nanjing University of Science and Technology(南京理工大学) ; State Key Lab. for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于提升原理的多模态学习方法,通过动态平衡弱强模态的分类能力以缓解模态不平衡问题。
Comments Accepted by NeurIPS 2025
面向大规模和小规模模型的不确定性感知协作系统用于多模态情感分析
机构 * School of Computer Science, South China Normal University(计算机科学学院,华南师范大学) ; School of Artificial Intelligence, South China Normal University(人工智能学院,华南师范大学) ; School of Electronics and Information Technology, Sun Yat-sen University(电子与信息工程学院,中山大学)
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL
AI总结 本文提出U-ACS系统,通过整合UBM与MLLMs,利用不确定性感知机制提升多模态情感分析的效率与性能。
一种互结构加权的子像素多模光学遥感图像匹配方法
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于相位一致性互结构加权的子像素多模光学遥感图像匹配方法,通过粗到细的框架提升匹配精度,实测平均精度达0.4像素。
毫米波通信中基于多模态真实模拟框架的高效波束预测
机构 * Department of Computer Science and Engineering, Kyung Hee University(计算机科学与工程系,庆尚大学) ; Bradley Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工大学) ; Department of Electronic Systems, Aalborg University(电子系统系,奥尔堡大学)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出了一种基于多模态真实模拟框架的资源高效学习框架,通过跨模态关系知识蒸馏算法,利用雷达数据实现高精度波束预测,同时降低计算复杂性和对多模态传感器数据的依赖。
Comments 13 pages, 9 figures, Submitted to IEEE Transactions on Mobile Computing on Dec. 01, 2025
学习细胞感知的层次多模态表示以实现稳健的分子建模
专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 CHMR通过联合建模分子与细胞反应的层次依赖关系,提升分子建模的稳健性和生物学基础。
Comments Accepted to AAAI 2026 (Oral)
机构 * UCLA(加州大学洛杉矶分校) ; Columbia University(哥伦比亚大学) ; Brookhaven National Laboratory(布鲁克海文国家实验室)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
Comments 25 pages, 12 figures, 8 tables