A Network-based Multimodal Data Fusion Approach for Characterizing Dynamic Multimodal Physiological Patterns
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments Accepted in 2018 IEEE International Conference on Image Processing
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract)
Comments Preliminary work
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 8 pages, under review
专题命中 多模态训练与对齐 :multi-modal(title,abstract)
Comments 9 pages, 26th International Conference on Computer Communication and Networks (ICCCN), Vancouver, BC, Canada, 2017, pp. 1-9
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments Proceedings of the 25th European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning, April 2017, Bruges, Belgium
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 14 pages, 6 figures, Siam Data Mining 2017
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments IEEE Wireless Communications and Networking Conference (WCNC), 2017
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 5 pages, 5 figures, under review
专题命中 多模态训练与对齐 :multi-modal(title,abstract)
Comments 20 pages, 4 figures, under submission
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 24 pages, 8 figures
专题命中 多模态训练与对齐 :multimodal(title,comments);分类 cs.CV、cs.AI
Comments Keywords: Multimodal Fusion, Breast Cancer, Whole Slide Images, Survival Prediction
SMA:谁说的?半黑盒RAG控制中的成员泄露审计
机构 * Sun Yat-Sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Science(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.AI
AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。
FIRM:面向遥感推理分割的掩码细粒度令牌内表示
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出FIRM模型,通过预测视觉令牌内的r×r二值子单元掩码代码结合轻量连续渲染器优化边界,在5个遥感推理分割基准上取得领先结果,提升了细粒度分割性能。
Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI
AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。
多模态大模型模态迁移:自主地理信息系统智能体的先决条件
机构 * Graz University of Technology(格拉茨工业大学) ; University of Vienna(维也纳大学) ; University of Liverpool(利物浦大学)
专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);multi-modal(abstract);分类 cs.AI
AI总结 本文针对自主GIS智能体的先决条件,提出LMM模态迁移任务,发现现有LMM在图像与文本模态间传递空间信息的能力不足,需加强多模态对齐以实现地理空间理解。
通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化
机构 * China University of Petroleum (East China)(中国石油大学(华东)) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Great Wall Motor(长城汽车) ; Nanyang Technological University(南洋理工大学) ; The University of Hong Kong(香港大学)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。
Comments This paper has been accepted by ACM MM 2026
作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位
机构 * National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。
Comments Accepted to ECCV 2026
通过从细到粗的监督实现SigLIP-HD
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 研究如何在低成本下实现精细视觉感知,提出SigLIP-HD,采用从细到粗监督设计,基于SigLIP 2模型构建,在相同推理预算下能产生更好视觉令牌,在多基准测试中结果优于基线模型。
Comments ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD
HumanOmni-Speaker: 识别说话者说了什么以及何时
机构 * Tongyi Lab Alibaba Group(阿里云实验室) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV
AI总结 本文提出HumanOmni-Speaker,通过视觉注册说话人辨识与识别方法,解决多人物对话中说话者身份与时间的识别问题,实现端到端的多模态协同。
理解多模态大语言模型如何通过Token激活图描述艺术品
机构 * University of Bari Aldo Moro(巴里阿尔多莫罗大学) ; University of Zurich(苏黎世大学)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 使用Token激活图(TAM)分析MLLMs在描述艺术品时对视觉区域的依赖,发现不同语义类别的token在视觉基础上有显著差异,并比较了TAM与SAM~3开放词汇分割。
Comments Accepted at PRESTIGE workshop at ICPR 2026
SpatialSV: 通过任务导向的视觉监督在多模态大语言模型中内化可解释的3D空间感知
机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
专题命中 多模态训练与对齐 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV
AI总结 提出SpatialSV框架,通过任务导向的视觉监督将MLLM的2D特征提升为显式3D表示(深度图、相机姿态、点云),实现可解释的3D空间感知内化,无需外部工具,并在半监督设置中展现强泛化能力。
Comments Accepted by IJCAI 2026
DV-SFT: 直接视觉监督用于细粒度视觉理解
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院) ; Beihang University(北航) ; Zhongguancun Laboratory(中关村实验室) ; Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科学技术东南学院)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出DV-SFT方法,通过为视觉令牌构建显式令牌级监督信号,利用OCR场景中的直接视觉-文本对应关系,在不修改模型架构或增加前向传播的情况下,显著提升多模态大语言模型的细粒度视觉理解能力。
Comments Under Review