arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-13 至 2026-01-13 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2601.07178 2026-01-13 cs.CV cs.AI 84%

DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection

DIVER: 动态迭代视觉证据推理用于多模态虚假新闻检测

Weilin Zhou, Zonghao Ying, Chunlei Meng, Jiahui Liu, Hengyang Zhou, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * Xinjiang University(新疆大学) AI Security Lab(360人工智能安全实验室) Beihang University(北航) Fudan University(复旦大学) Central South University(中南大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 DIVER通过动态迭代视觉证据推理提升多模态虚假新闻检测性能,利用文本和视觉证据融合优化检测效果。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01939 2026-01-13 cs.AI 79%

OpenSocInt: A Multi-modal Training Environment for Human-Aware Social Navigation

OpenSocInt: 一种多模态训练环境用于人感知的社会导航

Victor Sanchez, Chris Reinke, Ahamed Mohamed, Xavier Alameda-Pineda

机构 * Inria at Univ. Grenoble Alpes, LJK, CNRS(Inria与格勒诺布尔阿尔卑斯大学、LJK、CNRS)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 OpenSocInt是一个开源多模态训练环境,用于研究人感知的社会导航,支持不同感知特征的编码与融合以及多种代理的训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00521 2026-01-13 cs.LG cs.CL q-bio.QM 79%

Rep3Net: An Approach Exploiting Multimodal Representation for Molecular Bioactivity Prediction

Rep3Net:一种利用多模态表示进行分子生物活性预测的方法

Sabrina Islam, Md. Atiqur Rahman, Md. Bakhtiar Hasan, Md. Hasanul Kabir

机构 * Computer Science and Engineering, Islamic University of Technology, Bangladesh(计算机科学与工程,伊斯兰技术大学,孟加拉国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 Rep3Net通过融合分子描述符、图特征和SMILES嵌入,提升了PARP1生物活性预测的准确性,并在药物发现中展示了高效能的多模态方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06848 2026-01-13 cs.CL 79%

Explainable Multimodal Aspect-Based Sentiment Analysis with Dependency-guided Large Language Model

可解释的多模态基于方面的情感分析与依赖引导的大语言模型

Zhongzheng Wang, Yuanhe Tian, Hongzhi Wang, Yan Song

机构 * Harbin Institute of Technology(哈尔滨工程大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12195 2026-01-13 cs.CL 79%

Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion

浏览与聚焦:通过先验LLM上下文融合理解多模态内容

Ziyue Wang, Chi Chen, Yiqi Zhu, Fuwen Luo, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出浏览与聚焦两阶段范式,通过融合先验LLM上下文提升多模态内容理解,显著提升多图像场景的性能。

Comments 17 pages, 5 figures

Journal ref ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06140 2026-01-13 cs.LG stat.ML 78%

Causal and Federated Multimodal Learning for Cardiovascular Risk Prediction under Heterogeneous Populations

因果与联邦多模态学习用于异质人群中的心血管风险预测

Rohit Kaushik, Eva Kaushik

机构 * Hanson Professional Services(Hanson专业服务) University of Tennessee, Knoxville(田纳西大学 Knoxville分校) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种融合因果学习与联邦学习的多模态框架,用于在异质人群中预测心血管风险,通过整合多种生物医学数据并确保隐私和可解释性,提升预测的鲁棒性和公平性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08667 2026-01-13 cs.CV cs.MM 62%

Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization

通过分层双阶段优化学习通用且高效的图像水印技术

Ke Liu, Xuanhan Wang, Qilong Zhang, Lianli Gao, Jingkuan Song

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科学与技术大学) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出分层双阶段优化框架,通过学习通用且高效的图像水印技术,提升水印提取准确率并保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06835 2026-01-13 cs.CV cs.AI 62%

OSCAR: Optical-aware Semantic Control for Aleatoric Refinement in Sar-to-Optical Translation

OSCAR:面向随机细化的语义控制光学感知SAR到光学翻译

Hyunseo Lee, Sang Min Kim, Ho Kyung Shin, Taeheon Kim, Woo-Jeoung Nam

机构 * Kyungpook National University(庆北国立大学) Korea Aerospace Research Institute(韩国航空航天研究机构)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 OSCAR通过跨模态语义对齐、语义引导生成指导和不确定性感知目标,提升SAR到光学图像翻译的语义一致性和感知质量。

Comments main 15 pages, supplementary 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 57%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06473 2026-01-13 eess.SY cs.LG cs.SY 50%

Hybrid LSTM-UKF Framework: Ankle Angle and Ground Reaction Force Estimation

混合LSTM-UKF框架:踝角和地面反作用力估计

Mundla Narasimhappa, Praveen Kumar

机构 * Department of Computer Science Engineering SRMIST University(计算机科学工程系 SRMIST 大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出混合LSTM-UKF框架,用于在不同行走速度下准确估计踝角和地面反作用力,通过多模态传感器融合提升生物力学分析的可靠性。

Comments 8

详情

展开后加载摘要…

URL PDF HTML 收藏