arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-25 至 2025-12-25 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 8 篇

2512.20670 2025-12-25 cs.LG cs.AI 83%

Disentangling Fact from Sentiment: A Dynamic Conflict-Consensus Framework for Multimodal Fake News Detection

区分事实与情感:一种动态冲突-共识框架用于多模态虚假新闻检测

Weilin Zhou, Zonghao Ying, Junjie Mu, Shengwei Tian, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * Xinjiang University(新疆大学) AI Security Lab(360AI安全实验室) Beihang University(北航) South China University of Technology(华南理工大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出动态冲突-共识框架,通过区分事实与情感空间,利用物理启发式特征动态和冲突-共识机制,提升多模态虚假新闻检测的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19512 2025-12-25 cs.CV cs.AI 81%

Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation

Anatomy-R1: 通过解剖相似性课程和群体多样性增强多模态大语言模型的解剖推理

Ziyang Song, Zelin Zang, Zuyao Chen, Xusheng Liang, Dong Yi, Jinlin Wu, Hongbin Liu, Jiebo Luo, Zhen. Lei

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Anatomy-R1通过解剖相似性课程和群体多样性增强方法提升多模态大语言模型在医学影像中的解剖推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20892 2025-12-25 cs.CV 74%

Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification

超越权重适应:基于特征空间的域注入用于跨模态船舶重识别

Tingfeng Xian, Wenlve Zhou, Zhiheng Zhou, Zhelin Li

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Key Laboratory of Big Data and Intelligent Robot, Ministry of Education, South China University of Technology(大数据与智能机器人教育部重点实验室)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 本文提出基于特征空间的域注入方法,解决跨模态船舶重识别中的模态差异问题,通过轻量级模型提升性能,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22615 2025-12-25 cs.CV cs.AI cs.CL 67%

GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting

GaussianVision: 通过二维高斯散射从压缩图像表示中实现视觉-语言对齐

Yasmine Omri, Connor Ding, Tsachy Weissman, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GaussianVision通过二维高斯散射实现高效的视觉-语言对齐,提升边缘设备传输效率并优化多模态学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21264 2025-12-25 cs.CV 57%

AnyAD: Unified Any-Modality Anomaly Detection in Incomplete Multi-Sequence MRI

AnyAD:统一的多序列MRI任意模态异常检测

Changwei Wu, Yifei Chen, Yuxin Du, Mingxuan Liu, Jinying Zong, Beining Wu, Jie Dong, Feiwei Qin, Yunkang Cao, Qiyuan Tian

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) School of Biomedical Engineering, Tsinghua University(生物医学工程学院,清华大学) HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子科技大学-ITMO联合研究所) School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 AnyAD提出了一种统一的多模态MRI异常检测框架,通过双路径编码器和特征对齐机制实现任意模态下的稳健检测,实验表明其在多种模态组合中优于现有基线方法。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21065 2025-12-25 cs.RO cs.CV 57%

Language-Guided Grasp Detection with Coarse-to-Fine Learning for Robotic Manipulation

基于粗到细学习的语言引导抓取检测用于机器人操作

Zebin Jiang, Tianle Jin, Xiangtong Yao, Alois Knoll, Hu Cao

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于粗到细学习的语言引导抓取检测方法,通过跨模态融合和动态卷积头提升抓取精度与鲁棒性,实验证明其在复杂环境中的有效性。

Comments Submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20921 2025-12-25 cs.CV 57%

Self-supervised Multiplex Consensus Mamba for General Image Fusion

自监督多乘共识Mamba用于通用图像融合

Yingying Wang, Rongjin Zhuang, Hui Zheng, Xuanhua He, Ke Cao, Xiaotong Tu, Xinghao Ding

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 SMC-Mamba通过自监督多乘共识机制提升通用图像融合性能,有效整合多模态信息并优化下游任务表现。

Comments Accepted by AAAI 2026, 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20633 2025-12-25 cs.LG cs.AI 57%

Enhancing Lung Cancer Treatment Outcome Prediction through Semantic Feature Engineering Using Large Language Models

通过大语言模型进行语义特征工程提升肺癌治疗预后预测

MunHwan Lee, Shaika Chowdhury, Xiaodi Li, Sivaraman Rajaganapathy, Eric W Klee, Ping Yang, Terence Sio, Liewei Wang, James Cerhan, Nansu NA Zong

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用大语言模型进行语义特征工程,提升肺癌治疗预后预测的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏