arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-19 至 2026-02-19 共收录 38 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2602.08755 2026-02-19 cs.LG 78%

Align and Adapt: Multimodal Multiview Human Activity Recognition under Arbitrary View Combinations

对齐与适应:在任意视图组合下的人类活动识别多模态多视角学习

Duc-Anh Nguyen, Nhien-An Le-Khac

机构 * University College Dublin(都柏林大学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 AliAd通过结合多视角对比学习和专家混合模块,实现任意视图组合下的灵活多模态人类活动识别,提升模型适应性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08177 2026-02-19 cs.CV cs.AI 73%

MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision

MedReasoner: 通过强化学习实现从临床思维到像素级精度的推理 grounding

Zhonghao Yan, Muxi Diao, Yuxuan Yang, Ruoyan Jing, Jiayuan Xu, Kaizhou Zhang, Lele Yang, Yanxi Liu, Kongming Liang, Zhanyu Ma

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MedReasoner 通过强化学习实现从临床推理到像素级精度的医学影像 grounding,提出统一医学推理 grounding 任务和 U-MRG-14K 数据集,展示其在医学影像分析中的优越性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16681 2026-02-19 cs.CV 57%

VETime: Vision Enhanced Zero-Shot Time Series Anomaly Detection

VETime: 基于视觉增强的零样本时间序列异常检测

Yingyuan Yang, Tian Lan, Yifei Gao, Yimeng Lu, Wenjun He, Meng Wang, Chenghao Liu, Chen Zhang

机构 * Department of Industrial Engineering, Tsinghua University, Beijing, China(清华大学工业工程系) Lab, Huawei Technologies Ltd, Beijing, China(华为技术有限公司2012实验室) Datadog AI Research(Datadog人工智能研究)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 VETime通过融合视觉与时间模态,提出零样本时间序列异常检测框架,实现高精度定位与低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15857 2026-02-19 cs.CL 57%

Multi-source Heterogeneous Public Opinion Analysis via Collaborative Reasoning and Adaptive Fusion: A Systematically Integrated Approach

通过协同推理与自适应融合进行多源异构公共意见分析:一种系统整合方法

Yi Liu

机构 * Yi Liu School of Software Xi’an Jiaotong University(刘毅 软件学院 西安交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出CRAF框架,通过协同推理与自适应融合整合传统方法与LLMs,提升多源异构公共意见分析的跨平台适应性与性能

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16584 2026-02-19 q-bio.NC 50%

The Representational Alignment Hypothesis: Evidence for and Consequences of Invariant Semantic Structure Across Embedding Modalities

表征对齐假说:跨嵌入模态的不变语义结构的证据及其后果

Akhil Ramidi, Kevin Scharp

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 该研究提出表征对齐假说,探讨跨模态嵌入的不变语义结构,质疑其根本性,并提出新的哲学视角和区分方法。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 3 篇

2512.23597 2026-02-19 cs.CV cs.IR 79%

Scalable Residual Feature Aggregation Framework with Hybrid Metaheuristic Optimization for Robust Early Pancreatic Neoplasm Detection in Multimodal CT Imaging

可扩展的残差特征聚合框架与混合元启发式优化用于多模CT影像中胰腺肿瘤的稳健早期检测

Janani Annur Thiruvengadam, Kiran Mayee Nabigaru, Anusha Kovi

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种结合残差特征聚合与混合元启发式优化的框架,用于多模CT影像中胰腺肿瘤的稳健早期检测,实现了高准确率和泛化能力。

Comments Accepted at 11th International Conference on Big Data Analytics (ICBDA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15915 2026-02-19 cs.CV cs.AI 73%

MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering

MaS-VQA: 一种基于掩码和选择的基于知识的视觉问答框架

Xianwei Mao, Kai Ye, Sheng Zhou, Nan Zhang, Haikuan Huang, Bin Li, Jiajun Bu

机构 * Zhejiang University, Hangzhou, China(浙江大学, 杭州, 中国) Alibaba Group, Hangzhou, China(阿里巴巴集团, 杭州, 中国)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MaS-VQA通过结合显式知识过滤与隐式知识推理,提升基于知识的视觉问答任务的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16004 2026-02-19 q-bio.NC q-bio.QM 50%

Time-Varying Directed Interactions in Functional Brain Networks: Modeling and Validation

功能脑网络中时间变化的定向交互:建模与验证

Nan Xu, Xiaodi Zhang, Wen-Ju Pan, Jeremy L. Smith, Eric H. Schumacher, Jason W. Allen, Vince D. Calhoun, Shella D. Keilholz

专题命中 其他多模态 :multimodal(abstract)

AI总结 SWpC通过嵌入方向性线性时不变模型,提供时间变化定向功能性连接的生物可解释性分析,适用于多模态验证和临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏