arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-25 至 2025-12-25 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4 篇

2511.12870 2025-12-25 cs.CV 83%

View-aware Cross-modal Distillation for Multi-view Action Recognition

视点感知的多模态知识蒸馏用于多视图动作识别

Trung Thanh Nguyen, Yasutomo Kawanishi, Vijay John, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学) Guardian Robot Project, R-IH, RIKEN(守护机器人项目,RIIH,理化学研究所) Lawrence Technological University(劳伦斯技术大学)

专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 ViCoKD通过视点感知的多模态知识蒸馏方法,在多视图动作识别中提升模型性能,有效解决视点不一致问题。

Comments IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20898 2025-12-25 cs.CV cs.AI 73%

DGSAN: Dual-Graph Spatiotemporal Attention Network for Pulmonary Nodule Malignancy Prediction

DGSAN:双图时空注意力网络用于肺结节恶性预测

Xiao Yu, Zhaojie Fang, Guanyu Zhou, Yin Shen, Huoling Luo, Ye Li, Ahmed Elazab, Xiang Wan, Ruiquan Ge, Changmiao Wang

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 DGSAN通过双图时空注意力网络融合多模态数据,提升肺结节恶性预测的准确性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12284 2025-12-25 eess.IV cs.AI cs.AR cs.CV cs.MM 67%

V-Rex: Real-Time Streaming Video LLM Acceleration via Dynamic KV Cache Retrieval

V-Rex: 通过动态KV缓存检索实现实时视频大语言模型加速

Donghyuk Kim, Sejeong Yang, Wonjin Shin, Joo-Young Kim

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 V-Rex通过动态KV缓存检索算法和硬件加速器,实现边缘设备上的实时视频LLM推理,显著提升速度和能效。

Comments 14 pages, 20 figures, conference, accepted by HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21105 2025-12-25 cs.HC 50%

Volatile Organic Compounds for Stress Detection: A Scoping Review and Exploratory Feasibility Study with Low-Cost Sensors

挥发性有机化合物用于压力检测:一项综述和探索可行性研究,结合低成本传感器

Nicolai Plintz, Marcus Vetter, Dirk Ifenthaler

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文通过综述和探索性研究,证明低成本传感器可捕捉压力相关的VOC模式,揭示了VOC在情绪识别中的应用潜力及实施挑战。

Comments 13 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏