arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-01 至 2025-12-01 共收录 111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 20 篇

2511.21705 2025-12-01 cs.CL cs.CV 86%

Insight-A: Attribution-aware for Multimodal Misinformation Detection

Insight-A: 多模态虚假信息检测中的归因意识

Junjie Wu, Yumeng Fu, Chen Gong, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 Insight-A通过归因意识和分层推理提升多模态虚假信息检测效果,有效识别伪造来源并增强跨模态一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23070 2025-12-01 cs.CV cs.LG 85%

Buffer replay enhances the robustness of multimodal learning under missing-modality

缓冲回放增强了在缺失模态下的多模态学习的鲁棒性

Hongye Zhu, Xuan Liu, Yanwen Ba, Jingye Xue, Shigeng Zhang

机构 * College of Computer Science and Electronic Engineering Hunan University(湖南大学计算机科学与电子工程学院) School of Computer Science Central South University(中南大学计算机学院)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);vision-language-audio(abstract);分类 cs.CV

AI总结 REP通过特征缓冲和动态初始化提升多模态学习在缺失模态下的鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22232 2025-12-01 cs.CV cs.AI cs.CL 85%

From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation

从复合图形到综合理解:开发一种从生物医学文献中基于医疗多图像基准测试和验证的多模态大语言模型

Zhen Chen, Yihang Fu, Gabriel Madera, Mauro Giuffre, Serina Applebaum, Hyunjae Kim, Hua Xu, Qingyu Chen

机构 * Department of Biomedical Informatics and Data Science, Yale School of Medicine, Yale University, New Haven, CT 06510, USA(耶鲁医学院生物医学信息学与数据科学系,耶鲁大学,新 Haven,CT 06510,USA) School of Medicine, University of Puerto Rico, San Juan, PR 00921, USA(波多黎各大学医学院,波多黎各,San Juan,PR 00921,USA)

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出M3LLM,一种基于生物医学文献中复合图像的多模态大语言模型,通过分而治之策略提升多图像理解能力,实验证明其在多图像、单图像等场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23375 2025-12-01 cs.CL cs.CV 81%

Optimizing Multimodal Language Models through Attention-based Interpretability

通过基于注意力的可解释性优化多模态语言模型

Alexander Sergeev, Evgeny Kotelnikov

机构 * European University at Saint Petersburg(圣彼得堡欧洲大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 通过基于注意力的可解释性方法优化多模态语言模型,识别关键对象相关的注意力头以提高效率和性能。

Comments Accepted for ICAI-2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21947 2025-12-01 cs.CV cs.AI cs.LG 81%

WalkCLIP: Multimodal Learning for Urban Walkability Prediction

WalkCLIP: 城市步行性预测的多模态学习

Shilong Xiang, JangHyeon Lee, Min Namgung, Yao-Yi Chiang

机构 * University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 WalkCLIP通过整合视觉和行为数据,实现了对城市步行性的高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22664 2025-12-01 cs.CV 79%

VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models

VaMP:用于视觉-语言模型的变分多模态提示学习

Silin Cheng, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 VaMP提出了一种变分多模态提示学习框架,通过实例条件提示和不确定性建模提升视觉-语言模型在少样本和领域泛化任务中的性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22341 2025-12-01 cs.CV cs.LG 77%

Unexplored flaws in multiple-choice VQA evaluations

多选式视觉问答评估中的未探索缺陷

Fabio Rosenthal, Sebastian Schmidt, Thorsten Graf, Thorsten Bagodonat, Stephan Günnemann, Leo Schwinn

机构 * Technical University of Munich(慕尼黑技术大学) Volkswagen AG(大众集团) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 本文揭示了多选式视觉问答评估中因提示格式变化导致的未探索偏差,指出其对MLLM评估结果的显著影响,并表明现有缓解策略无法有效应对这些新发现的偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22906 2025-12-01 cs.CV 70%

See, Rank, and Filter: Important Word-Aware Clip Filtering via Scene Understanding for Moment Retrieval and Highlight Detection

见、排、滤:通过场景理解的重要词感知Clip过滤用于片段检索和亮点检测

YuEun Lee, Jung Uk Kim

机构 * YuEun Lee, Jung Uk Kim

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出通过识别查询中的重要词,结合多模态大语言模型实现视频片段检索和亮点检测的细粒度过滤方法,提升检索和检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22256 2025-12-01 cs.CV 70%

UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation

UMind-VL:一种通用的超声视觉-语言模型,用于统一的 grounded perception 和全面的 interpretation

Dengbo Chen, Ziwei Zhao, Kexin Zhang, Shishuang Zhao, Junjie Hou, Yaqian Wang, Nianxi Liao, Anlan Sun, Fei Gao, Jia Ding, Yuhang Liu, Dong Wang

机构 * Yizhun Medical AI Team(义诊医疗AI团队)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 UMind-VL 是一种通用超声视觉-语言模型,通过统一的 grounded perception 和 comprehensive interpretation 实现对医学影像的高效理解和诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22903 2025-12-01 cs.CV cs.AI 62%

Leveraging Textual Compositional Reasoning for Robust Change Captioning

利用文本组合推理实现鲁棒的变更描述

Kyu Ri Park, Jiyoung Park, Seong Tae Kim, Hong Joo Lee, Jung Uk Kim

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 CORTEX通过整合文本线索和组合推理,提升图像变化描述的鲁棒性与准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22739 2025-12-01 cs.CV cs.AI 62%

All Centers Are at most a Few Tokens Apart: Knowledge Distillation with Domain Invariant Prompt Tuning

所有中心距离最多几个token:基于领域不变提示微调的知识蒸馏

Amir Mohammad Ezzati, Alireza Malekhosseini, Armin Khosravi, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology, Tehran, Iran(计算机工程系,谢赫拉兹大学,德黑兰,伊朗)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出领域不变提示微调(DIPT)方法,通过学习领域不变提示提升知识蒸馏效果,从而增强病理学领域模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09185 2025-12-01 cs.CV cs.AI 62%

A Neurosymbolic Framework for Interpretable Cognitive Attack Detection in Augmented Reality

面向增强现实的认知攻击检测的神经符号框架

Rongqian Chen, Allison Andreyev, Yanming Xiu, Joshua Chilukuri, Shunav Sen, Mahdi Imani, Bin Li, Maria Gorlatova, Gang Tan, Tian Lan

机构 * George Washington University(乔治华盛顿大学) Duke University(杜克大学) Pennsylvania State University(宾夕法尼亚州立大学) Northeastern University(东北大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CADAR框架,结合神经网络与符号推理,用于增强现实中的认知攻击检测,通过多模态表示和统计推理提升检测的可解释性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10157 2025-12-01 cs.AI cs.CL 62%

One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence

一个患者,许多情境:通过情境智能扩展医疗AI

Michelle M. Li, Ben Y. Reis, Adam Rodman, Tianxi Cai, Noa Dagan, Ran D. Balicer, Joseph Loscalzo, Isaac S. Kohane, Marinka Zitnik

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出情境切换技术,通过调整模型推理而非重新训练,使医疗AI能适应不同专科、人群和地理环境,提升其在现实护理中的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02821 2025-12-01 cs.CV cs.AI cs.LG 62%

Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models

稀疏自编码器在视觉-语言模型中学习单义特征

Mateusz Pach, Shyamgopal Karthik, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) University of Tübingen(图宾根大学) University of Copenhagen(哥本哈根大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过稀疏自编码器提升视觉-语言模型中神经元的单义性,展示其在增强模型可解释性和可控性方面的有效性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23112 2025-12-01 cs.CV cs.LG 57%

MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?

MathSight: 一个探索视觉语言模型在大学级数学推理中是否真正看到的基准

Yuandong Wang, Yao Cui, Yuxin Zhao, Zhen Yang, Yangfu Zhu, Zhenzhou Shao

机构 * Capital Normal University(首都师范大学) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 MathSight基准测试通过对比不同视觉输入条件,探索视觉语言模型在大学级数学推理中视觉信息的真实贡献。

Comments Comments: 32 pages, 15 figures, 9 tables, includes appendix. Project page: https://cnu-bot-group.github.io/MathSight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16267 2025-12-01 cs.CV 57%

Infrared and Visible Image Fusion with Language-Driven Loss in CLIP Embedding Space

红外与可见图像融合中的语言驱动损失在CLIP嵌入空间中

Yuhao Wang, Lingjuan Miao, Zhiqiang Zhou, Lei Zhang, Yajun Qiao

机构 * School of Automation\ Institute of Technology Beijing China School of Automation\ Institute of Technology

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于语言驱动损失的IVIF方法,利用CLIP嵌入空间实现融合目标与输入图像模态的关系建模,提升融合性能。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22351 2025-12-01 cs.CV 57%

INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts

INSIGHT: 一种可解释的神经视觉-语言框架,用于生成性艺术作品的推理

Anshul Bagaria

机构 * Indian Institute of Technology, Madras, Tamil Nadu, India(印度理工学院Madras分校,泰米尔纳德州,印度)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 INSIGHT提出了一种可解释的神经视觉-语言框架,通过多尺度定位、语义对齐和结构化提示协议,实现对生成性艺术作品的鲁棒检测与透明解释。

Comments 36 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22170 2025-12-01 cs.CV 57%

Partially Shared Concept Bottleneck Models

部分共享概念瓶颈模型

Delong Zhao, Qiang Huang, Di Yan, Yiqun Sun, Jun Yu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 PS-CBM通过部分共享的概念策略和概念效率准确性度量,提升模型的分类准确性和可解释性。

Comments 14 pages, 7 figures, 11 tables, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22141 2025-12-01 cs.CL 57%

Bridging the Modality Gap by Similarity Standardization with Pseudo-Positive Samples

通过伪正样本进行相似性标准化以弥合模态差距

Shuhei Yamashita, Daiki Shirafuji, Tatsuhiko Saito

机构 * Mitsubishi Electric Corporation(三菱电机公司)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

AI总结 通过伪正样本进行相似性标准化,有效弥合跨模态检索中的模态差距,提升检索性能。

Comments Accepted to PACLIC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20330 2025-12-01 cs.RO cs.CV 57%

ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation

ArtiBench 和 ArtiBrain:可泛化的视觉-语言操纵基准测试

Yuhan Wu, Tiantian Wei, Shuo Wang, ZhiChao Wang, Yanyong Zhang, Daniel Cremers, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ArtiBench和ArtiBrain通过统一高层推理与自适应低层控制,提升可操纵物体操作的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2511.16901 2025-12-01 cs.CV 83%

R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios

R-AVST:通过细粒度时空推理增强视频大语言模型以应对复杂音频视觉场景

Lu Zhu, Tiantian Geng, Yangye Chen, Teng Wang, Ping Lu, Feng Zheng

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 R-AVST通过细粒度时空推理提升视频大语言模型,构建首个真实世界音频视觉时空推理数据集,并提出AVST-Zero模型增强推理能力。

Comments Accepted by AAAI 2026. Project page: https://github.com/zhlllau/R-AVST

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00279 2025-12-01 cs.MM cs.AI cs.CL cs.DC cs.LG cs.SD 80%

LongCat-Flash-Omni Technical Report

LongCat-Flash-Omni 技术报告

Meituan LongCat Team, Bairui Wang, Bayan, Bin Xiao, Bo Zhang, Bolin Rong, Borun Chen, Chang Wan, Chao Zhang, Chen Huang, Chen Chen, Chen Chen, Chengxu Yang, Chengzuo Yang, Cong Han, Dandan Peng, Delian Ruan, Detai Xin, Disong Wang, Dongchao Yang, Fanfan Liu, Fengjiao Chen, Fengyu Yang, Gan Dong, Gang Huang, Gang Xu, Guanglu Wan, Guoqiang Tan, Guoqiao Yu, Haibo Qiu, Hao Lu, Hongbo Liu, Hongyu Xiang, Jiaheng Wu, Jian Yang, Jiaxing Liu, Jing Huang, Jingang Wang, Jinrui Ding, Juchao Jiang, Jun Kuang, Jun Wang, Junhui Mei, Ke Ding, Kefeng Zhang, Lei Chen, Liang Shi, Limeng Qiao, Liming Zheng, Lin Ma, Liuyang Guo, Liya Ma, Luying Sun, Man Gao, Mengshen Zhu, Miao Cao, Minliang Lin, Nuo Xu, Peng Shi, Qi Zhang, Qian Fang, Qian Wang, Qian Yang, Quanxiu Wang, Rongxiang Weng, Rongxin Guo, Ruoxuan Liang, Senbin Yang, Shanbo Xu, Shanglin Lei, Shengze Ye, Shimin Chen, Shuaiqi Chen, Shujie Hu, Shuo Li, Siqi Yang, Siyu Xu, Siyu Ren, Song Li, Songxiang Liu, Tianhao Bai, Tianye Dai, Wei Hong, Wei Wang, Weixiao Zhao, Wengang Cao, Wenlong Zhu, Wenlong He, Xi Su, Xi Nan, Xiaohan Zhao, Xiaohao Wang, Xiaoyu Zhao, Xiaoyu Wang, Xiaoyu Li, Xin Pan, Xin Chen, Xiusong Sun, Xu Xiang, Xudong Xing, Xuezhi Cao, Xunliang Cai, Yang Yang, Yanli Tan, Yao Yao, Yerui Sun, Yi Chen, Yifan Lu, Yin Gong, Yining Zhang, Yitian Chen, Yiyang Gan, Yuchen Tang, Yuchen Xie, Yueqian Wang, Yuewen Zheng, Yufei Zhang, Yufeng Zhong, Yulei Qian, Yuqi Peng, Yuqian Li, Yuwei Jiang, Zeyang Hu, Zheng Zhang, Zhengkun Tian, Zhiqing Hong, Zhixiong Zeng, Zhuqi Mi, Ziran Li, Ziwen Wang, Ziyi Zhao, Ziyuan Zhuang, Zizhe Zhao

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 LongCat-Flash-Omni 是一个具有5600亿参数的开源多模态模型,通过课程启发式训练策略实现高效实时音频视觉交互,具备强大的多模态和单模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04275 2025-12-01 cs.DC 78%

DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models

DistTrain: 通过解耦训练解决多模态大语言模型中的模型与数据异质性

Zili Zhang, Yinmin Zhong, Yimin Jiang, Hanpeng Hu, Jianjian Sun, Zheng Ge, Yibo Zhu, Daxin Jiang, Xin Jin

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 DistTrain通过解耦模型编排和数据预处理,提升多模态大语言模型的训练效率和资源利用率。

Comments SIGCOMM 2025 (https://dl.acm.org/doi/10.1145/3718958.3750472)

Journal ref SIGCOMM'25: Proceedings of the ACM SIGCOMM 2025 Conference Pages 24-38

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06495 2025-12-01 cs.HC 71%

Colin: A Multimodal Human-AI Co-Creation Storytelling System To Support Children's Multi-Level Narrative Skills

Colin:一种多模态人机协同创故事叙述系统,以支持儿童的多层级叙述技能

Lyumanshan Ye, Jiandong Jiang, Yuhan Liu, Yihan Ran, Yufan Zhou, Zhao Wang, Yipeng Yu, Pengfei Liu, Danni Chang, Yucheng Jin

专题命中 音频语音多模态 :multimodal(title)

AI总结 Colin通过语音和视觉模态支持儿童多层级叙述技能发展,通过生成、理解和构建阶段提升儿童的叙事能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22025 2025-12-01 cs.CV 70%

Layover or Direct Flight: Rethinking Audio-Guided Image Segmentation

转折或直接飞行:重新思考音频引导的图像分割

Joel Alberto Santos, Zongwei Wu, Xavier Alameda-Pineda, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学、德国) Inria at Univ. Grenoble Alpes, CNRS, LJK, France(Inria于格勒诺布尔阿尔卑斯大学、CNRS、LJK、法国)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出通过直接音频-视觉对齐进行图像分割,无需依赖文本转录,提升了鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24693 2025-12-01 cs.SD cs.CL eess.AS 62%

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

STAR-Bench:探测深度时空推理作为音频4D智能

Zihan Liu, Zhikang Niu, Qiuyang Xiao, Zhisheng Zheng, Ruoqi Yuan, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Jianze Liang, Xie Chen, Leilei Sun, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 STAR-Bench通过测试音频4D智能,揭示了模型在细粒度感知和推理上的不足,为未来模型发展提供方向。

Comments Homepage: https://internlm.github.io/StarBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23404 2025-12-01 cs.LG cs.AI 57%

LFM2 Technical Report

LFM2 技术报告

Alexander Amini, Anna Banaszak, Harold Benoit, Arthur Böök, Tarek Dakhran, Song Duong, Alfred Eng, Fernando Fernandes, Marc Härkönen, Anne Harrington, Ramin Hasani, Saniya Karwa, Yuri Khrustalev, Maxime Labonne, Mathias Lechner, Valentine Lechner, Simon Lee, Zetian Li, Noel Loo, Jacob Marks, Edoardo Mosca, Samuel J. Paech, Paul Pak, Rom N. Parnichkun, Alex Quach, Ryan Rogers, Daniela Rus, Nayan Saxena, Bettina Schlager, Tim Seyde, Jimmy T. H. Smith, Aditya Tadimeti, Neehal Tumma

机构 * Liquid AI

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 LFM2 是一种高效部署且具备强大任务能力的液体基础模型家族,通过紧凑的混合主干和优化训练流程,在多种基准测试中表现出色,支持多模态和检索变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16897 2025-12-01 eess.AS 57%

Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM

通过持续预训练平衡基于编码器的语音LLM的语音理解和生成

Jiatong Shi, Chunlei Zhang, Jinchuan Tian, Junrui Ni, Hao Zhang, Shinji Watanabe, Dong Yu

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 本文提出通过持续预训练框架平衡基于编码器的语音LLM的语音理解和生成,实现端到端的语音翻译系统,无需中间转录和翻译步骤。

Comments Accepted by ASRU2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2504.10068 2025-12-01 cs.CV cs.AI cs.CL 82%

Mavors: Multi-granularity Video Representation for Multimodal Large Language Model

Mavors:多粒度视频表示用于多模态大语言模型

Yang Shi, Jiaheng Liu, Yushuo Guan, Zhenhua Wu, Yuanxing Zhang, Zihao Wang, Weihong Lin, Jingyun Hua, Zekun Wang, Xinlong Chen, Bohan Zeng, Wentao Zhang, Fuzheng Zhang, Wenjing Yang, Di Zhang

机构 * Peking University(北京大学) Kling Team(Kling团队) Nanjing University(南京大学) CASIA(中国科学院自动化研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Mavors通过多粒度视频表示方法,提升多模态大语言模型在长视频理解中的时空模式保留与计算效率平衡能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22774 2025-12-01 cs.CV 79%

Alzheimer's Disease Prediction Using EffNetViTLoRA and BiLSTM with Multimodal Longitudinal MRI Data

使用EffNetViTLoRA和BiLSTM的多模态纵向MRI数据进行阿尔茨海默病预测

Mahdieh Behjat Khatooni, Mohsen Soryani

机构 * School of Computer Engineering, Iran University of Science and Technology(伊朗科学技术大学计算机工程学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出结合EffNetViTLoRA和BiLSTM的多模态模型,利用纵向MRI数据实现高精度的阿尔茨海默病预测。

详情

展开后加载摘要…

URL PDF HTML 收藏