arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-12 至 2025-12-12 共收录 36 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2512.00087 2025-12-12 cs.CV 79%

Exploring Automated Recognition of Instructional Activity and Discourse from Multimodal Classroom Data

探索多模态课堂数据中教学活动和话语的自动化识别

Ivo Bueno, Ruikun Hou, Babette Bühler, Tim Fütterer, James Drimalla, Jonathan Kyle Foster, Peter Youngs, Peter Gerjets, Ulrich Trautwein, Enkelejda Kasneci

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过多模态分析方法,实现了课堂活动中教学活动和话语的自动化识别,展示了微调模型在视频和 transcripts 上的高准确率,为可扩展的教师反馈系统提供了基础。

Comments This article has been accepted for publication in the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13886 2025-12-12 cs.CL 79%

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Game-RL: 合成多模态可验证游戏数据以提升VLMs的通用推理能力

Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, Chaoran Tao, Zhiyuan Guo, Jizhou Yu, Tianhao Cheng, Zhiheng Xi, Changhao Jiang, Zhangyue Yin, Yining Zheng, Weifeng Ge, Guanhua Chen, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Game-RL通过合成多模态可验证游戏数据提升VLMs的通用推理能力。

Comments 69 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10300 2025-12-12 cs.AI 57%

Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules

探讨视觉语言模型中注意力头的功能作用:推理模块的证据

Yanbei Jiang, Xueqi Ma, Shu Liu, Sarah Monazam Erfani, Tongliang Liu, James Bailey, Jey Han Lau, Krista A. Ehinger

机构 * The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文通过CogVision数据集探讨视觉语言模型中注意力头的功能作用,揭示其在多模态推理中的关键作用及分布特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21888 2025-12-12 cs.CV 57%

CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference Understanding

CAPE:一种基于CLIP的互补热图线索点集用于具身参照理解

Fevziye Irem Eyiokur, Dogucan Yaman, Hazım Kemal Ekenel, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Istanbul Technical University(伊斯坦布尔技术大学) Carnegie Mellon University(卡内基梅隆大学) KIT Campus Transfer GmbH (KCT)(KIT校园转移有限责任公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 CAPE通过双模型框架和CLIP-aware Pointing Ensemble模块,提升具身参照理解任务中指向线索的多模态推理能力,实现75.0 mAP的高精度表现。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2511.19877 2025-12-12 cs.MM cs.CV cs.LG eess.AS 85%

It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models

它能听,也能看 too:通过将视觉理解整合到音频语言模型中构建多模态大语言模型以检测抑郁症

Xiangyu Zhao, Yaling Shen, Yiwen Jiang, Zimu Wang, Jiahe Liu, Maxmartwell H Cheng, Guilherme C Oliveira, Robert Desimone, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Massachusetts Institute of Technology(麻省理工学院) The University of Melbourne(墨尔本大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文提出了一种多模态大语言模型框架,通过整合视觉理解到音频语言模型中,提升抑郁症检测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10778 2025-12-12 cs.SD cs.MM eess.AS 81%

Building Audio-Visual Digital Twins with Smartphones

利用智能手机构建音频-视觉数字孪生

Zitong Lan, Yiwei Tang, Yuhan Wang, Haowen Lai, Yiduo Hao, Mingmin Zhao

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 AV-Twin通过智能手机实现可编辑的音频-视觉数字孪生,结合移动RIR捕获和视觉辅助声场模型,实现房间声学的高效重建与材料属性的动态更新。

Comments Under Mobisys 2026 review, single blind

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21429 2025-12-12 cs.LG 78%

Deception Detection in Dyadic Exchanges Using Multimodal Machine Learning: A Study on a Swedish Cohort

利用多模态机器学习检测双人交流中的欺骗:一项针对瑞典群体的研究

Thomas Jack Samuels, Franco Rugolon, Stephan Hau, Lennart Högman

机构 * Department of Psychology(心理学系) Department of Computer and Systems Sciences(计算机与系统科学系) Stockholm University(斯德哥尔摩大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本研究利用多模态机器学习分析双人互动中的欺骗检测,发现结合语音和面部信息及双方数据可提高检测准确率至71%。

Comments 40 pages, 2 figures, 2 tables. To be submitted in Behavior Research Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 57%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18708 2025-12-12 cs.CL 57%

The Spatial Semantics of Iconic Gesture

图标手势的空间语义

Andy Lücking, Alexander Henlein, Alexander Mehler

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出了一种空间手势语义学,通过区分图标性三个层面,探讨手势与言语意义的结合方式。

Comments 52 pages, 38 figures, in review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2507.00752 2025-12-12 cs.CV cs.RO 79%

Multi-Modal Graph Convolutional Network with Sinusoidal Encoding for Robust Human Action Segmentation

多模态图卷积网络与正弦编码用于鲁棒的人体动作分割

Hao Xing, Kai Zhe Boey, Yuankai Wu, Darius Burschka, Gordon Cheng

机构 * Institute for Cognitive Systems(认知系统研究所) Chair of Media Technology(媒体技术教授职位) Machine Vision and Perception Group(机器视觉与感知小组) School of Computation, Information and Technology(计算、信息与技术学院)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态图卷积网络与正弦编码方法,通过融合低帧率和高帧率数据提升人体动作分割的鲁棒性,实验表明在双手动作数据集上显著提高分割准确率。

Comments 8 pages, 5 figures, accepted in IROS25, Hangzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08051 2025-12-12 cs.LG 67%

ST-GraphNet: A Spatio-Temporal Graph Neural Network for Understanding and Predicting Automated Vehicle Crash Severity

ST-GraphNet:一种用于理解和预测自动驾驶车辆碰撞严重程度的时空图神经网络

Mahmuda Sultana Mimi, Md Monzurul Islam, Anannya Ghosh Tusti, Shriyank Somvanshi, Subasish Das

机构 * Texas State University(德克萨斯州立大学)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 ST-GraphNet通过时空图神经网络整合多模态数据,以高准确率预测自动驾驶车辆碰撞严重程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05537 2025-12-12 cs.CV cs.AI 62%

Towards Efficient Real-Time Video Motion Transfer via Generative Time Series Modeling

通过生成时间序列建模实现高效的实时视频运动迁移

Tasmiah Haque, Md. Asif Bin Syed, Byungheon Jeong, Xue Bai, Sumit Mohan, Somdyuti Paul, Imtiaz Ahmed, Srinjoy Das

机构 * Coupa Software(Coupa软件) Intel Corporation(英特尔公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出基于生成时间序列模型的实时视频运动迁移框架,通过关键点预测和光流模块实现高效低帧率视频传输,提升带宽效率与视频生成的可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2509.19980 2025-12-12 cs.LG 85%

RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis

RAD:迈向可信的检索增强多模态临床诊断

Haolin Li, Tianjie Dai, Zhe Chen, Siyuan Du, Jiangchao Yao, Ya Zhang, Yanfeng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai AI Laboratory(上海人工智能实验室) CMIC, Shanghai Jiao Tong University(上海交通大学计算机学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University(上海交通大学医学人工智能研究所)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 RAD通过检索增强多模态模型,提升临床诊断的可信度与准确性,实现任务特定知识的显式注入。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10419 2025-12-12 cs.CV 79%

TransLocNet: Cross-Modal Attention for Aerial-Ground Vehicle Localization with Contrastive Learning

TransLocNet: 跨模态注意力用于航空-地面车辆定位的对比学习

Phu Pham, Damon Conover, Aniket Bera

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 TransLocNet通过跨模态注意力和对比学习实现航空-地面车辆定位,显著提升定位精度和鲁棒性。

Comments 8 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10596 2025-12-12 cs.CV cs.AI 62%

Beyond Pixels: A Training-Free, Text-to-Text Framework for Remote Sensing Image Retrieval

超越像素:一种无训练的文本到文本框架用于遥感图像检索

J. Xiao, Y. Guo, X. Zi, K. Thiyagarajan, C. Moreira, M. Prasad

机构 * Information Technology University of Technology Sydney Sydney, Australia(信息科技技术大学悉尼分校悉尼澳大利亚) Robotics Laboratory (SensR Lab) Centre for Advanced Manufacturing Technology Western Sydney University Sydney, Australia(机器人实验室(SensR实验室)先进制造技术中心西悉尼大学悉尼澳大利亚) The Data Science Institute Faculty of Engineering(数据科学学院工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无训练的文本到文本框架TRSLLaVA,通过结构化文本实现高效遥感图像检索,实验表明其性能优于现有监督模型。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2512.10750 2025-12-12 cs.CV 83%

LDP: Parameter-Efficient Fine-Tuning of Multimodal LLM for Medical Report Generation

LDP:多模态大语言模型在医疗报告生成中的参数高效微调

Tianyu Zhou, Junyi Tang, Zehui Li, Dahong Qian, Suncheng Xiang

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 LDP通过多模态大语言模型和参数高效微调技术,提升结肠镜息肉诊断报告的准确性和效率,显著降低训练成本并获得专家评分。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10894 2025-12-12 cs.CV 79%

DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance

DuetSVG:基于内部视觉引导的统一多模态SVG生成

Peiying Zhang, Nanxuan Zhao, Matthew Fisher, Yiran Xu, Jing Liao, Difan Liu

机构 * City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 DuetSVG通过端到端生成图像和SVG标记,结合内部视觉引导提升SVG生成质量,实现视觉忠实与语义一致的统一多模态生成。

Comments Project page: https://intchous.github.io/DuetSVG-site

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15365 2025-12-12 eess.SY cs.LG cs.MA cs.SY 78%

TranSimHub:A Unified Air-Ground Simulation Platform for Multi-Modal Perception and Decision-Making

TranSimHub:一个多模态感知与决策的空地协同仿真平台

Maonan Wang, Yirong Chen, Yuxin Cai, Aoyu Pang, Yuejiao Xie, Zian Ma, Chengcheng Xu, Kemou Jiang, Ding Wang, Laurent Roullet, Chung Shue Chen, Zhiyong Cui, Yuheng Kan, Michael Lepech, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) SenseTime Group Ltd(商汤科技有限公司) Beihang University(北京航空航天大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 TranSimHub是一个用于空地协同智能的统一仿真平台,支持多模态感知与决策研究,提供同步渲染和可控场景编辑功能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10376 2025-12-12 cs.CV 70%

RaLiFlow: Scene Flow Estimation with 4D Radar and LiDAR Point Clouds

RaLiFlow: 基于4D雷达和激光雷达点云的场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 RaLiFlow是首个联合4D雷达和激光雷达的场景流学习框架,通过动态感知双向跨模态融合模块和精心设计的损失函数实现高效的雷达-激光雷达融合。

Comments Accepted by AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05991 2025-12-12 cs.CV 70%

EmoDiffTalk:Emotion-aware Diffusion for Editable 3D Gaussian Talking Head

EmoDiffTalk:面向可编辑3D高斯说话头的情绪感知扩散

Chang Liu, Tianjiao Jing, Chengcheng Ma, Xuanqi Zhou, Zhengxuan Lian, Qin Jin, Hongliang Yuan, Shi-Sheng Huang

机构 * Beijing Normal University(北京师范大学) Renmin University of China(中国人民大学) Tencent AI Lab(腾讯AI实验室)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 EmoDiffTalk通过情绪感知高斯扩散实现细粒度面部动画与多模态情绪编辑,提升3D说话头的情绪表达精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10949 2025-12-12 cs.CV cs.AI cs.CL 67%

Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

我们是否准备好在文本到3D生成中使用强化学习?一项渐进性的调查

Yiwen Tang, Zoey Guo, Kaixin Zhu, Ray Zhang, Qizhi Chen, Dongzhi Jiang, Junli Liu, Bohan Zeng, Haoming Song, Delin Qu, Tianyi Bai, Dan Xu, Wentao Zhang, Bin Zhao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文首次系统研究了强化学习在文本到3D生成中的应用,提出Hi-GRPO范式和AR3D-R1模型,探讨奖励设计、算法优化及3D生成基准。

Comments Code is released at https://github.com/Ivan-Tang-3D/3DGen-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07730 2025-12-12 cs.CV cs.AI 62%

SAVE: Sparse Autoencoder-Driven Visual Information Enhancement for Mitigating Object Hallucination

SAVE:基于稀疏自编码器的视觉信息增强用于缓解物体幻觉

Sangha Park, Seungryong Yoo, Jisoo Mok, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Daegu Gyeongbuk Institute of Science and Technology(大邱庆州科学技术院) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(IPAI、AIIS、ASRI、INMC 和 ISRC,首尔国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SAVE通过引导模型沿稀疏自编码器潜在特征减少物体幻觉,提升视觉理解能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10352 2025-12-12 cs.CV 57%

Topology-Agnostic Animal Motion Generation from Text Prompt

基于文本提示的拓扑无关动物运动生成

Keyi Chen, Mingze Sun, Zhenyu Liu, Zhangquan Chen, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OmniZoo数据集和通用自回归框架,实现基于文本提示的任意拓扑动物运动生成及跨物种风格迁移。

Comments 10 pages, 7 figures.Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 7 篇

2506.11375 2025-12-12 cs.AI cs.CL 84%

Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables

在化学表格上评估多模态大语言模型的基准测试

Yitong Zhou, Mingyue Cheng, Qingyang Mao, Yucong Luo, Qi Liu, Yupeng Li, Xiaohan Zhang, Deguang Liu, Xin Li, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Artificial Intelligence Research Institute(人工智能研究院) iFLYTEK Co., Ltd(iFLYTEK公司)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChemTable基准,用于评估多模态模型在理解化学表格中的能力,揭示了现有模型在跨模态对齐和领域推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10701 2025-12-12 cs.LG 82%

HybridVFL: Disentangled Feature Learning for Edge-Enabled Vertical Federated Multimodal Classification

HybridVFL:面向边缘计算的垂直联邦多模态分类的解耦特征学习

Mostafa Anoosha, Zeinab Dehghani, Kuniko Paxton, Koorosh Aslansefat, Dhavalkumar Thakker

机构 * University of Hull(赫尔大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 HybridVFL通过客户端特征解耦与服务器跨模态Transformer融合,提升边缘计算中多模态分类的隐私保护性能。

Comments 6 pages, 2 figures, 1 table. Accepted at UCC '25 (IEEE/ACM 18th International Conference on Utility and Cloud Computing), December 1-4, 2025, Nantes, France. DOI to be activated upon final publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10791 2025-12-12 cs.CL cs.AI 62%

The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality

FACTS排行榜:大型语言模型事实性的综合基准

Aileen Cheng, Alon Jacovi, Amir Globerson, Ben Golan, Charles Kwong, Chris Alberti, Connie Tao, Eyal Ben-David, Gaurav Singh Tomar, Lukas Haas, Yonatan Bitton, Adam Bloniarz, Aijun Bai, Andrew Wang, Anfal Siddiqui, Arturo Bajuelos Castillo, Aviel Atias, Chang Liu, Corey Fry, Daniel Balle, Deepanway Ghosal, Doron Kukliansky, Dror Marcus, Elena Gribovskaya, Eran Ofek, Honglei Zhuang, Itay Laish, Jan Ackermann, Lily Wang, Meg Risdal, Megan Barnes, Michael Fink, Mohamed Amin, Moran Ambar, Natan Potikha, Nikita Gupta, Nitzan Katz, Noam Velan, Ofir Roval, Ori Ram, Polina Zablotskaia, Prathamesh Bang, Priyanka Agrawal, Rakesh Ghiya, Sanjay Ganapathy, Simon Baumgartner, Sofia Erell, Sushant Prakash, Thibault Sellam, Vikram Rao, Xuanhui Wang, Yaroslav Akulov, Yulong Yang, Zhen Yang, Zhixin Lai, Zhongru Wu, Anca Dragan, Avinatan Hassidim, Fernando Pereira, Slav Petrov, Srinivasan Venkatachary, Tulsee Doshi, Yossi Matias, Sasha Goldshtein, Dipanjan Das

机构 * Google(谷歌)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 FACTS排行榜为大型语言模型提供事实性评估的综合基准,通过四个子排行榜全面衡量模型在不同场景下的事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10336 2025-12-12 cs.CL cs.AI 62%

Multilingual VLM Training: Adapting an English-Trained VLM to French

多语言视觉语言模型训练:将英语训练的VLM适应到法语

Jules Lahmi, Alexis Roger

机构 * Ecole Polytechnique(巴黎政治学院) Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了将英语训练的视觉语言模型适应到法语等其他语言的挑战,通过比较不同方法的性能和计算成本,发现数据翻译是多语言VLM性能的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10592 2025-12-12 cs.CV 57%

Salient Object Detection in Complex Weather Conditions via Noise Indicators

通过噪声指示器进行复杂天气条件下的显著物体检测

Quan Chen, Xiaokai Yang, Tingyu Wang, Rongfeng Lu, Xichun Sheng, Yaoqi Sun, Chenggang Yan

机构 * School of Automation, Hangzhou Dianzi University(自动化学院,杭州电子大学) College of Artificial Intelligence, Jiaxing University(人工智能学院,嘉兴大学) School of Communication Engineering, Hangzhou Dianzi University(通信工程学院,杭州电子大学) School of Faculty of Applied Science, Macao Polytechnic University(应用科学学院,澳门理工学院) School of Mathematics and Computer Science, Lishui University(数学与计算机科学学院,丽水大学) Lishui Institute of Hangzhou Dianzi University(杭州电子大学丽水学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种针对复杂天气条件的显著物体检测框架,通过引入噪声指示器融合模块提升分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10262 2025-12-12 cs.CV 57%

VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models

基于视觉大语言模型的新型类别发现

Yuetong Su, Baoguo Wei, Xinyu Wang, Xu Li, Lixin Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 基于视觉大语言模型的新型类别发现方法,通过融合视觉-文本语义和原型引导聚类,提升未知类别分类准确率25.3%,并展现对长尾分布的鲁棒性。

Comments 8 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21336 2025-12-12 cs.CV 57%

UniBiomed: A Universal Foundation Model for Grounded Biomedical Image Interpretation

UniBiomed: 一种用于 grounded 生物医学图像解释的通用基础模型

Linshan Wu, Yuxiang Nie, Sunan He, Jiaxin Zhuang, Luyang Luo, Tao Li, Zhuoyao Xie, Dexuan Chen, Yinghua Zhao, Neeraj Mahboobani, Varut Vardhanabhuti, Ronald Cheong Kin Chan, Yifan Peng, Pranav Rajpurkar, Hao Chen

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 UniBiomed是一种基于多模态大语言模型和Segment Anything Model的通用基础模型,能够同时生成诊断结果并分割生物医学目标,提升生物医学图像分析的可解释性与性能。

Comments A universal foundation model for grounded biomedical image interpretation

详情

展开后加载摘要…

URL PDF HTML 收藏