arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-21 至 2026-01-21 共收录 151 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 12 篇

2601.14052 2026-01-21 cs.CV 79%

Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model

视觉也需要:利用多模态大语言模型进行分布外检测导航

Haoran Xu, Yanlin Liu, Zizhao Tong, Jiaze Li, Kexue Fu, Yuyang Zhang, Longxiang Gao, Shuaiguang Li, Xingyu Li, Yanran Xu, Changwei Wang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(国家超算中心济南中心),齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算电力互联网与服务计算重点实验室,山东省计算机科学基础研究中心) University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) RWTH Aachen University(亚琛工业大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MM-OOD方法,利用多模态大语言模型的推理能力,通过多轮对话增强分布外检测,提升近远OOD任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13238 2026-01-21 cs.CV cs.AI 79%

A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models

基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷

Chengyin Hu, Xiang Chen, Zhe Jia, Weiwen Shi, Fengyu Zhang, Jiujiang Guo, Yiwei Wei

机构 * Chengyin Hu(独立研究者) Xiang Chen(独立研究者) Zhe Jia(独立研究者) Weiwen Shi(独立研究者) Fengyu Zhang(独立研究者) Jiujiang Guo(独立研究者) Yiwei Wei(独立研究者)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13919 2026-01-21 cs.CL cs.CV 73%

HyperWalker: Dynamic Hypergraph-Based Deep Diagnosis for Multi-Hop Clinical Modeling across EHR and X-Ray in Medical VLMs

HyperWalker: 基于动态超图的多跳临床建模深度诊断方法,跨EHR和X光在医学视觉语言模型中

Yuezhe Yang, Hao Wang, Yige Peng, Jinman Kim, Lei Bi

机构 * Institute of Translational Medicine, Shanghai Jiao Tong University(翻译医学研究院,上海交通大学) School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 HyperWalker通过动态超图和测试时训练,实现跨EHR和X光的多跳临床建模深度诊断,提升医疗视觉语言模型的诊断性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12260 2026-01-21 cs.AI 70%

Docs2Synth: A Synthetic Data Trained Retriever Framework for Scanned Visually Rich Documents Understanding

Docs2Synth: 一种用于扫描视觉丰富文档理解的合成数据训练检索框架

Yihao Ding, Qiang Sun, Puzhen Wu, Sirui Li, Siwen Luo, Wei Liu

机构 * University of Western Australia(西澳大学) The University of Hong Kong(香港大学) Murdoch University(默多克大学)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 Docs2Synth通过合成监督框架实现私有和低资源领域文档理解,利用检索引导推理提升接地能力和领域泛化,无需人工标注。

Comments Accepted at WWW 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12443 2026-01-21 cs.CV cs.AI 62%

Adversarial Defense in Vision-Language Models: An Overview

视觉-语言模型中的对抗防御:概述

Xiaowei Fu, Lei Zhang

机构 * School of Microelectronics and Communication Engineering(微电子与通信工程学院) Chongqing University(重庆大学) Chongqing, China(中国重庆)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了视觉-语言模型对抗防御的最新进展,探讨了三种主要防御范式及其优缺点,旨在提升模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12304 2026-01-21 cs.CV cs.AI 62%

A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models

面向视觉-语言预训练模型的双阶段全局多样化对抗攻击

Wutao Chen, Huaqin Zou, Chen Wan, Lifeng Huang

机构 * Department of Computer Science and Technology, Shantou University(汕头大学计算机科学与技术系) College of Mathematics and Informatics, South China Agricultural University(华南农业大学数学与信息学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出2S-GDA,一种双阶段全局多样化攻击框架,通过文本和图像扰动增强对抗攻击效果,提升黑盒场景下的攻击成功率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09147 2026-01-21 cs.CV cs.AI 62%

SSVP: Synergistic Semantic-Visual Prompting for Industrial Zero-Shot Anomaly Detection

SSVP:协同语义-视觉提示用于工业零样本异常检测

Chenhao Fu, Han Fang, Xiuzheng Zheng, Wenbo Wei, Yonghua Li, Hao Sun, Xuelong Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SSVP通过协同语义-视觉提示机制,提升工业零样本异常检测的细粒度感知能力,实现93.0%的图像AUROC和92.2%的像素AUROC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11644 2026-01-21 cs.CV cs.AI 62%

Predicting When to Trust Vision-Language Models for Spatial Reasoning

预测何时信任视觉-语言模型进行空间推理

Muhammad Imran, Yugyung Lee

机构 * University of Missouri Kansas City(密苏里大学堪萨斯城分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出一种基于视觉的置信度估计框架,通过几何验证提升VLM空间推理的可靠性,实验显示其在BLIP-2和CLIP上的AUROC显著优于文本方法基线。

Comments 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13705 2026-01-21 cs.CV 57%

Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles

推理还是模式匹配?通过视觉谜题探测大型视觉-语言模型

Maria Lymperaiou, Vasileios Karampinis, Giorgos Filandrianos, Angelos Vlachos, Chrysoula Zerva, Athanasios Voulodimos

机构 * National Technical University of Athens(国家技术大学雅典) Instituto de Telecomunicações(电信研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文通过视觉谜题探测大型视觉-语言模型的推理能力,揭示其在泛化、感知与推理整合及执行一致性方面的局限,并提出未来基准和系统的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18817 2026-01-21 cs.CV 57%

Disc3D: Automatic Curation of High-Quality 3D Dialog Data via Discriminative Object Referring

Disc3D:通过判别性对象指称自动校准高质量3D对话数据

Siyuan Wei, Chunjie Wang, Xiao Liu, Xiaosheng Yan, Zhishan Zhou, Rui Huang

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院) Tsinghua University(清华大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Disc3D通过自动化流程生成高质量3D对话数据,解决视角和对象指称模糊性问题,提升多模态大语言模型性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12865 2026-01-21 cs.CV 57%

Proxy Robustness in Vision Language Models is Effortlessly Transferable

视觉语言模型中的代理鲁棒性可以轻易转移

Xiaowei Fu, Fuxiang Huang, Lei Zhang

机构 * Chongqing Key Laboratory of Bio-perception(重庆生物感知实验室) Multimodal Intelligent Information Processing, Chongqing University, Chongqing 401331, China(多模态智能信息处理,重庆大学,重庆401331,中国) School of Microelectronics(微电子学院) Communication Engineering, Chongqing University, Chongqing 401331, China(通信工程,重庆大学,重庆401331,中国) School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出HPT-GPD框架,通过异构代理转移提升视觉语言模型的对抗鲁棒性,同时缓解过拟合问题,增强零样本自然泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07413 2026-01-21 cs.CV 57%

REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding

基于三元组的引用范式用于统一视觉解码

Yan Tai, Luhao Zhu, Yunan Ding, Yiying Dong, Guangtao Zhai, Xiaohong Liu, Guodong Guo

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学计算机科学学院) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学信息科学与电子工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 REF-VLM通过引入基于三元组的引用范式,提升多任务视觉解码的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 16 篇

2407.18552 2026-01-21 cs.MM cs.CL cs.CV cs.LG cs.SD eess.AS 85%

Multimodal Emotion Recognition using Audio-Video Transformer Fusion with Cross Attention

基于音频-视频Transformer融合与交叉注意力的多模态情感识别

Joe Dhanith P R, Shravan Venkatraman, Vigya Sharma, Santhosh Malarvannan

机构 * School of Computer Science and Engineering, Vellore Institute of Technology (VIT) University(计算机科学与工程学院,维洛雷理工学院(VIT大学))

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出AVT-CA模型,通过音频-视频Transformer融合与交叉注意力机制,提升多模态情感识别的准确率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11995 2026-01-21 cs.MM cs.AI cs.IR cs.LG cs.SD 84%

Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs

通过推断的潜在交互图学习音频-视觉嵌入

Donghuo Zeng, Hao Niu, Yanan Wang, Masato Taya

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出通过推断的潜在交互图学习音频-视觉嵌入,以提升嵌入学习的鲁棒性和语义一致性。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21650 2026-01-21 cs.LG 82%

Physic-HM: Restoring Physical Generative Logic in Multimodal Anomaly Detection via Hierarchical Modulation

Physic-HM: 通过分层调制恢复多模态异常检测中的物理生成逻辑

Xiao Liu, Junchen Jin, Yanjie Zhao, Zhixuan Xing

机构 * Chongqing University(重庆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract)

AI总结 Physic-HM通过引入物理归纳偏置,解决多模态异常检测中过程逻辑缺失的问题,实现高维与低维数据的协同建模,提升异常检测性能。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13143 2026-01-21 cs.LG 82%

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

FastAV: 面向音频视觉大语言模型推理的高效令牌修剪

Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 FastAV通过两阶段令牌修剪策略,针对音频视觉大语言模型实现高效推理,减少FLOPs超过40%并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13098 2026-01-21 cs.HC 82%

Exploring the Impacts of Background Noise on Auditory Stimuli of Audio-Visual eHMIs for Hearing, Deaf, and Hard-of-Hearing People

探索背景噪声对听觉刺激在音频视觉eHMIs中的影响:面向听障、聋人及听力障碍人群

Wenge Xu, Foroogh Hajiseyedjavadi, Debargha Dey, Tram Thi Minh Tran, Mark Colley

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract)

AI总结 研究探讨了背景噪声对聋人及听力障碍者在音频视觉eHMI中听觉刺激的影响,发现嘈杂环境会损害行人穿越体验,而增加铃声或语音提示可改善体验。

Comments This is the author's version of the paper accepted at CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11968 2026-01-21 cs.MM cs.SD eess.AS 81%

MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio

MuseAgent-1: 交互式 grounded 多模态理解音乐谱面与表演音频

Qihao Zhao, Yunqi Cao, Yangyu Huang, Hui Yi Leong, Fan Zhang, Kim-Hui Yap, Wei Hu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Chemical Technology(北京化工大学) Microsoft(微软公司) University of Chicago(芝加哥大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

AI总结 MuseAgent-1 是一个专注于音乐的多模态代理,通过结构化符号表示和多步骤推理,提升对音乐谱面和表演音频的交互式理解能力。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12354 2026-01-21 eess.AS cs.LG cs.SD 79%

Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models

骨传导引导的多模态语音增强与条件扩散模型

Sina Khanagha, Bunlong Lay, Timo Gerkmann

机构 * Signal Processing Group, University of Hamburg, Germany(汉堡大学信号处理组)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出一种基于条件扩散模型的多模态语音增强框架,通过整合骨传导传感器与空气传导麦克风,有效提升极端噪声环境下的语音增强性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11590 2026-01-21 cs.DC cs.AI 79%

EPD-Serve: A Flexible Multimodal EPD Disaggregation Inference Serving System On Ascend

EPD-Serve: 一种灵活的多模态EPD解耦推理服务系统在Ascend上

Fan Bai, Pai Peng, Zhengzhi Tang, Zhe Wang, Gong Chen, Xiang Lu, Yinuo Li, Huan Lin, Weizhe Lin, Yaoyuan Wang, Xiaosong Li

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 EPD-Serve通过阶段级解耦和异构硬件协同,提升多模态模型推理系统的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14227 2026-01-21 cs.SD 78%

Transformer Architectures for Respiratory Sound Analysis and Multimodal Diagnosis

用于呼吸声分析和多模态诊断的Transformer架构

Theodore Aptekarev, Vladimir Sokolovsky, Gregory Furman

机构 * Ben Gurion University of the Negev(本· Gurion 农业大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出基于Transformer的AST和VLM模型,用于呼吸声分析和多模态诊断,AST在哮喘检测中达到97%准确率,VLM整合临床信息提升诊断能力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13866 2026-01-21 q-bio.NC 67%

Audio Outperforms Text for Visual Decoding

音频在视觉解码中表现优于文本

Zhengdi Zhang, Hao Zhang, Wenjun Xia

专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract)

AI总结 本研究提出利用听觉表示替代文本描述,发现听觉模态在视觉解码中更高效且准确,揭示了听觉语义在解码视觉认知中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13651 2026-01-21 cs.CV 57%

Face-Voice Association with Inductive Bias for Maximum Class Separation

人脸-语音关联与最大类别分离的归纳偏置

Marta Moscati, Oleksandr Kats, Mubashir Noman, Muhammad Zaigham Zaheer, Yufang Hou, Markus Schedl, Shah Nawaz

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) MBZUAI IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利) Linz Institute of Technology(林茨技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于最大类别分离作为归纳偏置的人脸-语音关联方法,通过实验验证其在多模态学习中的有效性。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12844 2026-01-21 cs.CL 57%

Rapport du Projet de Recherche TRAIMA

TRAIMA研究项目报告

Julie Rançon, Jean-François Cerisier, Emilie Remond, Aurélien Nguyen, Andrew Peterson, Ladjel Bellatreche

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 TRAIMA项目旨在建立多模态教学互动自动处理的方法论框架,通过分析课堂互动中的解释性序列,探索机器学习在多模态数据转录和分类中的应用。

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12700 2026-01-21 eess.AS cs.SD 57%

Improving Audio Question Answering with Variational Inference

通过变分推断改进音频问答

Haolin Chen

机构 * Idiap Research Institute, Martigny, Switzerland(日内瓦研究所) École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(洛桑联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过改进的变分推断优化器提升音频问答任务的预测准确性与校准性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12289 2026-01-21 cs.SD cs.LG eess.AS 57%

ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech

ParaMETA: 向学习解耦的语音语义说话风格表示迈进

Haowei Lou, Hye-young Paik, Wen Hu, Lina Yao

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 ParaMETA通过统一框架学习解耦的语音语义说话风格表示,实现多任务处理和生成任务中的细粒度风格控制。

Comments 9 pages, 7 figures, Accepted to AAAI-26 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13355 2026-01-21 cs.HC 50%

Remote Triggers: Misophonia, Technology Non-Use, and Design for Inclusive Digital Spaces

远程触发:对声音厌恶、技术不使用与包容性数字空间的设计

Tawfiq Ammari, Samantha Gilgan

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本研究探讨声音厌恶者在数字空间中的体验,提出设计干预以减少技术不使用和排斥问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11328 2026-01-21 cs.HC 50%

ProjecTA: A Semi-Humanoid Robotic Teaching Assistant with In-Situ Projection for Guided Tours

ProjecTA:一种配备现场投影的半人形教学助手用于导览

Hanqing Zhou, Yichuan Zhang, Zihan Zhang, Wei Zhang, Chao Wang, Pengcheng An

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 ProjecTA通过现场投影与手势协调,减少认知负荷并提升学习体验,为移动学习提供新的设计方向。

Comments 35 pages, 12 figures, 2 appendixes, 3 supplementary meterials, to appear at ACM CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 10 篇

2601.12432 2026-01-21 cs.CV cs.MM 81%

SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition

SkeFi: 无线传感器跨模态知识转移用于基于骨骼的动作识别

Shunyu Huang, Yunjiao Zhou, Jianfei Yang

机构 * School of Electrical and Electronics Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 SkeFi通过跨模态知识转移方法,利用无线传感器提升基于骨骼的动作识别性能,实现毫米波和LiDAR上的先进表现。

Comments Published in IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 79%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏