arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1388 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1388 篇

2603.02872 2026-03-09 cs.CV 57%

Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models

Think-as-You-See: 为大视觉-语言模型设计的流式推理链式思维

Jialiang Zhang, Junlong Tong, Junyan Lin, Hao Wu, Yirong Sun, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东技术学院) Ocean University of China(中国海洋大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心,慕尼黑大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 TaYS为大视觉-语言模型设计了流式推理链式思维框架,通过并行化生成、流约束训练和解耦的KV缓存,提升视频理解的效率和响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01169 2026-03-03 cs.CV cs.AI cs.LG 57%

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

TripleSumm: 适应性三模态融合用于视频摘要

Sumin Kim, Hyemin Jeong, Mingu Kang, Yejin Kim, Yoori Oh, Joonseok Lee

机构 * Seoul National University(首尔国立大学)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 TripleSumm通过适应性三模态融合技术,在视频摘要任务中实现了最先进的性能,首次提出了多模态视频摘要的大型基准MoSu。

Comments Published as a Conference Paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08683 2026-02-27 cs.CV 57%

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

OneVision-Encoder: 编码对齐的稀疏性作为多模态智能的基础原则

Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康人工智能实验室) MVP Lab(MVP实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 OneVision-Encoder通过编码对齐的稀疏性原则,实现高效的多模态视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01552 2026-02-26 cs.CV 57%

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

面向变化的视觉令牌丢弃以加速更大的视觉-语言模型

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

机构 * Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Zhejiang University(浙江大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。

Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16231 2026-02-19 cs.CV 57%

DataCube: A Video Retrieval Platform via Natural Language Semantic Profiling

DataCube: 通过自然语言语义分析实现的视频检索平台

Yiming Ju, Hanyu Zhao, Quanyue Ma, Donglin Hao, Chengwei Wu, Ming Li, Songjing Wang, Tengfei Pan

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 DataCube通过自然语言语义分析实现视频检索,提供高效的视频处理和多维检索功能。

Comments This paper is under review for the IJCAI-ECAI 2026 Demonstrations Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10807 2026-02-18 cs.CV 57%

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

提示到摘要:基于大语言和视频模型的零样本语言引导视频摘要

Mario Barbara, Alaa Maalouf

机构 * Department of Computer Science, the University of Haifa(哈ifa大学计算机科学系)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 提出一种基于大语言和视频模型的零样本视频摘要方法,通过提示生成用户引导的摘要,无需训练数据,优于现有无监督和监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08882 2026-02-17 cs.HC cs.CV 57%

Designing Multi-Robot Ground Video Sensemaking with Public Safety Professionals

设计多机器人地面视频感知以服务于公共安全专业人员

Puqi Zhou, Ali Asgarov, Aafiya Hussain, Wonjoon Park, Amit Paudyal, Sameep Shrestha, Chia-wei Tang, Michael F. Lighthiser, Michael R. Hieb, Xuesu Xiao, Chris Thomas, Sungsoo Ray Hong

机构 * George Mason University(乔治·玛森大学) University of Maryland(马里兰大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种多机器人地面视频感知测试平台和MRVS工具,旨在提升公共安全专业人员的情报意识和工作效率,同时关注假警报和隐私问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13013 2026-02-16 cs.CV 57%

Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions

面向具有属性结构和质量验证指令的通用视频MLLMs

Yunheng Li, Hengrui Zhang, Meng-Hao Guo, Wenzhao Gao, Shaoyong Jia, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ByteDance Inc.(字节跳动公司) Tsinghua University(清华大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本研究提出ASID-1M数据集、ASID-Verify验证流程和ASID-Captioner模型,通过细粒度结构化指令提升视频理解性能,实现高质量描述生成与指令遵循。

Comments Project page: https://asid-caption.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19391 2026-02-16 cs.CV 57%

Fibottention: Inceptive Visual Representation Learning with Diverse Attention Across Heads

Fibottention: 基于多头注意力的视觉表征学习

Ali K. Rahimian, Manish K. Govind, Subhajit Maity, Dominick Reilly, Christian Kümmerle, Srijan Das, Aritra Dutta

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Central Florida(佛罗里达大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Fibottention通过引入稀疏自注意力机制,实现高效视觉表征学习,减少计算复杂度并提升表示多样性。

Comments The complete implementation, including source code and evaluation scripts, is publicly available at: https://github.com/Charlotte-CharMLab/Fibottention

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08439 2026-02-10 cs.CV 57%

Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

Demo-ICL: 用于过程视频知识获取的上下文学习

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Lab(上海人工智能实验室) CUHK-MMLab(香港大学多媒体实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Demo-ICL通过两阶段训练策略提升模型从上下文示例中学习的能力,针对视频理解中的新挑战提出Demo-ICL-Bench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13261 2026-02-10 cs.CV 57%

Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges

构建第一人称程序化AI助手:方法、基准和挑战

Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang

机构 * Department of EEE(电子工程系) The Hong Kong Polytechnic University(香港理工大学) RayNeo Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出第一人称程序化AI助手,探讨其核心任务、赋能维度及挑战,通过实验评估现有方法并指明未来研究方向。

Comments Under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03803 2026-02-10 cs.CV 57%

EgoLife: Towards Egocentric Life Assistant

EgoLife:迈向以自身为中心的生活助手

Jingkang Yang, Shuai Liu, Hongming Guo, Yuhao Dong, Xiamengwei Zhang, Sicheng Zhang, Pengyun Wang, Zitang Zhou, Binzhu Xie, Ziyue Wang, Bei Ouyang, Zhengyu Lin, Marco Cominelli, Zhongang Cai, Yuanhan Zhang, Peiyuan Zhang, Fangzhou Hong, Joerg Widmer, Francesco Gringoli, Lei Yang, Bo Li, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学新加坡分校) LMMs-Lab(LMMs实验室) IMDEA Networks, Spain(西班牙IMDEA网络) University of Brescia, Italy(意大利布雷西亚大学) Politecnico di Milano, Italy(意大利米兰理工学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 EgoLife旨在通过AI赋能的可穿戴设备开发以自身为中心的生活助手,通过多模态数据集和EgoButler系统提升日常效率与个性化服务。

Comments This version corrects the author affiliation to reflect the accurate institutional information at the time of publication. No technical content of the paper has been changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 57%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03589 2026-02-04 cs.CV 57%

SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM

SlowFocus: 提升视频大语言模型中的细粒度时间理解

Ming Nie, Dan Ding, Chunwei Wang, Yuanfan Guo, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿万象智能科技有限公司)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SlowFocus通过提升等效采样频率和引入多频率混合注意力模块,提升视频大语言模型对细粒度时间理解的能力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03529 2026-02-04 cs.NI cs.AI cs.MM 57%

Morphe: High-Fidelity Generative Video Streaming with Vision Foundation Model

Morphe: 基于视觉基础模型的高保真生成视频流媒体

Tianyi Gong, Zijian Cao, Zixing Zhang, Jiangkai Wu, Xinggong Zhang, Shuguang Cui, Fangxin Wang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

AI总结 Morphe基于视觉基础模型,通过联合训练和智能分组丢弃技术,实现高保真度、低带宽的实时视频流媒体传输。

Comments Accepted by NSDI 2026 Fall

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01369 2026-02-03 cs.CV 57%

Exposing and Defending the Achilles' Heel of Video Mixture-of-Experts

揭示视频混合专家架构的薄弱环节

Songping Wang, Qinglong Liu, Yueming Lyu, Ning Li, Ziwen He, Caifeng Shan

机构 * Nanjing University(南京大学) China Mobile Information Technology Co., Ltd.(中国移动信息科技有限公司) Nanjing University of Information Science and Technology(南京信息科技大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出TLGA和J-TLAT方法,揭示视频MoE模型的独立和协作性弱点,并通过联合对抗训练提升其鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12243 2026-02-02 cs.CV cs.AI 57%

Less is More: Label-Guided Summarization of Procedural and Instructional Videos

少即是多:基于标签的程序性和教学视频摘要

Shreya Rajpal, Michal Golovanevsky, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Vellore Institute of Technology(维洛雷理工学院) Brown University(布朗大学)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08512 2026-01-28 cs.CV cs.AI 57%

MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding

MLVTG: 基于Mamba的特征对齐与LLM驱动的多模态视频时间定位

Zhiyi Zhu, Xiaoyu Wu, Zihao Liu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 MLVTG通过结合MambaAligner和LLMRefiner,实现了多模态视频时间定位的高精度定位与语义净化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17818 2026-01-27 cs.CV 57%

ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning

ViTCoP: 通过视觉和文本语义协同剪枝加速大型视觉-语言模型

Wen Luo, Peng Chen, Xiaotao Huang, LiQun Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 ViTCoP通过结合视觉和文本语义协同剪枝,有效降低大型视觉-语言模型的计算成本,提升推理效率和内存利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11777 2026-01-26 cs.CV cs.AI cs.CY cs.LG 57%

Self-supervised Learning of Echocardiographic Video Representations via Online Cluster Distillation

通过在线聚类蒸馏实现心电图视频的自监督学习

Divyanshu Mishra, Mohammadreza Salehi, Pramit Saha, Olga Patey, Aris T. Papageorghiou, Yuki M. Asano, J. Alison Noble

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学) Nuffield Department of Women’s and Reproductive Health, University of Oxford(妇女与生殖健康系,牛津大学) Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 DISCOVR通过在线聚类蒸馏实现心脏超声视频的自监督学习,结合时序动态和细粒度空间语义,提升临床任务性能。

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09524 2026-01-15 cs.CV cs.HC 57%

Video Joint-Embedding Predictive Architectures for Facial Expression Recognition

视频联合嵌入预测架构用于面部表情识别

Lennart Eing, Cristina Luna-Jiménez, Silvan Mertes, Elisabeth André

机构 * Chair for Human-Centered Artificial Intelligence(人中心人工智能教研室) University of Augsburg(奥斯特拉赫大学) Faculty of Computer Science(计算机科学学院) Technical University of Applied Sciences Augsburg(应用科学大学奥斯特拉赫)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种基于嵌入的预训练方法,用于提升面部表情识别的性能,在RAVDESS和CREMA-D数据集上取得了显著成果。

Comments To appear in 2025 Proceedings of the 13th International Conference on Affective Computing and Intelligent Interaction (ACII), submitted to IEEE. \c{opyright} 2025 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05511 2026-01-12 cs.CV 57%

GaussianSwap: Animatable Video Face Swapping with 3D Gaussian Splatting

GaussianSwap: 基于3D高斯点云的可动画视频人脸交换

Xuan Cheng, Jiahao Rao, Chengyang Li, Wenhao Wang, Weilin Chen, Lvqing Yang

机构 * School of Informatics, Xiamen University(信息学院,厦门大学)

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 GaussianSwap通过3D高斯点云构建可动画视频人脸交换虚拟角色,实现身份保持与高保真视觉效果,支持交互式应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11830 2026-01-08 cs.CV cs.AI 57%

VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing

VISTA: 通过无训练动态推理路由缓解视频大语言模型中的语义惯性

Hongbo Jin, Jiayu Ding, Siyi Xie, Guibo Luo, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 VISTA通过动态推理路由和潜在推理共识机制,缓解视频大语言模型中的语义惯性问题,提升视频理解性能。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03781 2026-01-08 cs.CV 57%

MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction

MVP: 通过自监督掩码视频预测增强视频大型语言模型

Xiaokun Sun, Zezhong Wu, Zewen Ding, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视频理解 :video reasoning(abstract);分类 cs.CV

AI总结 MVP通过自监督掩码视频预测提升视频大语言模型的时间推理和因果理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18754 2026-01-06 cs.CV cs.AI 57%

COLT: Enhancing Video Large Language Models with Continual Tool Usage

COLT: 通过持续工具使用增强视频大语言模型

Yuyang Liu, Meng Cao, Xinyuan Shi, Xiaondan Liang

机构 * University of Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 COLT通过持续工具使用增强视频大语言模型,解决工具数据持续变化的问题,提升视频理解性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00887 2026-01-06 cs.CV 57%

VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition

VideoCuRL: 通过正交难度分解实现视频课程强化学习

Hongbo Jin, Kuanwei Lin, Wenhao Zhang, Yichen Jin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 VideoCuRL通过正交分解视频理解中的视觉复杂性和认知复杂性,提出了一种新的课程强化学习框架,提升了视频推理和感知任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21863 2025-12-29 cs.IR cs.MM 57%

Frozen LVLMs for Micro-Video Recommendation: A Systematic Study of Feature Extraction and Fusion

冻结的大型视频语言模型用于微视频推荐:特征提取与融合的系统研究

Huatuan Sun, Yunshan Ma, Changguang Wu, Yanxin Zhang, Pengfei Wang, Xiaoyu Du

专题命中 视频理解 :video language model(abstract);分类 cs.MM

AI总结 本文通过系统研究冻结LVLMs的特征提取与融合策略,提出DFF框架,证明中间隐藏状态优于标题表示,ID嵌入融合优于替换,并在微视频推荐中取得最佳性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11953 2025-12-25 cs.CV 57%

SPOC: Spatially-Progressing Object State Change Segmentation in Video

SPOC: 视频中空间性推进的对象状态变化分割

Priyanka Mandikal, Tushar Nagarajan, Alex Stoken, Zihui Xue, Kristen Grauman

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SPOC提出空间性推进的对象状态变化分割任务,通过伪标签和动态约束方法,解决视频中对象变化位置和速度的精确定位问题。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19687 2025-12-23 cs.SD cs.CV cs.LG 57%

Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning

推动音频视觉感知前沿:大规模多模态对应学习

Apoorv Vyas, Heng-Jui Chang, Cheng-Fu Yang, Po-Yao Huang, Luya Gao, Julius Richter, Sanyuan Chen, Matt Le, Piotr Dollár, Christoph Feichtenhofer, Ann Lee, Wei-Ning Hsu

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 PE-AV通过大规模多模态对应学习提升音频视频理解,支持跨模态嵌入并实现语音检索等新任务,同时开发PE-A-Frame实现细粒度音频-文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18878 2025-12-23 cs.CV cs.AI 57%

CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis

CrashChat: 一种多模态大语言模型用于多任务交通事故视频分析

Kaidi Liang, Ke Li, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(石溪大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 CrashChat是一种多模态大语言模型,用于多任务交通事故视频分析,通过任务解耦和分组策略提升事故识别、定位等任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏