arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4735 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4735 篇

2512.20025 2026-04-20 cs.CV 57%

A Contextual Analysis of Driver-Facing and Dual-View Video Inputs for Distraction Detection in Naturalistic Driving Environments

面向驾驶员和双视角视频输入在自然驾驶环境中的干扰检测情境分析

Anthony Dontoh, Stephanie Ivey, Armstrong Aboah

机构 * Environmental Engineering The University of Memphis Memphis, TN, USA Email(环境工程 明尼苏达大学 内华达州法戈 邮箱) Environmental Engineering North Dakota State University Fargo, ND, USA Email(环境工程 内华达州立大学 内华达州法戈 邮箱)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了在自然驾驶环境中,结合道路面向和驾驶员面向视频输入对干扰检测准确性的影响,通过对比三种时空动作识别模型,发现多视角融合需依赖特定架构设计以避免干扰。

Journal ref 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS), 02-05 Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01944 2026-04-20 cs.RO cs.CV 57%

AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving

AutoDrive-R$^2$: 促进自动驾驶VLA模型的推理与自反思能力

Zhenlong Yuan, Chengxuan Qian, Jing Tang, Rui Chen, Zijian Song, Lei Sun, Xiangxiang Chu, Yujun Cai, Dapeng Zhang, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) Sun Yat-sen University(中山大学) University of Queensland(昆士兰大学) Lanzhou University(兰州大学) Case Western Reserve University(凯斯西储大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AutoDrive-R$^2$框架,通过链式推理和强化学习提升自动驾驶VLA系统的推理与自反思能力,使用nuScenesR$^2$-6K数据集和GRPO算法实现高鲁棒性轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15308 2026-04-17 cs.CV 57%

RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework

RAD-2: 在生成器-判别器框架中扩展强化学习

Hao Gao, Shaoyu Chen, Yifan Zhu, Yuehao Song, Wenyu Liu, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RAD-2提出了一种生成器-判别器框架,通过扩散生成器生成轨迹候选并利用RL优化判别器评估长期驾驶质量,从而提升闭环规划的稳定性与安全性,实验显示碰撞率降低56%。

Comments Project page: https://hgao-cv.github.io/RAD-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19130 2026-04-17 cs.MM 57%

Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD

双流解耦学习用于AVSD中的时间一致性和说话人交互

Junhao Xiao, Shun Feng, Zhiyu Wu, Jinghan Yu, Haibiao Yao, Zhiyuan Ma, Jianjun Li, Youjun Bao, Yi Chen

专题命中 视频多模态 :audio-visual(abstract);分类 cs.MM

AI总结 本文提出D$^2$Stream双流框架,通过解耦时间连续性和人际交互任务,提升AVSD性能,实现95.6%的mAP和更广的泛化能力。

Comments Submitted to ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00998 2026-04-17 cs.CV 57%

Large Vision Model-Guided Masked Low-Rank Approximation for Ground-Roll Attenuation

大视觉模型引导的掩码低秩近似用于地面滚动生成消减

Jiacheng Liao, Feng Qian, Ziyin Fan, Yongjian Guo

机构 * School of Information and Communication Engineering, Center for Information Geoscience, University of Electronic Science and Technology of China(信息与通信工程学院,信息科学研究院,电子科学与技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于大视觉模型引导的掩码低秩近似框架,通过多模态提示生成精细掩码,结合全局和局部低秩约束,有效消减地面滚动生成并抑制信号泄漏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24869 2026-04-16 cs.CV 57%

SiLVR: A Simple Language-based Video Reasoning Framework

SiLVR:一种简单的基于语言的视频推理框架

Ce Zhang, Yan-Bo Lin, Ziyang Wang, Mohit Bansal, Gedas Bertasius

机构 * Department of Computer Science(计算机科学系) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SiLVR通过将复杂视频理解分解为两个阶段,利用多感官输入生成语言表示,并通过强大推理LLM解决复杂视频-语言任务,实现了在多个视频评估任务上的最佳表现。

Comments Accepted by TMLR (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV 57%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22364 2026-04-15 cs.RO cs.AI 57%

BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands

BINDER: 基于开放词汇命令的即时自适应移动操作

Seongwon Cho, Daechul Ahn, Donghyun Shin, Hyeonbeom Choi, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01186 2026-04-15 cs.CV 57%

ASTRA: Let Arbitrary Subjects Transform in Video Editing

ASTRA: 让任意主体在视频编辑中变换

Fei Shen, Weihao Xu, Rui Yan, Dong Zhang, Xiangbo Shu, Jinhui Tang, Maocheng Zhao

机构 * NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学与技术学院及人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ASTRA提出一种无需训练的视频编辑框架,通过多模态对齐模块和先验掩码重定位模块解决密集多主体场景中的注意力稀释和边界纠缠问题,实现精准操控与非目标区域的严格保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12145 2026-04-15 eess.AS cs.SD 57%

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

为何您的分词器在信息融合中失败:一种面向时间的预量化融合用于视频增强的音频分词

Xiangyu Zhang, Benjamin John Southwell, Siqi Pan, Xinlei Niu, Beena Ahmed, Julien Epps

机构 * School of Electrical Engineering and Telecommunications, University of New South Wales(新南威尔士大学电气工程与电信学院) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究了视频增强音频分词中重建质量下降的根本原因,提出了一种面向时间的预量化融合方法,通过在分词器架构中合理定位融合位置,结合时间轴上的特征融合,实现了高保真重建和下游任务的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11572 2026-04-14 cs.RO cs.MM 57%

DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models

DA-PTQ:面向视觉-语言-动作模型的漂移感知后训练量化

Siyuan Xu, Tianshi Wang, Fengling Li, Lei Zhu, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(悉尼科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出DA-PTQ,通过跨空间表示补偿和运动驱动混合精度分配,解决视觉-语言-动作模型中因量化扰动导致的轨迹漂移问题,实现低比特下的高效部署。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11498 2026-04-14 cs.CV 57%

TAG-Head: Time-Aligned Graph Head for Plug-and-Play Fine-grained Action Recognition

TAG-Head:时间对齐图头用于即插即用的细粒度动作识别

Imtiaz Ul Hassan, Nik Bessis, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TAG-Head,一种轻量级时空图头,通过RGB单一模态提升细粒度动作识别性能,采用Transformer编码器和图结构增强时空依赖性,实验证明其在RGB-only模型中达到SOTA,优于多模态方法。

Comments 15 pages, 3 figures, to appear in ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 57%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV 57%

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02311 2026-04-14 cs.CV cs.LG 57%

Inferring Dynamic Physical Properties from Video Foundation Models

从视频基础模型推断动态物理性质

Guanqi Zhan, Xianzheng Ma, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学VGG实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06964 2026-04-14 cs.CV 57%

Adversarial Video Promotion Against Text-to-Video Retrieval

对抗性视频推广对抗文本到视频检索

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Qian Li, Shuai Liu, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。

Comments This paper has been accepted by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09799 2026-04-14 cs.LG cs.AI 57%

Explainable Human Activity Recognition: A Unified Review of Concepts and Mechanisms

可解释的人体活动识别:概念和机制的统一综述

Mainak Kundu, Catherine Chen, Rifatul Islam, Ismail Uysal, Ria Kanjilal

机构 * University of South Florida(南佛罗里达大学) California Polytechnic State University(加州州立理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了可解释人体活动识别方法,从概念和机制角度分析其复杂性,总结了主要挑战和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18373 2026-04-14 cs.CV 57%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09513 2026-04-14 cs.CV 57%

Learning Parallax for Stereo Event-based Motion Deblurring

基于立体事件和强度相机的立体事件运动去模糊网络

Mingyuan Lin, Chi Zhang, Chu He, Lei Yu

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出St-EDNet网络,通过粗到细框架直接从错位输入恢复高质量图像,利用立体事件和强度相机数据,无需真实深度,构建双特征嵌入架构以重建潜在锐化图像序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 57%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21334 2026-04-13 cs.CV 57%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08966 2026-04-13 cs.CV 57%

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

视频大语言模型应如何输出时间?对高效时间接地范式的分析

Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

机构 * The University of Central Florida(中佛罗里达大学) Axon(Axon公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文对比三种主流视频时间接地范式,探讨输出设计对精度与效率的影响,发现连续分布范式在效率-精度权衡中表现最佳。

Comments CVPR 2026 Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07772 2026-04-10 cs.CV 57%

ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions

ESOM:基于开放世界动态定义的高效流视频异常理解

Zihao Liu, Xiaoyu Wu, Wenna Li, Jianqin Wu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出ESOM模型,通过定义规范化、帧间匹配、混合流内存和概率评分模块,实现高效流视频异常检测,同时引入OpenDef-Bench基准测试,在单GPU上实现实时效率和先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06036 2026-04-10 cs.DC cs.CV cs.LG 57%

CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference

CodecSight: 利用视频编码信号实现高效的流式视频语言模型推理

Yulin Zou, Yan Chen, Wenyan Chen, JooYoung Park, Shivaraman Nitin, Luo Tao, Francisco Romero, Dmitrii Ustiugov

机构 * Beihang University(北京航空航天大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 CodecSight通过利用视频编码器内嵌的时空结构信息,实现流式视频分析的高效推理,提升吞吐量并减少GPU计算量,同时保持高精度。

Comments 18 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06330 2026-04-09 cs.CL 57%

STDec: Spatio-Temporal Stability Guided Decoding for dLLMs

STDec:基于时空稳定性的解码方法用于dLLMs

Yuzhe Chen, Jiale Cao, Xuyang Liu, Jin Xie, Aiping Yang, Yanwei Pang

机构 * Tianjin University(天津大学) Sichuan University(四川大学) Chongqing University(重庆大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 STDec通过结合空间和时间稳定性,改进dLLM解码,提升吞吐量并保持性能。

Comments Homepage: https://yzchen02.github.io/STDec

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05323 2026-04-08 cs.CV cs.RO 57%

VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success

VLA-InfoEntropy:一种无需训练的视觉-注意力信息熵方法,用于视觉-语言-动作模型的推理加速与成功

Chuhang Liu, Yayun He, Zuheng Kang, Xiaoyang Qu, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLA-InfoEntropy方法,通过图像熵和注意力熵结合时间步信息,动态调整模型关注区域,减少冗余并提升推理效率。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05015 2026-04-08 cs.CV 57%

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

Video-MME-v2:迈向综合视频理解基准的下一阶段

Chaoyou Fu, Haozhi Yuan, Yuhao Dong, Yi-Fan Zhang, Yunhang Shen, Xiaoxing Hu, Xueying Li, Jinsen Su, Chengwu Long, Xiaoyao Xie, Yongkang Xie, Xiawu Zheng, Xue Yang, Haoyu Cao, Yunsheng Wu, Ziwei Liu, Xing Sun, Caifeng Shan, Ran He

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-MME-v2通过三级层次结构和非线性评估策略,评估视频理解的鲁棒性和准确性,揭示当前模型与人类专家间的差距及多模态推理瓶颈。

Comments Homepage: https://video-mme-v2.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25021 2026-04-08 cs.CV 57%

VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

VideoTIR:通过高效工具集成推理实现长视频的准确理解

Zhe Gao, Shiyu Shen, Taifeng Chai, Weinong Wang, Haotian Xu, Xing W, Wenbin Li, Qi Fan, Yang Gao, Dacheng Tao

机构 * Nanjing University(南京大学) Nankai University(南开大学) East China Normal University(华东师范大学) Tencent(腾讯) MiroMind Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VideoTIR,通过强化学习优化工具调用策略,提升长视频理解的准确性和效率,结合零样本RL和SFT冷启动方法,减少冗余调用并生成高质量轨迹数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04811 2026-04-07 cs.RO cs.CV cs.HC 57%

AnyUser: Translating Sketched User Intent into Domestic Robots

AnyUser: 将草图用户意图翻译成家用机器人

Songyuan Yang, Huibin Tan, Kailun Yang, Wenjing Yang, Shaowu Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学国家机器人视觉感知与控制技术工程研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 AnyUser通过相机图像上的自由形式草图(可选语言)实现直观的家庭任务指令,利用多模态输入生成无需先验地图或模型的可执行机器人动作,通过大量评估验证其在不同模拟家庭场景中的高准确性和真实环境中的可靠性。

Comments Accepted to IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04379 2026-04-07 cs.CV 57%

Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning

强化以学习,选择以推理:视频推理的双范式

Songyuan Yang, Weijiang Yu, Jilin Ma, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RLER双范式,通过强化学习生成证据并验证推理一致性,提升视频推理的可靠性和可解释性,实验表明其在多个基准上均取得最佳性能。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏