arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4735 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4735 篇

2511.02340 2026-06-29 cs.AI q-bio.OT 版本更新 57%

Chronic Kidney Disease Prognosis Prediction Using Transformer

使用Transformer进行慢性肾脏病预后预测

Yohan Lee, Dong Gyun Kang, SeHoon Park, Sa-Yoon Park, Kwangsoo Kim

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出基于Transformer的ProQ-BERT框架,利用多模态电子健康记录预测CKD进展,在9万余名患者数据上实现高达0.995的ROC-AUC。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03371 2026-06-26 cs.CL 版本更新 57%

See, Infer, Intervene: Proactive World Modeling for Goal-Oriented Social Intelligence

观察、推断、干预:面向目标导向社交智能的主动世界建模

Honghui Zhang, Chenmeinian Guo, Yichen Yu, Guanyu Liu, Yujia Zhang, Yongming Qin, Chongguo Song, Mengyue Yang, Lei Yu, Tianyu Shi

机构 * Mita Technology(Mita技术公司) University of Bristol(布里斯托大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。

Comments 16 pages, 3 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17683 2026-06-26 cs.LG cs.CV stat.ML 版本更新 57%

Probabilistic NDVI Forecasting from Sparse Satellite Time Series and Weather Covariates

基于稀疏卫星时间序列和天气协变量的概率NDVI预测

Irene Iele, Giulia Romoli, Daniele Molino, Elena Mulero Ayllón, Filippo Ruffini, Paolo Soda, Matteo Tortora

机构 * Department of Naval, Electrical, Electronics and Telecommunications Engineering, University of Genoa, Italy(海军、电子、电子与电信工程系,热那亚大学,意大利)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种概率预测框架,利用稀疏卫星数据和天气协变量进行田间NDVI预测,通过融合历史和未来数据实现多步分位数预测,实验表明优于传统和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12062 2026-06-26 cs.CV 版本更新 57%

Learning Language-Driven Sequence-Level Modal-Invariant Representations for Video-Based Visible-Infrared Person Re-Identification

基于语言驱动的序列级模态不变表示学习用于视频可见光-红外行人重识别

Xiaomei Yang, Antai Liu, Xizhan Gao, Fa Zhu, Sijie Niu, Giancarlo Fortino

机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东省 Ubiquitous Intelligent Computing 重点实验室,济南大学信息科学与工程学院) College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(信息科学与技术及人工智能学院,南京林业大学) Department of Informatics, Modeling, Electronics, and Systems, University of Calabria(信息学、建模、电子与系统系,卡利博大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出LSMRL方法,通过CLIP的时空特征学习、语义扩散和跨模态交互模块,结合模态级损失,学习序列级模态不变表示,在VVI-ReID任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25905 2026-06-25 cs.CV 新提交 57%

SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集

Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang, Alyssa M. Hardin, Ahmad M. Hider, Yayuan Li, Jing Bi, Susan Liang, Chenliang Xu, Donald S. Likosky, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Edinburgh(爱丁堡大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) University of Colorado(科罗拉多大学) University of Rochester(罗切斯特大学) Michigan Medicine(密歇根医学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25736 2026-06-25 cs.CV 新提交 57%

UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving

UniTeD: 面向自动驾驶联合感知与规划的时域统一扩散模型

Bo Zhao, Xinting Zhao, Naifan Li, Erkang Cheng, Haibin Ling

机构 * Nullmax Westlake University(西湖大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出UniTeD框架,通过共享生成空间的迭代去噪统一建模感知与规划,引入时域过渡模块和锚点刷新策略,在多个基准上达到最先进性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25535 2026-06-25 cs.CV 新提交 57%

Spatio-Temporal Mixture-of-Modality-Experts Diffusion for Quantitative DCE-MRI Synthesis from Incomplete MR Sequences

时空模态专家混合扩散:从不完整MR序列合成定量DCE-MRI

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University Hospital(首尔大学医院放射科) Department of Radiology, Seoul National University College of Medicine(首尔大学医学院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔大学医院医疗人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出时空模态专家混合(ST-MoME)条件扩散框架,通过时空门控网络融合多模态专家特征,从任意子集合成3D DCE参数图,在386例脑肿瘤数据上16种缺失场景下取得最优NMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25329 2026-06-25 cs.CV cs.LG 新提交 57%

State Space Models Meet Remote Sensing: A Survey

状态空间模型遇上遥感:综述

Qinzhe Yang, Chenyang Liu, Jia Xu, Zhenwei Shi, Zhengxia Zou

机构 * Shen Yuan Honors College, Beihang University(北航沈元荣誉学院) Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(北京航空航天大学宇航学院航天智能科学与技术系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Qian Xuesen Laboratory of Space Technology, China Academy of Space Technology(中国空间技术研究院钱学森空间技术实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了状态空间模型(SSM)在遥感中的应用,分析了其在密集视觉预测、多模态和时序遥感数据中的优势,并总结了架构设计进展与未来挑战。

Comments 25 pages, 5 figures, has been published in SCIS SCIQ1 IF=8.1 https://doi.org/10.1007/s11432-025-4780-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25122 2026-06-25 cs.RO cs.AI cs.LG 新提交 57%

AeroCast: Probabilistic 3D Trajectory Prediction for Non-Cooperative Aerial Obstacles via Transformer-MDN Architecture

AeroCast: 基于Transformer-MDN架构的非合作空中障碍物概率3D轨迹预测

Syed Izzat Ullah, Jose Baca

机构 * Department of Engineering, Texas A&M University–Corpus Christi(德克萨斯A&M大学科珀斯克里斯蒂分校工程系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出AeroCast框架,结合Transformer编码器和混合密度网络,预测非合作空中障碍物的多模态轨迹,在五秒预测范围内将位移误差降低约50%,并支持实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24986 2026-06-25 cs.LG cs.AI 新提交 57%

When Multi-Sensor Fusion Fails to Generalize: Cattle Posture Classification Under Animal-Level and Temporal Distribution Shift

当多传感器融合无法泛化:动物级别和时间分布偏移下的牛姿势分类

Leutrim Uka, Severino Pinto, Gundula Hoffmann, Marina M. -C. Höhne

机构 * Institute of Computer Science, University of Potsdam(波茨坦大学计算机科学研究所) Department of Sensors and Modelling, Leibniz Institute for Agricultural Engineering and Bioeconomy - ATB(莱布尼茨农业工程与生物经济研究所传感器与建模系) Department of Data Science in Bioeconomy, Leibniz Institute for Agricultural Engineering and Bioeconomy - ATB(莱布尼茨农业工程与生物经济研究所生物经济数据科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究评估多传感器融合在牛姿势分类中的鲁棒性,发现跨年评估性能大幅下降(F1从0.94降至0.49),表明常用评估高估实际性能,融合可能降低而非提升鲁棒性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23705 2026-06-24 stat.AP cs.AI 新提交 57%

Event-Aligned Analysis of Multi-Rater Pain Assessments Using Continuous Wearable Physiology

使用连续可穿戴生理数据进行多评估者疼痛评估的事件对齐分析

Saba A. Farahani, Elahe Khatibi, Thomas D. Hughes, Ariana M. Nelson, Hung Cao, Amir M. Rahmani

机构 * University of California, Irvine(加州大学伊维奇分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出一种考虑评估者身份的事件对齐框架,将稀疏的疼痛评分转化为离散事件,并对齐连续可穿戴生理信号,揭示评估者间差异及生理模式依赖。

Comments 6 pages, 3 figures. Accepted at IEEE EMBC 2026 (Toronto, Canada, July 26-30, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24636 2026-06-24 cs.AI 新提交 57%

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

CineCap: 基于时空锚点的结构化推理用于电影化视频描述

Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang, Xin Tao, Pengfei Wan, Xiaohan Xing, Max Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Xiamen University(厦门大学) Kling Team, Kuaishou Technology(快手科技Kling团队) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24602 2026-06-24 cs.CV 新提交 57%

ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

ViTexQA: 面向视频文本问答的多帧时序感知数据集

Zhentao Guo, Chen Duan, Tongkun Guan, Zining Wang, Kai Zhou, Pengfei Yan

机构 * Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出ViTexQA数据集和FrameThinker方法,通过跨帧文本融合的问答对和两阶段训练(CoT微调+时序强化学习),解决多帧时序文本感知难题,ROUGE-L提升6.3%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24282 2026-06-24 cs.CV 新提交 57%

UniRED: Unified RGB-D Video Frame Interpolation with Event Guidance

UniRED: 基于事件引导的统一RGB-D视频帧插值

Yinuo Zhang, Guangshun Wei, Yuanfeng Zhou, Yiran Shen

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出统一多模态框架UniRED,融合RGB外观、深度几何和事件时间线索,通过双向流估计与运动基细化实现高质量RGB-D视频帧插值,并构建RGB-D-Event数据集缓解数据稀缺。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24175 2026-06-24 cs.CV 新提交 57%

Tri-Efficient Transfer Learning for Point Cloud Videos

点云视频的三效迁移学习

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) SIGS, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出PoinTriE框架,通过伪运动轨迹合成、几何-运动对偶网络和时空侧网络,实现数据、参数和内存三方面高效的点云视频迁移学习,在动作识别和语义分割任务上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24731 2026-06-24 cs.CV 版本更新 57%

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

EchoFoley: 面向视频接地创意声音生成的事件中心层次化控制

Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EchoFoley任务,通过事件级局部控制和层次化语义控制实现视频接地声音生成,构建EchoFoley-6k基准并设计EchoVidia框架,在可控性和感知质量上分别提升40.7%和12.5%。

Comments CVPR-2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00324 2026-06-24 cs.RO cs.CV cs.HC 版本更新 57%

MILE: A Mechanically Isomorphic Hand Exoskeleton and Visuotactile Robotic Hand for Data Collection in Dexterous Manipulation

MILE:一种用于灵巧操作的指尖视觉触觉传感的机械同构外骨骼数据采集系统

Jinda Du, Jieji Ren, Qiaojun Yu, Ningbin Zhang, Yu Deng, Xingyu Wei, Yufei Liu, Guoying Gu, Xiangyang Zhu

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(机械系统与振动国家重点实验室,上海交通大学机械工程学院,上海200240,中国) Shanghai Key Laboratory of Intelligent Robotics, Shanghai Jiao Tong University, Shanghai 200240, China(智能机器人上海重点实验室,上海交通大学,上海200240,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Humanoid Robot (Shanghai) Co., Ltd., Shanghai, China(上海人形机器人有限公司,上海,中国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对现有灵巧操作数据采集系统运动重定向不准确、效率低、缺乏高分辨率指尖触觉传感的问题,提出MILE系统,通过从人手到外骨骼再到机械手的机械同构设计,实现无重定向精确控制,并集成指尖视觉触觉模块,采集多模态数据集,显著提升遥操作成功率。

Comments 18 pages including supplementary material. Main manuscript and supplementary material included in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23503 2026-06-23 cs.CV 新提交 57%

UniverSat: Resolution- and Modality-Agnostic Transformers for Earth Observation

UniverSat:面向地球观测的分辨率与模态无关的Transformer

Yohann Perron, Guillaume Astruc, Nicolas Gonthier, Clement Mallet, Loic Landrieu

机构 * LIGM, Ecole Nationale des Ponts et Chaussées, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎国立桥梁与道路学院,IP巴黎,埃夫尔大学,CNRS) LASTIG, Univ Gustave Eiffel, IGN, ENSG(LASTIG,埃夫尔大学,国家地理信息学院,ENSG) IGN(国家地理信息学院) CNES(国家航天中心) EFEO(埃克塞特东方研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出UniverSat,一种基于通用补丁编码器的ViT骨干网络,能处理任意空间、光谱和时间分辨率的光学与非光学传感器数据,通过自监督学习在异构多模态语料上训练单一模型,在多个EO基准上取得强分类与分割结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22126 2026-06-23 cs.CL 新提交 57%

From Recognition to Understanding: Unlocking Cognitive Time Series Reasoning with LLMs

从识别到理解:利用LLM解锁认知时间序列推理

Xin Qiu, Junlong Tong, Yao Zhang, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) Zhejiang University(浙江大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 57%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20857 2026-06-23 cs.AI cs.LG cs.RO 新提交 57%

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA: 通过注意力LSTM和视觉-语言-动作模型实现实时手语引导的机器人操作

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * University College London(伦敦大学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SignVLA框架,通过注意力LSTM网络将手语手势实时转换为语义指令,驱动VLA模型执行机器人操作任务,为听障用户提供无障碍交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 57%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新 57%

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20312 2026-06-19 cs.CV 新提交 57%

Reliability-Aware Prototype Calibration for Frozen Pose-Flow Video Anomaly Detection

面向冻结姿态流视频异常检测的可靠性感知原型校准

Ning Dong, Yingna Su, Xin Dong, Ziyun Jiao, Xinnian Guo, Zhuangzhuang Pan

机构 * School of Information Engineering(信息工程学院) Suqian University(宿迁大学) School of Electronic & Information Engineering(电子与信息工程学院) Nanjing University of Information Science and Technology(南京信息科学技术大学) University of Electronic Science and Technology of China(电子科学与技术大学) Institute for Advanced Studies(高级研究机构) Universiti Malaya(马来亚大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种后验评分校准方法RPC,通过标准化潜在空间中的最近原型偏差修正冻结姿态流检测器的排名,在8个骨干-数据集组合上平均提升AUROC 2.03个百分点。

Comments 15 pages, 5 figures, 7 tables. Code available at https://github.com/iNing10/RPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20135 2026-06-19 cs.RO cs.AI 新提交 57%

Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation

频率感知流匹配用于连续且一致的机器人动作生成

Jianing Guo, Fangzheng Chen, Zihao Mao, Wong Lik Hang Kenny, Zhenhong Wu, Yu Li, Yishuai Cai, Yuanpei Chen, Yikun Ban, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Simin Li

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) PKU-Psibot Lab(北大-智源机器人实验室) Zhongguancun Laboratory(中关村实验室) Hefei Comprehensive National Science Center(合肥综合性国家科学中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出频率感知流匹配(FAFM),通过离散余弦变换将离散动作序列转换到频域进行流匹配,并正则化一阶时间导数以生成平滑连续的动作,提升成功率、多模态表达性和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19927 2026-06-19 cs.CV 新提交 57%

CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

CARE: 面向视频多模态大语言模型的自适应推理长度的能力感知奖励塑形

Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出CARE框架,通过能力感知奖励塑形自适应优化推理长度,利用指数移动平均估计能力并分阶段调整奖励偏好,结合批次归一化和后验放大器提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09547 2026-06-19 cs.CV cs.LG 新提交 57%

Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

流式干预:视频大语言模型能否在错误发生时即时纠正?

Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh, Rajeev Yasarla, Reza Pourreza, Litian Liu, Risheek Garrepalli, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) York University(约克大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Ego-MC-Bench基准评估视频LLM在烹饪场景中的实时干预能力,并构建Ego-CoMist反事实合成数据集提升小模型性能。

Comments The project page is available at https://apratimbh.github.io/livecookv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07628 2026-06-19 cs.AI cs.LG 版本更新 57%

SleepMaMi: A Universal Sleep Foundation Model for Integrating Macro- and Micro-structures

SleepMaMi:一种融合宏观与微观结构的通用睡眠基础模型

Keondo Park, Younghoon Na, Yourim Choi, Hyunwoo Ryu, Hyun-Woo Shin, Hyung-Sin Kim

机构 * Graduate School of Data Science, Seoul National University, Seoul, South Korea(首尔国立大学数据科学研究生院,韩国首尔) Department of Biomedical Sciences, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院生物医学科学系,韩国首尔) Obstructive Upper Airway Research (OUaR) Laboratory, Department of Pharmacology, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院药理学系阻塞性上气道研究(OUaR)实验室,韩国首尔) Department of Otorhinolaryngology-Head and Neck Surgery, Seoul National University Hospital, Seoul, Republic of Korea(首尔国立大学医院耳鼻喉头颈外科系,韩国首尔)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出SleepMaMi睡眠基础模型,通过分层双编码器设计(宏观编码器建模整夜时间依赖,微观编码器捕捉生物信号短时特征),结合人口统计引导对比学习和混合掩码自编码器训练,在超过2万条PSG记录上预训练,在下游任务中优于或匹配现有基础模型。

Comments 8 pages, Appendix 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 57%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15200 2026-06-16 cs.CV 新提交 57%

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

铭记于心:面向用户中心的持续空间智能推理在自我中心视频流中的应用

Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出UCS-Bench数据集和DirectMe框架,通过增量构建结构化空间记忆,实现自我中心视频流中动态空间推理、长期记忆与用户实时位置对齐,显著提升多模态大模型的空间推理能力。

Comments 45 pages. https://icml.cc/virtual/2026/poster/63682

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏