arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 178 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 178 篇

2512.01803 2026-07-10 cs.CV 版本更新 57%

Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

生成式动作叙事:评估合成视频中的人体运动

Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Belmont High School(贝利蒙高中) Canyon Crest Academy(坎波尔峡谷学院) Runway

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 57%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01560 2026-07-10 cs.CV 版本更新 57%

XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition

XOV-Action:迈向可泛化的开放词汇动作识别

Kun-Yu Lin, Henghui Ding, Jia-Run Du, Jiaming Zhou, Yi-Xing Peng, Yu-Ming Tang, Zhilin Zhao, Chen Change Loy, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13808 2026-07-08 cs.CV 版本更新 57%

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21241 2026-07-07 cs.RO cs.AI 版本更新 57%

CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

CorridorVLA:通过稀疏锚点实现生成动作头的显式空间约束

Dachong Li, ZhuangZhuang Chen, Jin Zhang, Jianqiang Li

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 CorridorVLA通过稀疏锚点提供显式空间约束,提升动作生成性能,在LIBERO-Plus基准上改进成功率3.4%-12.4%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18157 2026-07-07 cs.CV cs.LG 版本更新 57%

Agentic Very Long Video Understanding

智能体超长视频理解

Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak, Yuning Chai, Yong Jae Lee, Hyo Jin Kim

机构 * Reality Labs Research at Meta(Meta 实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对智能眼镜等设备带来的长视频理解需求,以实体场景图为核心构建增强智能体框架EGAgent,实现结构化搜索、推理及跨模态能力,在相关数据集实验中取得较好表现。

Comments 29 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09604 2026-07-03 cs.CV 版本更新 57%

DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition

DAP:面向异构毫米波的点网络用于人类动作识别

Jiaying Lin, Shiman Wu, Jinfu Liu, Can Wang, Mengyuan Liu

机构 * Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) DJI Technology Company Ltd.(大疆技术创新有限公司) Christian-Albrechts-Universität zu Kiel(基尔大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DAP-Net,通过异构雷达源的跨模态对齐和D2R模块实现点云增强,提升动作识别的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04277 2026-07-03 cs.CV 版本更新 57%

Event-based vision sensing and its application to pedestrian detection for intelligent transportation and surveillance

基于事件的视觉感知及其在智能交通与监控中行人检测的应用

Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li

机构 * Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li(未知)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 综述事件视觉感知原理及其在行人检测中的应用,比较事件驱动与传统帧方法的优劣,分析现有方法并讨论开放挑战与未来方向。

Comments Published in Advanced Engineering Informatics, Vol. 76, Part B, 104989 (2026). Received 31 December 2025; Revised 3 June 2026; Accepted 18 June 2026; Available online 23 June 2026. DOI: 10.1016/j.aei.2026.104989

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31529 2026-07-02 cs.CV 版本更新 57%

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

SVI-Bench: 一个用于战略视频智能的动态微世界

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo Torresani, Gedas Bertasius

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Northeastern University(东北大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SVI-Bench,一个基于团队体育动态微世界的大规模基准,通过四个层级(动态场景理解、因果推理、战略模拟、智能体合成)的9个任务评估视频智能从感知到战略规划的能力,发现模型在感知任务上表现良好但在认知层级上性能急剧下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新 57%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06687 2026-07-01 cs.CV 版本更新 57%

RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection

RASR:基于检索的语义推理用于虚假新闻视频检测

Hui Li, Peien Ding, Jun Li, Guoqi Ma, Zhanyu Liu, Ge Xu, Junfeng Yao, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机科学与信息安全学院) School of Computer and Big Data, Minjiang University(闽江学院计算机与大数据学院) Xiamen University(厦门大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RASR框架,通过跨实例语义解析器和检索器、领域引导多模态推理模块和多视图特征解耦融合模块,提升虚假新闻视频检测的准确性和跨域泛化能力。

Comments The paper needs revision, and the experiments need to be expanded

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18242 2026-07-01 cs.CV 版本更新 57%

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA:学习规划与验证以实现自我中心视频推理

Yogesh Kulkarni, Pooyan Fazli

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17581 2026-07-01 cs.LG cs.CV 版本更新 57%

EgoCogNav: Cognition-aware Human Egocentric Navigation

EgoCogNav: 认知感知的人类自我中心导航

Zhiwen Qiu, Ziang Liu, Wenqian Niu, Tapomayukh Bhattacharjee, Saleh Kalantari

机构 * Cornell University(康奈尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EgoCogNav多模态自我中心导航框架,联合预测路径不确定性、轨迹和头部运动,并引入CEN数据集,实验表明其能学习与人类扫描、犹豫等行为相关的感知不确定性。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20328 2026-06-29 cs.CV 版本更新 57%

HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

混合潜在推理与解耦策略优化

Tao Cheng, Shi-Zhe Chen, Hao Zhang, Yixin Qin, Jinwen Luo, Zheng Wei

机构 * Tencent PCG(腾讯PCG) Tencent CSIG(腾讯CSIG)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HyLaR框架,通过结合离散文本生成与连续视觉潜在表示,提升多模态大语言模型在细粒度感知和通用多模态理解中的性能。

Comments Accepted to ECCV 2026

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00784 2026-06-29 cs.CV 版本更新 57%

An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models

一种丰富手术视频数据集的方法,用于视觉-语言模型的细粒度时空理解

Lennart Maack, Alexander Schlaefer

机构 * Hamburg University of Technology(汉堡理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SurgSTU-Pipeline生成管道,通过时空连续性过滤创建细粒度时空问答数据集SurgSTU,提升视觉-语言模型在手术视频中的时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02340 2026-06-29 cs.AI q-bio.OT 版本更新 57%

Chronic Kidney Disease Prognosis Prediction Using Transformer

使用Transformer进行慢性肾脏病预后预测

Yohan Lee, Dong Gyun Kang, SeHoon Park, Sa-Yoon Park, Kwangsoo Kim

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出基于Transformer的ProQ-BERT框架,利用多模态电子健康记录预测CKD进展,在9万余名患者数据上实现高达0.995的ROC-AUC。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03371 2026-06-26 cs.CL 版本更新 57%

See, Infer, Intervene: Proactive World Modeling for Goal-Oriented Social Intelligence

观察、推断、干预:面向目标导向社交智能的主动世界建模

Honghui Zhang, Chenmeinian Guo, Yichen Yu, Guanyu Liu, Yujia Zhang, Yongming Qin, Chongguo Song, Mengyue Yang, Lei Yu, Tianyu Shi

机构 * Mita Technology(Mita技术公司) University of Bristol(布里斯托大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。

Comments 16 pages, 3 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17683 2026-06-26 cs.LG cs.CV stat.ML 版本更新 57%

Probabilistic NDVI Forecasting from Sparse Satellite Time Series and Weather Covariates

基于稀疏卫星时间序列和天气协变量的概率NDVI预测

Irene Iele, Giulia Romoli, Daniele Molino, Elena Mulero Ayllón, Filippo Ruffini, Paolo Soda, Matteo Tortora

机构 * Department of Naval, Electrical, Electronics and Telecommunications Engineering, University of Genoa, Italy(海军、电子、电子与电信工程系,热那亚大学,意大利)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种概率预测框架,利用稀疏卫星数据和天气协变量进行田间NDVI预测,通过融合历史和未来数据实现多步分位数预测,实验表明优于传统和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12062 2026-06-26 cs.CV 版本更新 57%

Learning Language-Driven Sequence-Level Modal-Invariant Representations for Video-Based Visible-Infrared Person Re-Identification

基于语言驱动的序列级模态不变表示学习用于视频可见光-红外行人重识别

Xiaomei Yang, Antai Liu, Xizhan Gao, Fa Zhu, Sijie Niu, Giancarlo Fortino

机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东省 Ubiquitous Intelligent Computing 重点实验室,济南大学信息科学与工程学院) College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(信息科学与技术及人工智能学院,南京林业大学) Department of Informatics, Modeling, Electronics, and Systems, University of Calabria(信息学、建模、电子与系统系,卡利博大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出LSMRL方法,通过CLIP的时空特征学习、语义扩散和跨模态交互模块,结合模态级损失,学习序列级模态不变表示,在VVI-ReID任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24731 2026-06-24 cs.CV 版本更新 57%

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

EchoFoley: 面向视频接地创意声音生成的事件中心层次化控制

Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EchoFoley任务,通过事件级局部控制和层次化语义控制实现视频接地声音生成,构建EchoFoley-6k基准并设计EchoVidia框架,在可控性和感知质量上分别提升40.7%和12.5%。

Comments CVPR-2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00324 2026-06-24 cs.RO cs.CV cs.HC 版本更新 57%

MILE: A Mechanically Isomorphic Hand Exoskeleton and Visuotactile Robotic Hand for Data Collection in Dexterous Manipulation

MILE:一种用于灵巧操作的指尖视觉触觉传感的机械同构外骨骼数据采集系统

Jinda Du, Jieji Ren, Qiaojun Yu, Ningbin Zhang, Yu Deng, Xingyu Wei, Yufei Liu, Guoying Gu, Xiangyang Zhu

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(机械系统与振动国家重点实验室,上海交通大学机械工程学院,上海200240,中国) Shanghai Key Laboratory of Intelligent Robotics, Shanghai Jiao Tong University, Shanghai 200240, China(智能机器人上海重点实验室,上海交通大学,上海200240,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Humanoid Robot (Shanghai) Co., Ltd., Shanghai, China(上海人形机器人有限公司,上海,中国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对现有灵巧操作数据采集系统运动重定向不准确、效率低、缺乏高分辨率指尖触觉传感的问题,提出MILE系统,通过从人手到外骨骼再到机械手的机械同构设计,实现无重定向精确控制,并集成指尖视觉触觉模块,采集多模态数据集,显著提升遥操作成功率。

Comments 18 pages including supplementary material. Main manuscript and supplementary material included in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 57%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新 57%

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07628 2026-06-19 cs.AI cs.LG 版本更新 57%

SleepMaMi: A Universal Sleep Foundation Model for Integrating Macro- and Micro-structures

SleepMaMi:一种融合宏观与微观结构的通用睡眠基础模型

Keondo Park, Younghoon Na, Yourim Choi, Hyunwoo Ryu, Hyun-Woo Shin, Hyung-Sin Kim

机构 * Graduate School of Data Science, Seoul National University, Seoul, South Korea(首尔国立大学数据科学研究生院,韩国首尔) Department of Biomedical Sciences, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院生物医学科学系,韩国首尔) Obstructive Upper Airway Research (OUaR) Laboratory, Department of Pharmacology, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院药理学系阻塞性上气道研究(OUaR)实验室,韩国首尔) Department of Otorhinolaryngology-Head and Neck Surgery, Seoul National University Hospital, Seoul, Republic of Korea(首尔国立大学医院耳鼻喉头颈外科系,韩国首尔)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出SleepMaMi睡眠基础模型,通过分层双编码器设计(宏观编码器建模整夜时间依赖,微观编码器捕捉生物信号短时特征),结合人口统计引导对比学习和混合掩码自编码器训练,在超过2万条PSG记录上预训练,在下游任务中优于或匹配现有基础模型。

Comments 8 pages, Appendix 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01900 2026-06-16 cs.CV 版本更新 57%

Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation

Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Xuelin Chen, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科克大学) University College London(伦敦大学学院) Adobe(Adobe公司) Hacettepe University(哈切特佩大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。

Comments Project Page: https://cyberiada.github.io/Auteur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14482 2026-06-12 cs.CV 版本更新 57%

V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning

V-JEPA 2.1: 解锁视频自监督学习中的密集特征

Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha, Mike Rabbat, Yann LeCun, Nicolas Ballas, Adrien Bardes

机构 * FAIR at Meta(Meta的FAIR) Universidad de Zaragoza(萨拉戈萨大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出V-JEPA 2.1系列自监督模型,通过密集预测损失、深度自监督、多模态分词器和有效缩放,学习图像和视频的密集高质量视觉表示,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03340 2026-06-12 cs.LG cs.AI cs.CE physics.comp-ph 版本更新 57%

Equivariant Flow Matching for Symmetry-Breaking Bifurcation Problems

等变流匹配用于对称破缺分岔问题

Fleur Hendriks, Ondřej Rokoš, Martin Doškář, Marc G. D. Geers, Vlado Menkovski

机构 * Department of Mechanical Engineering, Eindhoven University of Technology(埃因霍温理工大学机械工程系) DIFFER – Dutch Institute for Fundamental Energy Research(荷兰基础能源研究所) Faculty of Civil Engineering, Department of Mechanics, Czech Technical University in Prague(布拉格捷克技术大学土木工程学院力学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对非线性动力系统中对称破缺导致的多稳态共存问题,提出等变流匹配方法,结合等变架构与最优传输耦合机制,准确捕捉多模态分布和对称破缺分岔,优于非概率和变分方法。

Comments 9 pages, 7 figures including appendices. Accepted to Machine Learning and the Physical Sciences Workshop, NeurIPS 2025 (https://ml4physicalsciences.github.io/2025/). Repository with corresponding code: https://github.com/FHendriks11/bifurcationML/. Video explanation: https://www.youtube.com/watch?v=wsL3h17KtjY

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20190 2026-06-11 cs.CV 版本更新 57%

CoVR-R:Reason-Aware Composed Video Retrieval

CoVR-R: 推理感知的组合视频检索

Omkar Thawakar, Dmitry Demidov, Vaishnav Potlapalli, Sai Prasanna Teja Reddy Bogireddy, Viswanatha Reddy Gajjala, Alaa Mostafa Lasheen, Rao Muhammad Anwer, Fahad Khan

机构 * Mohamed bin Zayed University of AI(莫扎德·本·扎耶德人工智能大学) University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Linköping University(林奈大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种零样本推理优先方法,利用大型多模态模型推断编辑的因果和时序后效,并构建CoVR-Reason基准评估,在隐式效应子集上显著优于强基线。

Comments 9 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09681 2026-06-10 cs.CV 版本更新 57%

GenEyePose: Patient-Free, Knowledge-Based Saccadic Eye Movement Modeling for Digital Neurophysiologic Biomarker Development

GenEyePose:用于数字神经生理学生物标志物开发的无患者、基于知识的扫视眼动建模

Tianyu Lin, Jooyoung Ryu, Puvada Sreevarsha, Rahul Srinivasaragavan, Riya Satavlekar, Susan Kim, Nidhi Soley, Yujie Yan, Ishan Vatsaraj, Carl Harris, Aimon Rahman, Vishal Patel, Joseph Greenstein, Casey Taylor, Kemar E. Green

机构 * Whiting School of Engineering, Johns Hopkins University(约翰霍普金斯大学惠廷工程学院) Department of Neurology, Johns Hopkins Medicine(约翰霍普金斯医学院神经内科)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出首个全合成、无患者的多模态眼动生成流水线,用于泛化扫视分析;基于合成数据训练的深度学习分类器在真实临床数据上区分正常与异常扫视精度,AUROC达0.76。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07431 2026-06-09 cs.CV 版本更新 57%

OpenGlass: Ultra-Low-Power On-Device AI Eyewear with Event-based Vision

OpenGlass:用于设备上基于事件的手势识别的开源智能眼镜

Pietro Bonazzi, Julian Moosmann, Ahmet Celik, Philipp Mayer, Michele Magno

机构 * Department of Information Technology and Electrical Engineering, ETH Zürich(信息科技与电气工程系,瑞士联邦理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出开源智能眼镜平台OpenGlass,采用模块化设计、事件驱动电源管理和GAP9 RISC-V SoC,实现低功耗设备上ML,在LynX数据集上达到83.94%的跨主体手势识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏