Adaptive Transit Design: Optimizing Fixed and Demand Responsive Multi-Modal Transportation via Continuous Approximation
专题命中 视频多模态 :multi-modal(title)
Comments 57 pages, 13 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multi-modal(title)
Comments 57 pages, 13 figures
专题命中 视频多模态 :multi-modal(title)
Comments Presented at HASCA workshop of Ubicomp2022
专题命中 视频多模态 :multimodal(title)
Comments to be published in Optics and Laser Technology
专题命中 视频多模态 :multimodal(title)
Comments To be published in Journal of Biomedical Informatics (Elsevier)
专题命中 视频多模态 :multimodal(title)
Comments 17 pages, 1 figure, 3 tables
专题命中 视频多模态 :multimodal(title)
Journal ref Journal of Advances in Artificial Intelligence and Machine Learning. 2021; Volume 1, Issue 1, Article 4
专题命中 视频多模态 :multi-modal(title)
Comments 42 pages, 19 figures
Journal ref Terrorism and Political Violence, 0(0), 1-20 (2021)
专题命中 视频多模态 :multimodal(title)
专题命中 视频多模态 :multi-modal(title)
专题命中 视频多模态 :multi-modal(title)
Comments 8 pages, 5 figure, submitted to accepted in American Control Conference (ACC)
专题命中 视频多模态 :multi-modal(title)
专题命中 视频多模态 :multi-modal(title)
Comments Accepted for publication in 41st International Engineering in Medicine and Biology Conference (EMBC), July 23-27, 2019
Journal ref 2019 41st Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC), Berlin, Germany, 2019, pp. 556-561
专题命中 视频多模态 :multimodal(title)
专题命中 视频多模态 :multimodal(title)
专题命中 视频多模态 :multimodal(title)
Comments 12 pages, 7 figures
Journal ref Phys. Rev. E 99, 032217 (2019)
专题命中 视频多模态 :multimodal(title)
Comments To appear in the proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2018
专题命中 视频多模态 :multimodal(title)
Comments Paper describing dataset. 11 pages; 4 figures
专题命中 视频多模态 :multimodal(title)
Comments 11 pages
VCIFBench:评估视频理解中的复杂指令遵循能力
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) ; International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL
AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。
用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能
机构 * University of Tehran(德黑兰大学)
专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。
超越视觉思维链:用于主动视频推理的内化视觉思维
机构 * Apple(苹果公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。
InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。
Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author
GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除
机构 * Tsinghua University(清华大学) ; Pengcheng National Laboratory(鹏城实验室) ; Huawei(华为) ; Southeast University(东南大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。
VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Renmin University of China(中国人民大学) ; Microsoft(微软公司)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。
Comments 27 pages, 15 figures
基于旅游视频先验的面向目标的导航指令生成
机构 * Uni-Ubi AI(优必爱人工智能) ; Zhejiang University(浙江大学) ; Tongji University(同济大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。
StreamArena:面向连续、交互式且长视界的智能体流媒体视频理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Xiaohongshu Inc.(小红书公司) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 针对当前智能体流媒体视频理解评估的缺陷,提出StreamArena基准,设计StreamMind架构解决连续交互与长视界理解的张力,在四项能力上优于现有基线并降低延迟。
视觉表示很重要:利用视频到音频生成中的时间差异
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。
FORGE:用于长视频理解的相关几何中的帧正交性
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) ; School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。
Comments Under Review
超越帧选择:用于长视频理解的生成式潜在证据聚合
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Baidu Inc.(百度公司) ; Alibaba Group(阿里巴巴集团) ; Xidian University(西安电子科技大学)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对长视频理解的帧选择局限,提出GenEvA框架,通过查询条件化分布聚合跨帧潜在证据,在四个基准和两个视频多模态大语言模型主干上显著提升性能且开销极低。
稀疏超图增强的帧事件目标检测与细粒度MoE
机构 * BNRist, THUIBCS, BLBCI, School of Software, Tsinghua University(清华大学软件学院,北京信息科学与技术国家研究中心,清华-英特尔先进移动计算中心,北京国家信息科学与技术实验室) ; State Key Laboratory of Heavy Oil Processing, China University of Petroleum (Beijing)(中国石油大学(北京)重质油国家重点实验室)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出Hyper-FEOD框架,通过稀疏超图增强交叉模态融合和细粒度MoE增强模块,实现高效的多模态交互优化,提升动态环境下目标检测的准确率与效率。