VideoStory Embeddings Recognize Events when Examples are Scarce
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.MM
Comments 4 pages, IGS 2013 Conference; IGS 2013
机构 * New York University(纽约大学) ; Stanford University(斯坦福大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV;MLLM(comments)
Comments Website: https://cambrian-mllm.github.io/
专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV
Comments Project page at https://multimodal-vid.github.io/
专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV
Comments To appear in CVPR 2023; The code will be released at https://github.com/XudongLinthu/upgradable-multimodal-intelligence
通过高效的段级到视频级监督增强长视频理解的局部推理能力
机构 * Ant Group(蚂蚁集团)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。
SPARC:采用保形贝叶斯最后层的运动预测单通缩放方法
机构 * Clausthal University of Technology (TU Clausthal)(克劳斯塔尔工业大学(克劳斯塔尔工业大学))
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出SPARC,一种贝叶斯-保形不确定性层,在9个数据集-协议模块上的NLL及MPJPE+NLL综合指标优于基线,可作为轻量风险监控工具。
Comments Accepted at ECCV 2026
TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络
机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) ; Zayed University(扎耶德大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CL
AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。
用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面
机构 * JPMorganChase(摩根大通)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI
AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。
Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA
ID-VTG:基于图像消歧的视频时间定位
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视频时间定位中视觉相似实体的消歧难题,本文提出ID-VTG任务与VGD-Agg框架,构建两个基准数据集,实现了该任务的当前最优性能。
Comments ACM-MM 2026
社会对偶性:用于人机交互的关系过程框架
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出社会对偶性这一关系过程框架,通过嵌套单元定义人机交互过程,经实验验证其可用于分析人机交互中贡献的形成及路径信息。
Comments 50 pages, 4 figures, 12 tables. Revised version adds a Supplementary Exploratory Analysis comparing Sociodual pathways with blind developmental/task-process segmentation, with granularity and record-format checks and an unseen-case extension. Main construct specification unchanged; minor editorial and terminology refinements
SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架
机构 * Zhejiang University(浙江大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。
Comments ACMMM 2026
自监督学习至关重要:一种用于微手势识别的简单集成方案
机构 * Hefei University of Technology(合肥工业大学) ; United Arab Emirates University(阿拉伯联合酋长国大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; Anhui Evolution Technology Co., Ltd.(安徽进化科技有限公司) ; Nanyang Technological University(南洋理工大学) ; University College London(伦敦大学学院) ; The University of Sydney(悉尼大学) ; Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯科技有限公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出一种集成自监督RGB模型与监督多流模型的框架,在MiGA挑战赛微手势分类赛道取得第一名,通过自监督预训练提升性能,在iMiGUE测试集上达到74.419%的top-1准确率。
概念分配区:追踪概念如何跨越Transformer深度形成
机构 * Independent Researcher(独立研究者)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出概念分配区(CAZ)框架,通过层间度量(分离度、概念一致性、概念速度)检测概念在残差流中逐渐形成的深度区间,并在34个模型上验证了分离曲线的多模态性及温和CAZ的因果活性。
Comments v2: substantial revision. Cross-architecture ordering statistic and MHA/GQA cohort-split claim retracted per recomputation; corpus and companion-paper citations refreshed. See paper's "Changes from Version 1" section for the full list of superseded values
迈向通用的基于骨骼的动作识别
机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) ; School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于Transformer的模型,通过统一骨骼表示、动作编码器和多粒度动作-文本对齐,解决异构骨骼动作识别的挑战,实验验证了方法的有效性和泛化能力。
通过结构化奖励强化视频MLLMs的一致性
机构 * Rutgers University(罗格斯大学) ; University of Toronto(多伦多大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。
Comments Accepted by COLM 2026
解锁表达中的运动:用于指称视频目标分割的时间校准
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 针对指称视频目标分割中运动语义依赖未显式建模的问题,提出EMC框架,通过MSP、MIC、STSC模块校准运动线索,在6个基准上验证了方法的优越性。
Comments Accept by ACM MM2026
你所问即你所定位:连接问题意图与时序证据以实现定位视频问答
机构 * KAIST(韩国科学技术院) ; Ewha Womans University(梨花女子大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对定位视频问答中问题不变定位的失效模式,提出GroundFormer模型,通过可学习通信令牌、因子化MIL交叉注意力等技术,在NExT-GQA和STAR数据集上实现最优性能,提升时序定位的问题区分性。
Comments Accepted at ECCV2026. Code: https://github.com/jinhseo/GroundFormer. Project page: https://jinhseo.github.io/groundformer/groundformer.html
MM-BEV:通过计算关键的位置与时刻提升时效性
机构 * Texas Tech University(德克萨斯理工大学) ; University of Michigan(密歇根大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 MM-BEV是一种遵循「计算关键位置与时刻」的实时多模态BEV系统,通过四种机制优化,在nuScenes数据集和Clearpath Husky A300平台上显著降低延迟,且性能损失极小。
Comments 12 pages, 20 figures
用于稳健光学-SAR目标检测的边界对齐贡献路由
机构 * Tianjin University(天津大学) ; School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 该研究针对光学-SAR融合目标检测中的负跨模态迁移问题,提出边界对齐贡献路由方法,在M4-SAR和SpaceNet6-OTD实验中提升了检测性能并降低了负迁移率。
PersonaDrive:基于多维驾驶 personas 的可控轨迹预测
机构 * Kyung Hee University(庆熙大学) ; ETRI(韩国电子通信研究院)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对现有轨迹预测方法可控性不足的问题,提出 PCT 数据集与 PersonaDrive 框架,通过多轴设计实现可控轨迹生成,性能优于基线。
Comments Accepted to ECCV 2026
为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。
MEDR:基于多信号事件建模与动态重评分的查询无关帧选择
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。
Comments 9 pages, 2 figures, 3 tables
从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Celia Research HK ; City University of Hong Kong(香港城市大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。
HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。
Comments 18 pages, 8 figures
基于点监督的骨架人类动作分割
机构 * Southeast University(东南大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种点监督框架,通过多模态骨架数据和新型原型相似性方法,实现了高效的基于骨架的人类动作分割,减少了注释工作量并提升了性能。
RbFT-Net:用于4D雷达-相机深度补全的融合前校正时间雷达锚点
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出RbFT-Net框架,通过图像条件校正模块校正雷达锚点并选择性传播,解决雷达测量的稀疏与干扰问题,在相关数据集上的深度补全性能优于对比方法。
具身融合智能体:以人为中心的智能体人工智能新范式
机构 * Université de Montréal(蒙特利尔大学) ; Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) ; Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) ; Nanjing Medical University(南京医科大学) ; Nanjing University(南京大学) ; Renmin University of China(中国人民大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Southern University of Science and Technology(南方科技大学) ; Southeast University(东南大学) ; University of Glasgow(格拉斯哥大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。
Comments 38 pages, 6 figures, 10 tables
迈向能量前沿异质中微子探测器的风格化模型:通过自监督预训练
机构 * IPA, ETH Zürich(瑞士苏黎世联邦理工学院IPA研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出一种稀疏ViT框架,通过自监督预训练学习异质探测器数据的可重用表示,提升中微子风味和charm夸克识别、动量回归和顶点重建性能。
Comments 18 pages, 6 figures
SAR2Agri:学习SAR强度表征用于农业监测
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出首个仅用SAR强度影像的自监督学习流水线,通过改进时间预文本任务提升物候特征捕捉能力,在SICKLE基准上的作物类型制图任务中,其IoU较光学基线和现有SAR基线均有显著提升,验证了SAR强度编码器预训练的有效性。