SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception
SapiensID 2.0:将人类识别基础模型与人类感知对齐
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对现有人类识别模型与人类感知脱节的问题,提出兼具语义与时间感知的SapiensID 2.0框架,通过多项技术实现最优识别性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
SapiensID 2.0:将人类识别基础模型与人类感知对齐
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对现有人类识别模型与人类感知脱节的问题,提出兼具语义与时间感知的SapiensID 2.0框架,通过多项技术实现最优识别性能。
网格是否抹去了事件?用于审计医疗世界模型流程的EndoClock
机构 * Diastole Medical R&D(Diastole医疗研发机构)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本研究针对医疗世界模型同步预处理可能抹去任务相关证据的问题,提出EndoClock审计方法及四分类法,以超声心动图为例验证其有效性,为医疗AI流程审计提供可执行方案。
Comments Accepted for publication at the 1st MICCAI Workshop on Medical World Models (MWM 2026)
GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。
Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany
FemWear:面向女性健康的专用可穿戴设备基础模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出面向女性健康的专用可穿戴基础模型FemWear,通过参数高效方式改造预训练主干,在女性健康相关指标上取得性能提升,但未确立普遍优势与临床有效性。
Comments 11 pages, 4 figures
学习物理交互:触觉与力感知机器人学习综述
机构 * Nanyang Technological University(南洋理工大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Tokyo(东京大学) ; ETH Zurich(苏黎世联邦理工学院) ; Harvard University(哈佛大学) ; Imperial College London(伦敦帝国学院) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; Technical University of Darmstadt(达姆施塔特工业大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本综述针对力与触觉感知机器人学习研究的空白,提出TF-ART分类法,整合多模态感知与多阶段系统设计视角,兼具算法与实践意义。
Comments 53 pages, 7 figures
单一排序,任意预算:用于长视频理解的套娃式证据到上下文帧选择框架
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出MEC帧选择框架,将长视频帧选择建模为套娃式排序问题,构建单一可复用排序适配任意预算,提升了长视频理解的准确率并降低了选择延迟。
Comments 21 pages, 7 figures, 7 tables
ChronoVision:基于潜在状态重构的时序推理
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。
超越帧选择:用多模态大语言模型重新思考长视频理解
机构 * National Institute of Informatics(信息学研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。
EffectLearner:面向真实世界视频物体移除的世界感知物体-效应推理
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 该研究提出EffectLearner框架,结合VLM物体-效应推理器与DiT视频擦除器,构建专属数据集EffectWorld并采用渐进式训练,在视频物体移除任务上实现更优性能。
Comments Project: https://morleyolsen.github.io/EffectLearner/
帧间解读:社交媒体视频中隐含与非字面意义的理解
机构 * University of Manchester(曼彻斯特大学) ; Durham University(杜伦大学) ; University of Sheffield(谢菲尔德大学) ; University of Exeter(埃克塞特大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
AI总结 本文提出DrivelHub+基准,评估视频-语言模型推断社交媒体视频隐含意义的能力,从解释和表征两方面开展实验,衡量模型多模态感知与语用理解的差距。
MetaVideoAgent:面向长视频理解的自动视频智能体进化框架
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; ByteDance(字节跳动)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。
Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent
Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。
生成体验用于数字心理健康干预:来自随机研究的证据
机构 * Stanford University(斯坦福大学) ; University of Toronto Mississauga(多伦多大学滑铁卢分校)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出生成体验范式,通过动态构建干预体验提升数字心理健康干预效果,实验显示GUIDE在减压和用户体验方面显著优于基线对照。
用于EEG-fNIRS想象手写解码的频率去相关时间集成
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本研究针对EEG-fNIRS想象手写解码难题,提出FRED系统,采用频率去相关时间集成等方法,在多模态脑机接口挑战赛中取得较好成绩,揭示了关键性能来源。
医疗保健中的医学世界模型:可信临床翻译的基础、应用与挑战
机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) ; Department of Radiology, Xinhua Hospital Affiliated to Dalian University(大连大学附属新华医院放射科) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of California, San Francisco(加州大学旧金山分校) ; Yale University(耶鲁大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 探讨医学世界模型在医疗保健中的应用,通过结构化综合定义其领域相关内容,围绕四种能力组织,涵盖多方面证据,虽有早期可行性证据,但受多种因素限制,临床翻译需多方面保障。
SVL:基于脉冲的视觉-语言预训练用于高效的3D开放世界理解
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) ; Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 SVL提出基于脉冲的视觉-语言预训练框架,通过多尺度三元组对齐和可重参数化的视觉-语言整合,提升SNN在3D开放世界理解中的性能,实现高效零样本3D分类和多模态问答。
Comments ICML 2026 Spotlight
PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。
超越对称融合:利用任务相关的模态优势进行RGB-事件小目标检测
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对现有RGB-事件检测器的对称融合设计缺陷,提出AERODet模型,通过SURE和TDSR实现任务相关的模态利用,在FRED和NeRDD数据集上取得最优性能,FRED挑战性拆分提升10.7 mAP点。
Comments 3 figures, 7 tables
儿童步态行为解码
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; PediaMed AI ; Shenzhen Children’s Hospital(深圳市儿童医院) ; Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。
Journal ref ECCV 2026
mmSimPrior:学习用于数据高效的真实世界可泛化雷达人体运动重建的模拟先验
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究针对毫米波雷达人体运动重建中数据收集成本高及模拟训练模型迁移差的问题,提出mmSimPrior框架,将知识分解为先验,经多模态编码器等训练,构建数据集并设无重叠设置,实验证明其在降低MPJPE上有显著效果。
Comments 19 pages, 11 figures, including supplementary material. Project page: https://ch3ngguo.github.io/mmsimprior/
用于人工智能篡改视频检测的集成深度学习方法
机构 * Department of Mathematical and Computational Sciences, University of Toronto Mississauga(多伦多大学密西沙加分校数学与计算科学系) ; Department of Mathematical and Computational Sciences, University of Toronto(多伦多大学数学与计算科学系) ; University of Toronto(多伦多大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究针对人工智能篡改视频检测难题,开发多模态深度伪造检测系统,结合音频视觉分析,用模型集成及均值平均、堆叠等策略组合分数,提升检测鲁棒性与性能,凸显对未见篡改泛化的挑战,平均准确率约70%。
NarrativeTrack: 评估实体中心推理在叙事理解中的表现
机构 * Apple(苹果公司) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。
Comments Project Page: https://github.com/apple/ml-NarrativeTrack
EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。
LADY:用于自动驾驶效率的线性注意力,无需Transformer
机构 * Udeer AI ; Zhejiang University(浙江大学) ; Yuanshi Intelligence(元世智能)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI
AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。
Comments Accepted by IEEE RAL
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
Comments This paper has been ACCEPTED as a FULL PAPER at DASFAA 2025
Journal ref Database Systems for Advanced Applications (DASFAA 2025), Lecture Notes in Computer Science, vol. 15987, pp. 571-586, 2026
FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。
面向情感的提示方法用于共情LLM辅导
机构 * Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) ; Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) ; Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) ; Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) ; Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系) ; Face the FACS ; Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文研究了在LLM辅导中整合面部表情信号以提升共情响应的效果,通过四种不同方法对比发现,基于动作单元的条件化能提升对面部表情的共情响应,而引导峰值帧选择优于随机帧输入。
LENS:用于长视频关键帧采样的自适应时空缩放
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 研究针对长视频理解受限于上下文窗口的问题,提出无需训练的关键帧采样框架LENS,它能基于文本查询动态分配帧预算,在时空缩放间平衡,提升关键帧采样效果,优于现有方法,提高了Video-MME准确率。
Comments Accepted at ECCV 2026. Project page: https://zhangce01.github.io/LENS/
扩展现实作为人机协作中情境化人类控制的中介层
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究探讨扩展现实在人机协作中作为情境化人类控制中介层的作用,通过床边护理等场景阐述观点,确定四种中介功能和六个设计维度,为使机器人自主性在动态环境中更具操作性和问责性的XR系统规划研究议程。
Comments Accepted to 2026 IEEE International Symposium on Mixed and Augmented Reality Adjunct (ISMAR-Adjunct)
用于模态缺失的RGBT跟踪的时空条件去噪Transformer
机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对RGBT跟踪中模态缺失致性能下降问题,提出时空条件去噪Transformer(SCDT)。它整合时空线索,通过利用不同时间线索及噪声调制适应机制,在统一框架下实现缺失模态信息重建等,实验证明其性能优于现有方法。
Comments Accepted by CVPR2026