Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection
用于短视频假新闻检测的自反思多模态推理
专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.MM
AI总结 针对短视频假新闻检测的挑战,提出SRM-FND框架,通过自反思多模态推理及相关机制,在FakeSV和FakeTT数据集上实现优于强基线的检测性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
用于短视频假新闻检测的自反思多模态推理
专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.MM
AI总结 针对短视频假新闻检测的挑战,提出SRM-FND框架,通过自反思多模态推理及相关机制,在FakeSV和FakeTT数据集上实现优于强基线的检测性能。
全交互通用嵌入器
机构 * Sony Group Corporation(索尼集团公司) ; Sony AI(索尼人工智能)
专题命中 视频多模态 :multimodal(abstract);any-to-any(abstract);omni-modal(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出OmniUE,一种支持文本、视频、音频全交互查询的通用嵌入器,在多个基准上超越现有模型,引入OmniCHOIR基准验证其能力,推动全模态表示学习发展。
Comments Preprint
多模态风险轨迹揭示痴呆的异质性路径
专题命中 视频多模态 :multimodal(title,abstract)
AI总结 该研究开发多模态框架NetMoint,整合多组学与影像数据预测不同痴呆亚型的个体化长期风险,识别出小比例高风险群体及其特异性分子特征,为痴呆风险分层提供新方法。
AffectOmni:面向社交与艺术相关场景的可通过强化学习验证的以人为中心的接地情感推理
机构 * Lanzhou University(兰州大学) ; Hainan University(海南大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 AffectOmni是面向社交与艺术场景的可验证情感推理框架,通过GRPO训练,引入两类奖励优化以人为中心的证据选择与时间推理,经多数据集实验较7B基线实现显著性能提升。
Comments 12 pages, 5 figures
CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(帕尔马大学) ; Amazon Prime Video(亚马逊Prime视频)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。
Comments EMNLP 2026
UniVVT:用于高保真视频虚拟试穿的统一端到端框架
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。
Comments 17 pages,21 figures
基于轨迹感知可靠性的流视频情感理解
专题命中 视频多模态 :multimodal(abstract);分类 cs.MM
AI总结 针对流视频情感理解的实时需求,提出TRACE框架,通过轨迹感知可靠性机制优化多模态推理分配,在StreamMER等数据集上提升了准确率与成本的权衡效果。
Comments Accepted by EMNLP2026
基于3D视觉几何的玻璃表面检测
机构 * Jiangnan University(江南大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Wurzburg(维尔茨堡大学) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞))
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出将玻璃表面检测(GSD)基于3D视觉几何的新范式,结合VGGT、FSAM与GeGB,在7个基准上达最优性能,泛化性好且提升玻璃场景重建效果。
Comments 9 pages, 10 figures. Accepted by ACM Multimedia 2026
用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写
机构 * KAIST(韩国科学技术院) ; Korea University(高丽大学) ; Google Cloud AI Research(谷歌云人工智能研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。
Comments Work in progress
Video-FLAIR:不是是否推理,而是如何推理
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。
用于可扩展强化学习的简单演员与深度评论家
机构 * Sungkyunkwan University(成均馆大学) ; Soongsil University(崇实大学)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出LAC算法,将容量分配给深度评论家而非简单演员,解决离线RL中加深评论家的三种失效模式,在OGBench上实现与强基线相当性能且推理延迟最高降4倍。
Comments Accepted at CIKM 2026
结合谱分解的微视频推荐偏好流匹配方法
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究针对微视频推荐中主流方法的语义动态纠缠与流匹配模型忽略时间结构的问题,提出PrismRec框架,通过谱语义分解和上下文校准偏好匹配,在四个数据集上较SOTA提升最高22.65%且效率更优。
UrbanGazeVis:用于分析城市安全感知眼动数据的可视化系统
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究开发UrbanGazeVis可视化系统,通过30名参与者使用HoloLens 2分析150张里约街景的眼动数据,揭示注视与城市安全感知的关联,为城市设计提供见解。