arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 13 篇

2608.26787 2026-08-28 cs.MM 新提交 79%

Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection

用于短视频假新闻检测的自反思多模态推理

Pinjie Xu, Yuzhou Yang, Zhikai Tan, Qichao Ying, Zaiyang Yu, Ce Li, Zhenxing Qian

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.MM

AI总结 针对短视频假新闻检测的挑战,提出SRM-FND框架,通过自反思多模态推理及相关机制,在FakeSV和FakeTT数据集上实现优于强基线的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27044 2026-08-28 cs.AI cs.CV 新提交 79%

Omni-Interactive Universal Embedder

全交互通用嵌入器

Wei-Yao Wang, Kazuya Tateishi, Shuyang Cui, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 视频多模态 :multimodal(abstract);any-to-any(abstract);omni-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出OmniUE,一种支持文本、视频、音频全交互查询的通用嵌入器,在多个基准上超越现有模型,引入OmniCHOIR基准验证其能力,推动全模态表示学习发展。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26210 2026-08-28 q-bio.QM 新提交 78%

Multimodal risk trajectories reveal heterogeneous paths to dementia

多模态风险轨迹揭示痴呆的异质性路径

Zhiqi Lee, Haowen Li, Tao Liu, Shiyuan Zhang, Bingjie Wang, Jinzhao Fan, Yunkai Zhang, Zhuonan Wang, Lijun Bai

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 该研究开发多模态框架NetMoint,整合多组学与影像数据预测不同痴呆亚型的个体化长期风险,识别出小比例高风险群体及其特异性分子特征,为痴呆风险分层提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26193 2026-08-28 cs.AI 新提交 70%

AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes

AffectOmni:面向社交与艺术相关场景的可通过强化学习验证的以人为中心的接地情感推理

Yibo Wang, Rui Yang, Jisheng Dang, Bimei Wang, Yitao Wu, Pengfei Cao, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) Hainan University(海南大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 AffectOmni是面向社交与艺术场景的可验证情感推理框架,通过GRPO训练,引入两类奖励优化以人为中心的证据选择与时间推理,经多数据集实验较7B基线实现显著性能提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 70%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-28 cs.CV cs.AI 版本更新 62%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26786 2026-08-28 cs.MM 新提交 57%

Emotion Understanding in Streaming Video with Trajectory-Aware Reliability

基于轨迹感知可靠性的流视频情感理解

Qingsong Wang, Qigong Lei, Zitong Wang, Bohan Yu, Zhiang Dong, Jian liu, Weiqiang Wang, Chang Yao, Jingyuan Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 针对流视频情感理解的实时需求,提出TRACE框架,通过轨迹感知可靠性机制优化多模态推理分配,在StreamMER等数据集上提升了准确率与成本的权衡效果。

Comments Accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26752 2026-08-28 cs.CV 新提交 57%

Glass Surface Detection Grounded in 3D Visual Geometry

基于3D视觉几何的玻璃表面检测

Yiwei Lu, Ke Xu, Tao Yan, Xiaojun Chang, Radu Timofte, Rynson W. H. Lau

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) University of Wurzburg(维尔茨堡大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出将玻璃表面检测(GSD)基于3D视觉几何的新范式,结合VGGT、FSAM与GeGB,在7个基准上达最优性能,泛化性好且提升玻璃场景重建效果。

Comments 9 pages, 10 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26684 2026-08-28 cs.CV 新提交 57%

Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs

用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写

Ji Soo Lee, Jinyoung Park, Seohyun Lee, Jongha Kim, Joonmyung Choi, Jinsung Yoon, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学) Google Cloud AI Research(谷歌云人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26495 2026-08-28 cs.CV 新提交 57%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26659 2026-08-28 cs.LG 新提交 50%

Simple Actors and Deep Critics for Scalable Reinforcement Learning

用于可扩展强化学习的简单演员与深度评论家

Guhyeon Kang, Jaehwi Lee, Minhae Kwon

机构 * Sungkyunkwan University(成均馆大学) Soongsil University(崇实大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出LAC算法,将容量分配给深度评论家而非简单演员,解决离线RL中加深评论家的三种失效模式,在OGBench上实现与强基线相当性能且推理延迟最高降4倍。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26579 2026-08-28 cs.IR 新提交 50%

Preference Flow Matching with Spectral Factorization for Micro-video Recommendation

结合谱分解的微视频推荐偏好流匹配方法

Xinxin Dong, Haokai Ma, Fei Hu, YuZe Zheng, Bin Wu, Yonghui Yang, Xiaodong Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究针对微视频推荐中主流方法的语义动态纠缠与流匹配模型忽略时间结构的问题,提出PrismRec框架,通过谱语义分解和上下文校准偏好匹配,在四个数据集上较SOTA提升最高22.65%且效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21686 2026-08-28 cs.HC 版本更新 50%

UrbanGazeVis: A Visualization System for Analyzing Eye-Tracking Data on Urban Safety Perception

UrbanGazeVis:用于分析城市安全感知眼动数据的可视化系统

Andres De La Puente, Luis Sante, Felipe Moreno-Vera, Mauro Diaz, Jorge Poco

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究开发UrbanGazeVis可视化系统,通过30名参与者使用HoloLens 2分析150张里约街景的眼动数据,揭示注视与城市安全感知的关联,为城市设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏