arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 238 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 22 篇

2608.30270 2026-09-01 cs.CL 新提交 79%

Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual Contexts

读懂房间,读懂图像:理解多模态视觉语境中的间接言语行为

Jaehee Kim, Ji Hoon Chung, Seoyoon Park, Unsol Kim, Kyungwon Park, Ji Hak Kim, Yi-Jun Chen, Hansaem Kim

机构 * Yonsei University(延世大学) LG AI Research(LG人工智能研究院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究推出多模态基准READI,以视觉语用问答任务评估间接言语行为理解,发现先进多模态模型在视觉接地间接言语行为上表现差,性能随间接性提升而下降,凸显相关基准的必要性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30204 2026-09-01 cs.CL 新提交 79%

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

当模型“听到”它们所期待的:诊断多模态讽刺检测中的韵律启发式算法

Yongjian Chen, Pengfei Wei, Yiqun Sun, Zhu Li, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(麦哲伦技术研究所(MTRI)) Center for Language and Cognition, University of Groningen(格罗宁根大学语言与认知中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文以讽刺检测为切入点,评估Qwen2.5-Omni等多模态大语言模型,发现模型依赖音高升高、停顿不规则的韵律刻板印象,操控该维度可使假阳性率达60%,且该效应可跨模型复现。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29121 2026-09-01 cs.CV 新提交 79%

Acoustically Grounded Cost Learning for Open-Vocabulary Audio-Visual Semantic Segmentation

基于声学接地代价学习的开放词汇视听语义分割

Tianrui Hui, Shaofei Huang, Qisong Han, Yaxiong Wang, Lechao Cheng, Zhedong Zheng, Zhun Zhong, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Cardiff University(卡迪夫大学) University of Macau(澳门大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 针对开放词汇视听语义分割的现有方法缺陷,提出AGCL框架及AMCG、AGTA、SDM模块,在AVSBench-OV数据集上显著优于现有SOTA方法,尤其在未见类别上表现突出。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28609 2026-09-01 cs.CL cs.AI cs.CV 新提交 78%

Parametric Multimodal User Memory: Storing What Captions Cannot Carry

参数化多模态用户记忆:存储字幕无法承载的内容

Bojie Li, Noah Shi

机构 * Pine AI(派恩人工智能) University of Washington(华盛顿大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出参数化多模态用户记忆,结合视觉语言模型与专用编码器,解决传统文本用户记忆丢失感知信息的问题,在PerceptMem数据集上验证了其有效性与可推广性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30013 2026-09-01 cs.HC 新提交 71%

Multimodal Takeover Requests for Drivers with Hearing Loss: Implications for AI-Enabled Communication in Automated Vehicles

针对听力障碍驾驶员的多模态接管请求:自动驾驶汽车中AI驱动通信的启示

Aries Chu, Wei-Hsiang Lo, Gaojian Huang

专题命中 音频语音多模态 :multimodal(title)

AI总结 该研究针对听力障碍驾驶员,通过驾驶模拟器实验发现视觉-触觉接管显示可缩短反应与接管时间,AI驱动汽车可据此调整接管消息内容以适配不同需求。

Comments 10 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31014 2026-09-01 cs.CL 新提交 70%

Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols

基于异构语音协议的证据受限心理健康推理

Chengyuan Gao, Jiang Wu, Tao Lu, Jiayan Guo, Mingkun Xu, Tianyi Zang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) GDIIST(广东省智能制造研究所) Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.CL

AI总结 本研究针对现有心理健康筛查模型的证据边界问题,提出协议感知的证据控制框架EviBound,在抑郁症筛查任务中达到0.8658的AUROC,且实现零宣称违规。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30156 2026-09-01 cs.CL 新提交 70%

Reactivating Test-Time Scaling for Plane Geometry Problem Solving

重新激活平面几何问题求解的测试时缩放能力

Xiaoqiang Kang, Shengen Wu, Maizhen Ning, Xiaobo Jin, Kaizhu Huang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) University of Liverpool(利物浦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hithink Research(海天瑞声研究院) Digital Innovation Research Center, Duke Kunshan University(昆山杜克大学数字创新研究中心)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 该研究针对平面几何问题求解中测试时缩放失效的问题,提出多轨迹合成、感知增强训练及共识引导多轨迹集成方法,提升了不同模型规模下的几何问题求解性能,且采样成本最高降低8倍。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30713 2026-09-01 cs.SD 新提交 67%

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

闭合验证循环:用于长段落详细音频字幕的自检查字幕生成

Fengji Ma, Yan Rong, Xu Li, Chen Zhang, Pengfei Wan, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 本研究针对长段落详细音频字幕的未解决问题,提出SCC框架,构建LACap-50k语料库与LC-SFT方法,使系统在开源字幕生成器中达最优性能。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30260 2026-09-01 cs.CL cs.AI cs.LG 新提交 62%

Using Prosody to Predict Syntactic Structure

用韵律预测句法结构

Junghyun Min, Alex Warstadt, Tamar I. Regev, Tiago Pimentel, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究从信息论视角提出通用框架,利用多模态语言模型量化韵律与句法的互信息,发现韵律可降低自然对话中10.2%的句法不确定性,为相关理论提供实证支持。

Comments 15 pages, 4 figures. EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28875 2026-09-01 cs.CL cs.AI cs.SD 新提交 62%

No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus

提示词层面上下文未检测到侧边级词错误率(WER)变化:对生产级口述历史语料库的预注册消融实验

Theodore O. Cochran, Stephanie Dodson, Keith Nore

机构 * AI for Altruism(利他智能)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该预注册实验在生产级口述历史转录工具上发现,提示词层面上下文未改变侧边级WER,仅短语有小幅改善,需结合序列对齐指标评估上下文机制。

Comments 31 pages, 1 figure. Preregistered on OSF (https://osf.io/ns49b, DOI 10.17605/OSF.IO/NS49B); release materials and dated provider-documentation snapshots in the study component (https://osf.io/9nsvr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-09-01 eess.AS cs.AI cs.SD 版本更新 62%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Accepted to Findings of EMNLP 2026, page 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28966 2026-09-01 eess.AS 新提交 57%

When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models

当语调与字面意义不一致时:面向大型音频语言模型的声学-语义不一致研究

Yu-Wen Chen, William Ho, Maxim Topaz, Zoran Kostic, Julia Hirschberg

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本研究针对LALMs在语调与字面意义不一致场景下的表现问题,构建CREMA-ASIS数据集,经实验发现其受语义主导且难识别不一致,监督式微调可显著提升其性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30622 2026-09-01 cs.SD eess.AS 新提交 57%

Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection

面向通用型大语言模型的深度伪造语音检测的文本声学接地

Yassine El Kheir, Xin Wang, Wanqing Ge, Tim Polzehl, Sebastian Moeller, Junichi Yamagishi

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) National Institute of Informatics(情报信息学研究所) Technical University of Berlin(柏林工业大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 该研究针对深度伪造语音检测的域泛化问题,提出跨模态提示策略,将openSMILE提取的声学特征作为文本标记注入冻结Qwen LLM,在ITW、MLAAD基准上获16.2%宏观F1绝对提升,性能最优。

Comments 6pages + 1ref, SLT Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30068 2026-09-01 cs.CV 新提交 57%

TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

TAKE 85:基于85小时电影时长的电影创作者意图测试基准

Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant, Xi Wang, Dimitris Samaras, Vicky Kalogeiton

机构 * LIX, Ecole Polytechnique, IP Paris(巴黎综合理工学院LIX实验室、巴黎IP大学) New York University(纽约大学) Ecole nationale supérieure Louis-Lumière(路易卢米耶高等国家学院) Stony Brook University(石溪大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文推出首个导演意图理解基准TAKE 85,通过实验发现当前顶尖MLLMs在感知识别与意图理解间存在显著差距,最强模型仅得58分,单一模态无法支撑意图理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-09-01 eess.AS 版本更新 57%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments INTERSPEECH 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00571 2026-09-01 cs.SD eess.AS 版本更新 57%

From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview

从音频深度伪造检测到AI生成音乐检测——路径与综述

Yupei Li, Manuel Milling, Lucia Specia, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文系统综述AI生成音乐(AIGM)检测方法,建立四级分类体系,结合音频深度伪造检测开展分层可迁移性分析,从多维度分类代表性方法并提出未来研究方向。

Comments Accepted at Computational Intelligence Magazine (CIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11764 2026-09-01 cs.MM 版本更新 57%

Identity-Driven Multimedia Forgery Detection via Reference Assistance

基于身份驱动的参考辅助多媒体伪造检测

Junhao Xu, Jingjing Chen, Xue Song, Feng Han, Haijun Shan, Yugang Jiang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 针对现有媒体伪造数据集的局限,提出含54位名人视频的IDForge数据集,设计参考辅助多模态伪造检测网络R-MFDN,实验验证其在多媒体伪造检测任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 22 篇

2509.06422 2026-09-01 cs.CV 版本更新 83%

Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM

Phantom-Insight:基于多模态大语言模型的视频伪装目标自适应多线索融合检测方法

Hua Zhang, Changjiang Luo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视频多模态 :multimodal(title);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对视频伪装目标检测的两大问题,提出Phantom-Insight方法,通过多线索融合与解耦学习优化SAM,在MoCA-Mask数据集上达最优性能,且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29711 2026-09-01 cs.CL 新提交 81%

DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

DVBench:用于评估多模态大语言模型(MLLMs)理解数据视频中动态图表与叙事的基准

Bomiao Wang, Zekai Shao, Jiexiang Lan, Xiaoliang Fu, Xingchen Zeng, Siming Chen

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究推出DVBench基准,评估MLLMs在结合动态图表与叙事的数据视频理解上的表现,发现开源模型性能不严格随参数规模扩展等现象,为MLLM发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30457 2026-09-01 cs.LG cs.CL 新提交 79%

Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

学习结果变化的位置:面向多模态几何的信用可寻址推理

Jiani Guo, Junjie Wang, Jie Wu, Pengxiang Zhao, Dongdong Zhang, Shaohan Huang, Yujiu Yang, Furu Wei

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对多模态几何推理中现有方法的缺陷,提出信用可寻址推理,通过Code-CoT和CE-GRPO实现,在9个几何基准上平均准确率达76.04,优于对比模型,凸显协同设计的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28844 2026-09-01 cs.HC cs.AI cs.LG 新提交 79%

Toward Postural State Classification in Immersive VR with Multimodal Data and Explainability Analysis

基于多模态数据与可解释性分析的沉浸式VR姿态状态分类研究

Nipa Anjum, Md Irfan Pavel, Robert Gonzalez, Kevin Desai, Alberto Cordova, M. Rasel Mahmud, John Quarles

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出用MI-CNN模型结合多模态数据与SHAP可解释性分析,实现VR中平衡与不平衡姿态的二分类,准确率达96.76%,降维后仍保持良好性能,为安全VR系统提供支撑。

Comments Accepted in The 25th IEEE International Symposium on Mixed and Augmented Reality (ISMAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 79%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15599 2026-09-01 cs.CV cs.LG 79%

Multi-Modal Fusion of In-Situ Video Data and Process Parameters for Online Forecasting of Cookie Drying Readiness

Shichen Li, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30804 2026-09-01 cs.LG 新提交 78%

Geometric Attractor Monitoring: A Robust and Frugal Framework for Multi-modal Industrial Robotic Cycles

几何吸引子监测:一种针对多模态工业机器人周期的鲁棒且经济的框架

Martin Bonsergent-Brachet, Jesse Read, Dany Abboud

机构 * LIX, École Polytechnique, Institut Polytechnique de Paris(巴黎综合理工学院LIX实验室,巴黎理工学院) Renault(雷诺公司)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 针对多模态工业机器人周期及故障数据稀缺的挑战,提出基于相空间重构的几何吸引子监测框架,用离散支持估计构建健康指标,在真实与合成数据集上性能优于深度学习基线。

Comments 17 pages, 6 figures. Accepted at ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09625 2026-09-01 cs.HC 版本更新 78%

AwareLLM: A Proactive Multimodal Ecosystem for Personalized Human-AI Collaboration to Enhance Productivity

AwareLLM: 一种主动多模态生态系统,用于个性化人机协作以提升生产力

Amog Rao, Utkarsh Agarwal, Amol Harsh, Siddharth Siddharth

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 AwareLLM通过整合多模态数据与大语言模型,实现主动适应用户心理生理状态,提升任务表现并降低认知疲劳,推动人机协作新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01600 2026-09-01 cs.CV cs.CL cs.RO 版本更新 73%

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

RoboTrustBench:机器人操作视频世界模型的可信度基准测试

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学) Princeton University(普林斯顿大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。

Comments EMNLP 2026 Findings, Project: https://huiqiongli.github.io/RoboTrustBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00514 2026-09-01 cs.RO 版本更新 71%

Cross-Modal Visuo-Tactile Representation Learning with Action Chunking Transformers for Contact-Rich Manipulation

一种低成本的基于视觉的触觉夹具,用于接触丰富的操作

Yaohua Liu, Rong Fu, Amir H. Gandomi, Simon Fong, Hengjun Zhang

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Innovation and Research and Development Department, BoardWare Information System Company Ltd.(创新与研发部,BoardWare信息系统有限公司) School of Artificial Intelligence, Nanjing Agricultural University(人工智能学院,南京农业大学) School of Computing, National University of Singapore(计算机学院,新加坡国立大学) School of Electronic Engineering and Automation, Guilin University of Electronic Technology(电子工程与自动化学院,桂林电子科技大学)

专题命中 视频多模态 :cross-modal(title)

AI总结 本研究提出了一种低成本的视觉-触觉夹具,通过融合视觉和触觉反馈,提升接触丰富环境中的操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28699 2026-09-01 cs.CV 新提交 70%

Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG

超越视觉边界:为电影检索增强生成(RAG)重新思考场景分割

Dong-Hee Kim, Seonwoo Choi, Changbeen Kim, Jungmyung Wi, Juyeon Ko, Youngju Choi, Il Hyeon Mun, Hyunwoo J. Kim, Donghyun Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本文针对电影RAG场景,发现现有场景分割方法不如均匀时间分块,提出以叙事为核心的NarraScene数据集,其生成的片段作为检索单元可提升下游电影理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30716 2026-09-01 cs.CL cs.CV 新提交 62%

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17790 2026-09-01 cs.CV cs.AI 版本更新 62%

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

ReViV:从单目自我中心视频中重建4D中的观看者和视图

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学) Microsoft(微软)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。

Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable

详情

展开后加载摘要…

URL PDF HTML 收藏