arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-25 至 2026-08-25 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 21 篇

2608.23373 2026-08-25 cs.AI stat.AP 新提交 85%

Modalities Should Talk to Each Other: Dual-Stream Multimodal Learning for Long-Horizon Influenza Forecasting

模态应相互协作:用于长期流感预测的双流多模态学习

Seyed Mohammad Hossein Hashemi, Mohsen Hooshmand, Parvin Razzaghi

机构 * Institute for Advanced Studies in Basic Sciences (IASBS)(基础科学高级研究所)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对长期流感预测问题,提出双流注意力(DSA)多模态框架,通过双向跨模态注意力耦合数值与文本流,在多个数据集上实现优于iTransformer等基线的预测性能,且方法具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22617 2026-08-25 cs.CV cs.AI cs.HC 新提交 81%

AI-based worker guidance in assembly and disassembly operations using multimodal ego/exo-centric data capture and structured task knowledge

基于多模态自我/外部中心数据采集与结构化任务知识的装配与拆卸作业中基于人工智能的工人指导

Vivek Chavan, Jörg Krüger

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出一种从专家演示中提取结构化任务知识的以数据为中心的方法,结合多模态数据推导任务表示,实现装配拆卸作业的工人指导,经案例验证其优于静态图像方法,可用于维修、培训等场景。

Comments 5 pages. Published in CIRP Annals - Manufacturing Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23503 2026-08-25 cs.CV 新提交 79%

Action-Aligned Retrieval with Pairwise Multimodal Reranking for Text-Based Person Anomaly Search

用于基于文本的人员异常搜索的动作对齐检索与成对多模态重排序

Thanh-Khoi Nguyen, Thanh-Nhan Vo, Trong-Thuan Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市国家大学科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对基于文本的人员异常搜索中现有方法的局限,提出ActPair三阶段由粗到细框架,结合动作对齐检索与成对多模态重排序,在PAB测试集取得最优结果且可有效迁移至新数据集。

Comments Accepted to the AI City workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22965 2026-08-25 cs.CV 新提交 79%

Simplified Cross-Modal Calibration for Heterogeneous Event-RGB Stereo Systems

面向异构事件-RGB立体系统的简化跨模态标定

Nico Hessenthaler, Adam T. Müller, Nicolaj C. Stache

机构 * Center for Machine Learning Heilbronn University of Applied Sciences(海尔布隆应用科学大学机器学习中心)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对异构事件-RGB立体系统的标定瓶颈,提出无运动跨模态标定框架,简化流程且降低重投影误差,在机器人眼到手标定中具实用性。

Comments Accepted to the 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22869 2026-08-25 cs.RO cs.CV 新提交 79%

UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models

UniMem:统一视觉-语言-动作模型的多模态记忆与控制

Lars Osterberg, Maggie Wang, Mac Schwager

机构 * Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 UniMem 是统一多模态记忆与控制的视觉-语言-动作模型框架,通过事件分类器、关键帧编码器等技术,在模拟和硬件任务中性能优于基线,推理更快、训练流程更简单。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22832 2026-08-25 cs.AI 新提交 79%

Let the Bullets Fly: Multimodal Fake News Detection with Temporal-Aligned Generative Danmaku

让子弹飞:基于时间对齐生成式弹幕的多模态假新闻检测

Xiansheng Luo, Chaowei Zhang, Zewei Zhang, Yi Zhu, Jipeng Qiang

机构 * Yangzhou University(扬州大学) Auburn University(奥本大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Genda生成式弹幕框架与DM-FEND检测模型,解决弹幕延迟导致的假新闻检测实时性问题,在FakeSV、FakeTT基准上性能优于现有最优方法,为多模态假新闻检测提供鲁棒方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-08-25 cs.CV 版本更新 79%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频多模态 :MLLM(title,abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23192 2026-08-25 eess.IV 新提交 78%

An Energy-Proportional Multimodal and Context-Aware Vision IoT Node

能量比例型多模态上下文感知视觉物联网节点

Julian Moosmann, Philipp Mayer, Luca Benini, Michele Magno

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 该研究提出一种异构多模态双摄像头架构的视觉物联网节点,采用 TinyissimoYOLOv12 模型,实现节能的始终开启视觉监测,在低功耗下完成目标检测与遥测,可支持三个月运行寿命。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23254 2026-08-25 cs.LG 新提交 78%

From Multimodal Observation to Interpretable Suggestions: Counterfactual Time-Expanded Relational Modeling of Surgical Teams

从多模态观察到可解释建议:手术团队的反事实时间扩展关系建模

Vincenzo Marco De Luca, Antonio Longa, Giovanna Varni, Andrea Passerini

机构 * University of Trento(特伦托大学) UiT the Arctic University of Norway(挪威北极大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 针对现有外科AI忽略团队互动建模的问题,提出tempo-relational框架结合Time-Expanded图,通过反事实程序生成可解释建议,在模拟手术实验中提升了多目标预测性能。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-08-25 cs.CL 版本更新 70%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23478 2026-08-25 cs.RO cs.AI cs.CV 新提交 62%

Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

依意图行动:为视觉-语言-动作模型提炼行为意图

Sangoh Lee, Sangwoo Mo, Wook-Shin Han

机构 * POSTECH(浦项科技大学) GSAI, POSTECH(浦项科技大学人工智能学院) IME, POSTECH(浦项科技大学工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对视觉-语言-动作(VLA)模型动作解码器未明确行为语义目标的问题,提出INDI方法提炼行为级意图,在多个基准及真实任务中显著提升了GR00T-N1.7的性能。

Comments Project page: this https URL (https://leesangoh.github.io/indi-project-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-25 cs.CV cs.AI 新提交 62%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13976 2026-08-25 cs.CL cs.AI cs.CY cs.SI 版本更新 62%

Towards Safer Social Media Platforms: Scalable and Performant Few-Shot Harmful Content Moderation Using Large Language Models

打造更安全的社交媒体平台:基于大语言模型的可扩展且高效的少样本有害内容审核

Akash Bonagiri, Lucen Li, Rajvardhan Oak, Zeerak Babar, Magdalena Wojcieszak, Anshuman Chhabra

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对社交媒体有害内容审核的可扩展性与动态性不足问题,研究人员利用大语言模型通过上下文学习提出少样本审核方法,实验显示其优于现有基线与少样本方法,纳入视觉信息可提升性能,为线上审核提供新方案。

Comments Accepted to ICWSM 2027 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22972 2026-08-25 cs.CV 新提交 57%

Optimize Surgical Triplet Recognition: A Knowledge-Driven Mixture-of-Experts Solution

优化手术三元组识别:一种知识驱动的混合专家解决方案

Yiyi Zhang, Yuchen Yuan, Ying Zheng, Jialun Pei, Jinpeng Li, Zheng Li, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对手术三元组识别的三大冲突问题,提出MoeCo框架,通过组件定制适配器、协同梯度学习及知识驱动混合专家机制,在CholecT45和CholecT50数据集上验证了方法的有效性与优越性。

Comments Accepted in TMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-25 cs.CV 版本更新 57%

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Haoxuan Che, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-08-25 cs.CV 版本更新 57%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15812 2026-08-25 cs.CV 版本更新 57%

ModTrack: Sensor-Agnostic Multi-View Tracking via Identity-Informed PHD Filtering with Covariance Propagation

ModTrack:通过身份感知的PHD滤波与协方差传播实现传感器无关的多视角跟踪

Aditya Iyer, Jack Roberts, Nora Ayanian

机构 * Brown University(布朗大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 ModTrack通过身份感知的PHD滤波与协方差传播实现多视角多目标跟踪,提供跨模态、传感器无关的泛化能力及可追溯的不确定性。系统将学习限制在检测和特征提取阶段,利用闭式分析方法进行融合、关联和跟踪,实现95.5 IDF1和91.4 MOTA的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23356 2026-08-25 cs.IR cs.LG stat.ML 新提交 50%

Hierarchical Exponential-Gaussian Mixtures for Watch-Time Distribution Prediction

用于观看时长分布预测的分层指数-高斯混合模型

Sofia Gulevskaia, Mikhail Trapeznikov, Aleksandr Poslavsky, Alexander D'yakonov

专题命中 视频多模态 :multimodal(abstract)

AI总结 针对短视频观看时长分布预测的EGMN模型存在的缺陷,提出HEGM模型并经实验验证可提升推荐相关性能,且生产测试获显著效果。

Comments 16 pages, 8 figures, 7 tables, accepted at IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21686 2026-08-25 cs.HC 新提交 50%

UrbanGazeVis: A Visualization System for Analyzing Eye-Tracking Data on Urban Safety Perception

UrbanGazeVis:用于分析城市安全感知眼动数据的可视化系统

Andres De La Puente, Felipe Moreno, Luis Sante, Mauro Diaz, Jorge Poco

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究开发UrbanGazeVis可视化系统,通过30名参与者使用HoloLens 2分析150张里约街景的眼动数据,揭示注视与城市安全感知的关联,为城市设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21467 2026-08-25 stat.ML cs.IT cs.LG 新提交 50%

Gauss--Hermite Quadrature for Gaussian-Mixture Entropy with an Action-Space Hermite Surrogate

用于高斯混合熵的高斯-埃尔米特求积法及动作空间埃尔米特代理模型

Jae Wan Shim

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究提出用于计算高斯混合微分熵的高斯-埃尔米特求积法,还提出动作空间埃尔米特多项式代理模型,在雷达指向基准中其性能优于二阶泰勒代理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14255 2026-08-25 cs.RO 版本更新 50%

A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots

面向工业机器人视觉-运动策略学习的延迟感知框架

Daniel Ruan (1), Salma Mozaffari (1), Sigrid Adriaenssens (1), Arash Adel (1) ((1) Princeton University)

机构 * Princeton University(普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种面向工业机器人视觉-运动策略学习的延迟感知框架,通过优化执行策略以应对延迟问题,提升策略在现实环境中的可靠性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏