arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-26 至 2025-11-26 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2511.20020 2025-11-26 cs.CV 83%

ACIT: Attention-Guided Cross-Modal Interaction Transformer for Pedestrian Crossing Intention Prediction

ACIT:基于注意力的跨模态交互Transformer用于行人过街意图预测

Yuanzhe Li, Steffen Müller

专题命中 视频多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 ACIT通过跨模态交互和注意力机制提升行人过街意图预测的准确性,实验显示在两个数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05034 2025-11-26 cs.CV 79%

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

视频大模型训练后:深入探讨大型多模态模型在视频推理中的应用

Yolo Y. Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Junhua Huang, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文深入探讨了Video-LMMs训练后处理方法,分析了监督微调、强化学习和测试时扩展等关键技术,总结了设计原则与挑战,为视频推理研究提供了统一框架。

Comments Version v1.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15097 2025-11-26 cs.CR cs.AI 70%

MAIF: Enforcing AI Trust and Provenance with an Artifact-Centric Agentic Paradigm

MAIF:基于 artifacts 的代理范式强化 AI 可信度与溯源

Vineeth Sai Narajala, Manish Bhatt, Idan Habler, Ronald F. Del Rosario, Ads Dawson

机构 * Security Researcher Cisco(安全研究员 希思科) Researcher OWASP/Project Kuiper Security(研究员 OWASP/项目 Kuiper 安全) Adversarial AI Security Research Cisco(对抗性AI安全研究 希思科)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 MAIF 通过以 artifacts 为中心的代理范式,解决 AI 的可信度、安全性和问责问题,实现数据的主动信任执行和高效处理。

Comments 7 Pages, 2 Figures, 6 Tables, Repo: https://github.com/vineethsai/maifscratch-1, Added additional Author and fixed Citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19475 2025-11-26 cs.CV cs.AI cs.MM 67%

Tracking and Segmenting Anything in Any Modality

任何模态下任何事物的跟踪与分割

Tianlu Zhang, Qiang Zhang, Guiguang Ding, Jungong Han

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SATA提出了一种通用框架,通过解耦的专家混合机制和任务感知多目标跟踪流程,统一了多种跟踪和分割任务,提升了模型的泛化能力。

Comments Accpetd by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17432 2025-11-26 cs.CV cs.CL 62%

Video Understanding with Large Language Models: A Survey

利用大语言模型进行视频理解:综述

Yolo Y. Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, Ali Vosoughi, Chao Huang, Zeliang Zhang, Pinxin Liu, Mingqian Feng, Feng Zheng, Jianguo Zhang, Ping Luo, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。

Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19882 2025-11-26 cs.CV 57%

ChessMamba: Structure-Aware Interleaving of State Spaces for Change Detection in Remote Sensing Images

ChessMamba: 结构感知的多时态空间交错用于遥感图像变化检测

Lei Ding, Tong Liu, Xuanguang Liu, Xiangyun Liu, Haitao Guo, Jun Lu

机构 * Information Engineering University(信息工程大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ChessMamba通过结构感知的交错状态空间建模,提升多时态遥感图像变化检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12959 2025-11-26 cs.CV 57%

Time-step Mixup for Efficient Spiking Knowledge Transfer from Appearance to Event Domain

时间步混合用于从外观域到事件域的高效脉冲知识转移

Yuqi Xie, Shuhan Ye, Yi Yu, Chong Wang, Qixin Zhang, Jiazhen Xu, Le Shen, Yuanbin Qian, Jiangbo Qian, Guoqi Li

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出时间步混合知识转移方法,通过细粒度混合策略和模态感知辅助学习目标,实现从外观到事件域的高效脉冲神经网络知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13789 2025-11-26 cs.LG cs.SI math.AT 50%

T3former: Temporal Graph Classification with Topological Machine Learning

T3former: 基于拓扑机器学习的时序图分类

Md. Joshem Uddin, Soham Changani, Baris Coskunuzer

专题命中 视频多模态 :cross-modal(abstract)

AI总结 T3former通过结合拓扑和谱信息,提出了一种新颖的时序图分类方法,实现了跨模态融合和理论稳定性保证。

Comments 14 pages, 8 figures

Journal ref AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏