StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos
StrAD:面向长视频音频描述生成的流式方法与基准
Julian Spravil, Sebastian Houben, Sven Behnke
机构
*
Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所)
;
University of Bonn(波恩大学)
;
University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学)
;
Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)
;
Center for Robotics, University of Bonn(波恩大学机器人中心)
CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks
CoLA: 跨模态低秩适配用于多模态下游任务
Wish Suharitdamrong, Tony Alex, Muhammad Awais, Sara Atito
机构
*
Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心)
;
University of Surrey(塞维利亚大学)
;
Surrey Institute for People-Centred AI(以人为本的人工智能研究所)
机构
*
Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程学院)
;
Faculty of CMC, Shenzhen MSU-BIT University(深圳北理莫斯科大学计算机、数学与力学学院)
;
Department of CDS, Indian Institute of Science(印度科学学院计算机与数据科学系)
专题命中
文档图表理解
:multimodal large language model(abstract);分类 cs.CV
How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures
视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估
Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao
机构
*
University of Aberdeen(阿伯丁大学)
;
International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院)
;
University of Technology Nuremberg(纽伦堡工业大学)
;
University of Southern California(南加利福尼亚大学)
The Hidden Evolution of Disguised Visual Context inside the VLM
VLM内部伪装视觉上下文的隐藏演化
Wish Suharitdamrong, Tony Alex, Xiatian Zhu, Muhammad Awais, Sara Atito
机构
*
Surrey Institute for People-Centred AI, University of Surrey(萨里大学以人为本人工智能研究所)
;
Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心)
Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval
用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法
Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen
机构
*
Hanoi University of Science and Technology(河内科技大学)
;
University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学)
;
Vietnam National University, Ho Chi Minh City(胡志明市国家大学)
;
VinUniversity
;
Vietnamese-German University(越南德国大学)
Perturbation-based Regional Interpretability through Subtraction Mapping (PRISM): naming-error dissociations in language models and post-stroke aphasia
基于减法映射的扰动型区域可解释性方法(PRISM):语言模型与卒中后失语症中的命名错误分离现象
Xiang Guan, Roger D. Newman-Norlund, Yong Yang, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Srihari Nelakuditi, Chris Rorden, Leonardo Bonilha, Julius Fridriksson
机构
*
University of South Carolina(南卡罗来纳大学)
;
ALLT.AI, LLC(ALLT.AI有限责任公司)
;
USC School of Medicine(南卡罗来纳大学医学院)
Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Yi Liu, Xingjun Ma, Yu-Gang Jiang
机构
*
Institute of Trustworthy Embodied AI(可信具身人工智能研究院)
;
Fudan University(复旦大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Ant Group(蚂蚁集团)
;
Zhejiang University(浙江大学)
;
City University of Hong Kong(香港城市大学)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.AI、cs.LG