arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-23 至 2026-01-23 共收录 33 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2405.10739 2026-01-23 cs.CV cs.AI 86%

Efficient Multimodal Large Language Models: A Survey

高效多模态大语言模型:综述

Yizhang Jin, Jian Li, Yexin Liu, Tianjun Gu, Kai Wu, Zhengkai Jiang, Muyang He, Bo Zhao, Xin Tan, Zhenye Gan, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Youtu Lab, Tencent(腾讯优图实验室) SJTU(上海交通大学) BAAI(北京人工智能研究院) ECNU(华东师范大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了高效多模态大语言模型的发展现状,探讨了其高效结构、策略及应用,并展望了未来研究方向。

Comments Accepted by Visual Intelligence

Journal ref Visual Intelligence, Volume 3, article number 27, (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15457 2026-01-23 cs.CL cs.AI cs.IR 57%

Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering

分块、检索与重排序:RAG架构在政策文件问答中的实证评估

Anuj Maharjan, Umesh Yadav

机构 * Computer Science (EECS) University of Toledo Toledo, OH, USA

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文通过实证评估,比较了RAG架构在政策文件问答中的有效性,发现Advanced RAG在忠实度上表现更优,但文档分段限制影响多步骤推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 6 篇

2506.09049 2026-01-23 cs.AI cs.CV cs.RO 79%

VIKI-R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning

VIKI-R: 通过强化学习协调具身多智能体合作

Li Kang, Xiufeng Song, Heng Zhou, Yiran Qin, Jie Yang, Xiaohong Liu, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 VIKI-R通过强化学习协调多智能体合作,提出分层基准VIKI-Bench,显著提升多智能体视觉驱动合作性能。

Comments Accepted by NeurIPS 2025 Track on Datasets and Benchmarks. Project page: https://faceong.github.io/VIKI-R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16007 2026-01-23 cs.CV cs.AI 73%

PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models

PhysicsMind: 为基础多模态大语言模型和世界模型中的物理推理和预测进行仿真与现实力学基准测试

Chak-Wing Mak, Guanyu Zhu, Boyi Zhang, Hongji Li, Xiaowei Chi, Kevin Zhang, Yichen Wu, Yangfan He, Chun-Kai Fan, Wentao Lu, Kuangzhi Ge, Xinyu Fang, Hongyang He, Kuan Lu, Tianxiang Xu, Li Zhang, Yongxin Ni, Youhua Li, Shanghang Zhang

机构 * Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学) Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 PhysicsMind是一个结合现实和仿真环境的统一基准,用于评估基础多模态大语言模型和世界模型在物理推理和预测中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15655 2026-01-23 cs.CV cs.AI 62%

Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams

Event-VStream: 基于事件驱动的长视频流实时理解

Zhenghui Guo, Yuanbin Man, Junyuan Sheng, Bowen Lin, Ahmed Ahmed, Bo Jiang, Boyuan Zhang, Miao Yin, Sian Jin, Omprakash Gnawal, Chengming Zhang

机构 * University of Houston(德克萨斯大学休斯顿分校) The University of Texas at Arlington(德克萨斯理工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校) Temple University(特拉华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Event-VStream通过事件感知框架实现长视频流的实时理解,利用事件序列进行语义连贯的处理,提升性能并保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15780 2026-01-23 cs.CV 57%

Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video

通过合成视频评估VLMs的情境与空间意识

Pascal Benschop, Justin Dauwels, Jan van Gemert

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 本文提出一个合成基准,评估VLMs在区分暴力与无害活动、跨视角角色绑定及细粒度轨迹对齐方面的性能,发现其表现仅略高于随机水平,且稳定颜色线索仅部分缓解了问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14691 2026-01-23 cs.AI cs.CL 57%

Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation

操纵法官:不忠的推理链可能损害智能体评估

Muhammad Khalifa, Lajanugen Logeswaran, Jaekyeom Kim, Sungryull Sohn, Yunxiang Zhang, Moontae Lee, Hao Peng, Lu Wang, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

AI总结 本文揭示了LLM法官对智能体推理轨迹操纵的脆弱性,表明基于内容的操纵能显著提高假阳性率,凸显了需验证推理与证据的评估机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21143 2026-01-23 cs.CL cs.CV 57%

The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?

感知挑战:多模态大语言模型能否解决简单感知问题?

Samrajnee Ghosh, Naman Agarwal, Hemanshu Garg, Chinmay Mittal, Mausam, Parag Singla

机构 * IIT Delhi(德里印度理工学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 14 篇

2601.15316 2026-01-23 cs.AI cs.CV 81%

The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection

范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查

Wei Ai, Yilong Tan, Yuntao Shou, Tao Meng, Haowen Chen, Zhixiong He, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16108 2026-01-23 cs.AI 79%

Multimodal Climate Disinformation Detection: Integrating Vision-Language Models with External Knowledge Sources

多模态气候虚假信息检测:整合视觉-语言模型与外部知识源

Marzieh Adeli Shamsabad, Hamed Ghodrati

机构 * CRIM

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15711 2026-01-23 cs.CV 79%

Zero-Shot Product Attribute Labeling with Vision-Language Models: A Three-Tier Evaluation Framework

基于视觉-语言模型的零样本产品属性标注:一种三级评估框架

Shubham Shukla, Kunal Sonalkar

机构 * Nordstrom(诺德斯特拉姆)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种三级评估框架,评估视觉-语言模型在多属性服装任务中的零样本属性标注性能,发现高效模型在成本较低时能实现接近旗舰级性能,揭示了属性适用性检测是关键瓶颈。

Comments Accepted to WACV 2026 Workshop on Physical Retail AI (PRAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11304 2026-01-23 cs.AI cs.CL cs.CV 79%

Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring

利用实例分割辅助的多模态大语言模型进行智能交通监控

Murat Arda Onsu, Poonam Lohan, Burak Kantarci, Aisha Syed, Matthew Andrews, Sean Kennedy

机构 * University of Ottawa(渥太华大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 视觉定位与Grounding :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文利用多模态大语言模型和实例分割技术,实现高准确率的交通监控系统,提升交通管理效率和安全性。

Comments 6 pages, 7 figures, submitted to 30th IEEE International Symposium on Computers and Communications (ISCC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14490 2026-01-23 cs.CV cs.AI cs.CL cs.LG 75%

GutenOCR: A Grounded Vision-Language Front-End for Documents

GutenOCR:文档的 grounded 视觉-语言前端

Hunter Heidenreich, Ben Elliott, Olivia Dinica, Yosheb Getachew

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GutenOCR 通过微调 Qwen2.5-VL 模型,实现了文档中的 grounded OCR 和检测,提升了 OCR 得分和文本检测召回率,但存在页面线性化和公式布局方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16038 2026-01-23 cs.AI 74%

Grounding Large Language Models in Reaction Knowledge Graphs for Synthesis Retrieval

将反应知识图谱接地于大语言模型以实现合成检索

Olga Bunkova, Lorenzo Di Fruscia, Sophia Rupprecht, Artur M. Schweidtmann, Marcel J. T. Reinders, Jana M. Weber

机构 * Department of Intelligent Systems, Delft University of Technology(智能系统系,代尔夫特理工大学) Department of Chemical Engineering, Delft University of Technology(化学工程系,代尔夫特理工大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本研究通过将反应路径检索转化为图查询生成问题,利用对齐示例的单样本提示提升大语言模型在合成规划中的检索准确性。

Comments Accepted at ML4Molecules 2025 (ELLIS UnConference workshop), Copenhagen, Denmark, December 2, 2025. Workshop page: https://moleculediscovery.github.io/workshop2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15533 2026-01-23 cs.AI 74%

From Generative Engines to Actionable Simulators: The Imperative of Physical Grounding in World Models

从生成引擎到可操作模拟器:世界模型中物理基础的必要性

Zhikang Chen, Tingting Zhu

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本文提出将世界模型重新定义为可操作模拟器,强调因果结构和约束意识,以提升医疗决策中的反事实推理和长期预见能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15624 2026-01-23 cs.CV 70%

Explainable Deepfake Detection with RL Enhanced Self-Blended Images

可解释的深度伪造检测与强化学习增强的自混合图像

Ning Jiang, Dingheng Zeng, Yanhong Liu, Haiyang Yi, Shijie Yu, Minghe Weng, Haifeng Shen, Ying Li

机构 * 1School of Software \& Microelectronics, Peking University, Beijing, China 2Mashang Consumer Finance Co., Ltd., Chongqing, China -0.15in

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于强化学习增强的自混合图像方法,用于可解释的深度伪造检测,通过自动化数据生成和定制奖励机制提升检测性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01910 2026-01-23 cs.AI 70%

MMP-A*: Multimodal Perception Enhanced Incremental Heuristic Search on Path Planning

MMP-A*:多模态感知增强的路径规划增量启发式搜索

Minh Hieu Ha, Khanh Ly Ta, Hung Phan, Tung Doan, Tung Dao, Dao Tran, Huynh Thi Thanh Binh

机构 * Hanoi University of Science and Technology(河内科学技术大学) Vingroup Big Data Research Center(VinGroup大数据研究中心) FPT Software AI Center(FPT软件AI中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 MMP-A*通过融合视觉语言模型的空间感知与自适应衰减机制,提升路径规划的几何精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15652 2026-01-23 cs.AI cs.CR cs.ET 57%

Predictive Coding and Information Bottleneck for Hallucination Detection in Large Language Models

预测编码与信息瓶颈用于大语言模型中的幻觉检测

Manish Bhatt

机构 * AI Offensive Security Researcher, OWASP(AI攻击防御安全研究员,OWASP)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出了一种结合预测编码和信息瓶颈的轻量级框架,用于高效检测大语言模型中的幻觉,实现了比传统方法更高的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15487 2026-01-23 cs.AI cs.CL cs.MA 57%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15453 2026-01-23 cs.CV 57%

DevPrompt: Deviation-Based Prompt Learning for One-Normal ShotImage Anomaly Detection

DevPrompt: 基于偏差的提示学习用于单正常样本图像异常检测

Morteza Poudineh, Marc Lalonde

机构 * Department of Electrical and Computer Engineering, Concordia University(电气与计算机工程系,康科迪亚大学) Computer Research Institute of Montreal (CRIM)(蒙特利尔计算机研究 institute)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 DevPrompt通过结合视觉语言模型的语义能力和基于偏差的评分机制,提升单正常样本图像异常检测的性能和可解释性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15465 2026-01-23 cs.HC 50%

Cloning the Self for Mental Well-Being: A Framework for Designing Safe and Therapeutic Self-Clone Chatbots

为心理健康福祉克隆自我:一种设计安全且治疗性自我克隆聊天机器人的框架

Mehrnoosh Sadat Shirvani, Jackie Crowley, Cher Peng, Jackie Liu, Thomas Chao, Suky Martinez, Laura Brandt, Ig-Jae Kim, Dongwook Yoon

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种设计安全且治疗性自我克隆聊天机器人的框架,旨在通过跨学科方法解决身份混淆和伦理风险,促进心理健康福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15352 2026-01-23 cs.SE 50%

A Prompt-Based Framework for Loop Vulnerability Detection Using Local LLMs

基于提示的本地LLM循环漏洞检测框架

Adeyemi Adeseye, Aisvarya Adeseye

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于本地LLM的循环漏洞检测框架,利用提示技术提高代码分析的准确性和安全性,验证Phi模型在性能上的优势。

Comments Accepted and Waiting to be published ICAI'25: 27th International Conference on Artificial Intelligence https://american-cse.org/csce2025/conferences-ICAI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2508.04037 2026-01-23 cs.AI 57%

Evolving in Tasks: Empowering the Multi-modality Large Language Model as the Computer Use Agent

任务演化:使多模态大语言模型成为计算机使用代理

Yuhao Cheng, Liang Tang, Shuxian Li, Yukang Huo, Tiaonan Duan, Kaer Huang, Yanzhe Jing, Yiqiang Yan

机构 * Lenovo Research(联想研究) China Agricultural University(中国农业大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文提出自演化代理(SEA),通过数据生成、强化学习和模型增强三个创新,使7B参数模型在计算机使用任务中超越同类模型并接近更大规模模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 4 篇

2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 85%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15698 2026-01-23 cs.CV cs.AI 81%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15549 2026-01-23 cs.CV cs.AI 73%

VIOLA: Towards Video In-Context Learning with Minimal Annotations

VIOLA:迈向最小标注的视频情境学习

Ryo Fujii, Hideo Saito, Ryo Hachiuma

机构 * Keio University(Keio大学) Keio AI Research Center(Keio人工智能研究中心) NVIDIA(NVIDIA公司)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 VIOLA通过结合最小专家监督和大量未标注数据,实现高效视频情境学习,显著提升低资源环境下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15745 2026-01-23 cs.CL 50%

Hallucination Mitigating for Medical Report Generation

缓解医疗报告生成中的幻觉

Ruoqing Zhao, Runze Xia, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 幻觉与鲁棒性 :vision language model(abstract)

AI总结 KERM框架通过知识检索、净化模块和细粒度奖励,有效缓解医疗报告生成中的幻觉问题,提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 4 篇

2407.17914 2026-01-23 cs.CL 82%

Vision-Language Models Align with Human Neural Representations in Concept Processing

视觉-语言模型在概念处理中与人类神经表征对齐

Anna Bavaresco, Marianne de Heer Kloots, Sandro Pezzelle, Raquel Fernández

机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract)

AI总结 本研究发现视觉-语言模型在概念处理中能与人类神经表征对齐,揭示了不同架构在脑部响应中的差异。

Comments Accepted to EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15370 2026-01-23 cs.LG cs.AI 62%

Improving MoE Compute Efficiency by Composing Weight and Data Sparsity

通过组合权重和数据稀疏性提高MoE计算效率

Maciej Kilian, Oleg Mkrtchyan, Luke Zettlemoyer, Akshat Shrivastava, Armen Aghajanyan

机构 * University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 通过结合权重和数据稀疏性,提高MoE计算效率,减少训练-推理不匹配,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11551 2026-01-23 cs.CV cs.IR cs.LG 62%

Multi-event Video-Text Retrieval

多事件视频-文本检索

Gengyuan Zhang, Jisen Ren, Jindong Gu, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出多事件视频-文本检索任务,设计Me-Retriever模型,通过关键事件表示和新损失函数提升视频-文本检索性能。

Comments [fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally

详情

展开后加载摘要…

URL PDF HTML 收藏