arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2506.04789 2025-11-06 cs.CV 57%

Object-X: Learning to Reconstruct Multi-Modal 3D Object Representations

Gaia Di Lorenzo, Federico Tombari, Marc Pollefeys, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Microsoft(微软)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11519 2025-11-06 cs.CV cs.CL 57%

Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models

Hao Cheng, Erjia Xiao, Yichi Wang, Lingfeng Zhang, Qiang Zhang, Jiahang Cao, Kaidi Xu, Mengshu Sun, Xiaoshuai Hao, Jindong Gu, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Oxford(牛津大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments This paper is accepted by IJCAI2025 Workshop on Deepfake Detection, Localization, and Interpretability as Best Student Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03186 2025-11-06 cs.AI 57%

Adobe Summit Concierge Evaluation with Human in the Loop

Yiru Chen, Sally Fang, Sai Sree Harsha, Dan Luo, Vaishnavi Muppala, Fei Wu, Shun Jiang, Kun Qian, Yunyao Li

机构 * Adobe Inc.(Adobe公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted by 6th Workshop on Data Science with Human in the Loop @ VLDB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03181 2025-11-06 cs.RO cs.LG 57%

Learning-based Cooperative Robotic Paper Wrapping: A Unified Control Policy with Residual Force Control

Rewida Ali, Cristian C. Beltran-Hernandez, Weiwei Wan, Kensuke Harada

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(大阪大学系统创新部门,工学研究科) OMRON SINIC X Corporation(OMRON SINIC X公司) The National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03047 2025-11-06 cs.LG 57%

Unsupervised Evaluation of Multi-Turn Objective-Driven Interactions

Emi Soroka, Tanmay Chopra, Krish Desai, Sanjay Lall

机构 * Department of Electrical Engineering Stanford University(电气工程系 斯坦福大学) Emissary Technologies

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07661 2025-11-06 cs.CV cs.RO 57%

ROADWork: A Dataset and Benchmark for Learning to Recognize, Observe, Analyze and Drive Through Work Zones

Anurag Ghosh, Shen Zheng, Robert Tamburo, Khiem Vuong, Juan Alvarez-Padilla, Hailiang Zhu, Michael Cardei, Nicholas Dunn, Christoph Mertz, Srinivasa G. Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025 Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00537 2025-11-05 cs.CL cs.LG 57%

Multi-refined Feature Enhanced Sentiment Analysis Using Contextual Instruction

Peter Atandoh, Jie Zou, Weikang Guo, Jiwei Wei, Zheng Wang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) Southwestern University of Finance and Economics(西南财经大学) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27195 2025-11-05 cs.CV cs.CL cs.SI 57%

Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments ICCV2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02238 2025-11-05 cs.AI 57%

Deep Ideation: Designing LLM Agents to Generate Novel Research Ideas on Scientific Concept Network

Keyu Zhao, Weiquan Lin, Qirui Zheng, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Artificial Intelligence Academy, Xidian University(西安电子科技大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17664 2025-11-05 cs.CV cs.RO 57%

Talk2Event: Grounded Understanding of Dynamic Scenes from Event Cameras

Lingdong Kong, Dongyue Lu, Ao Liang, Rong Li, Yuhao Dong, Tianshuai Hu, Lai Xing Ng, Wei Tsang Ooi, Benoit R. Cottereau

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) NTU(南洋理工大学) HKUST(香港科技大学) I 2 R, A*STAR(I2R, A*STAR) IPAL, CNRS IRL 2955, Singapore(IPAL, CNRS IRL 2955, 新加坡) CerCo, CNRS UMR 5549, Université Toulouse III(CerCo, CNRS UMR 5549, 法国图卢兹第三大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments NeurIPS 2025 Spotlight; 43 pages, 17 figures, 16 tables; Project Page at https://talk2event.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01753 2025-11-04 cs.LO cs.AI cs.PL 57%

SM-based Semantics for Answer Set Programs Containing Conditional Literals and Arithmetic

Zachary Hansen, Yuliya Lierler

机构 * University of Nebraska Omaha(内布拉斯加大学奥马哈分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments This version corrects the review of tau for negated atoms, and clarifies the distinction between global and local variables in conditional literals (the supporting proofs are also updated accordingly)

Journal ref In Practical Aspects of Declarative Languages: 27th International Symposium, PADL 2025, Denver, CO, USA, January 20-21, 2025, Proceedings. Springer-Verlag, Berlin, Heidelberg, 71-87

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16800 2025-11-04 cs.CV 57%

Phys4DGen: Physics-Compliant 4D Generation with Multi-Material Composition Perception

Jiajing Lin, Zhenzhong Wang, Dejun Xu, Shu Jiang, YunPeng Gong, Min Jiang

机构 * School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025. Project Page: https://jiajinglin.github.io/Phys4DGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16093 2025-11-04 cs.CL cs.AI 57%

Beyond Pointwise Scores: Decomposed Criteria-Based Evaluation of LLM Responses

Fangyi Yu, Nabeel Seedat, Dasha Herrmannova, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Thomson Reuters Labs(汤姆森·路透实验室) Imperial College London(帝国理工学院伦敦分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted by 2025 EMNLP industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01390 2025-11-04 cs.CY cs.AI 57%

Recognising, Anticipating, and Mitigating LLM Pollution of Online Behavioural Research

Raluca Rilla, Tobias Werner, Hiromu Yakura, Iyad Rahwan, Anne-Marie Nussberger

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26996 2025-11-03 cs.CV 57%

MoME: Mixture of Visual Language Medical Experts for Medical Imaging Segmentation

Arghavan Rezvani, Xiangyi Yan, Anthony T. Wu, Kun Han, Pooya Khosravi, Xiaohui Xie

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系) School of Medicine, University of California, Irvine(加州大学尔湾分校医学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26915 2025-11-03 cs.RO cs.AI 57%

Heterogeneous Robot Collaboration in Unstructured Environments with Grounded Generative Intelligence

Zachary Ravichandran, Fernando Cladera, Ankit Prabhu, Jason Hughes, Varun Murali, Camillo Taylor, George J. Pappas, Vijay Kumar

机构 * Dept. of Electrical and Computer Engineering at Texas A&M University(德克萨斯A&M大学电气与计算机工程系) GRASP Laboratory at the University of Pennsylvania(宾夕法尼亚大学GRASP实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21657 2025-11-03 cs.CV 57%

FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction

Yixiang Dai, Fan Jiang, Chiyu Wang, Mu Xu, Yonggang Qi

机构 * AMAP, Alibaba Group(阿里集团AMAP) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16556 2025-10-31 cs.CV 57%

Fit for Purpose? Deepfake Detection in the Real World

Guangyu Lin, Li Lin, Christina P. Walker, Daniel S. Schiff, Shu Hu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26527 2025-10-31 cs.LG 57%

Polybasic Speculative Decoding Through a Theoretical Perspective

Ruilin Wang, Huixia Li, Yuexiao Ma, Xiawu Zheng, Fei Chao, Xuefeng Xiao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) Efficient Computing, Ministry of Education of China, Xiamen University(高效计算、教育部中国 ministry of education、厦门大学) Institute of Artificial Intelligence, Xiamen University(人工智能研究院、厦门大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室、深圳中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26464 2025-10-31 cs.CV 57%

Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection

Yuanting Fan, Jun Liu, Xiaochen Chen, Bin-Bin Gao, Jian Li, Yong Liu, Jinlong Peng, Chengjie Wang

机构 * Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04448 2025-10-31 cs.CV cs.MM 57%

TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection

Zehong Yan, Peng Qi, Wynne Hsu, Mong Li Lee

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2025 Oral; Project Homepage: https://yanzehong.github.io/trust-vl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25094 2025-10-30 cs.CV 57%

Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection

Chanhyeong Yang, Taehoon Song, Jihwan Park, Hyunwoo J. Kim

机构 * Korea University(韩国大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25087 2025-10-30 cs.CL cs.LG 57%

BioCoref: Benchmarking Biomedical Coreference Resolution with LLMs

Nourah M Salem, Elizabeth White, Michael Bada, Lawrence Hunter

机构 * Computational Bioscience Program University of Colorado Anschutz Medical Campus(科学生物学程序,科罗拉多大学安舒茨医学校区) Department of Pediatrics University of Chicago(儿科学系,芝加哥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25070 2025-10-30 cs.CV 57%

Vision-Language Integration for Zero-Shot Scene Understanding in Real-World Environments

Manjunath Prasad Holenarasipura Rajiv, B. M. Vidyavathi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Preprint under review at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24055 2025-10-29 cs.RO cs.LG 57%

Language-Conditioned Representations and Mixture-of-Experts Policy for Robust Multi-Task Robotic Manipulation

Xiucheng Zhang, Yang Jiang, Hongwei Qing, Jiashuo Bai

机构 * Xiucheng Zhang(未知) Yang Jiang(未知) Jiashuo Bai(未知)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15536 2025-10-29 cs.RO cs.AI 57%

GRS: Generating Robotic Simulation Tasks from Real-World Images

Alex Zook, Fan-Yun Sun, Josef Spjut, Valts Blukis, Stan Birchfield, Jonathan Tremblay

机构 * NVIDIA Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23184 2025-10-28 cs.CV 57%

Finding 3D Scene Analogies with Multimodal Foundation Models

Junho Kim, Young Min Kim

机构 * Institute of New Media and Communications(新媒体与通讯研究所) Dept. of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to FM4RoboPlan workshop at RSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19333 2025-10-28 cs.CV 57%

A Training-Free Framework for Open-Vocabulary Image Segmentation and Recognition with EfficientNet and CLIP

Ying Dai, Wei Yu Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21900 2025-10-28 cs.CL cs.AI 57%

Deep Literature Survey Automation with an Iterative Workflow

Hongbo Zhang, Han Cui, Yidong Wang, Yijian Tian, Qi Guo, Cunxiang Wang, Jian Wu, Chiyu Song, Yue Zhang

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Peking University(北京大学) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03610 2025-10-28 cs.CV 57%

Learning Knowledge-based Prompts for Robust 3D Mask Presentation Attack Detection

Fangling Jiang, Qi Li, Bing Liu, Weining Wang, Caifeng Shan, Zhenan Sun, Ming-Hsuan Yang

机构 * School of Computer Science, University of South China(南方大学计算机科学学院) New Laboratory of Pattern Recognition, MAIS, CASIA(模式识别新实验室,MAIS,CASIA) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Department of Computer Science and Engineering, University of California, Merced(加州大学默塞德分校计算机科学与工程系) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏