arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2502.14019 2025-06-05 cs.CL cs.AI cs.HC 57%

Dehumanizing Machines: Mitigating Anthropomorphic Behaviors in Text Generation Systems

Myra Cheng, Su Lin Blodgett, Alicia DeVrio, Lisa Egede, Alexandra Olteanu

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02359 2025-06-04 cs.CV 57%

Auto-Labeling Data for Object Detection

Brent A. Griffin, Manushree Gangwar, Jacob Sela, Jason J. Corso

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10080 2025-06-04 cs.CV 57%

Bayesian Prompt Flow Learning for Zero-Shot Anomaly Detection

Zhen Qu, Xian Tao, Xinyi Gong, Shichen Qu, Qiyu Chen, Zhengtao Zhang, Xingang Wang, Guiguang Ding

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) HDU Casivision Luoyang Institute for Robot and Intelligent Equipment(洛阳机器人与智能装备研究所) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00844 2025-06-03 cs.LG 57%

LLM Cannot Discover Causality, and Should Be Restricted to Non-Decisional Support in Causal Discovery

Xingyu Wu, Kui Yu, Jibin Wu, Kay Chen Tan

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18022 2025-06-03 cs.CV 57%

RemoteSAM: Towards Segment Anything for Earth Observation

Liang Yao, Fan Liu, Delong Chen, Chuanyi Zhang, Yijun Wang, Ziyun Chen, Wei Xu, Shimin Di, Yuhui Zheng

机构 * Hohai University(河海大学) HKUST(香港科技大学) Southeast University(东南大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00249 2025-06-03 cs.AI cs.CL 57%

MIR: Methodology Inspiration Retrieval for Scientific Research Problems

Aniketh Garikaparthi, Manasi Patwardhan, Aditya Sanjiv Kanade, Aman Hassan, Lovekesh Vig, Arman Cohan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23272 2025-06-02 cs.CV 57%

Are MLMs Trapped in the Visual Room?

Yazhou Zhang, Chunwang Zou, Qimeng Liu, Lu Rong, Ben Yao, Zheng Lian, Qiuchi Li, Peng Zhang, Jing Qin

机构 * Zhengzhou University of Light Industry(郑州轻工业大学) Tianjin University(天津大学) The Hong Kong Polytechnic University(香港理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02219 2025-06-02 cs.CV cs.CL 57%

Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models

Andrés Villa, Juan Carlos León Alcázar, Alvaro Soto, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(卡斯土尼亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 18 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23930 2025-06-02 cs.CY cs.AI 57%

Exploring Societal Concerns and Perceptions of AI: A Thematic Analysis through the Lens of Problem-Seeking

Naomi Omeonga wa Kayembe

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23536 2025-05-30 cs.AI 57%

Synchronizing Process Model and Event Abstraction for Grounded Process Intelligence (Extended Version)

Janik-Vasily Benzin, Gyunam Park, Stefanie Rinderle-Ma

机构 * Technical University of Munich(慕尼黑技术大学) TUM School of Computation, Information and Technology(慕尼黑技术大学计算、信息与技术学院) Fraunhofer FIT(弗劳恩霍夫 FIT 研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22250 2025-05-30 cs.CV q-bio.QM 57%

YH-MINER: Multimodal Intelligent System for Natural Ecological Reef Metric Extraction

Mingzhuang Wang, Yvyang Li, Xiyang Zhang, Fei Tan, Qi Shi, Guotao Zhang, Siqi Chen, Yufei Liu, Lei Lei, Ming Zhou, Qiang Lin, Hongqiang Yang

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18686 2025-05-30 cs.CV 57%

WeakMCN: Multi-task Collaborative Network for Weakly Supervised Referring Expression Comprehension and Segmentation

Yang Liu, Silin Cheng, Xinwei He, Sebastien Ourselin, Lei Tan, Gen Luo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22869 2025-05-30 cs.CV 57%

SIGHT: Synthesizing Image-Text Conditioned and Geometry-Guided 3D Hand-Object Trajectories

Alexey Gavryushin, Alexandros Delitzas, Luc Van Gool, Marc Pollefeys, Kaichun Mo, Xi Wang

机构 * ETHZ(苏黎世联邦理工学院) MPI for Informatics(信息研究所) INSAIT(国际人工智能技术研究所) KU Leuven(鲁汶大学) Microsoft(微软公司) NVIDIA(英伟达公司) TUM(慕尼黑工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20960 2025-05-30 cs.CL cs.CY cs.LG 57%

Multi-Modal Framing Analysis of News

Arnav Arora, Srishti Yadav, Maria Antoniak, Serge Belongie, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06126 2025-05-30 cs.CV 57%

X2-DFD: A framework for eXplainable and eXtendable Deepfake Detection

Yize Chen, Zhiyuan Yan, Guangliang Cheng, Kangran Zhao, Siwei Lyu, Baoyuan Wu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, Guangdong, 518172, P.R. China(1 数据科学学院,香港中文大学(深圳)) School of Electronic and Computer Engineering, Peking University, P.R. China(2 电子与计算机工程学院,北京大学) Department of Computer Science, University of Liverpool, Liverpool, L69 7ZX, UK(3 计算机科学系,利物浦大学) Department of Computer Science and Engineering, University at Buffalo, State University of New York, Buffalo, NY, USA(4 计算机科学与工程系,布法罗大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15920 2025-05-29 cs.CL cs.AI 57%

Self-Taught Agentic Long Context Understanding

Yufan Zhuang, Xiaodong Yu, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Jingbo Shang, Zicheng Liu, Emad Barsoum

机构 * AMD UC San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Published at ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20732 2025-05-28 cs.CL cs.LG 57%

SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution

Hanlin Wang, Chak Tou Leong, Jiashuo Wang, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机学系,香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20639 2025-05-28 cs.CV 57%

Open-Det: An Efficient Learning Framework for Open-Ended Detection

Guiping Cao, Tao Wang, Wenjian Huang, Xiangyuan Lan, Jianguo Zhang, Dongmei Jiang

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17629 2025-05-28 cs.HC cs.AI 57%

TransBench: Breaking Barriers for Transferable Graphical User Interface Agents in Dynamic Digital Environments

Yuheng Lu, Qian Yu, Hongru Wang, Zeming Liu, Wei Su, Yanping Liu, Yuhang Guo, Maocheng Liang, Yunhong Wang, Haifeng Wang

机构 * Beihang University(北京航空航天大学) The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology(北京理工大学) Baidu Inc.(百度公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19409 2025-05-27 cs.AI 57%

Fusion Intelligence for Digital Twinning AI Data Centers: A Synergistic GenAI-PhyAI Approach

Ruihang Wang, Minghao Li, Zhiwei Cao, Jimin Jia, Kyle Guan, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University (NTU), Singapore(计算与数据科学学院,南洋理工大学(NTU),新加坡)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15725 2025-05-27 cs.RO cs.CV 57%

UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning

Xiangyu Wang, Donglin Yang, Yue Liao, Wenhao Zheng, wenjun wu, Bin Dai, Hongsheng Li, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) National University of Singapore(新加坡国立大学) MMLab, CUHK(香港中文大学MMLab) Hangzhou International Innovation Institute of Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18426 2025-05-27 cs.CL cs.AI 57%

Retrieval Augmented Generation-based Large Language Models for Bridging Transportation Cybersecurity Legal Knowledge Gaps

Khandakar Ashrafi Akbar, Md Nahiyan Uddin, Latifur Khan, Trayce Hockstad, Mizanur Rahman, Mashrur Chowdhury, Bhavani Thuraisingham

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Presented at the Transportation Research Board (TRB) Annual Meeting 2025, and subsequently submitted for publication consideration in the Transportation Research Record (TRR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17231 2025-05-26 cs.CL cs.AI cs.DB 57%

ExeSQL: Self-Taught Text-to-SQL Models with Execution-Driven Bootstrapping for SQL Dialects

Jipeng Zhang, Haolin Yang, Kehao Miao, Ruiyuan Zhang, Renjie Pi, Jiahui Gao, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16829 2025-05-26 cs.AI 57%

Visual Prompting with Iterative Refinement for Design Critique Generation

Peitong Duan, Chin-Yi Cheng, Bjoern Hartmann, Yang Li

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16659 2025-05-23 cs.CV 57%

SD-MAD: Sign-Driven Few-shot Multi-Anomaly Detection in Medical Images

Kaiyu Guo, Tan Pan, Chen Jiang, Zijian Wang, Brian C. Lovell, Limei Han, Yuan Cheng, Mahsa Baktashmotlagh

机构 * Shanghai Academy of AI for Science University of Queensland(上海人工智能科学研究院 华南理工大学) Fudan University Shanghai Academy of AI for Science(复旦大学 上海人工智能科学研究院) University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16425 2025-05-23 cs.CL cs.AI 57%

$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion

Jing Bi, Pinxin Liu, Ali Vosoughi, Jiarui Wu, Jinxi He, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 13 pages, 5 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15023 2025-05-22 cs.SE cs.AI 57%

Towards a Science of Causal Interpretability in Deep Learning for Software Engineering

David N. Palacio

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments PhD thesis, To appear in ProQuest

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15373 2025-05-22 cs.CV cs.RO 57%

RAZER: Robust Accelerated Zero-Shot 3D Open-Vocabulary Panoptic Reconstruction with Spatio-Temporal Aggregation

Naman Patel, Prashanth Krishnamurthy, Farshad Khorrami

机构 * Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(控制/机器人研究实验室(CRRL),电气与计算机工程系,纽约大学Tandon工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13828 2025-05-21 cs.AI 57%

Multimodal RAG-driven Anomaly Detection and Classification in Laser Powder Bed Fusion using Large Language Models

Kiarash Naghavi Khanghah, Zhiling Chen, Lela Romeo, Qian Yang, Rajiv Malhotra, Farhad Imani, Hongyi Xu

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.AI

Comments ASME 2025 International Design Engineering Technical Conferences and Computers and Information in Engineering Conference IDETC/CIE2025, August 17-20, 2025, Anaheim, CA (IDETC2025-168615)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13788 2025-05-21 cs.CV 57%

Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels

Yongshuo Zong, Qin Zhang, Dongsheng An, Zhihua Li, Xiang Xu, Linghan Xu, Zhuowen Tu, Yifan Xing, Onkar Dabeer

机构 * University of Edinburgh(爱丁堡大学) AWS AI Labs(AWS人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏