arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2508.08632 2025-08-13 cs.AI 57%

AgriGPT: a Large Language Model Ecosystem for Agriculture

Bo Yang, Yu Zhang, Lanfei Feng, Yunkui Chen, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Yurui Li, Yuxuan Chen, Guijun Yang, Yong He, Runhe Huang, Shijian Li

机构 * College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) College of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Geological Engineering and Geomatics, Chang’an University, China(长安大学地质工程与测绘学院) College of Biosystems Engineering and Food Science, Zhejiang University, China(浙江大学生物系统工程与食品科学学院) Faculty of Computer and Information Sciences, Hosei University, Japan(立命馆大学计算机与信息科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10066 2025-08-13 cs.MM cs.CV 57%

LayLens: Improving Deepfake Understanding through Simplified Explanations

Abhijeet Narang, Parul Gupta, Liuyijia Su, Abhinav Dhall

机构 * Monash University(墨尔本大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to ACM ICMI 2025 Demos

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02488 2025-08-13 cs.CV 57%

SCB-Dataset: A Dataset for Detecting Student and Teacher Classroom Behavior

Fan Yang

机构 * Fan Yang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07803 2025-08-12 cs.CV 57%

MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks

Yushen Xu, Xiaosong Li, Zhenyu Kuang, Xiaoqi Cheng, Haishu Tan, Huafeng Li

机构 * School of Physics and Optoelectronic Engineering(物理与光电工程学院) Guangdong-HongKong-Macao Joint Laboratory for Intelligent Micro-Nano Optoelectronic Technology(粤港澳联合智能微纳光电技术实验室) School of Information Engineering and Automation(信息工程与自动化学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06539 2025-08-12 cs.LG math.OC 57%

Self-Organizing Survival Manifolds: A Theory for Unsupervised Discovery of Prognostic Structures in Biological Systems

Atahan Karagoz

机构 * Department of Computer Science University of Basel Basel, Switzerland(计算机科学系 巴塞尔大学 巴塞尔瑞士)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05799 2025-08-11 cs.SE cs.AI cs.HC 57%

AI-Guided Exploration of Large-Scale Codebases

Yoseph Berhanu Alebachew

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05409 2025-08-08 cs.CV cs.SD eess.AS 57%

From Detection to Correction: Backdoor-Resilient Face Recognition via Vision-Language Trigger Detection and Noise-Based Neutralization

Farah Wahida, M. A. P. Chamikara, Yashothara Shanmugarasa, Mohan Baruwal Chhetri, Thilina Ranbaduge, Ibrahim Khalil

机构 * RMIT University, Australia(皇家墨尔本理工大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments 19 Pages, 24 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04868 2025-08-08 cs.CV 57%

Dual-Stream Attention with Multi-Modal Queries for Object Detection in Transportation Applications

Noreen Anwar, Guillaume-Alexandre Bilodeau, Wassim Bouachir

机构 * LITIV, Polytechnique Montréal(Polytechnique Montréal 的 LITIV) Data Science Laboratory, Université du Québec (TELUQ)(Université du Québec (TELUQ) 的 Data Science Laboratory)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04418 2025-08-07 cs.MM cs.CV cs.MA cs.SD eess.AS 57%

Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation

Jinxing Zhou, Yanghao Zhou, Mingfei Han, Tong Wang, Xiaojun Chang, Hisham Cholakkal, Rao Muhammad Anwer

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Project page: https://github.com/jasongief/TGS-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04120 2025-08-07 cs.CV 57%

CLIPVehicle: A Unified Framework for Vision-based Vehicle Search

Likai Wang, Ruize Han, Xiangqun Zhang, Wei Feng

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08808 2025-08-06 cs.LG math.OC stat.ML 57%

A First-order Generative Bilevel Optimization Framework for Diffusion Models

Quan Xiao, Hui Yuan, A F M Saif, Gaowen Liu, Ramana Kompella, Mengdi Wang, Tianyi Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Princeton University(普林斯顿大学) Cisco Research(思科研究) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Cameral-ready version: added experiments using the HPSv2 reward, improved notation consistency for the diffusion model, and added related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02988 2025-08-06 cs.RO cs.AI 57%

GACL: Grounded Adaptive Curriculum Learning with Active Task and Performance Monitoring

Linji Wang, Zifan Xu, Peter Stone, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系) Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 7 pages, IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02973 2025-08-06 cs.CV 57%

Diffusion Models with Adaptive Negative Sampling Without External Resources

Alakh Desai, Nuno Vasconcelos

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02405 2025-08-05 cs.RO cs.CV 57%

Improving Generalization of Language-Conditioned Robot Manipulation

Chenglin Cui, Chaoran Zhu, Changjae Oh, Andrea Cavallaro

机构 * Centre for Intelligent Sensing, Queen Mary University of London(智能传感中心,伦敦女王玛丽大学) Idiap Research Institute and École Polytechnique Fédérale de Lausanne(Idiap研究机构和日内瓦联邦理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 7 pages,18 figures,2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01150 2025-08-05 cs.CV 57%

OpenGS-Fusion: Open-Vocabulary Dense Mapping with Hybrid 3D Gaussian Splatting for Refined Object-Level Understanding

Dianyi Yang, Xihan Wang, Yu Gao, Shiyang Liu, Bohan Ren, Yufeng Yue, Yi Yang

机构 * School of Automation, Beijing Institute of Technology, Beijing, China(自动化学院,北京理工大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

Comments IROS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00557 2025-08-04 cs.CV 57%

Training-Free Class Purification for Open-Vocabulary Semantic Segmentation

Qi Chen, Lingxiao Yang, Yun Chen, Nailong Zhao, Jianhuang Lai, Jie Shao, Xiaohua Xie

机构 * Sun Yat-sen University(中山大学) ByteDance Intelligent Creation(字节跳动智能创作) University of Surrey(Surrey大学) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00081 2025-08-04 cs.AI 57%

Rethinking Evidence Hierarchies in Medical Language Benchmarks: A Critical Evaluation of HealthBench

Fred Mutisya, Shikoh Gitau, Nasubo Ongoma, Keith Mbae, Elizabeth Wamicha

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23134 2025-08-01 cs.CV 57%

Details Matter for Indoor Open-vocabulary 3D Instance Segmentation

Sanghun Jung, Jingjing Zheng, Ke Zhang, Nan Qiao, Albert Y. C. Chen, Lu Xia, Chi Liu, Yuyin Sun, Xiao Zeng, Hsiang-Wei Huang, Byron Boots, Min Sun, Cheng-Hao Kuo

机构 * University of Washington(华盛顿大学) Amazon Lab126(亚马逊实验室126) National Tsing Hua University(国立清华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22886 2025-08-01 cs.CV 57%

Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation

Kaining Ying, Henghui Ding, Guangquan Jie, Yu-Gang Jiang

机构 * Fudan University, China(复旦大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

Comments ICCV 2025, Project Page: https://henghuiding.com/OmniAVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24329 2025-08-01 cs.CV 57%

DisTime: Distribution-based Time Representation for Video Large Language Models

Yingsen Zeng, Zepeng Huang, Yujie Zhong, Chengjian Feng, Jie Hu, Lin Ma, Yang Liu

机构 * Meituan Inc.(美团公司) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11237 2025-08-01 cs.AI cs.CL cs.SE 57%

Collaboration is all you need: LLM Assisted Safe Code Translation

Rabimba Karanjai, Sam Blackshear, Lei Xu, Weidong Shi

机构 * University Of Houston(休斯顿大学) Mysten Labs(Mysten实验室) Kent State University(肯特州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22617 2025-07-31 cs.CR cs.CV 57%

Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions

Yiting Qu, Ziqing Yang, Yihan Ma, Michael Backes, Savvas Zannettou, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心) TU Delft(代尔夫特理工大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22213 2025-07-31 cs.IR cs.LG 57%

Intent-Aware Neural Query Reformulation for Behavior-Aligned Product Search

Jayanth Yetukuri, Ishita Khan

机构 * eBay Inc(eBay公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Accepted at SIGIR eCom'25. https://sigir-ecom.github.io/eCom25Papers/paper_23.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20397 2025-07-29 cs.CV 57%

VESPA: Towards un(Human)supervised Open-World Pointcloud Labeling for Autonomous Driving

Levente Tempfli, Esteban Rivera, Markus Lienkamp

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19939 2025-07-29 cs.CV 57%

LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs

Jiaze Wang, Rui Chen, Haowang Cui

机构 * Tianjin University(天津大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13092 2025-07-29 cs.CV 57%

EventVAD: Training-Free Event-Aware Video Anomaly Detection

Yihua Shao, Haojin He, Sijie Li, Siyu Chen, Xinwei Long, Fanhu Zeng, Yuxuan Fan, Muyang Zhang, Ziyang Yan, Ao Ma, Xiaochen Wang, Hao Tang, Yan Wang, Shuyan Li

机构 * Peking University(北京大学) Guangdong University of Technology(广东工业大学) The University of Sheffield(谢菲尔德大学) University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanjing University(南京大学) University of Trento(特伦特大学) Queen's University Belfast(贝尔法斯特女王大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

Comments Paper was accepted by ACM MM 2025; Code: https://github.com/YihuaJerry/EventVAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19370 2025-07-28 cs.CV 57%

BEV-LLM: Leveraging Multimodal BEV Maps for Scene Captioning in Autonomous Driving

Felix Brandstaetter, Erik Schuetz, Katharina Winter, Fabian Flohr

机构 * Intelligent Vehicles Lab (IVL) Munich University of Applied Sciences(智能车辆实验室(IVL)慕尼黑应用科学大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19359 2025-07-28 cs.CV 57%

SemGes: Semantics-aware Co-Speech Gesture Generation using Semantic Coherence and Relevance Learning

Lanmiao Liu, Esam Ghaleb, Aslı Özyürek, Zerrin Yumak

机构 * Max Planck Institute for Psycholinguistics(马克斯·普朗克心理学研究所) Donders Institute for Brain Cognition and Behaviour(多纳尔斯脑认知与行为研究所) Utrecht University(乌得勒支大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19213 2025-07-28 cs.CV 57%

PRE-MAP: Personalized Reinforced Eye-tracking Multimodal LLM for High-Resolution Multi-Attribute Point Prediction

Hanbing Wu, Ping Jiang, Anyang Su, Chenxu Zhao, Tianyu Fu, Minghui Wu, Beiping Tan, Huiying Li

机构 * Jilin University(吉林大学) Peking University(北京大学) Mininglamp Technology(Mininglamp科技)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17456 2025-07-24 cs.CV 57%

Dynamic Scoring with Enhanced Semantics for Training-Free Human-Object Interaction Detection

Francesco Tonini, Lorenzo Vaquero, Alessandro Conti, Cigdem Beyan, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Verona(威尼斯大学) Department of Computer Science(计算机科学系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏