arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2309.06176 2023-09-13 cs.CV cs.MM 79%

Dual-Path Temporal Map Optimization for Make-up Temporal Video Grounding

Jiaxiu Li, Kun Li, Jia Li, Guoliang Chen, Dan Guo, Meng Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05251 2023-09-12 cs.CV 79%

Multi3DRefer: Grounding Text Description to Multiple 3D Objects

Yiming Zhang, ZeMing Gong, Angel X. Chang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01352 2023-09-06 cs.CL cs.AI 79%

Self-driven Grounding: Large Language Model Agents with Automatical Language-aligned Skill Learning

Shaohui Peng, Xing Hu, Qi Yi, Rui Zhang, Jiaming Guo, Di Huang, Zikang Tian, Ruizhi Chen, Zidong Du, Qi Guo, Yunji Chen, Ling Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16354 2023-09-01 cs.CV 79%

Catalog Phrase Grounding (CPG): Grounding of Product Textual Attributes in Product Images for e-commerce Vision-Language Applications

Wenyi Wu, Karim Bouyarmane, Ismail Tutar

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments KDD 2022 Workshop on First Content Understanding and Generation for e-Commerce

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16715 2023-08-21 cs.CV 79%

UniVTG: Towards Unified Video-Language Temporal Grounding

Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex Jinpeng Wang, Rui Yan, Mike Zheng Shou

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2023. 16 pages, 10 figures, 13 tables. Code: https://github.com/showlab/UniVTG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07102 2023-08-15 cs.CV cs.CL cs.MM 79%

Temporal Sentence Grounding in Streaming Videos

Tian Gan, Xiao Wang, Yan Sun, Jianlong Wu, Qingpei Guo, Liqiang Nie

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10437 2023-08-10 cs.CV 79%

Grounding 3D Object Affordance from 2D Interactions in Images

Yuhang Yang, Wei Zhai, Hongchen Luo, Yang Cao, Jiebo Luo, Zheng-Jun Zha

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV2023, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04197 2023-08-09 cs.CV 79%

D3G: Exploring Gaussian Prior for Temporal Sentence Grounding with Glance Annotation

Hanjun Li, Xiujun Shu, Sunan He, Ruizhi Qiao, Wei Wen, Taian Guo, Bei Gan, Xing Sun

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13363 2023-07-26 cs.CV 79%

3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding

Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12392 2023-07-25 cs.CV 79%

Iterative Robust Visual Grounding with Masked Reference based Centerpoint Supervision

Menghao Li, Chunlei Wang, Wenquan Feng, Shuchang Lyu, Guangliang Cheng, Xiangtai Li, Binghao Liu, Qi Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00805 2023-07-25 cs.CV 79%

Betrayed by Captions: Joint Caption Grounding and Generation for Open Vocabulary Instance Segmentation

Jianzong Wu, Xiangtai Li, Henghui Ding, Xia Li, Guangliang Cheng, Yunhai Tong, Chen Change Loy

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11558 2023-07-24 cs.CV cs.CL 79%

Advancing Visual Grounding with Scene Knowledge: Benchmark and Method

Zhihong Chen, Ruifei Zhang, Yibing Song, Xiang Wan, Guanbin Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Computer Vision and Natural Language Processing. 21 pages, 14 figures. CVPR-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10567 2023-07-21 cs.CV 79%

No-frills Temporal Video Grounding: Multi-Scale Neighboring Attention and Zoom-in Boundary Detection

Qi Zhang, Sipeng Zheng, Qin Jin

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09267 2023-07-19 cs.CV 79%

Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding

Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05963 2023-07-13 cs.RO cs.CV 79%

GVCCI: Lifelong Learning of Visual Grounding for Language-Guided Robotic Manipulation

Junghyun Kim, Gi-Cheon Kang, Jaein Kim, Suyeon Shin, Byoung-Tak Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted at IROS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05873 2023-07-13 cs.CV 79%

OG: Equip vision occupancy with instance segmentation and visual grounding

Zichao Dong, Hang Ji, Weikun Zhang, Xufeng Huang, Junbo Chen

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04652 2023-06-09 cs.CV 79%

Language Adaptive Weight Generation for Multi-task Visual Grounding

Wei Su, Peihan Miao, Huanzhang Dou, Gaoang Wang, Liang Qiao, Zheyang Li, Xi Li

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.10918 2023-06-01 cs.CV cs.CL cs.IR 79%

CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding

Zhijian Hou, Wanjun Zhong, Lei Ji, Difei Gao, Kun Yan, Wing-Kwong Chan, Chong-Wah Ngo, Zheng Shou, Nan Duan

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ACL 2023 Camera Ready. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18993 2023-05-31 cs.CV 79%

ConES: Concept Embedding Search for Parameter Efficient Tuning Large Vision Language Models

Huahui Yi, Ziyuan Qin, Wei Xu, Miaotian Guo, Kun Wang, Shaoting Zhang, Kang Li, Qicheng Lao

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13359 2023-05-26 cs.CV cs.CL 79%

Towards Parameter-Efficient Integration of Pre-Trained Language Models In Temporal Video Grounding

Erica K. Shimomoto, Edison Marrese-Taylor, Hiroya Takamura, Ichiro Kobayashi, Hideki Nakayama, Yusuke Miyao

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted for Findings of ACL2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13668 2023-05-24 cs.CL cs.LG 79%

Grounding and Distinguishing Conceptual Vocabulary Through Similarity Learning in Embodied Simulations

Sadaf Ghaffari, Nikhil Krishnaswamy

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

Comments Accepted at IWCS Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.09071 2023-05-16 cs.CV 79%

Variational Cross-Graph Reasoning and Adaptive Structured Semantics Learning for Compositional Temporal Grounding

Juncheng Li, Siliang Tang, Linchao Zhu, Wenqiao Zhang, Yi Yang, Tat-Seng Chua, Fei Wu, Yueting Zhuang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2203.13049

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01588 2023-05-15 cs.CL cs.AI 79%

RHO ($ρ$): Reducing Hallucination in Open-domain Dialogues with Knowledge Grounding

Ziwei Ji, Zihan Liu, Nayeon Lee, Tiezheng Yu, Bryan Wilie, Min Zeng, Pascale Fung

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments accepted by ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04123 2023-05-09 cs.CV 79%

Transform-Equivariant Consistency Learning for Temporal Sentence Grounding

Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Zichuan Xu, Haozhao Wang, Xing Di, Weining Lu, Yu Cheng

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09736 2023-05-04 cs.CL cs.AI 79%

Don't Generate, Discriminate: A Proposal for Grounding Language Models to Real-World Environments

Yu Gu, Xiang Deng, Yu Su

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 18 pages, 6 figures, 6 tables; accepted to ACL'2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13130 2023-04-27 cs.CV 79%

Hypernymization of named entity-rich captions for grounding-based multi-modal pretraining

Giacomo Nebbia, Adriana Kovashka

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.08481 2023-04-26 cs.CL cs.CV 79%

Parallel Attention Network with Sequence Matching for Video Grounding

Hao Zhang, Aixin Sun, Wei Jing, Liangli Zhen, Joey Tianyi Zhou, Rick Siow Mong Goh

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 15 pages, 10 figures, 7 tables, Findings at ACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02556 2023-04-06 cs.CV 79%

Detecting and Grounding Multi-Modal Media Manipulation

Rui Shao, Tianxing Wu, Ziwei Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments CVPR 2023. Project page: https://rshaojimmy.github.io/Projects/MultiModal-DeepFake Code: https://github.com/rshaojimmy/MultiModal-DeepFake

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17647 2023-04-03 cs.CL cs.CV 79%

Detecting and Grounding Important Characters in Visual Stories

Danyang Liu, Frank Keller

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17018 2023-03-31 cs.AI 79%

System Predictor: Grounding Size Estimator for Logic Programs under Answer Set Semantics

Daniel Bresnahan, Nicholas Hippen, Yuliya Lierler

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏