arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-03 至 2025-10-03 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 6 篇

2510.02155 2025-10-03 cs.CV cs.AI 84%

Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting

Shu Zou, Xinyu Tian, Lukas Wesemann, Fabian Waschkowski, Zhaoyuan Yang, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) Maincode GE Research(通用电气研究)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 14 pages, video anomaly detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01954 2025-10-03 cs.CV 77%

Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs

Yongyi Su, Haojie Zhang, Shijie Li, Nanqing Liu, Jingyi Liao, Junyi Pan, Yuan Liu, Xiaofen Xing, Chong Sun, Chen Li, Nancy F. Chen, Shuicheng Yan, Xulei Yang, Xun Xu

机构 * South China University of Technology(华南理工大学) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究所(I 2 R),A*STAR) WeChat Vision, Tencent Inc.(微信视觉,腾讯公司) Foshan University(佛山大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 24 pages, 12 figures and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05288 2025-10-03 cs.CV cs.AI cs.RO 62%

PlaceIt3D: Language-Guided Object Placement in Real 3D Scenes

Ahmed Abdelreheem, Filippo Aleotti, Jamie Watson, Zawar Qureshi, Abdelrahman Eldesokey, Peter Wonka, Gabriel Brostow, Sara Vicente, Guillermo Garcia-Hernando

机构 * Niantic Spatial KAUST(科威特科学与技术研究中心) UCL(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025. Project page: https://nianticlabs.github.io/placeit3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14073 2025-10-03 stat.ML cs.AI cs.LG math.PR 62%

Neural Network Parameter-optimization of Gaussian pmDAGs

Mehrzad Saremi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02273 2025-10-03 cs.CV 57%

RS-OOD: A Vision-Language Augmented Framework for Out-of-Distribution Detection in Remote Sensing

Chenhao Wang, Yingrui Ji, Yu Meng, Yunjian Zhang, Yao Zhu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02044 2025-10-03 cs.CL cs.SD eess.AS 50%

Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage

Siddhant Arora, Haidar Khan, Kai Sun, Xin Luna Dong, Sajal Choudhary, Seungwhan Moon, Xinyuan Zhang, Adithya Sagar, Surya Teja Appini, Kaushik Patnaik, Sanat Sharma, Shinji Watanabe, Anuj Kumar, Ahmed Aly, Yue Liu, Florian Metze, Zhaojiang Lin

机构 * Meta Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏