arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-18 至 2025-11-18 共收录 14 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 14 篇

2511.12220 2025-11-18 cs.CV cs.LG 86%

Suppressing VLM Hallucinations with Spectral Representation Filtering

Ameen Ali, Tamim Zoabi, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);LLaVA(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12638 2025-11-18 cs.CV cs.AI 86%

edgeVLM: Cloud-edge Collaborative Real-time VLM based on Context Transfer

Chen Qian, Xinran Yu, Zewen Huang, Danyang Li, Qiang Ma, Fan Dang, Xuan Ding, Guangyong Shang, Zheng Yang

机构 * Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学) Inspur Yunzhou Industrial Internet Co., Ltd(Inspur云洲工业互联网有限公司)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12140 2025-11-18 cs.CL cs.CV 83%

Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding

Pinxue Guo, Chongruo Wu, Xinyu Zhou, Lingyi Hong, Zhaoyu Chen, Jinglun Li, Kaixun Jiang, Sen-ching Samson Cheung, Wei Zhang, Wenqiang Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00411 2025-11-18 cs.CV cs.AI 73%

Does Bigger Mean Better? Comparitive Analysis of CNNs and Biomedical Vision Language Modles in Medical Diagnosis

Ran Tong, Jiaqi Liu, Tong Wang, Xin Hu, Su Liu, Lanruo Wang, Jiexi Xu

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者) Duke University(杜克大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Irvine(加州大学 Irvine 分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 6pages,3 figures.Uunder review of International Conference on Artificial Intelligence, Computer, Data Sciences and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12363 2025-11-18 cs.CV 70%

Explainable AI-Generated Image Detection RewardBench

Michael Yang, Shijian Deng, William T. Doan, Kai Wang, Tianyu Yang, Harsh Singh, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) University of Notre Dame(诺特大学) Stony Brook University(石溪大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13684 2025-11-18 cs.CV cs.LG 62%

Training-Free Multi-View Extension of IC-Light for Textual Position-Aware Scene Relighting

Jiangnan Ye, Jiedong Zhuang, Lianrui Mu, Wenjie Zheng, Jiaqi Hu, Xingze Zou, Jing Wang, Haoji Hu

机构 * College of Information Science(信息科学学院) Electronic Engineering, Zhejiang University, Hangzhou, 310027, Zhejiang, China(电子工程系,浙江大学,杭州,310027,浙江,中国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Submitting for Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03238 2025-11-18 eess.IV cs.AI cs.CV 62%

Rethinking Whole-Body CT Image Interpretation: An Abnormality-Centric Approach

Ziheng Zhao, Lisong Dai, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Radiology, Renmin Hospital of Wuhan University(武汉大学仁医院放射科)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01895 2025-11-18 cs.RO cs.CV cs.LG 62%

EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation

Siyuan Huang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Zhengkai Jiang, Yue Hu, Yue Liao, Peng Gao, Hongsheng Li, Maoqing Yao, Guanghui Ren

机构 * SJTU(上海交通大学) AgiBot Shanghai AI Lab(上海人工智能实验室) CUHK MMLab(香港大学多模态实验室) LV-NUS Lab(南洋理工大学-立陶宛实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted by NeurIPS 2025. Website: https://sites.google.com/view/enerverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11702 2025-11-18 cs.CV cs.AI eess.IV 62%

Task-Aware 3D Affordance Segmentation via 2D Guidance and Geometric Refinement

Lian He, Meng Liu, Qilang Ye, Yu Zhou, Xiang Deng, Gangyi Ding

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11583 2025-11-18 cs.LG cs.AI cs.IR 62%

Parallel and Multi-Stage Knowledge Graph Retrieval for Behaviorally Aligned Financial Asset Recommendations

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 3 figures, RAGE-KG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13242 2025-11-18 cs.CV 57%

MMD-Thinker: Adaptive Multi-Dimensional Thinking for Multimodal Misinformation Detection

Junjie Wu, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12404 2025-11-18 cs.MM cs.AI cs.SD 57%

SynthGuard: An Open Platform for Detecting AI-Generated Multimedia with Multimodal LLMs

Shail Desai, Aditya Pawar, Li Lin, Xin Wang, Shu Hu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12387 2025-11-18 cs.CL cs.AI 57%

From Phonemes to Meaning: Evaluating Large Language Models on Tamil

Jeyarajalingam Varsha, Menan Velayuthan, Sumirtha Karunakaran, Rasan Nivethiga, Kengatharaiyer Sarveswaran

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12020 2025-11-18 cs.CV 57%

LIHE: Linguistic Instance-Split Hyperbolic-Euclidean Framework for Generalized Weakly-Supervised Referring Expression Comprehension

Xianglong Shi, Silin Cheng, Sirui Zhao, Yunhan Jiang, Enhong Chen, Yang Liu, Sebastien Ourselin

机构 * University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学) King’s College London(伦敦国王学院) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏