arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-19 至 2026-01-19 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 8 篇

2312.03543 2026-01-19 cs.CV cs.AI 81%

GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models

GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型

Haicheng Liao, Huanming Shen, Zhenning Li, Chengyue Wang, Guofa Li, Yiming Bie, Chengzhong Xu

机构 * Univ City(大学城市)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。

Journal ref Communications in Transportation Research 4 (2024) 100116

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06899 2026-01-19 cs.AI 79%

V2P: Visual Attention Calibration for GUI Grounding via Background Suppression and Center Peaking

V2P: 通过背景抑制和中心峰值校准实现GUI定位的视觉注意力校准

Jikai Chen, Long Chen, Dong Wang, Qinglin Su, Zhixuan Chu, Bingguang Hao, Leilei Gan, Chenyi Zhuang, Jinjie Gu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 V2P通过背景抑制和中心峰值校准方法提升GUI元素定位精度,实现更精确的GUI交互。

Comments This work was intended as a replacement of arXiv:2508.13634 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02358 2026-01-19 cs.CV 77%

VINO: A Unified Visual Generator with Interleaved OmniModal Context

VINO:一个具有交错多模态上下文的统一视觉生成器

Junyi Chen, Tong He, Zhoujie Fu, Pengfei Wan, Kun Gai, Weicai Ye

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 VINO通过统一的视觉生成框架实现图像和视频的生成与编辑,利用交错多模态上下文条件处理,提升多任务视觉创作能力。

Comments Project page: https://sotamak1r.github.io/VINO-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06204 2026-01-19 cs.CV cs.MA 74%

Cascading multi-agent anomaly detection in surveillance systems via vision-language models and embedding-based classification

通过视觉-语言模型和基于嵌入的分类实现监视系统中的级联多代理异常检测

Tayyab Rehman, Giovanni De Gasperis, Aly Shmahell

机构 * University of L’Aquila(拉奎拉大学) SPEE S.R.L(SPEE公司)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 本文提出一种级联多代理框架,结合视觉-语言模型和嵌入分类,实现高效且可解释的异常检测,减少延迟并提升监控系统性能。

Comments Author email changed, Acknowlegement changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11514 2026-01-19 cs.CV cs.LG 62%

ShapeR: Robust Conditional 3D Shape Generation from Casual Captures

ShapeR: 从随意捕获序列中生成鲁棒的条件3D形状

Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Henry Howard-Jenkins, Daniel DeTone, Pierre Moulon, Qirui Wu, Zhengqin Li, Julian Straub, Richard Newcombe, Jakob Engel

机构 * Meta Reality Labs Research(Meta现实实验室) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 ShapeR通过整合视觉-惯性SLAM、3D检测和视觉-语言模型,从随意捕获的序列中生成鲁棒的条件3D形状,实验显示其在Chamfer距离上优于现有方法2.7倍。

Comments Project Page: http://facebookresearch.github.io/ShapeR Video: https://www.youtube.com/watch?v=EbY30KAA55I

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03585 2026-01-19 cs.CV cs.AI cs.CL 62%

Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation

Causal-SAM-LLM:大型语言模型作为因果推理器用于稳健的医学分割

Tao Tang, Shijie Xu, Jionglong Su, Zhixiang Lu

机构 * City University of Hong Kong, Hong Kong, China(香港城市大学) Xi’an Jiaotong-liverpool University, Suzhou, China(西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Causal-SAM-LLM利用大型语言模型作为因果推理器,提升医学图像分割的鲁棒性和泛化能力。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23044 2026-01-19 cs.CV 57%

Video-Browser: Towards Agentic Open-web Video Browsing

Video-Browser: 向具有代理能力的开放网页视频浏览迈进

Zhengyang Liang, Yan Shu, Xiangrui Liu, Minghao Qin, Kaixin Liang, Nicu Sebe, Zheng Liu, Lizi Liao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Video-Browser通过金字塔感知技术,在开放式网络视频浏览中实现37.5%的相对提升,同时减少58.3%的token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22753 2026-01-19 cs.CL 50%

Opportunities and Challenges of LLMs in Education: An NLP Perspective

大语言模型在教育中的机遇与挑战:一种自然语言处理视角

Sowmya Vajjala, Bashar Alhafni, Stefano Bannò, Kaushal Kumar Maurya, Ekaterina Kochmar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文从自然语言处理视角探讨大语言模型在教育中的应用,分析其在教学、学习和评估中的机遇与挑战。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏