arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-13 至 2026-01-13 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 17 篇

2601.06847 2026-01-13 cs.CV cs.AI 88%

MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data

MedGround: 通过验证的 grounding 数据弥合医学视觉-语言模型中的证据差距

Mengmeng Zhang, Xiaoping Wu, Hao Luo, Fan Wang, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Hupan Lab, Zhejiang Province(浙江省 Hupan 实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 MedGround通过生成高质量的医学指称 grounding 数据,提升视觉-语言模型在临床场景中的定位和泛化能力。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07291 2026-01-13 cs.CV cs.AI 84%

A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model

基于前缀微调的视觉语义自适应水印

Qi Zheng, Shuliang Liu, Yu Huang, Sihang Jia, Jungang Li, Lyuhao Chen, Junhao Chen, Hanqian Li, Aiwei Liu, Yibo Yan, Xuming Hu

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VISA-Mark,一种基于前缀微调的视觉语义自适应水印方法,通过动态视觉证据权重提升视觉与语义保真度,实现高效且可靠的多模态水印技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20876 2026-01-13 cs.RO 82%

Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task

本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用

Kanata Suzuki, Shota Shimizu, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University(工学部,早稻田大学) Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract)

AI总结 本研究通过引入本体感知数据,提升视觉语言模型在机器人任务描述和子任务分割中的性能,以增强机器人模仿学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07645 2026-01-13 cs.CL 78%

PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs

PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义

Zijing Wang, Yongkang Liu, Mingyang Wang, Ercong Nie, Deyuan Chen, Zhengjie Zhao, Shi Feng, Daling Wang, Xiaocui Yang, Yifei Zhang, Hinrich Schütze

机构 * Northeastern University, China(东北大学) CIS, LMU Munich, Germany(慕尼黑大学计算机学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)

专题命中 视觉定位与Grounding :grounding(title);multimodal large language model(abstract)

AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07795 2026-01-13 cs.CV 74%

Vision-Language Model for Accurate Crater Detection

面向准确陨石坑检测的视觉-语言模型

Patrick Bauer, Marius Schwinning, Florian Renk, Andreas Weinmann, Hichem Snoussi

机构 * University of Technology of Troyes(图卢兹技术大学) Hochschule Darmstadt(达姆施塔特应用科学大学) GMV for European Space Agency(欧洲航天局GMV) European Space Agency(欧洲航天局) Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施韦因富特技术大学)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 本文提出基于Vision Transformer的深度学习模型,用于在复杂月球成像条件下实现高精度陨石坑检测,通过低秩适应策略和组合损失函数提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25263 2026-01-13 cs.CV 70%

LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation

LangHOPS: 语言引导的层次开放词汇部件分割

Yang Miao, Jan-Nico Zaech, Xi Wang, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧里迪斯基") ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 LangHOPS通过多模态大语言模型实现开放词汇物体-部件实例分割,取得领域内和跨数据集的优异性能。

Comments 10 pages, 5 figures, 14 tables, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 62%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05269 2026-01-13 cs.IR cs.CV cs.LG 62%

Studying Illustrations in Manuscripts: An Efficient Deep-Learning Approach

研究手稿中的插图:一种高效的深度学习方法

Yoav Evron, Michal Bar-Asher Siegal, Michael Fire

机构 * Faculty of Computer and Information Science, Ben-Gurion University of the Negev, Be’er Sheva, Israel(计算机与信息科学学院,内盖夫本· Gurion大学,贝尔谢巴,以色列) The Goldstein-Goren Department of Jewish Thought, Ben-Gurion University of the Negev, Be’er Sheva, Israel(犹太思想Goldstein-Goren部门,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种高效的深度学习方法,用于大规模分析历史插图手稿,通过多模态描述和共享表示空间揭示视觉模式和跨手稿关系。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06781 2026-01-13 cs.HC cs.AI cs.CV 62%

AutoTour: Automatic Photo Tour Guide with Smartphones and LLMs

AutoTour:基于智能手机和LLMs的自动照片导览系统

Huatao Xu, Zihe Liu, Zilin Zeng, Baichuan Li, Mo Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 AutoTour利用智能手机和LLMs自动为用户照片生成细粒度地标注释和描述,实现可扩展且上下文感知的交互式探索体验。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07290 2026-01-13 cs.CV 57%

VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

VideoLoom:一种用于联合空间-时间理解的视频大语言模型

Jiapeng Shi, Junke Wang, Zuyao You, Bo He, Zuxuan Wu

机构 * Fudan University(复旦大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07221 2026-01-13 cs.CV 57%

Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance

基于语义差异指导的多领域图像翻译

Jongwon Ryu, Joonhyung Park, Jaeho Han, Yeong-Seok Kim, Hye-rin Kim, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Hyundai Mobis Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LACE通过语义差异指导实现多领域图像翻译,结合全局语义与局部结构特征融合及多领域控制机制,提升视觉翻译的保真度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06875 2026-01-13 cs.AI cs.CL 57%

An Ubuntu-Guided Large Language Model Framework for Cognitive Behavioral Mental Health Dialogue

以Ubuntu为指导的认知行为大型语言模型框架用于认知行为心理健康对话

Sontaga G. Forane, Absalom E. Ezugwu, Kevin Igwe, Karen van den Berg

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种结合Ubuntu哲学与认知行为疗法的AI心理健康对话系统,旨在提升非洲语境下的文化敏感性和治疗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23035 2026-01-13 cs.CV 57%

Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion

迈向稳定的半监督遥感分割:通过共引导与共混淆

Yi Zhou, Xuechao Zou, Shun Zhang, Kai Li, Shiying Wang, Jingming Chen, Congyan Lang, Tengfei Cao, Pin Tao, Yuanchun Shi

机构 * School of Computer Technology and Application, Qinghai University(青海大学计算机技术与应用学院) Intelligent Computing and Application Laboratory of Qinghai Province, Qinghai University(青海省智能计算与应用实验室,青海大学) Key Lab of Big Data & Artificial Intelligence in Transportation (Ministry of Education), School of Computer Science & Technology, Beijing Jiaotong University(交通运输大数据与人工智能重点实验室(教育部),北京交通大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Co2S框架,通过融合视觉-语言模型和自监督模型的先验知识,解决半监督遥感分割中的伪标签漂移问题,提升分割精度。

Comments 12 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06551 2026-01-13 cs.IR cs.AI cs.CL 57%

L-RAG: Balancing Context and Retrieval with Entropy-Based Lazy Loading

L-RAG:基于熵的惰性加载平衡上下文与检索

Sergii Voloshyn

机构 * Faculty of Computer Science and Cybernetics(计算机科学与自动化系) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) ClickUp(ClickUp公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 L-RAG通过基于熵的惰性加载机制,在准确率与效率之间提供可调节的权衡,有效减少检索开销并提升RAG系统的部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06496 2026-01-13 cs.CV 57%

3D CoCa v2: Contrastive Learners with Test-Time Search for Generalizable Spatial Intelligence

3D CoCa v2:基于测试时间搜索的对比学习用于通用空间智能

Hao Tang, Ting Huang, Zeyu Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 3D CoCa v2通过测试时间搜索提升3D场景描述的泛化能力,实现对比学习与描述生成的统一,提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06164 2026-01-13 cs.SE cs.AI 57%

Contract2Plan: Verified Contract-Grounded Retrieval-Augmented Optimization for BOM-Aware Procurement and Multi-Echelon Inventory Planning

Contract2Plan: 一种基于合同的验证性检索增强优化方法用于BOM感知采购和多层级库存规划

Sahil Agarwal

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Contract2Plan通过验证性检索增强优化方法,解决合同条款与BOM耦合导致的采购和库存规划问题,确保计划的可行性与合规性。

Comments 22 pages, 5 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06066 2026-01-13 cs.CY cs.AI 57%

TEAS: Trusted Educational AI Standard: A Framework for Verifiable, Stable, Auditable, and Pedagogically Sound Learning Systems

TEAS: 可信教育AI标准:可验证、稳定、可审计和教学上可靠的系统框架

Abu Syed

机构 * Abu Syed(阿布·赛德)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出TEAS框架,通过可验证性、稳定性、可审计性和教学合理性四个支柱,为教育AI系统提供可信度标准,强调系统架构而非模型能力的重要性。

Comments 19 pages, 6 tables, accepted at AAAI-26 (DAI Workshop) in Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏