arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2511.04678 2026-01-15 cs.CV 57%

Tracking and Understanding Object Transformations

跟踪和理解物体变换

Yihong Sun, Xinyu Yang, Jennifer J. Sun, Bharath Hariharan

机构 * Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出TubeletGraph系统,用于跟踪和理解物体在变换中的状态变化,并引入新的基准数据集VOST-TAS,以提升复杂物体变换的跟踪与理解能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04184 2026-01-15 cs.CV 57%

MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives

MedicalNarratives: 通过局部化叙述连接医学视觉与语言

Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MedicalNarratives通过局部化鼠标轨迹连接医学视觉与语言,训练出的GenMedClip在12个医学领域均优于现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08773 2026-01-14 cs.SE cs.AI 57%

Reliable Graph-RAG for Codebases: AST-Derived Graphs vs LLM-Extracted Knowledge Graphs

可靠的代码库图-RAG:基于AST的图与LLM提取的知识图谱

Manideep Reddy Chinthareddy

机构 * Software Engineer, Centerville, USA(美国辛斯维尔软件工程师)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文比较了基于AST的图谱和LLM提取的知识图谱在代码库中的检索性能,发现确定性AST图谱在索引成本和多跳推理方面更具优势。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 57%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08288 2026-01-14 cs.AI 57%

OpenMic: A Multi-Agent-Based Stand-Up Comedy Generation System

OpenMic: 基于多智能体的站立喜剧生成系统

Yuyang Wu, Hanzhong Cao, Jianhao Chen, Yufei Li

机构 * School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 OpenMic通过多智能体系统生成基于文化背景的站立喜剧,结合检索增强生成和专用JokeWriter提升幽默与节奏表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08040 2026-01-14 cs.CV 57%

Rescind: Countering Image Misconduct in Biomedical Publications with Vision-Language and State-Space Modeling

Rescind: 通过视觉-语言和状态空间建模对抗生物医学出版物中的图像不当行为

Soumyaroop Nandi, Prem Natarajan

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 Rescind通过视觉-语言和状态空间建模方法,提出首个生物医学图像伪造生成与检测框架,实现高精度伪造定位与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00406 2026-01-14 quant-ph cs.AI 57%

Quantum Machine Unlearning: Foundations, Mechanisms, and Taxonomy

量子机器遗忘:基础、机制与分类

Thanveer Shaik, Xiaohui Tao, Haoran Xie

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出量子机器遗忘的统一框架,结合物理约束、算法机制与伦理治理,通过五轴分类体系和实用机制设计,推动QMU在可验证性和伦理对齐方面的应用发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07290 2026-01-13 cs.CV 57%

VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

VideoLoom:一种用于联合空间-时间理解的视频大语言模型

Jiapeng Shi, Junke Wang, Zuyao You, Bo He, Zuxuan Wu

机构 * Fudan University(复旦大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07221 2026-01-13 cs.CV 57%

Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance

基于语义差异指导的多领域图像翻译

Jongwon Ryu, Joonhyung Park, Jaeho Han, Yeong-Seok Kim, Hye-rin Kim, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) Hyundai Mobis Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LACE通过语义差异指导实现多领域图像翻译,结合全局语义与局部结构特征融合及多领域控制机制,提升视觉翻译的保真度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06875 2026-01-13 cs.AI cs.CL 57%

An Ubuntu-Guided Large Language Model Framework for Cognitive Behavioral Mental Health Dialogue

以Ubuntu为指导的认知行为大型语言模型框架用于认知行为心理健康对话

Sontaga G. Forane, Absalom E. Ezugwu, Kevin Igwe, Karen van den Berg

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种结合Ubuntu哲学与认知行为疗法的AI心理健康对话系统,旨在提升非洲语境下的文化敏感性和治疗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23035 2026-01-13 cs.CV 57%

Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion

迈向稳定的半监督遥感分割:通过共引导与共混淆

Yi Zhou, Xuechao Zou, Shun Zhang, Kai Li, Shiying Wang, Jingming Chen, Congyan Lang, Tengfei Cao, Pin Tao, Yuanchun Shi

机构 * School of Computer Technology and Application, Qinghai University(青海大学计算机技术与应用学院) Intelligent Computing and Application Laboratory of Qinghai Province, Qinghai University(青海省智能计算与应用实验室,青海大学) Key Lab of Big Data & Artificial Intelligence in Transportation (Ministry of Education), School of Computer Science & Technology, Beijing Jiaotong University(交通运输大数据与人工智能重点实验室(教育部),北京交通大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Co2S框架,通过融合视觉-语言模型和自监督模型的先验知识,解决半监督遥感分割中的伪标签漂移问题,提升分割精度。

Comments 12 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06551 2026-01-13 cs.IR cs.AI cs.CL 57%

L-RAG: Balancing Context and Retrieval with Entropy-Based Lazy Loading

L-RAG:基于熵的惰性加载平衡上下文与检索

Sergii Voloshyn

机构 * Faculty of Computer Science and Cybernetics(计算机科学与自动化系) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) ClickUp(ClickUp公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 L-RAG通过基于熵的惰性加载机制,在准确率与效率之间提供可调节的权衡,有效减少检索开销并提升RAG系统的部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06496 2026-01-13 cs.CV 57%

3D CoCa v2: Contrastive Learners with Test-Time Search for Generalizable Spatial Intelligence

3D CoCa v2:基于测试时间搜索的对比学习用于通用空间智能

Hao Tang, Ting Huang, Zeyu Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 3D CoCa v2通过测试时间搜索提升3D场景描述的泛化能力,实现对比学习与描述生成的统一,提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06164 2026-01-13 cs.SE cs.AI 57%

Contract2Plan: Verified Contract-Grounded Retrieval-Augmented Optimization for BOM-Aware Procurement and Multi-Echelon Inventory Planning

Contract2Plan: 一种基于合同的验证性检索增强优化方法用于BOM感知采购和多层级库存规划

Sahil Agarwal

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Contract2Plan通过验证性检索增强优化方法,解决合同条款与BOM耦合导致的采购和库存规划问题,确保计划的可行性与合规性。

Comments 22 pages, 5 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06066 2026-01-13 cs.CY cs.AI 57%

TEAS: Trusted Educational AI Standard: A Framework for Verifiable, Stable, Auditable, and Pedagogically Sound Learning Systems

TEAS: 可信教育AI标准:可验证、稳定、可审计和教学上可靠的系统框架

Abu Syed

机构 * Abu Syed(阿布·赛德)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出TEAS框架,通过可验证性、稳定性、可审计性和教学合理性四个支柱,为教育AI系统提供可信度标准,强调系统架构而非模型能力的重要性。

Comments 19 pages, 6 tables, accepted at AAAI-26 (DAI Workshop) in Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18620 2026-01-09 cs.CV physics.comp-ph 57%

Spontaneous emergence of linguistic statistical laws in images via artificial neural networks

通过人工神经网络在图像中自发涌现语言统计规律

Ping-Rui Tsai, Chi-hsiang Wang, Yu-Cheng Liao, Hong-Yue Huang, Tzay-Ming Hong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 通过人工神经网络在图像中自发涌现语言统计规律,揭示图像处理能自动生成类似语言的统计特性。

Comments 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04715 2026-01-09 cs.CV 57%

On the Holistic Approach for Detecting Human Image Forgery

对人类图像伪造的总体方法

Xiao Guo, Jie Zhu, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

AI总结 HuForDet通过双分支架构,结合异构专家和多模态大语言模型,实现了对人类图像伪造的全面检测,提升了对各类伪造的检测性能和鲁棒性。

Comments 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06282 2026-01-09 cs.CV 57%

From Dataset to Real-world: General 3D Object Detection via Generalized Cross-domain Few-shot Learning

从数据集到现实世界:通过通用跨领域少样本学习实现通用3D目标检测

Shuangzhi Li, Junlong Shen, Lei Ma, Xingyu Li

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出通用跨领域少样本学习方法,通过融合2D语义与3D空间推理,实现对现实世界中常见和新类目标的高效检测。

Comments The latest version refines the few-shot setting on common classes, enforcing a stricter object-level definition

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03261 2026-01-08 cs.CL cs.AI 57%

DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing

DeepResearch-Slice: 通过显式文本切片弥合检索-利用差距

Shuo Lu, Yinuo Xu, Jianjie Cheng, Lingxiao He, Meng Wang, Jian Liang

机构 * NLPR & MAIS CASIA(CASIA NLPR与MAIS) School of AI UCAS(UCAS人工智能学院) Meituan Inc.(美团公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DeepResearch-Slice通过显式文本切片技术,有效解决检索与利用之间的差距问题,提升模型在嘈杂环境中的鲁棒性。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 57%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03195 2026-01-07 cs.LG 57%

Sparse Knowledge Distillation: A Mathematical Framework for Probability-Domain Temperature Scaling and Multi-Stage Compression

稀疏知识蒸馏:概率域温度缩放与多阶段压缩的数学框架

Aaron R. Flouro, Shawn P. Chadwick

机构 * PhD. research(博士研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出概率域温度缩放与多阶段压缩的数学框架,通过算子层面分析揭示稀疏学生优于密集教师的条件,并提供收敛保证与等价类特征化,为知识蒸馏和模型压缩提供理论支持。

Comments Machine learning theory. Develops an axiomatic, operator-agnostic framework for probability-domain knowledge distillation, including bias--variance analysis of sparse students, homotopy-based multi-stage pruning, $O(1/n)$ convergence guarantees, and equivalence classes of probability-domain softening operators. Theoretical analysis only

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02249 2026-01-06 cs.CV 57%

SLGNet: Synergizing Structural Priors and Language-Guided Modulation for Multimodal Object Detection

SLGNet: 结合结构先验与语言引导调制的多模态目标检测

Xiantai Xiang, Guangyao Zhou, Zixiao Wen, Wenshuai Li, Ben Niu, Feng Wang, Lijia Huang, Qiantong Wang, Yuhan Liu, Zongxu Pan, Yuxin Hu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 SLGNet通过结合结构先验与语言引导调制,在冻结的ViT基础上实现高效多模态目标检测,提升环境适应性和检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02065 2026-01-06 cs.CL cs.AI 57%

Cost-Efficient Cross-Lingual Retrieval-Augmented Generation for Low-Resource Languages: A Case Study in Bengali Agricultural Advisory

低成本的跨语言检索增强生成用于低资源语言:孟加拉语农业咨询案例研究

Md. Asif Hossain, Nabil Subhan, Mantasha Rahman Mahi, Jannatul Ferdous Nabila

机构 * Dept. of Computer Science and Engineering(计算机科学与工程系) East West University(东-西大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种低成本的跨语言检索增强生成框架,用于孟加拉语农业咨询,通过翻译和领域关键词注入提升生成质量,实现低资源语言下的高效农业知识访问。

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01878 2026-01-06 cs.AI cs.CY 57%

Theory Trace Card: Theory-Driven Socio-Cognitive Evaluation of LLMs

理论追溯卡:基于理论的社认知评估方法

Farzan Karimi-Malekabadi, Suhaib Abdurahman, Zhivar Sourati, Jackson Trager, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出理论追溯卡(TTC)以解决LLMs社会认知评估中理论基础缺失的问题,通过明确理论依据和能力组件,提升评估的可解释性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00994 2026-01-06 cs.AI cs.CY 57%

ElecTwit: A Framework for Studying Persuasion in Multi-Agent Social Systems

ElecTwit:多智能体社交系统中说服研究的框架

Michael Bao

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 ElecTwit通过模拟政治选举中的社交媒体互动,研究多智能体系统中说服现象的影响因素及不同模型架构对说服动态的作用。

Comments In proceedings of 2025 IEEE International Conference on Agentic AI (ICA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23413 2026-01-06 cs.CV 57%

Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment

弥合认知鸿沟:面向艺术图像美学评估的层次描述学习

Henglin Liu, Nisha Huang, Chang Liu, Jiangpeng Yan, Huijuan Huang, Jixuan Ying, Tong-Yee Lee, Pengfei Wan, Xiangyang Ji

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出RAD数据集和ArtQuant框架,通过联合描述生成和LLM解码器提升艺术图像美学评估的准确性和效率。

Comments AAAI2026,Project Page:https://github.com/Henglin-Liu/ArtQuant

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17229 2026-01-06 cs.CV 57%

Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos

视频侦探:通过反复寻找关键线索来回答长视频中的问题

Henghui Du, Chunjie Zhang, Xi Chen, Chang Zhou, Di Hu

机构 * Gaoling School of Artificial Intelligence(北京中国人民大学人工智能学院) Renmin University of China(中国人民大学) AI Technology Center Online Video Business Unit(人工智能技术中心在线视频业务部) Tencent PCG(腾讯PCG)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VideoDetective通过问题感知的记忆机制,使大语言模型能高效处理长视频问答任务,减少计算资源消耗并提升关键信息提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02565 2026-01-06 cs.CV 57%

SJTU:Spatial judgments in multimodal models towards unified segmentation through coordinate detection

上海交通大学:通过坐标检测实现多模态模型中的空间判断以实现统一分割

Joongwon Chae, Zhenyu Wang, Peiwu Qin

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SJTU通过坐标检测实现多模态模型中的空间判断,提升图像分割的准确性和实用性。

Comments A flaw was discovered in the experimental setup. Therefore, we are retracting the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00513 2026-01-05 cs.LG 57%

When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents

当小模型适用于错误的原因:信任代理的过程验证

Laksh Advani

机构 * Laksh Advani

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文揭示小型语言模型在推理过程中的可靠性问题,提出推理完整性评分,并展示RAG提升推理质量而元认知可能损害性能,强调过程验证对可信代理的重要性。

Comments Accepted to Trustagent workshop AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏