arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2602.21735 2026-02-26 cs.CV 57%

SigVLP: Sigmoid Volume-Language Pre-Training for Self-Supervised CT-Volume Adaptive Representation Learning

SigVLP:基于sigmoid体积-语言预训练的自监督CT体积自适应表示学习

Jiayi Wang, Hadrien Reynaud, Ibrahim Ethem Hamamci, Sezgin Er, Suprosanna Shit, Bjoern Menze, Bernhard Kainz

机构 * Friedrich-Alexander University Erlangen-Nürnberg(弗里德里希-亚历山大大学埃尔兰根-纽伦堡) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院AI中心) International School of Medicine, Istanbul Medipol University(伊斯坦布尔梅迪波尔大学国际医学院) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SigVLP通过引入旋转位置嵌入和块级对齐方法,改进CT体积与文本的自监督表示学习,提升文本到体积对齐的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21716 2026-02-26 cs.CV 57%

TranX-Adapter: Bridging Artifacts and Semantics within MLLMs for Robust AI-generated Image Detection

TranX-Adapter: 在MLLMs中弥合artifact与语义以实现鲁棒的AI生成图像检测

Wenbin Wang, Yuge Huang, Jianqing Xu, Yue Yu, Jiangtao Yan, Shouhong Ding, Pan Zhou, Yong Luo

机构 * Wuhan University(武汉大学) Tencent YouTu Lab(腾讯YouTu实验室) Singapore Management University(新加坡管理学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 TranX-Adapter通过引入任务感知的最优传输融合和X-Fusion机制,在MLLMs中提升AI生成图像检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21598 2026-02-26 cs.IR cs.AI 57%

Retrieval Challenges in Low-Resource Public Service Information: A Case Study on Food Pantry Access

低资源公共信息服务中的检索挑战:食品储藏室访问案例研究

Touseef Hasan, Laila Cure, Souvika Sarkar

机构 * Wichita State University(威斯科州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的对话式检索系统,用于解决低资源环境下食品储藏室信息检索的挑战,通过RAG流程提升自然语言查询的准确性与可靠性。

Comments 3 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17905 2026-02-25 cs.HC cs.AI cs.CL cs.ET 57%

Games That Teach, Chats That Convince: Comparing Interactive and Static Formats for Persuasive Learning

教学式游戏,说服式对话:比较互动与静态格式在说服学习中的应用

Seyed Hossein Alavi, Zining Wang, Shruthi Chockkalingam, Raymond T. Ng, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能矢量研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文比较了互动和静态格式在说服学习中的效果,发现聊天机器人在提升感知重要性方面表现最佳,但基于文本的游戏在延迟测试中表现更优,揭示了说服体验与实际学习之间的脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20818 2026-02-25 cs.CV 57%

GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection

GatedCLIP:用于仇恨表情包检测的门控多模态融合

Yingying Guo, Ke Zhang, Zirong Zeng

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 GatedCLIP通过门控融合和对比学习提升多模态仇恨表情包检测性能,实现0.66 AUROC优于CLIP基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20423 2026-02-25 cs.CV cs.CL 57%

MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation

MedCLIPSeg: 基于概率视觉语言适应的数据高效且可泛化的医学图像分割

Taha Koleilat, Hojat Asgariandehkordi, Omid Nejati Manzari, Berardino Barile, Yiming Xiao, Hassan Rivaz

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MedCLIPSeg通过概率视觉语言适应方法,提升医学图像分割的数据效率和泛化能力,提供可解释的不确定性图。

Comments CVPR 2026; Project Page: https://tahakoleilat.github.io/MedCLIPSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 57%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20300 2026-02-25 cs.CL cs.AI 57%

What Makes a Good Query? Measuring the Impact of Human-Confusing Linguistic Features on LLM Performance

什么让一个查询良好?测量人类困惑语言特征对LLM性能的影响

William Watson, Nicole Cho, Sumitra Ganesh, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究通过分析查询特征对LLM幻觉的影响,揭示了特定语言特征与幻觉风险的关系,为优化查询设计提供依据。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20294 2026-02-25 cs.CL cs.AI cs.CY 57%

InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation

InterviewSim: 一种可扩展的基于面试的人格模拟框架

Yu Li, Pranav Narayanan Venkit, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce 研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 InterviewSim提出了一种基于真实面试数据的多维评估框架,通过系统比较证明基于真实访谈数据的方法在人格模拟中表现更优,并揭示了不同方法在人格风格与事实一致性方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20219 2026-02-25 cs.RO cs.AI 57%

An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction

一种结合视频和语音的大型语言模型在人机交互中的应用方法

Guanting Shen, Zi Tian

机构 * Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 本文提出结合视觉-语言模型、语音处理和模糊逻辑的多模态人机交互框架,通过语音指令实现机械臂的精准操控,实验显示命令执行准确率达75%,为未来人机协作提供灵活的基础。

Comments Preprint currently under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20040 2026-02-24 cs.CL cs.AI 57%

AgenticSum: An Agentic Inference-Time Framework for Faithful Clinical Text Summarization

AgenticSum: 一种用于临床文本忠实总结的代理推理框架

Fahmida Liza Piya, Rahmatollah Beheshti

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) University of Delaware, Newark, DE, USA(特拉华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19308 2026-02-24 cs.RO cs.CV 57%

WildOS: Open-Vocabulary Object Search in the Wild

WildOS: 野外环境中的开放词汇物体搜索

Hardik Shah, Erica Tevere, Deegan Atha, Marcel Kaufmann, Shehryar Khattak, Manthan Patel, Marco Hutter, Jonas Frey, Patrick Spieler

机构 * Jet Propulsion Laboratory(喷气推进实验室) California Institute of Technology(加州理工学院) Swiss Federal Institute of Technology(瑞士联邦理工学院) ETH Zürich(苏黎世联邦理工学院) FieldAI Inc.(FieldAI公司) Stanford University(斯坦福大学) University of California Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.CV

AI总结 WildOS通过结合安全几何探索与语义视觉推理,实现野外环境中的开放词汇物体搜索,显著提升导航效率和自主性。

Comments 28 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19254 2026-02-24 cs.CV 57%

RegionRoute: Regional Style Transfer with Diffusion Model

RegionRoute: 区域风格迁移与扩散模型

Bowen Chen, Jake Zuena, Alan C. Bovik, Divya Kothandaraman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Dolby Laboratories, Inc.(杜比实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 RegionRoute提出一种注意力监督的扩散框架,通过训练对齐风格标记的注意力分数与对象掩码,实现精确的区域风格迁移,提升风格应用的局部化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18943 2026-02-24 cs.AI 57%

High Dimensional Procedural Content Generation

高维程序化内容生成

Kaijie Xu, Clark Verbrugge

机构 * McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 高维程序化内容生成通过引入非几何游戏维度作为联合状态空间的一级坐标,提升可控性和表现力,实现更广泛的游戏机制生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18811 2026-02-24 cs.CV 57%

Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection

跨域少样本目标检测中的多模态原型学习

Wanqi Wang, Jingcai Guo, Yuxiang Cai, Zhi Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) The University of Southern Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出LMP方法,通过结合文本和视觉信息,提升跨域少样本目标检测的精度和性能。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12268 2026-02-24 cs.AI 57%

CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use

CM2:基于检查清单奖励的多轮多步代理工具使用的强化学习

Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 CM2通过检查清单奖励提升多轮多步骤代理工具使用的强化学习效果,实现比监督微调更优的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04847 2026-02-24 cs.LG 57%

Test-Time Adaptation for LLM Agents via Environment Interaction

通过环境交互实现LLM代理的测试时适应

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

机构 * University of Waterloo(滑铁卢大学) Salesforce AI Research(Salesforce AI研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。

Comments Our code is available here: https://github.com/r2llab/GTTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10164 2026-02-23 cs.AI cs.SC 57%

Two Constraint Compilation Methods for Lifted Planning

用于提升规划的两种约束编译方法

Periklis Mantenoglou, Luigi Bonassi, Enrico Scala, Pedro Zuidberg Dos Martires

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出两种无需地面化的约束编译方法,用于提升大规模规划问题的效率和规范简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17913 2026-02-23 cs.DB cs.AI 57%

From Lossy to Verified: A Provenance-Aware Tiered Memory for Agents

从损失到验证:一种面向代理的分层内存

Qiming Zhu, Shunian Chen, Rui Yu, Zhehao Wu, Benyou Wang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TierMem 提出了一种面向代理的分层内存框架,通过双层内存结构在推理时分配证据,以降低 token 消耗和延迟,提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17799 2026-02-23 cs.CV 57%

Enabling Training-Free Text-Based Remote Sensing Segmentation

无需训练的基于文本的遥感分割

Jose Sosa, Danila Rukhovich, Anis Kacem, Djamila Aouada

机构 * SnT, University of Luxembourg(SnT,卢森堡大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本研究提出无需额外训练的遥感分割方法,结合对比和生成型VLMs与SAM,实现零样本开放词汇语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17386 2026-02-20 cs.AI cs.IR 57%

Visual Model Checking: Graph-Based Inference of Visual Routines for Image Retrieval

视觉模型检查:基于图的图像检索中的视觉例行程序推断

Adrià Molina, Oriol Ramos Terrades, Josep Lladós

机构 * Centre de Visió per Computador(视觉计算中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种结合图基验证与神经代码生成的框架,用于提升图像检索中复杂查询的可信度和可验证性。

Comments Submitted for ICPR Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16650 2026-02-19 cs.CE cs.AI 57%

Retrieval Augmented Generation of Literature-derived Polymer Knowledge: The Example of a Biodegradable Polymer Expert System

文献衍生聚合物知识的检索增强生成:生物降解聚合物专家系统的例子

Sonakshi Gupta, Akhlak Mahmood, Wei Xiong, Rampi Ramprasad

机构 * School of Computational Science and Engineering(计算科学与工程学院) Georgia Institute of Technology(佐治亚理工学院) Matmerize, Inc.(Matmerize公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于检索增强生成的聚合物知识系统,通过构建结构化知识图谱和语义向量方法,提升生物降解聚合物领域的文献检索与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10067 2026-02-19 cs.LG 57%

Features as Rewards: Scalable Supervision for Open-Ended Tasks via Interpretability

特征作为奖励:通过可解释性实现开放性任务的可扩展监督

Aaditya Vikram Prasad, Connor Watts, Jack Merullo, Dhruvil Gala, Owen Lewis, Thomas McGrath, Ekdeep Singh Lubana

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出通过特征作为奖励实现开放性任务的可扩展监督,利用强化学习流程减少幻觉并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15556 2026-02-18 cs.CV 57%

Revealing and Enhancing Core Visual Regions: Harnessing Internal Attention Dynamics for Hallucination Mitigation in LVLMs

揭示并增强核心视觉区域:利用内部注意力动态缓解LVLMs中的幻觉

Guangtao Lyu, Qi Liu, Chenghao Xu, Jiexi Yan, Muli Yang, Xueting Li, Fen Fang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) College of Computer and Information, Hohai University(河海大学计算机与信息学院) Institute for Infocomm Research, A*STAR(A*STAR信息与通信研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 PADE通过构建PAD图和系统令牌补偿,利用内部注意力动态提升LVLMs的视觉定位能力并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17812 2026-02-18 cs.CL cs.LG 57%

Can Multimodal LLMs Perform Time Series Anomaly Detection?

多模态大语言模型能否进行时间序列异常检测?

Xiongxiao Xu, Haoran Wang, Yueqing Liang, Philip S. Yu, Yue Zhao, Kai Shu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.LG

AI总结 本研究提出基于多代理框架的TSAD-Agents,利用多模态大语言模型实现自动时间序列异常检测。

Comments ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15461 2026-02-18 cs.CV 57%

Emergent Morphing Attack Detection in Open Multi-modal Large Language Models

开放多模态大语言模型中的涌现形变攻击检测

Marija Ivanovska, Vitomir Štruc

机构 * Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出利用开源多模态大语言模型进行零样本人脸形变攻击检测,通过实验表明其在无微调情况下具备优异的判别能力,性能超越传统基线23%。

Comments This manuscript is currently under review at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19692 2026-02-18 cs.SE cs.AI cs.MA 57%

Toward Agentic Software Engineering Beyond Code: Framing Vision, Values, and Vocabulary

迈向超越代码的代理软件工程:构架视野、价值观和词汇

Rashina Hoda

机构 * Monash University(墨尔本大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出代理软件工程应超越代码,构建全过程愿景,基于SE基础和新兴框架,提出价值观和原则,并指导词汇设计,推动SE范式转变。

Comments 5 pages

Journal ref Rashina Hoda, Toward agentic software engineering beyond code: Framing vision, values, and vocabulary. In 2026 IEEE/ACM 48th International Conference on Software Engineering: Companion Proceedings (ICSE-Companion), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14929 2026-02-17 cs.CV 57%

Wrivinder: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery

Wrivinder:迈向空间智能:将地面图像定位到卫星图像

Chandrakanth Gudavalli, Tajuddin Manhar Mohammed, Abhay Yadav, Ananth Vishnu Bhaskar, Hardik Prajapati, Cheng Peng, Rama Chellappa, Shivkumar Chandrasekaran, B. S. Manjunath

机构 * Mayachitra, Inc.(Mayachitra公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Wrivinder通过聚合地面影像与卫星图像,实现零样本的几何驱动定位,提供首个全面的跨视角对齐基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14890 2026-02-17 cs.AI 57%

Lifted Relational Probabilistic Inference via Implicit Learning

通过隐式学习实现提升的关系概率推断

Luise Ge, Brendan Juba, Kris Nilsson, Alison Shao

机构 * Washington University in St. Louis(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于隐式学习的方法,实现第一-order概率逻辑的隐式学习和提升推断,解决了传统方法在模型构建上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏