arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-25 至 2026-02-25 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 18 篇

2602.20794 2026-02-25 cs.CV 89%

VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving

VGGDrive: 通过跨视角几何 grounding 为自动驾驶赋能 Vision-Language 模型

Jie Wang, Guang Li, Zhijian Huang, Chenxu Dang, Hangjun Ye, Yahong Han, Long Chen

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Xiaomi EV(小米汽车)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.CV

AI总结 VGGDrive通过引入跨视角几何 grounding 机制,提升Vision-Language模型在自动驾驶任务中的性能表现。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20658 2026-02-25 cs.CV cs.AI cs.HC cs.LG 85%

Vision-Language Models for Ergonomic Assessment of Manual Lifting Tasks: Estimating Horizontal and Vertical Hand Distances from RGB Video

用于手动搬运任务的视觉-语言模型:从RGB视频估计水平和垂直手距

Mohammad Sadra Rajabi, Aanuoluwapo Ojelade, Sunwook Kim, Maury A. Nussbaum

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型从RGB视频中非侵入性估计搬运任务的水平和垂直手距,通过两种多阶段管道验证了该方法的可行性,并展示了分割技术在减少误差方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20608 2026-02-25 cs.CV 83%

VAGNet: Grounding 3D Affordance from Human-Object Interactions in Videos

VAGNet: 从视频中的人-物体交互中接地3D affordance

Aihua Mao, Kaihang Huang, Yong-Jin Liu, Chee Seng Chan, Ying He

机构 * SCUT(华南理工大学) THU(清华大学) NTU(国立新加坡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 VAGNet通过视频引导的动态交互序列,实现3D affordance接地,提出PVAD数据集并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20639 2026-02-25 cs.AI 79%

Grounding LLMs in Scientific Discovery via Embodied Actions

通过具身动作 grounding LLMs 在科学发现中

Bo Zhang, Jinfeng Zhou, Yuxuan Chen, Jianing Yin, Minlie Huang, Hongning Wang

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 通过具身动作框架,LLMs在科学发现中实现更稳定的物理模拟和更高的建模准确性。

Comments 24 pages, 7 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19768 2026-02-25 cs.CV 79%

TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding

TraceVision: 一种具有轨迹感知能力的视觉-语言模型,用于类人空间理解

Fan Yang, Shurong Zheng, Hongyin Zhao, Yufei Zhan, Xin Li, Yousong Zhu, Chaoyang Zhao Ming Tang, Jinqiao Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 TraceVision通过整合轨迹感知的空间理解,实现了类人空间认知,提升视觉-语言模型在轨迹引导任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13314 2026-02-25 cs.CV cs.AI 76%

Sim2Radar: Toward Bridging the Radar Sim-to-Real Gap with VLM-Guided Scene Reconstruction

Sim2Radar:通过VLM引导的场景重建弥合雷达仿真到现实的差距

Emily Bejerano, Federico Tondolo, Ayaan Qayyum, Xiaofan Yu, Xiaofan Jiang

机构 * Columbia University(哥伦比亚大学) University of California, Merced(加州大学默塞德分校)

专题命中 视觉定位与Grounding :VLM(title);分类 cs.CV、cs.AI

AI总结 Sim2Radar通过VLM引导的场景重建,利用合成数据提升雷达感知性能,实现3D AP提升3.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21045 2026-02-25 cs.HC cs.CL 71%

PaperTrail: A Claim-Evidence Interface for Grounding Provenance in LLM-based Scholarly Q&A

PaperTrail: 一种用于在基于大语言模型的学术问答中建立溯源的声明-证据接口

Anna Martin-Boyle, Cara A. C. Leckey, Martha C. Brown, Harmanpreet Kaur

机构 * University of Minnesota(明尼苏达大学) NASA Langley Research Center(NASA兰利研究中心)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 PaperTrail通过分解LLM回答和源文档为声明与证据,帮助学术领域更严谨地验证LLM的可信度,并揭示其信任worthiness。

Comments 25 pages, 3 figures. Accepted at the ACM CHI conference on Human Factors in Computing Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20696 2026-02-25 cs.AI 70%

PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding

PromptCD:通过极性提示对比解码提升测试时行为

Baolong Bi, Yuyao Ge, Shenghua Liu, Yuchen He, Siqian Tong, Lizhe Chen, Lingrui Mei, Zehao Li, Yiwei Wang, Yujun Cai, Ming-Hsuan Yang, Xueqi Cheng

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 PromptCD通过极性提示对比解码在测试时提升LLM和VLM的行为一致性,实现无需额外训练的广泛增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20543 2026-02-25 cs.CV 70%

Beyond Human Performance: A Vision-Language Multi-Agent Approach for Quality Control in Pharmaceutical Manufacturing

超越人类表现:一种视觉-语言多智能体方法用于制药制造中的质量控制

Subhra Jyoti Mandal, Lara Rachidi, Puneet Jain, Matthieu Duvinage, Sander W. Timmer

机构 * GSK, Enterprise AI(葛兰素史克、企业人工智能) Databricks

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种结合深度学习与视觉-语言模型的多智能体框架,用于提高制药制造中菌落形成单位检测的准确性和效率,实现高质量的质量控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17905 2026-02-25 cs.HC cs.AI cs.CL cs.ET 57%

Games That Teach, Chats That Convince: Comparing Interactive and Static Formats for Persuasive Learning

教学式游戏,说服式对话:比较互动与静态格式在说服学习中的应用

Seyed Hossein Alavi, Zining Wang, Shruthi Chockkalingam, Raymond T. Ng, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能矢量研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文比较了互动和静态格式在说服学习中的效果,发现聊天机器人在提升感知重要性方面表现最佳,但基于文本的游戏在延迟测试中表现更优,揭示了说服体验与实际学习之间的脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20818 2026-02-25 cs.CV 57%

GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection

GatedCLIP:用于仇恨表情包检测的门控多模态融合

Yingying Guo, Ke Zhang, Zirong Zeng

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 GatedCLIP通过门控融合和对比学习提升多模态仇恨表情包检测性能,实现0.66 AUROC优于CLIP基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20423 2026-02-25 cs.CV cs.CL 57%

MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation

MedCLIPSeg: 基于概率视觉语言适应的数据高效且可泛化的医学图像分割

Taha Koleilat, Hojat Asgariandehkordi, Omid Nejati Manzari, Berardino Barile, Yiming Xiao, Hassan Rivaz

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MedCLIPSeg通过概率视觉语言适应方法,提升医学图像分割的数据效率和泛化能力,提供可解释的不确定性图。

Comments CVPR 2026; Project Page: https://tahakoleilat.github.io/MedCLIPSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 57%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20300 2026-02-25 cs.CL cs.AI 57%

What Makes a Good Query? Measuring the Impact of Human-Confusing Linguistic Features on LLM Performance

什么让一个查询良好?测量人类困惑语言特征对LLM性能的影响

William Watson, Nicole Cho, Sumitra Ganesh, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究通过分析查询特征对LLM幻觉的影响,揭示了特定语言特征与幻觉风险的关系,为优化查询设计提供依据。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20294 2026-02-25 cs.CL cs.AI cs.CY 57%

InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation

InterviewSim: 一种可扩展的基于面试的人格模拟框架

Yu Li, Pranav Narayanan Venkit, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce 研究)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 InterviewSim提出了一种基于真实面试数据的多维评估框架,通过系统比较证明基于真实访谈数据的方法在人格模拟中表现更优,并揭示了不同方法在人格风格与事实一致性方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20219 2026-02-25 cs.RO cs.AI 57%

An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction

一种结合视频和语音的大型语言模型在人机交互中的应用方法

Guanting Shen, Zi Tian

机构 * Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 本文提出结合视觉-语言模型、语音处理和模糊逻辑的多模态人机交互框架,通过语音指令实现机械臂的精准操控,实验显示命令执行准确率达75%,为未来人机协作提供灵活的基础。

Comments Preprint currently under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20683 2026-02-25 eess.SY cs.SY 50%

Grid-Mind: An LLM-Orchestrated Multi-Fidelity Agent for Automated Connection Impact Assessment

Grid-Mind: 一种基于LLM的多保真度代理用于自动化连接影响评估

Mohamed Shamseldein

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Grid-Mind是一种基于LLM的多保真度代理,通过自主协调电力系统模拟,实现自动化连接影响评估,具有高准确率和自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20183 2026-02-25 math.GM 50%

Quantile-Based Skewness for Fuzzy Numbers with Probabilistic Foundations: With an Application in Portfolio Optimization

基于分位数的模糊数偏度:具有概率基础的方法:在投资组合优化中的应用

Jan Schneider, Kaja Bilińska, Paul Schneider, Tomasz Szandała

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于分位数的模糊数偏度系数,通过概率基础解决模糊数不对称性量化问题,并在投资组合优化中展示其计算效率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏