arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2509.24506 2026-03-16 cs.CL 50%

Building Benchmarks from the Ground Up: Community-Centered Evaluation of LLMs in Healthcare Chatbot Settings

从底层构建基准:面向医疗聊天机器人场景的社区中心评估

Hamna Hamna, Gayatri Bhat, Sourabrata Mukherjee, Faisal Lalani, Evan Hadfield, Divya Siddarth, Kalika Bali, Sunayana Sitaram

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Samiksha社区驱动评估流程,通过与社会组织和社区成员合作,实现医疗领域LLM的可扩展自动化评估,强调文化意识和社区反馈在构建基准中的作用。

Comments Accepted at ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11997 2026-03-12 cs.CL 50%

SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation

SAGE: 一种面向多轮智能体评估的上下文知识引导用户模拟器

Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SAGE通过整合业务上下文知识,提出一种多轮智能体评估的用户模拟框架,生成更真实的交互并提高错误检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07304 2026-03-12 cs.DB 50%

Tursio for Credit Unions: Structured Data Search with Automated Context Graphs

Tursio 用于信用社:基于自动上下文图的结构化数据搜索

Shivani Tripathi, Ravi Shetye, Shi Qiao, Alekh Jindal

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Tursio 通过自动上下文图技术,实现信用社等受监管行业结构化数据的自然语言查询与高效搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09891 2026-03-11 cs.IR 50%

Overview of the TREC 2025 Retrieval Augmented Generation (RAG) Track

TREC 2025检索增强生成(RAG)赛道概述

Shivani Upadhyay, Nandan Thakur, Ronak Pradeep, Nick Craswell, Daniel Campos, Jimmy Lin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 TREC 2025 RAG赛道通过多句叙述查询和多层次评估框架,推动检索增强生成系统的可信与上下文感知创新。

Comments 21 pages, 8 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09497 2026-03-11 cs.SE 50%

EmbC-Test: How to Speed Up Embedded Software Testing Using LLMs and RAG

EmbC-Test: 如何利用LLMs和RAG加速嵌入式软件测试

Maximilian Harnot, Sebastian Komarnicki, Michal Polok, Timo Oksanen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出利用LLMs和RAG技术,通过生成自动测试用例,显著提高嵌入式软件测试效率,节省66%的测试时间并每小时生成270个测试用例。

Journal ref Technical University of Munich. 2026. ISBN 978-3-911430-12-8. https://mediatum.ub.tum.de/1846559

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08519 2026-03-10 cs.RO 50%

AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models

AtomVLA: 通过预测性潜在世界模型实现机器人操作的可扩展后训练

Xiaoquan Sun, Zetian Xu, Chen Cao, Zonghe Liu, Yihan Sun, Jingrui Pang, Ruijian Zhang, Zhen Yang, Kang Pang, Dingxin He, Mingqi Yuan, Jiayu Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 AtomVLA通过预测性潜在世界模型实现机器人操作的可扩展后训练,提升长时间任务的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10918 2026-03-10 cs.HC cs.CL 50%

CompanionCast: Toward Social Collaboration with Multi-Agent Systems in Shared Experiences

CompanionCast:迈向多智能体系统在共享体验中的社会协作

Yiyang Wang, Chen Chen, Tica Lin, Vishnu Raj, Josh Kimball, Alex Cabral, Josiah Hester

机构 * Georgia Institute of Technology(佐治亚理工学院) Dolby Laboratories, Inc.(杜比实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CompanionCast通过多智能体系统提升共享体验中的社会协作,通过多模态检测、上下文缓存和空间音频增强共在感,实验显示其在体育观看中显著提升社会存在感和情感共享。

Comments Accepted at ACM CHI 2026 Workshop on Human-Agent Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07279 2026-03-10 q-bio.QM 50%

Learning When to Look: On-Demand Keypoint-Video Fusion for Animal Behavior Analysis

学习何时观察:按需关键点-视频融合用于动物行为分析

Weihan Li, Jingyang Ke, Yule Wang, Chengrui Li, Anqi Wu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LookAgain通过按需视觉定位结合关键点与视频数据,实现高效且低计算成本的动物行为分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06918 2026-03-10 cs.RO 50%

T2Nav Algebraic Topology Aware Temporal Graph Memory and Loop Detection for ZeroShot Visual Navigation

T2Nav 基于代数拓扑的时序图记忆与循环检测用于零样本视觉导航

Quang-Anh N. D., Duc Pham, Minh-Anh Nguyen, Tung Doan, Tuan Dang

机构 * International School, Vietnam National University, Hanoi, Vietnam(越南国家大学河内国际学校) Hanoi University of Science, Vietnam National University, Hanoi, Vietnam(越南国家大学河内科学大学) Hanoi University of Science and Technology, Hanoi, Vietnam(河内科学技术大学) Cognitive Robotics Lab, Department of Electrical Engineering and Computer Science, University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校电气工程与计算机科学系认知机器人实验室) University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校)

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 T2Nav通过整合异构数据和基于图的推理,实现零样本视觉导航,具备高效探索和路径规划能力,适用于视觉相似但空间不同的目标实例导航。

Journal ref EEE International Conference on Robotics & Automation 2026 (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06775 2026-03-10 cs.RO 50%

HybridMimic: Hybrid RL-Centroidal Control for Humanoid Motion Mimicking

HybridMimic: 人形机器人运动模仿的混合强化学习-质心控制

Ludwig Chee-Ying Tay, I-Chia Chang, Yan Gu

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) School of Mechanical Engineering, Purdue University(普渡大学机械工程学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 HybridMimic通过结合强化学习与质心模型控制,有效提升人形机器人在分布外环境下的运动模仿性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05909 2026-03-09 cs.CL 50%

InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning

InfoGatherer: 通过证据检索和策略性提问进行原理化的信息获取

Maksym Taranukhin, Shuyue Stella Li, Evangelos Milios, Geoff Pleiss, Yulia Tsvetkov, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) CIFAR AI Chair(CIFAR人工智能主席) University of Washington(华盛顿大学) Dalhousie University(达尔豪斯大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 InfoGatherer通过证据检索和策略性提问,结合结构化证据网络和Dempster-Shafer理论,实现原理化的信息获取,提升医疗和法律任务中的可靠性与可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04853 2026-03-06 physics.optics 50%

Stochastic inner workings of subdiffraction laser writing

亚衍射激光刻写中的随机机制

Julia M. Mikhailova, Aleksei M. Zheltikov

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究通过统计光学方法揭示了亚衍射激光刻写中确定性与随机性相互作用的物理机制,并探讨了其对量子光子系统可扩展性的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04705 2026-03-06 cs.RO cs.HC 50%

LEGS-POMDP: Language and Gesture-Guided Object Search in Partially Observable Environments

LEGS-POMDP:语言和手势引导的在部分可观测环境中的对象搜索

Ivy Xiao He, Stefanie Tellex, Jason Xinyu Liu

机构 * Brown University(布朗大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LEGS-POMDP通过整合语言、手势和视觉信息,在部分可观测环境中实现高效的开放世界对象搜索,显著提升了多模态感知和不确定性处理能力。

Comments 10 pages, 8 figures, accepted at ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04416 2026-03-06 cs.CL 50%

Optimizing What We Trust: Reliability-Guided QUBO Selection of Multi-Agent Weak Framing Signals for Arabic Sentiment Prediction

优化我们信任的内容:基于可靠性引导的多智能体弱标注信号QUBO选择用于阿拉伯语情感预测

Rabab Alkhalifa

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于可靠性的弱监督框架,通过QUBO选择优化多智能体弱标注信号,提升阿拉伯语情感预测的可靠性与结构迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04107 2026-03-05 physics.ins-det hep-ex 50%

The CMS ME0 Upgrade: Enhancing Forward Muon Reconstruction at the HL-LHC

CMS ME0升级:提升HL-LHC前方缪子重建

Anureet Kaur

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CMS ME0升级通过六层站扩展伪横坐标覆盖范围,提升HL-LHC前方缪子重建的灵敏度和精度。

Comments 5 pages, 6 figures, Proceedings of the 31st International Symposium on Lepton Photon Interactions at High Energies (LP2025). https://cds.cern.ch/record/2952677

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11291 2026-03-05 cs.RO 50%

H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model

H-WM:由分层世界模型引导的机器人任务和运动规划

Jinbang Huang, Wenyuan Chen, Zhiyuan Li, Oscar Pang, Xiao Hu, Lingfeng Zhang, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Tongtong Cao, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 H-WM通过结合逻辑和视觉世界模型,实现机器人任务和运动规划中的鲁棒长视界推理与稳定引导。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12753 2026-03-04 cs.RO 50%

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Models Reasoning

osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航

Fujing Xie, Sören Schwertfeger, Hermann Blum

机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) University of Bonn(波恩大学) Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。

Comments accepted at RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02146 2026-03-03 cs.CL 50%

LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards

长上下文强化学习需要可验证的上下文奖励

Guanzheng Chen, Michael Qizhe Shieh, Lidong Bing

机构 * National University of Singapore(国立新加坡大学) MiroMind AI absolute AI

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LongRLVR通过引入可验证的上下文奖励,解决长上下文强化学习中因稀疏奖励导致的梯度消失问题,显著提升大语言模型的推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16017 2026-03-03 cs.GT 50%

Hidden-Role Games: Equilibrium Concepts and Computation

隐性角色游戏:均衡概念与计算

Luca Carminati, Brian Hu Zhang, Gabriele Farina, Nicola Gatti, Tuomas Sandholm

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出隐性角色游戏的均衡定义,揭示其计算复杂性,并通过实验验证了在大规模实例中的计算可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01460 2026-03-03 cs.SE 50%

Production-Grade AI Coding System for Client-Side Development

面向客户端开发的生产级AI编码系统

Ruihan Wang, Chencheng Guo, Guangjing Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种面向客户端开发的生产级AI编码系统,通过结构化多阶段流程整合Figma设计、PRD和领域知识,提升代码生成与产品需求的对齐性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00725 2026-03-03 cs.CL 50%

LaSTR: Language-Driven Time-Series Segment Retrieval

LaSTR:基于语言的时间序列片段检索

Kota Dohi, Harsh Purohit, Tomoya Nishida, Takashi Endo, Yusuke Ohtsubo, Koichiro Yawata, Koki Takeshita, Tatsuya Sasaki, Yohei Kawaguchi

机构 * Research(研究) Development Group, Hitachi, Ltd.(日立有限公司研发小组)

专题命中 视觉定位与Grounding :VLM(abstract)

AI总结 LaSTR通过结合语言描述和时间序列数据,实现了高效的时间序列片段检索,提升了检索质量和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00612 2026-03-03 cs.CL 50%

From Literature to Hypotheses: An AI Co-Scientist System for Biomarker-Guided Drug Combination Hypothesis Generation

从文献到假设:一种用于生物标志物引导的药物组合假设生成的AI合作者系统

Raneen Younis, Suvinava Basak, Lukas Chavez, Zahra Ahmadi

机构 * Peter L. Reichertz Institute for Medical Informatics (PLRI), Hannover Medical School(汉诺威医学院彼得·L·里赫茨医学信息学研究所) Lower Saxony Center for Artificial Intelligence and Causal Methods in Medicine (CAIMed)(下萨克森医学人工智能与因果方法中心) Sanford Burnham Prebys (SBP) Medical Discovery Institute, San Diego(圣地亚哥桑福尔德·伯恩斯医学发现研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出 AI 合作者系统 CoDHy,通过整合生物医学知识图谱和文献证据,实现基于生物标志物的药物组合假设生成与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24241 2026-03-02 cs.IR cs.HC 50%

UXSim: Towards a Hybrid User Search Simulation

UXSim: 向混合用户搜索模拟迈进

Saber Zerhoudi, Michael Granitzer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 UXSim 通过整合传统模拟器与适应性 LLM 代理,提供更准确的用户行为模拟和可解释的验证方法。

Journal ref Proceedings of the 34th ACM International Conference on Information and Knowledge Management (CIKM '25), November 10--14, 2025, Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24156 2026-03-02 cs.RO 50%

Humanoid Robots as First Assistants in Endoscopic Surgery

人形机器人作为内窥手术中的第一助手

Sue Min Cho, Jan Emily Mangulabnan, Han Zhang, Zhekai Mao, Yufan He, Pengfei Guo, Daguang Xu, Gregory Hager, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学院) NVIDIA Corporation(NVIDIA公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文展示了一人形机器人通过遥控协助完成尸体内窥手术,验证了其在手术辅助中的可行性并指出了后续发展的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15759 2026-03-02 cs.SD cs.MM eess.AS 50%

Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration

Sonic4D: 4D场景沉浸式探索的空间音频生成

Siyi Xie, Hanxin Zhu, Xinyi Chen, Tianyu He, Xin Li, Zhibo Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Sonic4D通过生成与4D场景一致的空间音频,提升沉浸式4D场景探索体验。

Comments 17 pages, 7 figures. Project page: https://x-drunker.github.io/Sonic4D-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23075 2026-02-27 cs.CL cs.IR 50%

CiteLLM: An Agentic Platform for Trustworthy Scientific Reference Discovery

CiteLLM:一个用于可信科学引文发现的代理平台

Mengze Hong, Di Jiang, Chen Jason Zhang, Zichang Guo, Yawen Li, Jun Chen, Shaobo Cui, Zhiyang Su

机构 * Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Swiss Federal Technology Institute of Lausanne (EPFL)(洛桑联邦理工学院) Hong Kong University of Science and Technology (HKUST)(香港科学大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CiteLLM通过在LaTeX编辑器中嵌入LLM工具,实现可信的科学引文发现,确保引文的准确性和可靠性。

Comments Accepted by TheWebConf 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21723 2026-02-26 cs.RO 50%

LessMimic: Long-Horizon Humanoid Interaction with Unified Distance Field Representations

LessMimic:基于统一距离场表示的长时域人形交互

Yutang Lin, Jieming Cui, Yixuan Li, Baoxiong Jia, Yixin Zhu, Siyuan Huang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LessMimic通过统一距离场表示实现人形机器人长时域交互,无需参考动作,利用变分自编码器和对抗交互先验进行训练,实现高成功率和多任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21681 2026-02-26 cs.SE 50%

AkiraRust: Re-thinking LLM-aided Rust Repair Using a Feedback-guided Thinking Switch

AkiraRust:重新思考利用反馈引导的思考开关的LLM辅助Rust修复

Renshuang Jiang, Yichong Wang, Pan Dong, Xiaoxiang Fang, Zhenling Duan, Tinglue Wang, Yuchen Hu, Jie Yu, Zhe Jiang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 AkiraRust通过反馈引导的思考开关机制,实现Rust修复的语义正确性和效率提升。

Comments 7 pages, 11 figures, accepted to DAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21604 2026-02-26 cs.DB 50%

Towards Autonomous Graph Data Analytics with Analytics-Augmented Generation

迈向具有分析增强生成的自主图数据分析

Qiange Wang, Chaoyi Chen, Jingqi Gao, Zihan Wang, Yanfeng Zhang, Ge Yu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出分析增强生成(AAG)范式,通过知识驱动的任务规划和算法中心的LLM-分析交互,实现端到端的图分析流水线,将自然语言意图转化为自动执行和可解释结果。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20683 2026-02-25 eess.SY cs.SY 50%

Grid-Mind: An LLM-Orchestrated Multi-Fidelity Agent for Automated Connection Impact Assessment

Grid-Mind: 一种基于LLM的多保真度代理用于自动化连接影响评估

Mohamed Shamseldein

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Grid-Mind是一种基于LLM的多保真度代理,通过自主协调电力系统模拟,实现自动化连接影响评估,具有高准确率和自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏