arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-13 至 2026-02-13 共收录 44 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2504.04988 2026-02-13 cs.CV cs.AI 73%

Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model

遥感检索增强生成:通过多模态数据集和检索增强生成模型连接遥感图像与综合知识

Congcong Wen, Yiting Lin, Xiaokang Qu, Nan Li, Yong Liao, Xiang Li, Hui Lin

机构 * School of Cyber Science and Technology, University of Science and Technology of China(信息科学技术学院,中国科学技术大学) China Academy of Electronics and Information Technology(电子信息技术研究院)

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RS-RAG框架,通过多模态数据集和检索增强生成模型,提升遥感图像与综合知识的连接能力,有效提升复杂查询的语义推理性能。

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine (GRSM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12203 2026-02-13 cs.CL 67%

ExStrucTiny: A Benchmark for Schema-Variable Structured Information Extraction from Document Images

ExStrucTiny:一种用于从文档图像中进行模式变量结构信息提取的基准

Mathieu Sibue, Andres Muñoz Garza, Samuel Mensah, Pranav Shetty, Zhiqiang Ma, Xiaomo Liu, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract)

AI总结 ExStrucTiny是一个新的文档图像结构信息提取基准,通过结合手动和合成样本,涵盖更多多样化的文档类型和提取场景,旨在提升通用模型在结构化信息提取中的性能。

Comments EACL 2026, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 12 篇

2602.12196 2026-02-13 cs.CL cs.AI 83%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12159 2026-02-13 cs.RO cs.AI 83%

3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting

3DGSNav: 通过主动3D高斯散射增强视觉-语言模型的物体导航

Wancai Zheng, Hao Chen, Xianlong Lu, Linlin Ou, Xinyi Yu

机构 * Zhejiang University of Technology, Hangzhou, China(浙江工业大学,杭州,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 3DGSNav通过主动3D高斯散射提升视觉-语言模型的物体导航能力,结合结构化视觉提示和链式推理,实现高效且可靠的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13853 2026-02-13 cs.CV 83%

Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark

世界模拟器能推理吗?Gen-ViRe:一个生成性视觉推理基准

Xinxin Liu, Zhaopan Xu, Ming Li, Kai Wang, Yong Jae Lee, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) National University of Singapore(新加坡国立大学) UW-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual reasoning(title,abstract);VLM(abstract);分类 cs.CV

AI总结 Gen-ViRe提出一个生成性视觉推理基准,通过分解CoF推理为六个认知维度和24个子任务,评估视频模型的推理能力,揭示视觉质量与推理深度的差异。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11455 2026-02-13 cs.AI 83%

Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning

应得之 credit:跨模态连接驱动精确强化学习用于 MLLM 推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, SJTU(EPIC实验室,上海交通大学)

专题命中 视觉推理 :MLLM(title);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 通过跨模态连接驱动精确强化学习,提升多模态大语言模型的推理能力,仅引入1.2%开销即超越基线模型。

Comments 20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11241 2026-02-13 cs.CV cs.LG 81%

Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration

主动零:通过主动环境探索实现自我进化的视觉-语言模型

Jinghan He, Junfeng Fang, Feng Xiong, Zijun Yao, Fei Shen, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究所) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 Active-Zero通过主动环境探索实现视觉-语言模型的自我进化,提升推理和理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11073 2026-02-13 cs.CV cs.AI cs.CL 73%

Chatting with Images for Introspective Visual Thinking

与图像对话以进行反思性视觉思维

Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11678 2026-02-13 cs.AI cs.CV 62%

Beyond Pixels: Vector-to-Graph Transformation for Reliable Schematic Auditing

超越像素:用于可靠图示审计的向量到图转换

Chengwei Ma, Zhen Tian, Zhou Zhou, Zhixian Xu, Xiaowei Zhu, Xia Hua, Si Shi, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Guangdong Power Grid Co., Ltd.(广东电网公司) Shanghai University(上海大学) Carleton University(卡尔顿大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出向量到图转换方法,通过将CAD图转换为属性图,提升工程图示审计的准确性,克服基于像素方法的局限性。

Comments 4 pages, 3 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11980 2026-02-13 cs.CV 57%

Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation

空间链式思考:连接理解与生成模型以实现空间推理生成

Wei Chen, Yancheng Long, Mingqiao Liu, Haojie Ding, Yankai Yang, Hongyang Wei, Yi-Fan Zhang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SCoT框架,通过结合MLLMs的推理能力与扩散模型的生成能力,提升空间推理生成任务的性能。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11782 2026-02-13 cs.AI cs.SE 57%

FlowMind: Execute-Summarize for Structured Workflow Generation from LLM Reasoning

FlowMind: 从LLM推理生成结构化工作流的执行-总结

Yihao Liu, Ziyun Zhang, Zile He, Huaqian Cai

机构 * Peking University(北京大学) East China University of Technology(东华大学) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 FlowMind通过执行-总结框架将LLM推理转化为结构化工作流,提高工作流的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11615 2026-02-13 cs.LG 57%

SkillRater: Untangling Capabilities in Multimodal Data

SkillRater: 解构多模态数据中的能力

Naveen Sahi, Jeremy Dohmann, Armen Aghajanyan, Akshat Shrivastava

专题命中 视觉推理 :vision language model(abstract);分类 cs.LG

AI总结 SkillRater通过分解多模态数据质量为多个独立能力维度,提升模型在视觉理解、OCR和STEM推理上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11609 2026-02-13 cs.AI q-bio.GN 57%

scPilot: Large Language Model Reasoning Toward Automated Single-Cell Analysis and Discovery

scPilot:面向自动化单细胞分析与发现的大型语言模型推理

Yiming Gao, Zhen Wang, Jefferson Chen, Mark Antkowiak, Mengzhou Hu, JungHo Kong, Dexter Pratt, Jieyuan Liu, Enze Ma, Zhiting Hu, Eric P. Xing

机构 * UC San Diego(UC圣地亚哥大学) MBZUAI CMU(卡内基梅隆大学) Texas A&M(德克萨斯A&M大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 scPilot通过组学原生推理提升单细胞分析的准确性与可解释性,实现自动化细胞类型注释和轨迹重建。

Comments Accepted at NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-02-13 cs.RO 50%

Affordance-Graphed Task Worlds: Self-Evolving Task Generation for Scalable Embodied Learning

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 10 篇

2602.11730 2026-02-13 cs.CV 83%

STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning

STVG-R1: 通过强化学习激励视频中实例级推理与 grounding

Xiaowen Zhang, Zhi Gao, Licheng Jiao, Lingling Li, Qing Li

机构 * Xidian University(西电大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 STVG-R1通过强化学习框架提升视频中实例级推理与 grounding 的准确性,实现显著的性能提升和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07497 2026-02-13 cs.CL 78%

From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection

从本土迷因到全球监管:跨文化评估视觉-语言模型在仇恨迷因检测中的应用

Mo Wang, Kaixuan Ren, Pratik Jalan, Ahmed Ashraf, Tuong Vy Vu, Rahul Seetharaman, Shah Nawaz, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Nile University(尼罗大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Johannes Kepler University(约翰尼斯·开普勒大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract)

AI总结 本文通过跨文化评估揭示视觉-语言模型在仇恨迷因检测中的文化偏见问题,并提出本土语言提示和一样本学习等改进策略以提升模型的公平性和鲁棒性。

Comments 12 pages, 5 figures, Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11244 2026-02-13 cs.CV 74%

Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

压力测试揭示视频-语言模型中脆弱的时间与视觉基础

Sethuraman T, Savya Khosla, Aditi Tiwari, Vidya Ganesh, Rakshana Jayaprakash, Aditya Jain, Vignesh Srinivasakumar, Onkar Kishor Susladkar, Srinidhi Sunkara, Aditya Shanmugham, Rakesh Vaideeswaran, Abbaas Alif Mohamed Nishar, Simon Jenni, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Qualtrics iManage NVIDIA Amazon Science(亚马逊科学) Capital One

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 REVEAL{}通过五个压力测试揭示视频-语言模型在时间与视觉基础方面的脆弱性,展示其在处理视频内容、时间序列和运动方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11583 2026-02-13 cs.AI cs.LG 62%

The Five Ws of Multi-Agent Communication: Who Talks to Whom, When, What, and Why -- A Survey from MARL to Emergent Language and LLMs

多智能体通信的五个W:谁与谁沟通,何时沟通,沟通什么,为何沟通——从MARL到涌现语言和LLMs的综述

Jingdi Chen, Hanqing Yang, Zongjun Liu, Carlee Joe-Wong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多智能体通信的五个W,探讨了从MARL到涌现语言和LLM的发展,分析了不同范式下的通信设计、权衡与挑战。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13779 2026-02-13 cs.CL cs.AI cs.LG 62%

NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews

NewsInterview: 一个用于通过信息性访谈评估LLM地面间隙的数据集和游乐场

Alexander Spangher, Michael Lu, Sriya Jeslyn Kalyan, Hyundong Justin Cho, Weiyan Shi, Jonathan May

机构 * University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 NewsInterview通过信息性访谈数据集和模拟环境,揭示LLMs在战略对话和多轮规划方面的能力不足,强调需提升其对话策略与说服力。

Comments Accepted at ACL 2025: https://aclanthology.org/2025.acl-long.1580/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12173 2026-02-13 cs.AI 57%

SAM3-LiteText: An Anatomical Study of the SAM3 Text Encoder for Efficient Vision-Language Segmentation

SAM3-LiteText: SAM3文本编码器的解剖学研究:用于高效视觉-语言分割

Chengxi Zeng, Yuxuan Jiang, Ge Gao, Shuai Wang, Duolikun Danier, Bin Zhu, Stevan Rudinac, David Bull, Fan Zhang

机构 * Visual Information Lab, University of Bristol(布里斯托大学视觉信息实验室) University of Amsterdam(阿姆斯特丹大学) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Singapore Management University(新加坡管理大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SAM3-LiteText通过轻量级文本编码框架优化视觉-语言分割模型,减少88%的参数并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05578 2026-02-13 cs.CV 57%

LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation

LoGoSeg:整合局部和全局特征以实现开放词汇语义分割

Junyang Chen, Xiangbo Lv, Zhiqiang Kou, Xingdong Sheng, Ning Xu, Yiguo Qiao

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 LoGoSeg通过整合局部和全局特征,提升开放词汇语义分割的精度与效率,减少幻觉和漏检问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19269 2026-02-13 cs.RO cs.LG 57%

Translating Flow to Policy via Hindsight Online Imitation

通过回顾在线模仿将流翻译为政策

Yitian Zheng, Zhangchen Ye, Weijun Dong, Shengjie Wang, Yuyang Liu, Chongjie Zhang, Chuan Wen, Yang Gao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) University of California San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Qi Zhi Institute(上海启智研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 通过回顾在线模仿将流翻译为政策,利用2D点流作为高层规划器,在模拟和现实任务中实现超过2倍的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11662 2026-02-13 cs.LG 57%

UMAP Is Spectral Clustering on the Fuzzy Nearest-Neighbor Graph

UMAP是模糊最近邻图上的谱聚类

Yang Yang

机构 * Frazer Institute, Faculty of Health, Medicine and Behavioural Sciences, The University of Queensland(弗拉泽研究所,健康、医学与行为科学学院,昆士兰大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文证明UMAP在模糊最近邻图上执行谱聚类,将UMAP、对比学习和谱聚类统一于一个理论框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18382 2026-02-13 cs.RO 50%

One Demo Is All It Takes: Planning Domain Derivation with LLMs from A Single Demonstration

一个演示就足够:从单个演示中利用LLM进行规划域推导

Jinbang Huang, Yixin Xiao, Zhanguang Zhang, Mark Coates, Jianye Hao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 PDDLLM通过结合LLM推理与物理模拟,从单个演示中自动推导规划域,提升长时间跨度任务规划的自动化与可靠性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 3 篇

2602.11960 2026-02-13 cs.CV cs.CL cs.LG 84%

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

对法语PDF到Markdown转换的视觉语言模型进行基准测试

Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

机构 * Probayes, La Poste(Probayes公司) OpenValue, La Poste(OpenValue公司)

专题命中 文档图表理解 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本研究针对法语PDF到Markdown转换,评估了视觉语言模型在处理复杂文档中的表现,发现专有模型在手写和表单处理上更具鲁棒性,而开源系统在标准打印布局上表现良好。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21205 2026-02-13 cs.CV cs.CL 57%

TABLET: A Large-Scale Dataset for Robust Visual Table Understanding

TABLET:一个大规模数据集,用于鲁棒的视觉表格理解

Iñigo Alonso, Imanol Miranda, Eneko Agirre, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 TABLET是一个大规模视觉表格理解数据集,包含400万个示例和21项任务,旨在提升模型对真实世界表格可视化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11156 2026-02-13 cs.CL cs.AI cs.IR 57%

HybridRAG: A Practical LLM-based ChatBot Framework based on Pre-Generated Q&A over Raw Unstructured Documents

HybridRAG: 一种基于预生成问答的LLM聊天机器人框架

Sungmoon Kim, Hyuna Jeon, Dahye Kim, Mingyu Kim, Dong-Kyu Chae, Jiwoong Kim

机构 * Hanyang University(翰阳大学) Makebot Inc.(Makebot公司)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 HybridRAG通过预生成问答库和实时生成相结合,提升聊天机器人在处理无结构文档时的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2602.11832 2026-02-13 cs.CV cs.RO 57%

JEPA-VLA: Video Predictive Embedding is Needed for VLA Models

视频预测嵌入对于VLA模型是必要的

Shangchen Miao, Ningya Feng, Jialong Wu, Ye Lin, Xu He, Dong Li, Mingsheng Long

机构 * Tsinghua University(清华大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 JEPA-VLA通过引入视频预训练的预测嵌入,提升VLA模型在机器人任务中的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11750 2026-02-13 cs.SE cs.AI cs.HC 57%

AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild

AmbiBench:在真实场景中超越单次指令的移动GUI代理基准测试

Jiazheng Sun, Mingxuan Li, Yingying Zhang, Jiayang Niu, Yachen Wu, Ruihan Jin, Shuyu Lei, Pengrongrui Tan, Zongyu Zhang, Ruoyi Wang, Jiachen Yang, Boyu Yang, Jiacheng Liu, Xin Peng

机构 * Fudan University(复旦大学) Jilin University(吉林大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

AI总结 AmbiBench是首个针对移动GUI代理在真实场景中超越单次指令的双向意图对齐的基准测试,通过引入清晰度分类和MUSE框架评估代理在不同清晰度下的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11862 2026-02-13 cs.RO 50%

LAMP: Implicit Language Map for Robot Navigation

LAMP:机器人导航的隐式语言地图

Sibaek Lee, Hyeonwoo Yu, Giseop Kim, Sunwook Choi

机构 * Department of Intelligent Robotics, Sungkyunkwan University(智能机器人学系,全北国立大学) NAVER LABS Department of Robotics and Mechatronics Engineering, DGIST(机器人与机电工程系,韩国科学技术院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 LAMP通过隐式语言地图实现高效机器人导航,结合隐式神经场与稀疏图进行粗到细路径优化,提升大环境下的内存效率和目标精度。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). Project page: https://lab-of-ai-and-robotics.github.io/LAMP/

Journal ref IEEE Robotics and Automation Letters (RA-L), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏