arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-14 至 2025-10-14 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2510.04991 2025-10-14 cs.RO 82%

Efficient Navigation in Unknown Indoor Environments with Vision-Language Models

D. Schwartz, K. Kondo, J. P. How

机构 * ETH Zürich(苏黎世联邦理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)

Comments 7 pages, 4 figures, accepted to the OWN workshop at IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11509 2025-10-14 cs.CV 79%

Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model

Ruiping Liu, Junwei Zheng, Yufan Chen, Zirui Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Marc Pollefeys, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01424 2025-10-14 cs.RO 75%

TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control

Zhenyang Liu, Yongchong Gu, Sixiao Zheng, Yanwei Fu, Xiangyang Xue, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01185 2025-10-14 cs.RO 50%

HoMeR: Learning In-the-Wild Mobile Manipulation via Hybrid Imitation and Whole-Body Control

Priya Sundaresan, Rhea Malhotra, Phillip Miao, Jingyun Yang, Jimmy Wu, Hengyuan Hu, Rika Antonova, Francis Engelmann, Dorsa Sadigh, Jeannette Bohg

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏