arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-19 至 2025-12-19 共收录 46 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2511.12142 2025-12-19 cs.CV 74%

MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering

MAVIS:多模态来源归因的长形式视觉问答基准

Seokwon Song, Minsu Park, Gunhee Kim

专题命中 视觉问答 :visual question answering(title);分类 cs.CV

AI总结 MAVIS基准旨在评估多模态来源归因系统,通过多模态文档检索和长形式答案生成,揭示多模态设置下信息量、 groundedness 和流畅性之间的权衡与改进方向。

Comments AAAI 2026; code is available at https://github.com/seokwon99/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16891 2025-12-19 cs.CV cs.AI cs.IR cs.LG cs.MM 67%

LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation

LinkedOut: 从视频大语言模型中提取世界知识表示以实现下一代视频推荐

Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu

机构 * Northeastern University(东北大学) LinkedIn(领英) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 LinkedOut通过从视频中提取世界知识表示,实现低延迟、多视频输入的视频推荐,无需人工标注,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15233 2025-12-19 cs.CV 57%

Null-LoRA: Low-Rank Adaptation on Null Space

Null-LoRA: 在空域上进行低秩适应

Yi Zhang, Yulei Kang, Haoxuan Chen, Jinxuan Li, Jian-Fang Hu

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University, Guangdong, China(工程学院,中山大学,广东,中国)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 Null-LoRA通过在空域上进行低秩适应,提升参数效率和模型效果,在图像-文本检索和视觉问答任务中取得最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 13 篇

2512.16561 2025-12-19 cs.CV 92%

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(title,abstract);grounding(title,abstract);visual reasoning(abstract)

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 86%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15705 2025-12-19 cs.CV 83%

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

GeoVista: 基于网络增强的代理视觉推理用于地理定位

Yikun Wang, Zuyan Liu, Ziyi Wang, Han Hu, Pengfei Liu, Yongming Rao

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文元) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV

AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 83%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2025-12-19 cs.CV cs.AI 81%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai, Kangning Yang, Lan Fu, Jiaming Ding, Jinlong Li, Huiming Sun, Daitao Xing, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16461 2025-12-19 cs.CV cs.RO 77%

SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning

SNOW:基于世界知识的时空场景理解用于开放世界具身推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16237 2025-12-19 cs.AI 70%

Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis

通过程序化数据合成提升大规模语言模型的空间推理能力

Zhi Helu, Huang Jingjing, Xu Wang, Xu Yangbin, Zhang Wanyue, Jiang Baoyang, Deng Shirui, Zhu Liang, Li Fangfang, Zhao Tiejun, Lin Yankai, Yao Yuan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院电子学研究所) Renmin University of China(中国人民大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 SPRITE通过程序化数据合成生成高质量空间推理数据,提升大规模语言模型的空间推理能力,并在多个基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16302 2025-12-19 cs.RO 67%

ManiLong-Shot: Interaction-Aware One-Shot Imitation Learning for Long-Horizon Manipulation

ManiLong-Shot:交互感知的一次学习方法用于长周期操控

Zixuan Chen, Chongkai Gao, Lin Shao, Jieqi Shi, Jing Huo, Yang Gao

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 ManiLong-Shot通过交互感知原语分解实现长周期操控任务的一次学习,有效提升机器人任务执行能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08976 2025-12-19 cs.LG cs.AI 62%

Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs

peek-a-boo推理:多模态大语言模型中的对比区域遮挡

Isha Chaturvedi, Anjana Nair, Yushen Li, Adhitya Rajendra Kumar, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究机构) Princeton University(普林斯顿大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 对比区域遮挡通过遮挡视觉区域并对比推理轨迹,揭示多模态大语言模型在推理过程中的依赖模式和失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16698 2025-12-19 cs.AI cs.CG 57%

Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning

多智能体表现更优吗?评估用于图示引导几何问题解决与推理的智能体框架

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Mohammad Nehad Alam, Proma Hossain Progga, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Center for Computational & Data Sciences(计算与数据科学中心) Independent University, Bangladesh(孟加拉国独立大学) Spectrum Software & Consulting Ltd(Spectrum软件与咨询有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文评估了多智能体框架在图示引导几何问题解决中的表现,发现其对开源模型有明显提升,但对闭源模型效果有限,且并非普遍最优。

Comments Accepted to the ARR October 2025 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16584 2025-12-19 cs.CV 57%

Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs

Sketch-in-Latents: 在潜在空间中实现多模态统一推理

Jintao Tong, Jiaqi Gu, Yujing Lou, Lubin Fan, Yixiong Zou, Yue Wu, Jieping Ye, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 SkiLa通过在潜在空间中实现多模态统一推理,扩展MLLMs的自回归能力,生成连续视觉嵌入,提升视觉任务性能和多模态泛化能力。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24342 2025-12-19 cs.CV cs.CL 57%

VAEER: Visual Attention-Inspired Emotion Elicitation Reasoning

VAEER:基于视觉注意力的情感激发推理

Fanhang Man, Xiaoyue Chen, Huandong Wang, Baining Zhao, Han Li, Xinlei Chen

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Peng Cheng Labotory(鹏城实验室)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 VAEER通过结合注意力启发的提示提取与知识引导推理,实现了多标签情绪激发,展示了在社交媒体和灾难图像上的高精度情绪预测能力。

Comments Currently under review as conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15309 2025-12-19 cs.RO 50%

DynamicGSG: Dynamic 3D Gaussian Scene Graphs for Environment Adaptation

DynamicGSG: 动态3D高斯场景图用于环境适应

Luzhou Ge, Xiangyu Zhu, Zhuo Yang, Xuesong Li

机构 * School of Computer Science, Beijing Institute of Technology, China(计算机学院,北京理工大学)

专题命中 视觉推理 :vision language model(abstract)

AI总结 DynamicGSG通过动态高斯场景图实现环境适应,利用高斯溅射技术构建层次化场景图,提升环境理解和适应能力。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 11 篇

2512.15949 2025-12-19 cs.CV 83%

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs

感知观测站:多模态大语言模型的鲁棒性与基础性表征

Tejas Anvekar, Fenil Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 感知观测站通过系统性扰动和真实数据集,评估多模态大语言模型在视觉基础性和关系结构上的鲁棒性,揭示其在扰动下的表现,为模型分析提供系统基础。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16770 2025-12-19 cs.CL cs.AI 79%

GinSign: Grounding Natural Language Into System Signatures for Temporal Logic Translation

GinSign:将自然语言接地到系统签名以进行时序逻辑翻译

William English, Chase Walker, Dominic Simon, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 GinSign通过将自然语言接地到系统签名,提升时序逻辑翻译的准确性和下游模型检查能力,实现95.5%的逻辑等价分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15971 2025-12-19 cs.CV 77%

From Words to Wavelengths: VLMs for Few-Shot Multispectral Object Detection

从词语到波长:用于少样本多光谱目标检测的视觉语言模型

Manuel Nkegoum, Minh-Tan Pham, Élisa Fromont, Bruno Avignon, Sébastien Lefèvre

机构 * Univ Bretagne Sud, IRISA, UMR 6074(布列塔尼大学,IRISA,UMR 6074) Univ Rennes, IRISA, UMR 6074(里尔大学,IRISA,UMR 6074) ATERMES UiT The Arctic University of Norway(北欧大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出利用视觉语言模型进行少样本多光谱目标检测,通过整合文本、视觉和热模态,在数据稀缺情况下实现高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12793 2025-12-19 cs.RO 67%

VLG-Loc: Vision-Language Global Localization from Labeled Footprint Maps

VLG-Loc: 从标注足迹地图实现视觉-语言全局定位

Mizuho Aoki, Kohei Honda, Yasuhiro Yoshimura, Takeshi Ishita, Ryo Yonetani

机构 * The Department of Mechanical Systems Engineering, Nagoya University(名古屋大学机械系统工程系) CyberAgent AI Lab(CyberAgent AI实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 VLG-Loc通过视觉-语言模型实现从标注足迹地图的全局定位,结合蒙特卡洛定位框架和概率融合提升环境变化下的鲁棒性。

Comments v2: Updated the citation of SparseLoc from an arXiv preprint to its published version in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16924 2025-12-19 cs.CV 57%

The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text

世界是你的画布:通过参考图像、轨迹和文本绘画可提示事件

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Yue Yu, Yihao Meng, Wen Wang, Ka Leong Cheng, Shuailei Ma, Qingyan Bai, Yixuan Li, Cheng Chen, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) NEU(南京大学) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 WorldCanvas通过结合文本、轨迹和参考图像,实现可提示的多代理交互事件生成,提升世界模型的交互性和可控性。

Comments Project page and code: https://worldcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16841 2025-12-19 cs.CV 57%

Radiology Report Generation with Layer-Wise Anatomical Attention

基于层间解剖注意力的放射报告生成

Emmanuel D. Muñiz-De-León, Jorge A. Rosales-de-Golferichs, Ana S. Muñoz-Rodríguez, Alejandro I. Trejo-Castro, Eduardo de Avila-Armenta, Antonio Martínez-Torteya

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出了一种基于层间解剖注意力的紧凑图像到文本模型,用于生成胸部X光报告的发现部分,通过整合解剖区域信息提升了报告的准确性和连贯性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16444 2025-12-19 cs.AI 57%

StarCraft+: Benchmarking Multi-agent Algorithms in Adversary Paradigm

StarCraft+: 在对抗范式下评估多智能体算法的基准测试

Yadong Li, Tong Zhang, Bo Huang, Zhen Cui

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) School of Information Science and Engineering, Zaozhuang University(信息科学与工程学院,枣庄大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出SC2BA环境,通过对抗范式评估多智能体算法,揭示算法在有效性、灵敏度和可扩展性方面的挑战。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16077 2025-12-19 cs.CV 57%

Auto-Vocabulary 3D Object Detection

自动词汇3D目标检测

Haomeng Zhang, Kuan-Chuan Peng, Suhas Lohit, Raymond A. Yeh

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 AV3DOD通过自动生成类别名称,实现了无需用户输入的开放词汇3D目标检测,取得SOTA性能。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03508 2025-12-19 cs.CV 57%

Exploiting Domain Properties in Language-Driven Domain Generalization for Semantic Segmentation

利用领域特性进行语言驱动的领域泛化以实现语义分割

Seogkyu Jeon, Kibeom Hong, Hyeran Byun

机构 * Yonsei University(延世大学) Sookmyung Women’s University(淑明女子大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DPMFormer框架,通过领域感知提示学习和对比学习提升语义分割的领域泛化能力。

Comments ICCV 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00774 2025-12-19 q-bio.BM cs.LG 57%

GeoGraph: Geometric and Graph-based Ensemble Descriptors for Intrinsically Disordered Proteins

GeoGraph: 基于几何和图的集成描述符用于内在无序蛋白质

Eoin Quinn, Marco Carobene, Jean Quentin, Sebastien Boyer, Miguel Arbesú, Oliver Bent

机构 * InstaDeep

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 GeoGraph通过结合几何和图方法,从序列预测内在无序蛋白质的构象集合统计信息,提升对关键生物物理性质的预测能力。

Comments Accepted at AI4Science and ML4PS NeurIPS Workshops 2025. v2: comparison with Human-IDRome model and link to github added

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00877 2025-12-19 eess.SY cs.CL cs.SY 50%

Verifiable Natural Language to Linear Temporal Logic Translation: A Benchmark Dataset and Evaluation Suite

可验证的自然语言到线性时序逻辑翻译:一个基准数据集和评估套件

William H English, Chase Walker, Dominic Simon, Sumit Kumar Jha, Rickard Ewetz

机构 * University of Florida(佛罗里达大学) Florida International University(佛罗里达国际大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出VLTL-Bench,一个用于评估可验证自然语言到线性时序逻辑翻译的基准数据集和评估套件。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2512.15804 2025-12-19 cs.SE 82%

XBIDetective: Leveraging Vision Language Models for Identifying Cross-Browser Visual Inconsistencies

XBIDetective: 利用视觉语言模型识别跨浏览器视觉不一致

Balreet Grewal, James Graham, Jeff Muizelaar, Jan Honza Odvarko, Suhaib Mujahid, Marco Castelluccio, Cor-Paul Bezemer

专题命中 文档图表理解 :vision language model(title,abstract);VLM(abstract)

AI总结 XBIDetective利用视觉语言模型识别跨浏览器视觉不一致,通过自动截图和分析检测渲染错误,准确率高达79%

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 4 篇

2512.16501 2025-12-19 cs.CV 79%

VenusBench-GD: A Comprehensive Multi-Platform GUI Benchmark for Diverse Grounding Tasks

VenusBench-GD: 一个全面的多平台GUI基准测试用于多样化的接地任务

Beitong Zhou, Zhexiao Huang, Yuan Guo, Zhangxuan Gu, Tianyu Xia, Zichen Luo, Fei Tang, Dehan Kong, Yanyi Shang, Suling Ou, Zhenlin Guo, Changhua Meng, Shuheng Shen

机构 * Venus Team, AntGroup(蚂蚁集团 Venus 团队)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 VenusBench-GD提出一个跨平台的GUI接地基准测试,通过分层任务分类和高质量数据构建,评估模型在基本和高级任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04070 2025-12-19 cs.CL cs.MM 67%

LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward

LaF-GRPO:通过GRPO与LLM-as-Follower生成视障人士的现场导航指令

Yi Zhao, Siqi Wang, Jing Li

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 LaF-GRPO通过GRPO与LLM-as-Follower生成更直观安全的视障人士现场导航指令,提升指令准确性和实用性。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏