arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-25 至 2026-08-25 共收录 183 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 54 篇

2607.24772 2026-08-25 cs.AI cs.CL 版本更新 57%

RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation

RSMeM:用于遥感智能体的知识增强记忆进化及系统评估

Bingxian Wu, Yu Zhang, Zonghao Guo, Tang Liu, Chen Qian, Yuxiang Lu, Xingbo Du, Yanghao Li, Yidan Zhang, Chi Chen, Ling Yao, Maosong Sun

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有遥感智能体问题,提出RSMeM机制,通过分层知识基础和失败感知经验提炼两个组件,迭代吸收领域知识转化为执行经验,经实验验证能提升工具使用性能和答案质量,具有强大知识密度。

Comments Accepted to ACL 2026 Main. 18 pages. Added links to the GitHub repository and ModelScope Studio below the title; technical content and results remain unchanged. Code: https://github.com/AI9Stars/RSMeM. Demo: https://modelscope.cn/studios/wbx929/RSMeM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20553 2026-08-25 cs.AI cs.CL 版本更新 57%

CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning

CMI-Mem:通过CMI增强的强化学习实现可泛化的长期内存管理

Yubo Wang, Qiuyu Zhao, Zenghui Sun, Shichao Dong, Jinsong Lan, Xiaoyong Zhu, Haoyang Li, Bo Zheng, Lei Chen

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) PolyU(香港理工大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有内存管理器模型局限,提出基于强化学习的CMI-Mem模型,结合下游问答正确性与内在条件互信息CMI作为混合奖励,可评估新输入信息,补充而非取代问答基础,实现可泛化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20274 2026-08-25 cs.AI 版本更新 57%

Lagrange: An Open-Vocabulary, Energy-Based Sparse Framework for Generalized End-to-End Driving

Lagrange: 一种面向通用端到端驾驶的开放词汇、基于能量的稀疏框架

Shihao Ji, HongXi Li, Zihui Song, Mingyu Li

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 提出Lagrange框架,利用掩码潜在场和视觉语言模型实现开放词汇、稀疏计算,通过拉格朗日动作最小化确保运动学约束,在nuScenes和CODA基准上验证了鲁棒性和可解释性。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17904 2026-08-25 cs.AI 版本更新 57%

DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

DiagFlowBench:评估语言模型在基于规程的诊断对话中如何处理偏离规程输入

Guillermo Gil de Avalle, Laura Maruster, Shaina Raza, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出DiagFlowBench基准,包含50个工业诊断流程图转化的1676轮对话,评估10个模型在识别偏离规程输入时的表现,发现模型常选择真实但不恰当的步骤而非捏造事实。

Comments Accepted to the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026) Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-08-25 cs.CV 版本更新 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Accepted by ECCV 2026. Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18061 2026-08-25 cs.CL cs.AI cs.SD eess.AS 版本更新 57%

TELEVAL: A Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios

TELEVAL: 为中国交互场景中的语音语言模型设计的动态基准

Zehan Li, Hongjie Chen, Qing Wang, Yuxin Zhang, Jing Zhou, Hang Lv, Mengjie Du, Yaodong Song, Jie Lian, Jian Kang, Jie Li, Yongxiang Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI)、中国电信)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TELEVAL是一个为中国语音交互场景设计的动态基准,旨在评估语音语言模型在真实对话中的表现,强调内容准确性和互动适当性,揭示当前模型在自然交互回应上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17730 2026-08-25 cs.CV 版本更新 57%

AdaptPrompt: Parameter-Efficient Adaptation of VLMs for Generalizable Deepfake Detection

AdaptPrompt: 为通用深度伪造检测高效调整视觉语言模型参数

Yichen Jiang, Mohammed Talha Alam, Sohail Ahmed Khan, Duc-Tien Dang-Nguyen, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) University of Bergen(卑尔根大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 AdaptPrompt通过参数高效迁移学习框架,利用CLIP模型提升深度伪造检测的泛化能力,实现跨领域和少量样本下的高准确率识别。

Comments Accepted at DFF ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22917 2026-08-25 cs.CL cs.IR 新提交 50%

TSWAP: A Multilingual Retrieval-Augmented Thai Wellness Advisor

TSWAP:多语言检索增强型泰国健康顾问

Pornthep Ukosaramig, Kobkrit Viriyayudhakorn

机构 * Digital Touch Point Co., Ltd.(数字触点有限公司) iApp Technology Co., Ltd.(iApp技术有限公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究提出多语言检索增强型泰国健康顾问TSWAP,基于泰国传统医学知识库,采用混合检索等技术,发布相关基准与日志,发现量化及强制检索的部署要点。

Comments 8 pages, 2 tables. Data and evaluation logs: https://huggingface.co/datasets/iapp/tswap-wellness-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22229 2026-08-25 cs.CL 新提交 50%

Grounded Normative Rule Generation with Structured Search

基于结构化搜索的接地规范规则生成

Fanqi Kong, Huaxiao Yin, Ruijie Zhang, Xiaoyuan Zhang, Yizhe Huang, Jian Gao, Shuo Chen, Song-Chun Zhu

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室、北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出GNRS-Search框架,将规范规则生成为接地规范规则合成问题,通过MCMC采样优化AOG,在两个基准上提升规则质量,为受监管环境的合规智能体提供基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22152 2026-08-25 cs.CL 新提交 50%

The Collaboration Tax: How Much LLM Multi-Agent Systems Pay to Coordinate

协作损耗:LLM多智能体系统协调时的性能损失有多大

Weixiang Sun, Zehong Wang, Hong Huang, Colby Nelson, Yanfang Ye

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究定义了LLM多智能体系统的协作损耗,揭示其随模型能力提升单调下降,可通过对话特征预测,提示干预可缩小差距,为优化多智能体协作提供了量化依据。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22135 2026-08-25 cs.IR 新提交 50%

GrOIL: Graph-Grounded Domain Ontology Induction with Constrained LLM Mediation

GrOIL:基于图的领域本体归纳与受限大语言模型调解

Maruf Ahmed Mridul, Abid Talukder, Oshani Seneviratne

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出GrOIL流程,以受限LLM调解的七阶段图基方法构建可审计OWL TBox,在人寿保险领域的基准测试中,其CQ覆盖率等指标优于LLM基线,可生成稳定领域表示。

Comments 12 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21612 2026-08-25 physics.optics 新提交 50%

Machine Learning to Foundation Models: Artificial Intelligence for Nanophotonic Modeling and Scientific Discovery

从机器学习到基础模型:用于纳米光子学建模与科学发现的人工智能

Chaobin Yang, Xueqing Liu, Yiqun Fu, Fengbo Zhou, Krzysztof Kempa, Stefano Anzellotti, Michael J. Naughton

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本综述梳理了纳米光子学领域AI从机器学习到基础模型的发展,介绍了相关平台、问题与方法,分析了当前基础模型的局限并展望了多模态模型的未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-25 cs.CL 版本更新 50%

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Vasu Rangarajan, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-25 cs.CL 版本更新 50%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

Comments Paper accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23772 2026-08-25 cs.HC 版本更新 50%

PageGuide: Browser extension to assist users in navigating a webpage and locating information

PageGuide: 一款辅助用户在网页上导航和查找信息的浏览器扩展

Tin Nguyen, Thang T. Truong, Runtao Zhou, Trung Bui, Chirag Agarwal, Anh Totti Nguyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 PageGuide通过视觉叠加将LLM回答与HTML DOM结合,帮助用户快速定位信息、逐步指导操作并隐藏干扰内容,提升浏览效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10029 2026-08-25 cs.GT 版本更新 50%

Auditing Game-Theoretic Measures of Strategic Reasoning in LLMs

量子反应均衡作为战略成熟度的度量:理论与LLM评估中的验证

Mateo Pechon-Elkins, Jon Chun

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于量子反应均衡的理论框架,用于评估大型语言模型的战略成熟度,通过实验验证了模型在不同认知能力上的表现及参数估计的稳健性。

Comments v2: substantive self-correction of v1 against raw transcripts; title changed. Corrects game specs to the implemented games; exact equilibrium solve (conditional bluff rate 2/3, not 0.340); response-validity audit: parser-substituted defaults retract Kimi K2's profile; prompt-framing result reversed. Appendix itemizes all changes. Data: https://doi.org/10.5281/zenodo.21943627. 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 12 篇

2608.22366 2026-08-25 cs.CV 新提交 84%

When Do VLMs Help Arabic Manuscript OCR? A Cross-Dataset Study

视觉语言模型(VLMs)何时助力阿拉伯手稿光学字符识别(OCR)?一项跨数据集研究

Moshiur Farazi, Firoj Alam, Abderrahmane Maaradji, Zakaria Maamar, Hamdy Mubarak, Wajdi Zaghouani

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Northwestern University in Qatar(卡塔尔西北大学) University of Doha for Science Technology(多哈科技大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文通过跨8类阿拉伯语文本数据集的实验,探究VLMs对阿拉伯手稿OCR的助力场景,提出OCR先验可恢复性原则,支持构建自适应OCR-VLM工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22754 2026-08-25 cs.CV cs.AI 版本更新 81%

Procedural Knowledge Extraction from Industrial Troubleshooting Guides Using Vision Language Models

从工业故障排除指南中提取程序性知识:使用视觉语言模型

Guillermo Gil de Avalle, Laura Maruster, Christos Emmanouilidis

机构 * University of Groningen(Groningen大学)

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究如何利用视觉语言模型从工业故障排除指南中提取结构化知识,通过对比两种提示策略评估模型性能,揭示布局敏感性与语义稳健性的权衡。

Comments Accepted to the 23rd IFAC World Congress (IFAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22724 2026-08-25 cs.CE 新提交 80%

Frontiers in FinTech: Multimodal Foundation Models for Financial Reporting and Decision Science

金融科技前沿:面向财务报告与决策科学的多模态基础模型

Yulu Huang, Niannian Yu, Yaxin Yang, Yong Huang

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract)

AI总结 针对异构财务数据对会计信息系统的挑战,本研究提出多模态大语言模型FinVision,经200家上市公司验证可降低19%估值误差,48名专业用户测试缩短51%任务时间,助力审计自动化与财务分析民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22316 2026-08-25 cs.LG cs.CV 新提交 73%

Does a Modern-Handwriting Warm-Up Help Historical Arabic OCR? A Reproducible, Compute-Matched Evaluation on Muharaf and KHATT

现代手写体热身是否有助于历史阿拉伯文OCR?针对Muharaf和KHATT的可复现、计算匹配评估

Sumaih Almarshad, Maram Alamri, Dona Aloraini, Fares Altuwaim, AlJawharh AlOtaibi, Reem Alyabis, Rayah Aldawsari

机构 * Dal Research Team(达尔研究团队)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本研究通过可复现、计算匹配的实验评估现代手写体热身对历史阿拉伯文OCR的影响,发现其并非普遍有效,发布了可独立验证的SaudiHeritage-OCR包。

Comments 14 pages, Dal Research Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09874 2026-08-25 cs.CV cs.AI cs.IR 版本更新 62%

Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs

对PDF中数学公式提取的文档解析器进行基准测试

Pius Horn, Janis Keuper

机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University, Offenburg, Germany(机器学习与分析研究所(IMLA)、奥芬堡大学) University of Mannheim, Mannheim, Germany(曼海姆大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种新的PDF数学公式提取基准测试框架,通过合成数据和LLM评估方法,评估了多种解析器的性能差异,揭示了选择合适解析器的关键因素。

Comments Best Scientific Paper Award, ICPR 2026 (Document Analysis and Recognition Track)

Journal ref Pattern Recognition. ICPR 2026. Lecture Notes in Computer Science, vol 16813, pp. 93-107. Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22842 2026-08-25 cs.AI 新提交 57%

FinixDoc: Rethinking Financial Document Parsing Beyond Saturated Benchmarks

FinixDoc:重新思考超出饱和基准的金融文档解析

Hang Wang, Jin Zhang, Guoliang Xu, Pengyue Lu, Yao Li, Zijiao Zhang, Tianyu Huang, Weiqi Xiong, Yulong Wang, Chuqiao Lu, Wenkang Huang, Kai Yang, Yadong Li, Hui Li, Xingzhong Xu, Xiao Xu

机构 * Ant Group(蚂蚁集团)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本研究针对金融文档解析基准与实际需求的差距,提出端到端智能体解析系统FinixDoc,核心为4B规模视觉语言模型FinixDoc-VL,在自建评估套件FinixDocBench上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22214 2026-08-25 cs.AI cs.MM 新提交 57%

Query-Driven Multimodal Information Extraction from Long Documents

面向长文档的查询驱动多模态信息抽取

Yikai Gao, Ding Xia, Xi Yang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 针对现有多模态长文档信息抽取范式的不足,本文提出查询驱动的图像-文本联合抽取任务,构建基准ITJoint并设计多智能体框架Q2IT,实验显示Q2IT性能显著优于独立VLMs但仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新 57%

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04529 2026-08-25 cs.AI 版本更新 57%

SlideGen: Collaborative Multimodal Agents for Scientific Slide Generation

SlideGen:用于科学幻灯片生成的协作多模态智能体

Xin Liang, Zhilin Zhang, Xiang Zhang, Haoran Su, Yiwei Xu, Siqi Sun, Chenyu You

机构 * Stony Brook University(石溪大学) University of British Columbia(不列颠哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Fudan University(复旦大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 SlideGen通过协作多模态智能体实现科学论文到高质量幻灯片的生成,提升视觉质量和内容忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00391 2026-08-25 cs.CV 版本更新 57%

VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning

VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成

Xuanle Zhao, Deyang Jiang, Zhixiong Zeng, Lei Chen, Haoyue Yang, Haibo Qiu, Jing Huang, Yufeng Zhong, Liming Zheng, Yilin Cao, Lin Ma

机构 * Meituan(美团)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23176 2026-08-25 cs.IR 新提交 50%

Evaluating Modern RAG: Textual, Multimodal, Dense, and Late Interaction Pipelines

评估现代RAG:文本、多模态、密集型与后期交互管道

Emre Kuru, Mehmet Onur Keskin

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 该研究针对传统RAG在含视觉元素文档上的局限,提出数据驱动的RAG管道选择方法,评估了文本、多模态等现代RAG管道的性能与效率权衡,为实际应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22081 2026-08-25 cs.SE cs.CL cs.IR 新提交 50%

W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases

W-RAG:面向异构知识库的企业文档生成的源感知检索方法

Hridya Dhulipala, Rajesh Ombase, Michael Wang, Tien N. Nguyen

专题命中 文档图表理解 :grounding(abstract)

AI总结 针对异构知识库下企业文档生成中全局排序导致的上下文失衡问题,提出源感知检索框架W-RAG,引入相关数据集并验证其可提升文档覆盖率与生成质量。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 12 篇

2608.22847 2026-08-25 cs.AI 新提交 81%

GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis

GSAR:面向移动GUI智能体的目标-状态-锚点奖励,结合自进化数据合成技术

Long Zhang, Yuhan Chen, Chaoran Zhang, Wanxia Cao, Kun Huang, Pengzhi Gao, Wei Liu, Jian Luan, Chenliang Li, Lixin Zou

机构 * Wuhan University(武汉大学) Xiaomi Inc.(小米公司)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本研究提出GSAR奖励框架,结合自进化数据合成与状态-锚点机制,解决VLM-GUI智能体训练中数据合成及奖励信号的问题,在多基准测试中表现优异,为GUI智能体训练提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21794 2026-08-25 cs.CL cs.AI cs.HC 新提交 79%

Lexical Coupling in GUI Element Grounding: Sentence Embeddings Track Labels across Mobile and Web

GUI元素定位中的词汇耦合:句子嵌入追踪移动端与网页的标签

Qijia Chen, Giulio Jacucci

机构 * University of Helsinki(赫尔辛基大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

AI总结 该研究针对GUI定位评估中嵌入相似度与语义定位的混淆问题,对比编码器与词汇基线,提出需报告词汇基线等诊断指标以区分标签恢复与语义定位。

详情

展开后加载摘要…

URL PDF HTML 收藏