arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-27 至 2026-08-27 共收录 52 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2608.26091 2026-08-27 cs.IR cs.CL cs.CV 新提交 86%

PlanSightRAG: A Visual-First Multimodal RAG for Automating Question Answering and Compliance Checking for Civil Standard Plans

PlanSightRAG:面向民用标准图纸的自动化问答与合规检查的视觉优先多模态检索增强生成模型

Nabaraj Subedi, Shuvo Dip Datta, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar

专题命中 视觉问答 :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对民用标准图纸的OCR自动化方法会丢失关键几何信息,本文提出视觉优先多模态RAG框架PlanSightRAG,整合多向量检索与智能体架构,构建基准数据集并验证其在检索、合规检查任务上的性能,还实现了自主视觉规则 grounding。

Comments 32 pages, 9 figures, 25 tables. Preprint submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25618 2026-08-27 cs.CL 新提交 83%

AWM: Answerable Working Memory for Long-Document VQA Agents

AWM:面向长文档VLM智能体的可回答工作记忆

Dongzhuoran Zhou, Yuqicheng Zhu, Yule Liu, Zhen Yang, Rui Lu, Yuxiao Dong, Jie Tang, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 视觉问答 :VLM(title_cn,abstract);visual question answering(abstract)

AI总结 针对长文档VQA智能体的记忆质量盲区,提出AWM方法,通过融入仅记忆可回答性的GRPO奖励机制,提升了最终答案准确率并降低记忆缺失正确的比例。

Comments EMNLP 2026 Findings. 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25422 2026-08-27 cs.IT 新提交 67%

Towards Faithful and Efficient Semantic Communication: An Ontological Approach

面向忠实且高效的语义通信:一种本体论方法

Yixiao Feng, Yueting Wang, Yining Wang, Han Han, Bo Zhang

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)

AI总结 针对多视图VQA任务,提出ODSC本体驱动语义通信框架,通过共享本体知识库优化场景图,可减少SI数据量、提升问答准确率及多视图VQA准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 10 篇

2608.24886 2026-08-27 cs.AI 新提交 89%

VLM-based automatic multi-granularity graph representation of building layouts for design informatics

基于视觉语言模型的建筑布局多粒度图自动表示方法,用于设计信息学

Song Guo, Zhuoshi Chen, Maosu Li, Weimin Zhuang

机构 * Massachusetts Institute of Technology(麻省理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 视觉推理 :VLM(title,summary_cn);vision-language model(abstract);分类 cs.AI

AI总结 本研究提出基于VLM的多粒度图自动构建方法,以147份高校图书馆平面图为案例,验证其生成的图与人工标注图一致性良好,可用于设计信息学相关任务,提升建筑全生命周期设计信息利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交 88%

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 视觉推理 :visual reasoning(title,abstract);VLM(abstract,abstract_cn);MLLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: this https URL (https://video-reason.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25641 2026-08-27 cs.RO cs.AI 新提交 84%

Leveraging Inter-object Affordances for Efficient Planning in Contact-rich Tasks

利用物体间可供性实现接触密集型任务的高效规划

Pouya P. Niaz, Justus Piater, Alejandro Agostini

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 该研究针对传统TAMP方法在接触密集型任务中规划时间长、成功率低的问题,提出结合VLM与U-TAMP的方法,在模拟厨房场景中实现了更高的规划成功率与更快的规划速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25097 2026-08-27 cs.AI cs.MM math-ph 新提交 77%

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

PhysElite:大型语言模型在解决奥林匹克级物理问题上的表现差距有多大?

Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出PhysElite基准,含11586道奥林匹克级物理题及配套资源,测试18款MLLM发现最强者准确率仅33.7%,还开展分步流程评估诊断推理失败环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24954 2026-08-27 cs.LG physics.ao-ph 新提交 70%

AFDBench: A Reasoning-First AI Scientist for NationalWeather Service Forecast Discussions

AFDBench:面向国家气象局预报讨论的推理优先AI科学家

Manmeet Singh, Somnath Luitel, Prabhjot Singh, Manraaj Banga, Naveen Sudharsan, Josh Durkee

机构 * Western Kentucky University(西肯塔基大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) RediMinds Inc.(睿智公司)

专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.LG

AI总结 针对LLMs生成高风险气象文本时虚构数值的问题,研究提出AFDBench基准,采用GRPO优化7B参数模型,提升其生成专业气象讨论的风格契合度与数据保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25935 2026-08-27 cs.CV cs.AI 新提交 62%

TAU-Agent: An Agentic Retrieval-Augmented Framework for Traffic Anomaly Understanding

TAU-Agent:用于交通异常理解的智能体式检索增强框架

Yuqiang Lin, Yan Shi, Sam Lockyer, Harish Tayyar Madabushi, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对交通异常理解需求,提出TAU-Agent智能体式检索增强框架,调度两类视觉工具获取证据,结合微调视觉语言模型推理,在AI City 2026挑战赛多赛道取得对应排名成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25580 2026-08-27 cs.CV cs.AI 新提交 62%

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

V-Rubrics:基于评分规则的强化学习实现视觉忠实性

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao, Jingkang Yang, Hongyuan Zhu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) UIUC(伊利诺伊大学厄巴纳-香槟分校) A*STAR(新加坡科技研究局)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉-语言模型回答缺乏视觉依据的问题,提出基于评分规则的强化学习方法V-Rubrics,通过分解响应为原子命题并从三方面评分,训练的模型在相关推理基准上性能优于基线。

Comments Proj page: this https URL (https://shulin16.github.io/v-rubrics/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24910 2026-08-27 cs.HC cs.AI 新提交 57%

From Plots to Words: Model-Aware Multimodal Explanations as a Foundation for Accessible, Non-Visual Interaction

从图表到文本:模型感知的多模态解释作为可访问非视觉交互的基础

Nur Keleşoğlu, Łukasz Sobczak, Joanna Domańska

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 该研究提出多智能体框架,将时间序列预测的视觉输出转为模型感知文本解释,可提升非视觉交互的可访问性,其可解释配置使解释质量最高提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25531 2026-08-27 cs.CL 新提交 50%

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

ClueWeaver:面向紧凑型大语言模型的、针对文学长篇叙事的奖励引导双智能体证据推理框架

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu, Jin B. Hong

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Aberdeen(阿伯丁大学) The University of Western Australia(西澳大学) Brown University(布朗大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 ClueWeaver是用于紧凑型本地模型的双智能体证据推理框架,可提升本地语言模型在长篇叙事问答与声明验证任务中的性能,提供可检查的证据推理轨迹。

Comments Accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25398 2026-08-27 cs.CL 新提交 50%

OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora

OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准

Hao Chen, Yumin Lin, Nadila Yushanjiang, Xin Lin, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 10 篇

2608.25299 2026-08-27 cs.CV 新提交 83%

PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence

PointRL:从可验证标注证据中学习点级视觉-语言接地

Jingyang Su, Pu Cao, Xiuze Jin, Longyue Zhang, Qing Song, Lu Yang

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 PointRL是一种可验证强化学习框架,通过将异构标注证据转换为指向指令并设计多维度奖励,提升了Qwen3.5-4B等模型的点级视觉-语言接地性能,在多个基准上取得显著增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25662 2026-08-27 cs.CL 新提交 78%

Overview of SHROOM-Visions 2026: A Shared Task on Hallucination Detection in Large Vision-Language Models

SHROOM-Visions 2026概览:大型视觉语言模型幻觉检测共享任务

Raúl Vázquez, Aman Sinha, Chuyuan Li, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Lorenzo Vaiani, Jörg Tiedemann, Timothee Mickus

机构 * University of Helsinki(赫尔辛基大学) Politecnico di Torino(都灵理工大学) Université Bretagne Sud(南布列塔尼大学) University of Copenhagen(哥本哈根大学) University Grenoble Alpes(格勒诺布尔阿尔卑斯大学) University of Lorraine(洛林大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract)

AI总结 本文介绍了2026年在EMNLP 2026同期举办的SHROOM-Visions共享任务,该任务针对大型视觉语言模型的幻觉检测,依托SHEEP数据集开展,吸引27支团队提交600余个系统,最优系统较基线提升30-40个百分点。

Comments To appear at UncertaiNLP 2026 @ EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25559 2026-08-27 cs.CV cs.AI 新提交 62%

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:面向视频深度研究的自适应工具使用与反思

Xintong Zhang, Xiaomeng Fan, Shilin Yan, Ekko He, Zicheng Liu, Zijian Zou, Guannan Zhang, Yuwei Wu, Zhi Gao, Hongwei Xue

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-27 cs.CV cs.AI 新提交 62%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24935 2026-08-27 cs.CV cs.AI 新提交 62%

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Central Florida(中佛罗里达大学) Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25866 2026-08-27 cs.CV 新提交 57%

LUTSeg: A Longitudinal Multi-Expert Dataset for Ulcer Tissue Segmentation

LUTSeg:用于溃疡组织分割的纵向多专家数据集

Karen Sanchez, Carlos Hinojosa, Albert A. Ávila, Andrea C. Riano-Rojas, Diego H. Romero, Jenny C. Páez, Martina Llinás, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Subred Norte E.S.E, Hospital Simón Bolívar(北红区E.S.E西蒙·玻利瓦尔医院) Universidad del Rosario(罗萨里奥大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 研究针对慢性溃疡组织分割数据稀缺问题,构建LUTSeg数据集,并提出半监督框架TiSage,在低标注设置下优于基线方法。

Comments Published at ISIC in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25663 2026-08-27 cs.IR cs.AI cs.DB cs.DL 新提交 57%

Data Citation for Large Language Models: A Challenge

大语言模型的数据引用:一项挑战

Gianmaria Silvello

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文指出大语言模型的数据引用是一项开放挑战,提出训练数据归因、推理时数据引用、知识图谱事实引用三个研究方向,需跨领域协同推进以解决该问题。

Comments 7 pages, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24977 2026-08-27 cs.CR cs.CL cs.LG 新提交 57%

Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation

可检索但不可靠:检索增强生成中的攻击与防御研究综述

Minh Tran, Cuong Dang, Tuc Nguyen, Khanh-Tung Tran, Minh Huynh Nguyen, Trinh Chau, Kien Le, Do Xuan Long, Jiahao Zhang, Hoang D. Nguyen, Thanh Le, Suhang Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本综述针对检索增强生成(RAG)的安全与鲁棒性问题,形式化其各阶段威胁模型,分类攻击目标并梳理各阶段防御及评估方法,为该领域提供统一研究框架。

Comments 24 pages, 6 figures. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Peer-reviewed through ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25659 2026-08-27 cs.RO 新提交 50%

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

Yuqing Jiang, Zijian Zhang, Weitao Zhou, Jiawei Wang, Junjie He, Lei Yang, Haifang Qing, Si Liu, Ding Zhao, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25131 2026-08-27 physics.med-ph 新提交 50%

Evaluation of the Exradin A30 Parallel Plate Ion Chamber as a Reference Dosimeter in Ultra-High Dose Rate (UHDR) Electron Beams

Exradin A30平行板电离室作为超高中子剂量率(UHDR)电子束参考剂量计的评估

Mervat Alharbi, Kevin Liu, Brian Hooten, Shannon Holmes, Stefanno Alarcon-Nunez, Jeffrey Radtke, Larry DeWerd, Sam Beddar, Wesley Culberson, Emil Schueler, Ahtesham Khan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究评估Exradin A30平行板电离室作为超高中子剂量率电子束参考剂量计的性能,明确其漏电流、电荷收集效率等参数特性,证实经修正后该电离室可用于UHDR电子束参考剂量测定。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 3 篇

2608.25140 2026-08-27 cs.CV cs.CL 新提交 84%

RefLAM: A Reference-Grounded Line Annotation Pipeline for Historical Arabic Manuscripts

RefLAM:一种用于历史阿拉伯文手稿的参考依据型行标注流水线

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 文档图表理解 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 RefLAM是用于历史阿拉伯文手稿的参考依据型行标注流水线,结合深度学习、MLLM与模糊对齐引擎,可高效生成标注数据,吞吐量较手动标注提升75倍,发布的AraMS-28k可用于HTR模型微调。

Comments 11 pages, 6 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26053 2026-08-27 cs.RO cs.AI cs.CL cs.LG 新提交 82%

$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning

R^3:通过强化学习训练机器人以自然语言进行推理

Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出R^3方法,通过中间训练和基于准则的强化学习将VLM转化为机器人推理器,在两个测试平台上提升了机器人的探索与泛化能力,优于仅指令式的模仿学习基线。

Comments 42 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25434 2026-08-27 cs.IR 新提交 50%

DocPC: Document-Level Visual Retrieval via Representative Page Composition

DocPC:基于代表性页面组合的文档级视觉检索

Chengsong You, Junwei Zhou, Nan Du

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 针对现有视觉文档检索以页面为中心的问题,提出DocPC框架,通过组合代表性页面实现文档级索引,在DocViRe基准上性能优于最强页面级基线且存储成本大幅降低。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2608.25876 2026-08-27 cs.HC cs.CV 新提交 89%

Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

视觉-语言模型是否对形状的情感特质达成一致?面向生成式设计界面的跨模型审计

Luca Bux, Thiago Rios, Ingo Scholtes, Stefan Menzel

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究审计6个VLM对ShapeNet中10类3D物体的情感特质一致性,发现其一致性介于零基准与几何上限之间,据此实现UI原型指导生成式设计界面的语义控制选择。

Comments 13 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25308 2026-08-27 cs.CV 新提交 77%

V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models

V-Link:为视觉-语言-动作模型恢复动作DiT中丢失的视觉表征

Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Zequn Qin, Enyu Li, Xi Li

机构 * Zhejiang University(浙江大学) AGIBOT The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Simon Fraser University(西蒙菲莎大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本研究针对VLA模型中动作专家访问视觉信息不足的问题,提出V-Link方法,通过注入空间与语义查询提升动作DiT性能,在多个机器人操作基准及现实任务中均取得显著成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25425 2026-08-27 cs.SE cs.AI 新提交 57%

RotDroid: Cross-Orientation State Equivalence Testing for Detecting GUI Rotation Bugs in Android Apps

RotDroid:用于检测Android应用GUI旋转漏洞的跨方向状态等价测试

Mengdi Qin, Bo Jiang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 RotDroid是一款检测Android应用GUI旋转漏洞的测试框架,通过生成SPS、构建RotBench数据集及开发RotVL模型,在相同预算下比现有技术检测到更多旋转故障,还发现94个未知漏洞且47个被确认修复。

Comments Accepted to ISSRE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 8 篇

2608.24934 2026-08-27 cs.CV cs.AI 新提交 89%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏