arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 90 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 35 篇

2608.22232 2026-08-26 cs.AI cs.CL cs.CV cs.MM 版本更新 84%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-26 cs.AI 新提交 83%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24157 2026-08-26 cs.HC 新提交 82%

Balancing Evidence and Interpretation: Historical Grounding Ratio as a Design Parameter for AI-Generated Urban Storytelling

平衡证据与阐释:历史接地比率作为AI生成城市叙事的设计参数

Fuyang Zhang, Maurice Benayoun

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究提出历史接地比率(HGR)作为AI生成城市叙事的设计参数,通过GeoDrama系统的步行研究发现,HGR增强叙事与位置相关性,但多项体验指标在中间平衡条件下最优,为信息分配策略提供可操作测量方法。

Comments 34 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24574 2026-08-26 cs.AI 新提交 81%

PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos

PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验

Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24044 2026-08-26 cs.LG 新提交 79%

XP-JEPA: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

XP-JEPA:用于可预测潜在动力学的交叉预测物理基础

Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 XP-JEPA通过将视觉与物理表征交叉预测,提升了潜在动力学的可预测性,在多任务套件上降低了展开漂移并提高了控制成功率,无需特权输入即可实现更优的基于展开的控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20405 2026-08-26 cs.CL 版本更新 78%

ARGUS: Theory-of-Mind Guided Argument Generation with Strategy-Aware Planning and Knowledge Grounding

ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地

Zhe Hu

机构 * InspireOmni AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24107 2026-08-26 cs.CV cs.AI 新提交 73%

MatReplace: A Reference-Free, Conditioning-Aligned Benchmark for Material Replacement in Interior Scenes

MatReplace:用于室内场景材料替换的无参考、条件对齐基准

Mingzhe Du, Thong Thanh Nguyen, Nguyen Tran Cong Duy, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) VinUniversity

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对室内场景材料替换任务推出无参考基准MatReplace,定义三个条件轨道,实验发现命名材料渲染基本解决但像素视觉定位仍存挑战,专家评分验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23965 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 73%

RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation

RAGSentinel:用于鲁棒检索增强生成的可验证几何共识

Yueyang Quan, Anjun Gao, Yufei Xia, Minghong Fang, Zhuqing Liu

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究针对RAG系统的中毒攻击漏洞,提出无训练无标签的RAGSentinel防御方法,通过几何共识过滤中毒文档,实验显示其能低攻高保准且抗自适应攻击。

Comments To appear in EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-26 cs.CV cs.AI 版本更新 73%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Zhengrui Chen, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Yuan Wang, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24281 2026-08-26 cs.CV 新提交 70%

Example-based Robust Abnormality Detection with Minimal Annotations using Exemplar Med-DETR

基于范例的、使用最少标注的鲁棒异常检测:Exemplar Med-DETR

Sheethal Bhat, Bogdan Georgescu, Awais Mansoor, Mathias Zinnen, Pranjal Sahu, Florin C. Ghesu, Sasa Grbic, Andreas Maier

机构 * Friedrich-Alexander-Universität(弗里德里希-亚历山大大学) Siemens Healthineers(西门子医疗) Siemens Medical Solutions(西门子医疗解决方案)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对医学目标检测标注需求高的问题,扩展EM-DETR框架提出Exemplar Med-DETR方法,结合基于范例的特征生成与领域感知对比优化,用不足10%标注数据实现接近SOTA的胸部X射线异常检测性能,适配新疾病发现且无需大量重训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交 70%

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23845 2026-08-26 cs.CV 新提交 70%

Object Counting Across Modalities: Taxonomies, Benchmarks, Applications, and Open Challenges

跨模态物体计数:分类体系、基准、应用及开放挑战

Joana Konadu Owusu, Shivanand Venkanna Sheshappanavar

机构 * University of Wyoming(怀俄明大学) Geometric Intelligence Research Lab.(几何智能研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本综述针对跨模态物体计数领域,提出五轴分类体系,梳理应用领域挑战,给出路线图,强调需构建稳健评估基础设施区分开放世界泛化与基准优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24263 2026-08-26 cs.AI cs.CV 新提交 62%

Real-World Knowledge-Guided Change Data Synthesis for Remote Sensing

面向遥感的真实世界知识引导变化数据合成

Yaoyi Qi, Xingxing Weng, Chao Pang, Yongkang Cui, Xiangyu Hao, Xiaokang Zhang, Guibo Zhu, Gui-Song Xia

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Wuhan AI Research(武汉人工智能研究院) Institute of Automation, University of Chinese Academy of Sciences(中国科学院大学自动化研究所) Institute for Math & AI, Wuhan(武汉数学与人工智能研究院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出KnowChange框架,利用预训练视觉-语言模型实现知识引导的变化数据合成,其生成的紧凑规模数据在合成到真实迁移及增强任务中性能优于现有合成数据集,可提升合成数据下游效用。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02304 2026-08-26 cs.AI cs.LG 版本更新 62%

Comparing Explanations is Not Enough, Explain the Change: New Standards are Needed to Explain Behavioral Shifts in Large Language Models

比较解释并不足够,解释变化:需要新的标准来解释大型语言模型中的行为转变

Martino Ciaperoni, Marzio Di Vece, Roberto Pellungrini, Luca Pappalardo, Fosca Giannotti, Francesco Giannini

机构 * Scuola Normale Superiore(诺莱学院) ISTI-CNR(意大利国家研究委员会ISTI研究所) University of Pisa(比萨大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的XAI方法,旨在解释大型语言模型在干预后行为转变的原因和机制,以应对现有解释方法无法解释行为转变的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10863 2026-08-26 cs.LG cs.AI 版本更新 62%

ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents

ICA: 信息感知的信用分配用于基于视觉的长周期信息寻求智能体

Cong Pang, Xuyu Feng, Yujie Yi, Jiaqi Su, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

机构 * Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) SenseTime Research(商汤科技研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICA方法,通过视觉快照和信息层面信用分配,提升开放网络环境中信息寻求智能体的性能。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24876 2026-08-26 cs.AI cs.CL 新提交 57%

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

面向长 horizon 智能体利用的递归经验-工作记忆演化

Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling Yang

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对长 horizon 智能体的递归自我改进难题,提出 Recuris 架构,通过递归记忆演化提升任务成功率,在多个基准和模型上实现显著性能提升,为 RSI 提供可扩展基础。

Comments Code: this https URL (https://github.com/Gen-Verse/Recuris)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23839 2026-08-26 cs.RO cs.AI 新提交 57%

Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization

弹性对具身智能体系统的重要性:新指标、系统评估与优化

Yapeng Liu, Yuanzhao Zhai, Xudong Gong, Dawei Feng, Bo Ding, Lin Wang, Huaimin Wang

机构 * National University of Defense Technology(国防科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对具身智能体系统忽略弹性属性的问题,提出弹性评估框架与指标集,经400项家庭任务实验验证其诊断优化效果,揭示弹性特征间的权衡关系。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23723 2026-08-26 cs.CV 新提交 57%

DriftAD: Visually-Guided Text Drift for Few-Shot Industrial Anomaly Detection

DriftAD:用于小样本工业异常检测的视觉引导文本漂移

Wenyang Liu, Tianyi Liu, Dongshuo Zhang, Kejun Wu, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对现有小样本工业异常检测方法无法捕捉缺陷局部性与尺度依赖性的问题,提出含ASA、VGTD、DGSG模块及对应损失的DriftAD框架,在MVTec-AD和VisA数据集的1/2/4次设置下取得最优性能。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23640 2026-08-26 cs.AI cs.CL cs.CY 新提交 57%

Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes

审计合成回忆录:对照人生的文献记录,测量大语言模型生成自传中的场景层面虚构

Heather Renze

机构 * Serenze Global(塞伦兹全球)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文对照人生真实语料库审计LLM生成的自传,发现96.7%的场景验证失败,提出了可重复使用的审计工具及基于真实信息的补救方法。

Comments 20 pages, 4 figures, 6 tables. Code and derived data available at this https URL (https://github.com/heathriel/synthetic-memoir-audit)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23397 2026-08-26 cs.AI 版本更新 57%

MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction

MediSkill-Evo:面向证据依据的临床交互的过程约束自进化

Ruoyu Wu, Shenfu Xie, Yinqian Sun, Haibo Tong, Feifei Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-26 cs.CL cs.AI 版本更新 57%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10485 2026-08-26 cs.AI 版本更新 57%

Panning for Gold: Expanding Domain-Specific Knowledge Graphs with General Knowledge

寻找黄金:利用通用知识图谱扩展领域特定知识图谱

Runhao Zhao, Weixin Zeng, Wentao Zhang, Chong Chen, Zhengpin Li, Xiang Zhao, Lei Chen

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) The Center for machine learning research(机器学习研究中心) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出领域特定知识图谱融合任务,通过神经符号框架ExeFuse,利用通用知识图谱提升领域知识图谱的完整性和实用性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23688 2026-08-26 astro-ph.SR astro-ph.IM 新提交 50%

Agentic Active Learning Meets Visual Embeddings: Finding Anomalies among 370 000 Variable Stars from ASAS-SN

智能体主动学习结合视觉嵌入:从ASAS-SN的370000颗变星中发现异常天体

Milan Pesta, Yuan-Sen Ting

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 该研究提出结合多模态大语言模型智能体的主动学习框架,从ASAS-SN的37万余颗变星中高效发现异常天体,仅用约3小时、约40美元成本便得到含24个新异常的星表,验证了该方法的可行性。

Comments 24 pages, 12 figures, 6 tables. Submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19269 2026-08-26 cs.SE 版本更新 50%

What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals

内部稳定,跨样本未识别:基准效应与排名的语义识别

Xi Qin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究针对TraceElephant基准,揭示评估语义对结论的影响,通过分析F_asym、F_cc等的效应与排名,提出局部非蕴含见证及族索引审计方法。

Comments 31 pages; major revision; adds a commit-bound 124-unit Inspect Evals census, typed evidence-stopping taxonomy, executable claim-replay contract, full scientific appendix, and public reproducibility package

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-26 cs.CL 版本更新 50%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

Comments Paper accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-08-26 cs.CE 版本更新 50%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13830 2026-08-26 cs.IR 版本更新 50%

A Tale of Two Graphs: Separating Knowledge Exploration from Outline Structure for Open-Ended Deep Research

双图之 tale:分离知识探索与大纲结构以实现开放性深度研究

Zhuofan Shi, Ming Ma, Zekun Yao, Fangkai Yang, Jue Zhang, Dongge Han, Victor Rühle, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DualGraph架构,通过分离知识与写作结构,提升开放性深度研究的效率和深度,实验表明其在报告深度、广度和事实准确性上优于现有方法。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 7 篇

2608.24885 2026-08-26 cs.RO cs.CV 新提交 70%

Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning

机器人世界模型真的会遵循动作吗?面向策略学习的动作条件生成诊断与对齐

Sixiang Chen, Jiaming Liu, Jixian Wu, Yichen Guo, Tinghao Wang, Siyuan Qian, Hao Chen, Jiajun Cao, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) New York University(纽约大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对动作条件世界模型的动作遵循问题,提出WorldEcho诊断工具与WorldSync改进方法,经实验验证WorldSync可提升动作遵循性能,作为可靠模拟器助力策略改进并提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-08-26 cs.CV cs.AI cs.LG 版本更新 67%

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18532 2026-08-26 cs.CV cs.AI cs.RO 版本更新 62%

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: this https URL (https://dravenalg.github.io/VLANeXt/)

详情

展开后加载摘要…

URL PDF HTML 收藏