arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 34 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2506.12202 2026-08-26 cs.PL cs.AI cs.CR cs.LG 版本更新 62%

Quasar: A Programming Language Specialized for LLM Code Actions

Quasar:一种专门用于LLM代码操作的编程语言

Stephen Mell, Botong Zhang, David Mell, Shuo Li, Ramya Ramalingam, Nathan Yu, Stephan Zdancewic, Osbert Bastani

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出专门用于LLM代码操作的编程语言Quasar,通过分离内部代码与外部调用实现新特性,还实现了访问控制、自动并行化、共形预测等增强代码操作的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 11 篇

2608.21170 2026-08-26 cs.CV cs.AI 版本更新 91%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Daniel Kurzawe, Jan Philip Wahle, Bela Gipp

专题命中 视觉推理 :VLM(title,summary_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14026 2026-08-26 cs.CE 版本更新 85%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-26 cs.CV cs.AI 版本更新 81%

EviPathBench: Benchmarking Evidence Acquisition and Reasoning in Vision-Language Models for Whole-Slide Pathology

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-08-26 cs.CV cs.AI cs.CL 版本更新 81%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-08-26 cs.CV 版本更新 79%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: this https URL (https://shinmohuang.github.io/spatialdise_page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-08-26 cs.AI 版本更新 70%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-26 cs.CV cs.AI 版本更新 62%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Zeyu Wang, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Hongyi Fu, Jianxiong Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20073 2026-08-26 cs.CL cs.AI cs.LG 版本更新 62%

A Modular Multitask Reasoning Framework Integrating Spatio-temporal Models and LLMs

整合时空模型与大语言模型(LLMs)的模块化多任务推理框架

Kethmi Hirushini Hettige, Jiahao Ji, Cheng Long, Shili Xiang, Gao Cong, Jingyuan Wang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Institute for Infocomm Research, A*STAR, Singapore(资讯通信研究院) School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出整合时空模型与LLMs的STReason框架,通过上下文学习分解查询生成解释,在时空推理任务中显著优于LLM基线,可抑制幻觉并减少专家工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22018 2026-08-26 cs.AI 版本更新 57%

SPAR-Hate: Auditor-Guided Multi-Perspective Role Reasoning for Bilingual Hate Speech Parsing

SPAR-Hate:一种由审核员引导的用于双语仇恨言论解析的多智能体框架

Yifan Lyu, Dianqing Lin, Xinran Li, Jiaqi Qiao, Xiujuan Xu

机构 * Dalian University of Technology(大连理工大学) Inner Mongolia University(内蒙古大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 针对结构化仇恨言论解析的文化等挑战,提出SPAR-Hate多智能体框架,分解文档为决策单元后从三视角生成判断并仲裁,在基准上实现双语仇恨解析最优结果。

Comments 16 pages, 2 figures. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-08-26 cs.CV 版本更新 57%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :VLM(abstract_cn);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19001 2026-08-26 cs.CV 版本更新 57%

Life-Bench: A Benchmark and Knowledge Graph Framework for Multimodal Personalization Beyond Concept Recognition

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 14 篇

2602.23553 2026-08-26 cs.CV 版本更新 84%

RT-NeuS: Towards Real-Time Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, S P Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Camera-ready version, accepted at NeuS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23474 2026-08-26 cs.CL cs.AI cs.CV 版本更新 84%

What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

有何玄机?评估视觉-语言模型的时间一致性

Marek Hradil, Danae Sánchez Villegas

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出TimeCatch基准,发现视觉-语言模型可检测单帧异常但难整合跨帧信息,在时间异常检测上表现接近随机水平。

Comments 17 pages, ACL format

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-26 cs.AI cs.CL cs.CV cs.MM 版本更新 84%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20405 2026-08-26 cs.CL 版本更新 78%

ARGUS: Theory-of-Mind Guided Argument Generation with Strategy-Aware Planning and Knowledge Grounding

ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地

Zhe Hu

机构 * InspireOmni AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-26 cs.CV cs.AI 版本更新 73%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Zhengrui Chen, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Yuan Wang, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02304 2026-08-26 cs.AI cs.LG 版本更新 62%

Comparing Explanations is Not Enough, Explain the Change: New Standards are Needed to Explain Behavioral Shifts in Large Language Models

比较解释并不足够,解释变化:需要新的标准来解释大型语言模型中的行为转变

Martino Ciaperoni, Marzio Di Vece, Roberto Pellungrini, Luca Pappalardo, Fosca Giannotti, Francesco Giannini

机构 * Scuola Normale Superiore(诺莱学院) ISTI-CNR(意大利国家研究委员会ISTI研究所) University of Pisa(比萨大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的XAI方法,旨在解释大型语言模型在干预后行为转变的原因和机制,以应对现有解释方法无法解释行为转变的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10863 2026-08-26 cs.LG cs.AI 版本更新 62%

ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents

ICA: 信息感知的信用分配用于基于视觉的长周期信息寻求智能体

Cong Pang, Xuyu Feng, Yujie Yi, Jiaqi Su, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

机构 * Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) SenseTime Research(商汤科技研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICA方法,通过视觉快照和信息层面信用分配,提升开放网络环境中信息寻求智能体的性能。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23397 2026-08-26 cs.AI 版本更新 57%

MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction

MediSkill-Evo:面向证据依据的临床交互的过程约束自进化

Ruoyu Wu, Shenfu Xie, Yinqian Sun, Haibo Tong, Feifei Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-26 cs.CL cs.AI 版本更新 57%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10485 2026-08-26 cs.AI 版本更新 57%

Panning for Gold: Expanding Domain-Specific Knowledge Graphs with General Knowledge

寻找黄金:利用通用知识图谱扩展领域特定知识图谱

Runhao Zhao, Weixin Zeng, Wentao Zhang, Chong Chen, Zhengpin Li, Xiang Zhao, Lei Chen

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) The Center for machine learning research(机器学习研究中心) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出领域特定知识图谱融合任务,通过神经符号框架ExeFuse,利用通用知识图谱提升领域知识图谱的完整性和实用性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19269 2026-08-26 cs.SE 版本更新 50%

What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals

内部稳定,跨样本未识别:基准效应与排名的语义识别

Xi Qin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究针对TraceElephant基准,揭示评估语义对结论的影响,通过分析F_asym、F_cc等的效应与排名,提出局部非蕴含见证及族索引审计方法。

Comments 31 pages; major revision; adds a commit-bound 124-unit Inspect Evals census, typed evidence-stopping taxonomy, executable claim-replay contract, full scientific appendix, and public reproducibility package

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-26 cs.CL 版本更新 50%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

Comments Paper accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-08-26 cs.CE 版本更新 50%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13830 2026-08-26 cs.IR 版本更新 50%

A Tale of Two Graphs: Separating Knowledge Exploration from Outline Structure for Open-Ended Deep Research

双图之 tale:分离知识探索与大纲结构以实现开放性深度研究

Zhuofan Shi, Ming Ma, Zekun Yao, Fangkai Yang, Jue Zhang, Dongge Han, Victor Rühle, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DualGraph架构,通过分离知识与写作结构,提升开放性深度研究的效率和深度,实验表明其在报告深度、广度和事实准确性上优于现有方法。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 2 篇

2603.00188 2026-08-26 cs.CV cs.AI cs.LG 版本更新 67%

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18532 2026-08-26 cs.CV cs.AI cs.RO 版本更新 62%

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: this https URL (https://dravenalg.github.io/VLANeXt/)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 2 篇

2605.31351 2026-08-26 cs.CL cs.CV 版本更新 90%

VIABLE: A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

面向VLM-as-a-Judge评估的视障辅助基准

Yi Zhao, Siqi Wang, Zhe Hu, Yushi Li, Jing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);分类 cs.CV

AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-08-26 cs.CV cs.AI 版本更新 62%

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏