arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2608.20492 2026-08-24 cs.CV 新提交 77%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 视觉定位与Grounding :MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: https://orarl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01460 2026-08-19 cs.CV 版本更新 77%

Reinforcing Consistency in Video MLLMs with Structured Rewards

通过结构化奖励强化视频MLLMs的一致性

Yihao Quan, Zeru Shi, Jinman Zhao, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19759 2026-08-19 cs.CV 版本更新 77%

Vision-Language Enhanced Foundation Model for Semi-Supervised Medical Image Segmentation

增强视觉-语言能力的半监督医学图像分割基础模型

Jiaqi Guo, Mingzhen Li, Hanyu Su, Keigo Healy, Lexiaozi Fan, Neda Tavakoli, Santiago López-Tapia, Daniel Kim, Aggelos K. Katsaggelos

机构 * ECE, Northwestern University(电气工程与计算机科学系,西北大学) Stats, Northwestern University(统计学系,西北大学) Radiology, Northwestern University(放射学系,西北大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出VESSA模型,通过增强视觉-语言能力的半监督方法提升医学图像分割精度,实验表明其在有限标注条件下表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13343 2026-08-14 cs.CV 新提交 77%

AmalthAI: An Open-Source Computer Vision Platform for Cultural Heritage

AmalthAI:面向文化遗产的开源计算机视觉平台

Christos Chatzisavvas, Stelios Alvanos, Efstratios Politis, Panagiotis Rigas, Thomas Pappas, Ioannis Giannoukos, Nikolaos Mitianoudis, Agata Ulanowska, Katarzyna Żebrowska, Nazarij Buławka, Christina Margariti, George Pavlidis, Chairi Kiourt, Anestis Koutsoudis, Vassilis Katsouros, George Ioannakis

机构 * Democritus University of Thrace(德谟克利特色雷斯大学) Athena Research Center(雅典娜研究中心) National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学) University of Warsaw(华沙大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 AmalthAI是面向文化遗产领域专家的开源计算机视觉平台,通过集成Kubeflow、Katib等工具,支持数据集管理、模型训练与推理,可保障敏感考古数据安全,已在黏土织物印痕数据集上验证其功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02711 2026-08-14 cs.CV 版本更新 77%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract_cn);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 77%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 视觉定位与Grounding :multimodal large language model(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14098 2026-08-13 cs.CV 版本更新 77%

ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization

ForgeryVCR: 通过高效的取证工具在MLLMs中实现视觉中心推理用于图像伪造检测与定位

Youqi Wang, Shen Chen, Haowei Wang, Rongxuan Peng, Taiping Yao, Shunquan Tan, Changsheng Chen, Bin Li, Shouhong Ding

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 ForgeryVCR通过高效的取证工具实现视觉中心推理,提升图像伪造检测与定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26046 2026-08-11 cs.RO cs.CV 版本更新 77%

RoboAtlas: Contextual Active SLAM

RoboAtlas:上下文感知主动SLAM

Alexander Schperberg, Shivam K. Panda, Abraham P. Vinod, Rokaha Bhagawan, M. K. Jawed, Stefano Di Cairano

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出RoboAtlas框架,通过上下文感知的多臂赌博机平衡几何探索与语义推理,结合3D语义地图OpenRoboVox,在真实环境中实现100%任务成功率,并在GOAT-Bench上以90.6%成功率达到SOTA。

Comments Alexander Schperberg and Shivam K. Panda made equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05699 2026-08-07 cs.CV 新提交 77%

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding

TAU-Bench:从异常实例跟踪到细粒度视频异常理解

Kepeng Yang, Dongxuan Liu, Rongxin Gao, Zixin Su, Rui Wu, Shuzhao Xie, Chenxin Li, Panwang Pan, Yuzhi Huang, Yue Huang, Jingyan Jiang

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 该研究引入TAU-Bench这一以跟踪为核心的基准,用于联合评估异常实例跟踪与细粒度视频异常理解,发现现有视觉-语言模型存在语义推理与视觉接地的差距,为构建更可靠的视频异常理解系统提供了关键评估方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 77%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07916 2026-08-05 cs.CV 版本更新 77%

Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation

Tarot-SAM3: 无需训练的SAM3用于任意指称表达分割

Weiming Zhang, Dingwen Xiao, Songyue Guo, Guangyu Xiang, Shiqi Wen, Minwei Zhao, Lei Chen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 Tarot-SAM3通过引入推理辅助提示和自修复机制,实现对任意指称表达的高效分割,有效解决传统方法对长或隐含表达的处理难题。

Comments We need to make a huge revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22768 2026-08-05 cs.CV 77%

From Pixels to Semantics: A Multi-Stage AI Framework for Structural Damage Detection in Satellite Imagery

从像素到语义:一种多阶段AI框架用于卫星图像中的结构损坏检测

Bijay Shakya, Catherine Hoier, Khandaker Mamun Ahmed

机构 * The Beacom College of Computer & Cyber Sciences, Dakota State University(达科他州立大学比康计算机与网络科学学院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种多阶段AI框架,结合超分辨率、目标检测和视觉-语言模型,提升灾害后建筑损坏评估的语义解读能力,通过CLIPScore和多模型策略提高检测可靠性。

Journal ref IEEE/CVF Conference on Computer Vision & Pattern Recognition Workshop (CVPRW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11385 2026-08-04 cs.CV 版本更新 77%

DeceptionX: From Multimodal Evidence to Explainable Deception Detection

DeceptionX: 基于多模态大语言模型的可解释欺骗检测

Jiayu Zhang, Shuo Ye, Jiajian Huang, Yawen Cui, Taorui Wang, Wei Xia, Zeheng Wang, Haowen Tang, Yelin Wang, Hui Ma, Zitong Yu

机构 * Great Bay University(大湾区大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出DeceptionX框架,将欺骗检测从黑箱分类转变为可解释的观察-思考-总结推理过程,通过构建DeceptChain数据集和三阶段训练管道,在标准基准上超越现有方法,同时提供专家级可解释推理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29222 2026-08-03 cs.CV 新提交 77%

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?

Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao, Ronghao Xian, Yao Jiang, Zhao Gao, Keren Fu, Qijun Zhao, Jian Cheng

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。

Comments 10 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25196 2026-07-29 cs.LG 新提交 77%

Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs

重新思考对比解码:关于多模态大语言模型中对比解码在减轻对象幻觉方面无效性的可重复性研究与扩展

Arnav Bendre, Guneesh Gupta, Kavish Grover, Chayan Aggarwal, Shreyansh Modi

机构 * Indian Institute of Technology, Roorkee(印度理工学院鲁尔基分校)

专题命中 视觉定位与Grounding :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 研究多模态大语言模型中对比解码减轻对象幻觉的有效性,通过重现和扩展相关研究,进行多实验验证其在不同数据集上效果,发现其带来的改善常是虚假的,挑战了当前策略有效性,推动更可靠方法开发。

Comments 32 pages, 9 Figures, submitted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30201 2026-07-23 cs.CV cs.CL 版本更新 77%

SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

SHOVIR:评估放射学报告生成中视觉捷径学习的基准

Filippo Ruffini, Marco Salmé, Rosa Sicilia, Valerio Guarrasi, Paolo Soda

机构 * UniCamillus-Saint Camillus International University of Health Sciences, Rome, Italy(乌尼卡米尔斯-圣卡米卢斯国际健康科学大学,意大利罗马)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出SHOVIR基准,通过遮挡实验检测放射学报告生成模型是否依赖视觉捷径而非真实病理证据,发现高报告质量模型未必具有良好空间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17693 2026-07-21 cs.CV 新提交 77%

Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation

用于无训练测试时医学图像分割的内存支持协同适应

Lingrui Li, Nan Pu, Dong Zhao, Wenjing Li, Andrew P French, Zhun Zhong, Xin Chen

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计支柱)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究针对医学图像分割中测试时适应的挑战,提出内存支持协同适应(MSSA)框架,不更新模型参数,通过构建在线内存、文本引导语义先验及跨图像结构对齐实现稳健适应,实验证明其优于现有方法。

Comments 18 pages, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11470 2026-07-15 cs.CV 版本更新 77%

Sat2RealCity: Geometry-Aware and Appearance-Controllable 3D Urban Generation from Satellite Imagery

Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成

Xinliang Wang, Yijie Kang, Zhenyu Wu, Yifeng Shi

机构 * KE Holdings Inc.(KE控股公司) Beijing, China(中国北京)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。

Comments The first two authors contributed equally. The fourth author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交 77%

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08798 2026-07-13 cs.GR cs.CV 新提交 77%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00296 2026-07-07 cs.LG cs.CR 版本更新 77%

VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild

VLMGuard:从野生未标记视觉语言提示中引导恶意提示检测器

Junlin Fang, Wenyu Chen, Reshmi Ghosh, Robert Sim, Ahmed Salem, Vitor R. Carvalho, Emily Lawton, Sharon Li, Jack W. Stokes, Sean Du

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Physical and Mathematical Sciences(物理与数学科学学院) Microsoft Corp.(微软公司) Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 研究针对视觉语言模型易受恶意输入影响的问题,提出VLMGuard框架,利用野生未标记用户提示,通过自动恶意估计分数区分良性和恶意样本,训练二进制提示分类器,无需额外人工标注,效果优于现有方法。

Comments Accepted to Transactions on Machine Learning Research (07/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 77%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30220 2026-06-30 cs.CV 77%

From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

从准确性到视觉依赖性:审计与过滤交通视频问答中的模态崩溃

Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim, Zeynep Akata

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 针对交通视频问答中模型依赖文本捷径而非视觉证据的问题,提出盲差距和视觉增益两个数据集级诊断指标,以及实例级捷径分数实现无训练过滤,提升视觉基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 77%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新 77%

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22488 2026-06-23 cs.AI 新提交 77%

SCOPE: Evolving Symbolic World for Planning in Open-Ended Environments

SCOPE:面向开放环境规划的演化符号世界

Yundaichuan Zhan, Minghe Gao, Zhongqi Yue, Wendong Bu, Wenqiao Zhang, Guoming Wang, Jisheng Dang, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Chalmers University of Technology(查尔姆斯理工大学) Lanzhou University(兰州大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.AI

AI总结 提出SCOPE框架,通过符号执行模拟器和自适应符号记忆模块,在开放环境中演化符号世界表示,提升规划完整性和鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30226 2026-06-09 cs.RO cs.AI 版本更新 77%

BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models

BORA: 弥合离线强化学习与在线残差适应以实现真实世界灵巧VLA模型

Zhongxi Chen, Yifan Han, Yanming Shao, Huanming Liu, Congsheng Xu, Xiaoyu Chen, Yao Mu, Wenzhao Lian

机构 * Shanghai Jiao Tong University(上海交通大学) CASIA(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) USTC(中国科学技术大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 提出BORA框架,通过离线构建动作条件价值引导的评论家,并结合在线冻结VLA基础、引入人类在环的分块残差适应机制,解决灵巧操作中高维探索导致的时间不一致、样本低效和硬件风险问题,在五个真实灵巧任务上平均成功率提升33%。

Comments 24 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08168 2026-06-08 cs.RO cs.AI 版本更新 77%

ViVa: A Video-Generative Value Model for Robot Reinforcement Learning

ViVa:用于机器人强化学习的视频生成价值模型

Jindi Lv, Hao Li, Jie Li, Fankun Kong, Yang Wang, Pengfei Yi, Yifei Nie, Xiaofeng Wang, Zheng Zhu, Chaojun Ni, Qiuping Deng, Hengtao Li, Jiancheng Lv, Guan Huang

机构 * GigaAI Sichuan University(四川大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.AI

AI总结 提出ViVa,利用预训练视频生成器联合预测未来本体感受和标量价值,通过时空先验实现可靠价值估计,在三个任务中取得最优结果,与RECAP结合平均成功率达80%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18577 2026-06-04 cs.AI 77%

MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning

MedForge:基于伪造感知推理的可解释医学深度伪造检测

Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学) Xi’an Jiaotong University(西安交通大学) Guangdong Provincial People’s Hospital(广东省人民医院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 提出MedForge框架,通过构建大规模基准数据集MedForge-90K和局部-分析推理方法,实现可解释的医学图像伪造检测,在准确性和专家对齐解释上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01600 2026-06-02 cs.CV cs.CL cs.RO 77%

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

RoboTrustBench:机器人操作视频世界模型的可信度基准测试

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。

Comments Project: https://huiqiongli.github.io/RoboTrustBench/

详情

展开后加载摘要…

URL PDF HTML 收藏