arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3148 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3148 篇

2105.00136 2021-05-04 cs.MM 78%

Cross-Modal Self-Attention with Multi-Task Pre-Training for Medical Visual Question Answering

Haifan Gong, Guanqi Chen, Sishuo Liu, Yizhou Yu, Guanbin Li

专题命中 视觉问答 :visual question answering(title,abstract)

Comments ICMR '21: ACM International Conference on Multimedia Retrieval, Taipei, Taiwan, August 21-24, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06216 2019-06-17 cs.CL 78%

Improving Visual Question Answering by Referring to Generated Paragraph Captions

Hyounghun Kim, Mohit Bansal

专题命中 视觉问答 :visual question answering(title,abstract)

Comments ACL 2019 (7 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.04229 2019-06-12 cs.CL 78%

Psycholinguistics meets Continual Learning: Measuring Catastrophic Forgetting in Visual Question Answering

Claudio Greco, Barbara Plank, Raquel Fernández, Raffaella Bernardi

专题命中 视觉问答 :visual question answering(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12008 2019-05-30 cs.CV cs.AI cs.CL cs.LG 78%

Leveraging Medical Visual Question Answering with Supporting Facts

Tomasz Kornuta, Deepta Rajan, Chaitanya Shivade, Alexis Asseman, Ahmet S. Ozcan

专题命中 视觉问答 :visual question answering(title);分类 cs.CV、cs.AI、cs.LG

Comments Working notes from the ImageCLEF 2019 VQA-Med competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17427 2026-08-19 cs.CV 新提交 77%

Counterfactual Anatomy-guided Spatial-Temporal Decoding for Annotation-Free Hallucination Mitigation in Medical VLMs

用于医学视觉语言模型无注释幻觉缓解的反事实解剖学引导时空解码

Yifan Lu, Adinath Dukre, Abhijit Das, Ziyun Zou, Haolin Yang, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) MedOS

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究提出无需人工注释的CAST框架,通过自动选择解剖区域结合对比解码,在SLAKE和MIMIC-CXR数据集上针对三种Med-VLMs实现优于基线的幻觉缓解,提升了医学视觉语言模型的空间接地性。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14841 2026-08-18 cs.AI 新提交 77%

What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering

重排序器所见:面向长文档多模态问答的多方面页面标注

Guanchen Wu, Jiayuan Ding, Subhabrata Mukherjee, Carl Yang

机构 * Emory University(埃默里大学) Hippocratic AI(希波克拉底人工智能公司)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI

AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09573 2026-08-11 cs.CV 新提交 77%

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准

Jiajun Xu, Yanghao Zhou, Jingyun Liao, Yu Bai, Jinxing Zhou, Chengliang Liu, Changsen Yuan, Bo Wang, Qian Liu

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 针对现有一次性交互式网站生成质量评估的不足,提出VideoVIBE基准与V2Lens多智能体系统,实验显示V2Lens可提升Video MLLM的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05631 2026-08-07 cs.CV 新提交 77%

ChronoVision: Temporal Reasoning via Latent State Reconstruction

ChronoVision:基于潜在状态重构的时序推理

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

专题命中 视觉问答 :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03292 2026-08-05 cs.AI 新提交 77%

DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法

Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02615 2026-08-05 cs.CL cs.AI 新提交 77%

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00976 2026-08-04 cs.CV 新提交 77%

Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models

面向医学视觉基础模型的位置感知细粒度表示学习

Myeongkyun Kang, Yanting Yang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 本研究提出基于位置感知细粒度表示学习的医学视觉基础模型LoFi,构建大规模医学定位数据集MedG,在多项医学视觉任务中性能优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28442 2026-07-31 cs.CV 新提交 77%

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA

ViewMind3D:用于无需训练的3D问答的模块化视图感知推理

Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng

专题命中 视觉问答 :grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28374 2026-07-31 cs.LG 新提交 77%

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) University of Sussex(萨塞克斯大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract_cn);分类 cs.LG

AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25393 2026-07-29 cs.CV 新提交 77%

Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment

迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架

Siyuan Xu, Yan Wang, Haofei Song, Lili Gao, Jiansheng Wang, Qing Zhang, Dan Huang, Boxiang Yun, Hongkai Xiong, Qingli Li

机构 * East China Normal University(华东师范大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司) Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究针对染色转移建模难题,提出DMCoStain框架,通过迭代优化数据与模型能力提升准确性和可解释性。基于IPE视觉语言模型构建MEGFS策略并创建ImmunoInstruction数据集,实验证明该框架达最优精度,其范式有实用价值,MEGFS可作评估工具。

Comments 10 pages, accepted by ACMMM2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25699 2026-07-22 cs.CV 版本更新 77%

AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning

AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理

Xiping Li, Jianghong Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。

Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16742 2026-07-21 cs.CV 新提交 77%

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model

人工智能生成的以人为中心的视频的多维质量评估:数据集与模型

Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学南加州大学文化创意产业学院) Polytech Nantes, Université de Nantes(法国南特大学高等理工学院)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对AI生成的以人为中心的视频质量评估问题,提出扩展数据集HVEval+并构建MoE-Rater模型,该模型采用专家混合及三阶段训练策略,能统一多种任务,在相关数据集上性能优越,推动了视频质量评估及T2V模型优化。

Comments Accepted for publication in IEEE TCSVT, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23216 2026-07-03 cs.CV 版本更新 77%

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

CaST-Bench:面向视频问答的因果链时空推理基准

Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan, Hsuan-Kung Yang, Caixin Kang, Yifei Huang, Yoichi Sato, Quan Kong

机构 * Woven by Toyota(丰田公司) The University of Tokyo(东京大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出CaST-Bench基准,通过构建包含因果链时空标注的数据集和评估指标,系统评测视觉语言模型在视频因果推理中的细粒度证据定位能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00159 2026-07-02 cs.CL cs.CV cs.IR cs.MM 新提交 77%

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强

Qian Ma, S M Rayeed, Charles V. Stewart, Qiong Wu, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 视觉问答 :VLM(abstract_cn);visual language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。

Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11689 2026-07-02 cs.AI 版本更新 77%

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型

Mei Chee Leong, Ying Gu, Hui Li Tan, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Singapore(新加坡)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02482 2026-06-30 cs.CV 77%

X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding

X-Stream: 探索多模态大语言模型作为多流理解的多路复用器

Peiwen Sun, Xudong Lu, Huadai Liu, Yang Bo, Dongming Wu, Huankang Guan, Minghong Cai, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Rui Liu, Xiangyu Yue

机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) Huawei Inc.(华为公司)

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。

Comments Project Page: https://peiwensun2000.github.io/xstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01173 2026-06-30 cs.CV 77%

EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment

EEmo-Logic:面向全面图像诱发情感评估的统一数据集与多阶段框架

Lancheng Gao, Ziheng Jia, Zixuan Xing, Wei Sun, Huiyu Duan, Guangtao Zhai, Xiongkuo Min

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出最大图像诱发情感理解数据集EEmoDB和统一多模态大语言模型EEmo-Logic,通过指令微调和任务定制GRPO实现细粒度情感问答与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25645 2026-06-25 eess.IV cs.CV cs.HC 版本更新 77%

Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

Colon-Bench:一种用于全流程结肠镜视频中可扩展密集病变标注的智能工作流

Abdullah Hamdi, Changchun Yang, Xin Gao

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科学与技术大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出Colon-Bench,通过多阶段智能工作流实现全流程结肠镜视频的密集病变标注,包含528个视频、14类病变、30万+边界框等,并评估多模态大模型在病变分类、开放词汇视频目标分割和视频视觉问答上的性能。

Comments published at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21968 2026-06-23 cs.CV cs.CL 新提交 77%

Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG

先看再缩放:视觉RAG中分辨率-上下文权衡的自适应路由

Oanh N. Tran, Thanh Quoc Hung Le, Oscar Chew, Kuan-Hao Huang, Khoa D. Doan

机构 * VinUni-Illinois Smart Health Center, VinUniversity(VinUni-Illinois智慧健康中心,VinUniversity) Texas A&M University(德克萨斯农工大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出ViRGo框架,通过自适应路由选择全局感知、基于补丁或注意力的检索,以平衡小目标细节和大目标上下文,提升视觉RAG的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20736 2026-06-23 cs.CV 新提交 77%

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

REKEY: 基于元数据的视觉键再生方法用于抗污染的VQA评估

Tengjie Lin, Yutao Sun, Jingwei Ni, Shuhan Ge, Hao-Xuan Ma, Yanting Miao, Wangyue Lu, Mingshuai Chen, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) University of Waterloo(滑铁卢大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);visual question answering(abstract);分类 cs.CV

AI总结 提出ReKey协议,通过随机再生图像中的视觉键来防止VQA基准测试泄露,实验显示原始项目得分比再生变体高9.5-18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23176 2026-06-17 cs.CV 版本更新 77%

DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准

Hao Vo, Khoa Vo, Phu Loc Nguyen, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Gladys Gawugah, Sreevenkata Anjani Tishita Godavarthi, Chase Rainwater, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le

机构 * University of Arkansas, USA(美国阿肯色大学) Google Research, Google(谷歌研究院) University of Liverpool, UK(英国利物浦大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出DriveSpatial基准,通过多视角、时空推理任务评估视觉语言模型在自动驾驶中的场景构建、关系理解、时序推理和泛化能力,发现人类与模型间存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12813 2026-06-16 cs.CV cs.MM 版本更新 77%

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

DPC-VQA: 解耦质量感知与残差校准用于视频质量评估

Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Baidu Inc.(百度公司) Xinjiang University(新疆大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出DPC-VQA框架,通过冻结多模态大模型提供感知先验,轻量校准分支预测残差修正,实现低训练成本下视频质量评估,在UGC和AIGC基准上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10572 2026-06-10 cs.AI 新提交 77%

One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA

每个多模态证据一个令牌:面向资源受限问答的潜在记忆

Zhi Zheng, Ziqiao Meng, Hao Luan, Wei Liu, Wee Sun Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出潜在记忆范式,将每个证据压缩为单个高维潜在令牌,通过统一训练实现高效检索与生成,在资源受限场景下以3-10倍令牌节省达到竞争性问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07549 2026-06-09 cs.AI cs.MA 新提交 77%

PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow

PathoSage:通过经验感知的代理工作流实现病理学多源证据裁决

Chengyang Zhang, Wenchuan Zhang, Bo Li, Mengran Li, Bob Zhang, Yuhao Yi, Hong Bu, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Department of Pathology and Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科/临床病理研究所) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出PathoSage框架,通过结构化证据审议和Beta-Bernoulli经验系统,独立评估工具证据并解决冲突,减少幻觉和分类器分歧,提升病理学推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04708 2026-06-05 cs.RO cs.AI 77%

VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training

VISTA: 基于视觉和物理验证的UMI数据适配用于VLA训练

Siyuan Yang, Linzheng Guo, Ouyang Lu, Zhaxizhuoma, Daoran Zhang, Xinmiao Wang, Ting Xiao, Fangzheng Yan, Zhijun Chen, Yan Ding, Chao Yu, Chenjia Bai, Xuelong Li

机构 * Institute of AI (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Lumos Robotics(Lumos机器人) University of Science and Technology of China(中国科学技术大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学) Harbin Engineering University(哈尔滨工程大学) Fudan University(复旦大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 提出VISTA框架,通过UMI-VQA数据集对齐视觉表示、物理验证流水线筛选可行轨迹以及两阶段联合训练,解决UMI数据训练VLA模型时的视觉分布偏移和物理不可行动作问题。

Comments Corrected the typing error

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00829 2026-06-02 cs.CV 77%

The Right Inference Strategy Is All You Need: Nearly Training-Free Domain-Wise Inference for EgoCross Challenge

正确的推理策略即是一切:面向EgoCross挑战的近乎无需训练的领域感知推理

Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Knowin

专题命中 视觉问答 :VLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对EgoCross挑战中源受限场景下多模态大模型在领域偏移严重的自我中心视频问答任务上表现不佳的问题,提出一种领域感知推理策略,通过为四个目标领域分别设计不同的输入、提示和答案映射流程,在不进行额外训练的情况下显著提升基线模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏