arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-31 至 2026-08-31 共收录 44 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2608.28406 2026-08-31 cs.CV cs.LG 新提交 79%

Post-Training VLMs for Video Mistake Detection

用于视频错误检测的后训练视觉语言模型

Federico Spurio, Olga Zatsarynna, Lars Doorenbos, Emad Bahrami, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Toyota Motor Europe Belgium(丰田汽车欧洲比利时公司)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.LG

AI总结 针对视频错误检测的闭集方法泛化性差的问题,提出首个VLM后训练技术,采用定制奖励函数,在EP-VQA上较最佳基线提升11.6%,实现更好的泛化。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27467 2026-08-31 cs.CL cs.AI cs.HC 新提交 74%

UIC-AIHealth4All at ArchEHR-QA 2026: Answer-First Evidence Grounding for Clinical Question Answering

UIC-AIHealth4All参加ArchEHR-QA 2026:面向临床问答的优先答案式证据定位

Mohammad Arvan, Hossein Haeri, Natalie Parde, Rebecca T. Feinstein

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 视觉问答 :grounding(title);分类 cs.AI

AI总结 UIC-AIHealth4All系统参加ArchEHR-QA 2026共享任务,针对相关子任务提出优先答案式流程等方法,在三项任务中取得对应排名,还发现模型输出可读性需优化的问题。

Comments 10 pages, 2 figures, 6 tables. System description paper for the UIC-AIHealth4All submission to the ArchEHR-QA 2026 shared task, presented at the CL4Health workshop, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 9 篇

2608.27461 2026-08-31 cs.CL cs.AI cs.LG 新提交 79%

SciReC: Diagnostic Evaluation of Multimodal, Multi-Turn Relational Reasoning with Adaptive Interaction

SciReC:基于自适应交互的多模态多轮关系推理诊断评估

Nilay Yilmaz, Naga Sai Abhiram Kusumba, Stella Wenxing Liu, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Capital One(第一资本金融公司)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究构建了多模态学术对话基准SciReC,提出缺陷诊断框架DMRA评估多模态大语言模型的关系推理能力,发现不同模型在各类关系及领域上的表现差异,明确错误的主要来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27929 2026-08-31 cs.CV 新提交 77%

Training-Free Temporal Abstraction for General Video Understanding

用于通用视频理解的无训练时间抽象

Etienne Casanova, Sevan Brodjian, Pietro Perona

机构 * California Institute of Technology(加州理工学院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出无训练的STITCH方法,将视频划分为语义时间块,在三个视频理解任务上表现具竞争力,为通用视频理解提供新方向。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-08-31 cs.AI 新提交 70%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27869 2026-08-31 cs.AI 新提交 70%

See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs

观测、假设、验证:用于发现控制偏微分方程的多模态智能体框架

Sarang Manoj Pekhale, Amartya Roy, Rajat Sarkar, Souvik Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院) Robert Bosch GmbH(罗伯特·博世有限公司) TCS Research(塔塔咨询服务公司研究院) Yardi School of Artificial Intelligence (ScAI)(亚迪人工智能学院) Department of Applied Mechanics(应用力学系)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出多模态智能体框架MAGE,通过四个专业化智能体协作迭代发现控制PDE,在经典PDE套件等测试中实现优异恢复与误差表现,支持无库控制定律发现的结构化智能体推理研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28402 2026-08-31 cs.AI 新提交 57%

VERA-8B: Evidence-Grounded Audit Risk Reasoning from SEC Filings

VERA-8B:基于SEC文件的证据支撑审计风险推理模型

Menghan Liu, Elynn Chen

机构 * New York University(纽约大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 该研究推出端到端审计推理系统VERA-8B,统一SFT与GRPO实现证据支撑审计推理,引入弃权机制,设计AuditBridge实现原始文件到可用报告的转换,性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27871 2026-08-31 cs.CV 新提交 57%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27549 2026-08-31 cs.CV 新提交 57%

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

代码即世界:用于物理推理的可执行世界表征的智能体式发现

Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu

机构 * MirroS

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出Code-as-World范式,通过智能体式发现循环构建可执行世界表征,将其用于为视觉-语言模型训练提供物理监督,在QuantiPhy数据集上取得最优性能且超越领先专有模型

Comments Project Page: this https URL (https://mirros-lab.github.io/code-as-world)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28212 2026-08-31 cs.MM cs.SD 新提交 50%

MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance

MuSP-Bench:面向乐谱与演奏的高级多模态音乐理解基准测试

Milan Liessens Dujardin, Song-Ze Yu, Kevin Miao

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 研究人员推出MuSP-Bench基准测试,含490个乐谱与演奏理解问题,评估发现前沿多模态大语言模型理解乐谱困难,推理演奏音频时挑战更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27932 2026-08-31 cs.HC 新提交 50%

Graphionale: How Graph Visualizations of LLM Rationales Affect Human Decision Making

Graphionale:LLM推理依据的图形可视化如何影响人类决策

Xinru Wang, Zhexuan Ma, Ming Yin, Shuai Ma, Thomas W Malone

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 本研究开发了Graphionale作为测试平台,通过204人在线用户研究发现,图形化LLM推理依据对不同任务模态的决策影响不同,匹配推理格式与任务模态是AI解释设计的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 11 篇

2608.28216 2026-08-31 cs.CV 新提交 84%

WALDO: One-Shot Exemplar-Conditioned Object Detection in Cluttered Scenes

WALDO:杂乱场景中的一次性示例条件目标检测

Kishor Datta Gupta, Ahmed Rafi Hasan, Md. Mahfuzur Rahman, Md. Sadman Haque, Mohd Ariful Haque

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(联合国际大学)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出WALDO检测头,利用V-JEPA 2.1特征实现低成本一次性示例条件目标检测,在杂乱场景的AP@50优于Grounding DINO,验证了世界模型特征对定位和不存在检测的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28192 2026-08-31 cs.CV 新提交 83%

Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

在视频中定位任意目标:重新思考高效的生成式时空视频定位

Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of California, Merced(加州大学默塞德分校) Apertix(阿珀蒂克斯公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对时空视频定位的自回归解码存在延迟高、误差易传播的问题,提出并行轨迹解码,在VidSTG等数据集上实现显著的延迟降低与吞吐量提升,且可零样本泛化到多项相关任务

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28246 2026-08-31 cs.RO cs.AI 新提交 79%

Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring

基于视觉语言模型与几何表面评分的免训练变形无菌纸箱吸盘抓取检测

Marin Maletic, Goran Vasiljevic

机构 * University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算机学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI

AI总结 该研究针对可回收废物机器人分拣的挑战,提出一种免训练的变形无菌纸箱吸盘抓取系统,结合视觉语言模型、SAM2与几何表面评分方法,在真实机器人实验中取得了良好的抓取与检索效果。

Comments 6 pages, ICCAS 2026 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27997 2026-08-31 cs.CV cs.MM 新提交 79%

A-PAIR: A Benchmark and Identity-Consistent Grounding Framework for Air-Ground Cross-View Referring Person Detection

A-PAIR:空-地跨视角参考人物检测的基准与身份一致的定位框架

Zhoupeng Guo, Xinjie Yao, Yunqi Zhu, Zhihe Fan, Siqi Zhao, Jianjun Chen, Yichen Dong, Yan Fan, Pengfei Zhu

机构 * School of Automation, Southeast University(东南大学自动化学院) Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) School of Sports Training, Tianjin University of Sport(天津体育学院运动训练学院) Tianjin University(天津大学) National University of Defense Technology(国防科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对空-地跨视角参考人物检测的挑战,本文提出首个该任务基准A-PAIR及ICRG框架,将对级F1从16.65%提至22.28%,验证了配对检测与身份一致推理的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28108 2026-08-31 cs.RO cs.CV 新提交 70%

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA:在单一视觉-语言-动作模型(VLA)中统一基于语言和指示手势的指令模式

Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出DeicticVLA,将三种指令模式统一于单一VLA,经仿真与真实任务验证,其在未见场景和新类别下的表现优于仅用语言指令的模型,为相关设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28491 2026-08-31 cs.AI cs.RO 新提交 57%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28363 2026-08-31 cs.AI 新提交 57%

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses

EvoUndo:面向大语言模型智能体执行框架的可恢复性约束自进化

Tanmay Sah, Dolly Sah, Harshul Jain, Tanya Sah

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体自进化的可恢复性问题,提出EvoUndo框架,通过协同设计验证、状态落地等,在600个任务中实现高比例的失败变更恢复,且效应存在模型依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27902 2026-08-31 cs.CL cs.AI 新提交 57%

LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages

LandingAgent:用于落地页的参考标注数据集与智能体生成框架

Injun Baek, HyeongSeok Lee, Yearim Kim, Junhoo Lee, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对落地页生成中通用模板与无依据主张的问题,本文提出智能体框架LandingAgent,结合参考标注数据集LandingBench,实验验证其在目标适配性、呈现质量等方面优于直接生成方法。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27840 2026-08-31 cs.AI cs.IR 新提交 57%

An Empirical Evaluation of Cross-City POI Recommendation on a Large-Scale Benchmark

大规模基准下跨城市兴趣点(POI)推荐的实证评估

Peibo Li, Yang Song, Hao Xue, Maarten de Rijke, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文以大规模基准Trip World开展跨城市POI推荐实证评估,发现现有SOTA方法存在三个瓶颈,且适配的智能体方法效果不佳,凸显需设计任务特定的跨城市推荐方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27675 2026-08-31 cs.AI 新提交 57%

Agents for Everyone: A Workshop Framework for Building Agentic AI Capabilities in a Distributed Curation Community

面向所有人的智能体:分布式整理社区中构建智能体AI能力的研讨会框架

Seth Carbon, Sierra Moxon, Kimberly Van Auken, Pascale Gaudet, Christopher J. Mungall

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对智能体AI应用于生物数据库整理的障碍,构建了基于JupyterHub与Claude Code的云环境及含四个模块的研讨会,证明其可提升分布式社区的智能体AI整理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27668 2026-08-31 cs.CV 新提交 57%

Report Supervision

报告监督

Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal, Jieneng Chen, Xinze Zhou, Zheren Zhu, Chuntung Zhuanga, Sergio Decherchi, Andrea Cavalli, Kang Wang, Yang Yang, Alan Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) University Hospital Basel(巴塞尔大学医院) Stanford University(斯坦福大学) University of California, San Francisco(加利福尼亚大学旧金山分校) Italian Institute of Technology(意大利技术研究院) University of Bologna(博洛尼亚大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Johns Hopkins Medicine(约翰斯·霍普金斯医疗集团)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出报告监督(R-Super)框架,利用大量放射学报告补充稀缺的肿瘤掩码训练数据,在肾脏和胰腺肿瘤分割任务上显著提升了AI的检测与分割性能。

Comments Published in Medical Image Analysis, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 3 篇

2608.27531 2026-08-31 cs.CR cs.CV 新提交 79%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27753 2026-08-31 cs.CV 新提交 77%

What Can Low Resource Languages Learn From Each Other?

低资源语言能从彼此间学到什么?

Achyuth P, Kahaan Shah, Chetan Arora

机构 * IIT Delhi(印度理工学院德里分校)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对低资源语言OCR数据稀缺问题,提出PSMC框架,通过融合语言特定专家实现知识迁移,在10种印度文字上使词识别率平均提升约2%。

Comments 16 pages, 4 Tables, 6 Figures. To appear at ICDAR 2026. This version predates reviewer revisions. A revised version will be posted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28248 2026-08-31 cs.CV cs.CL 新提交 70%

Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images

Synth-JDoc:用于OCR的、包含多样布局与嵌入图像的日文文档图像数据集合成

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(信息学研究所) NII LLMC(信息学研究所语言媒体研究中心)

专题命中 文档图表理解 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本研究构建了含多样布局与嵌入图像的日文文档合成OCR数据集,可有效提升大型视觉语言模型读取竖排日文文本的性能,相关资源已公开。

Comments Accepted to ICDAR 2026, 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 5 篇

2608.27793 2026-08-31 cs.RO 新提交 90%

CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments

CAVE-NAV:基于VLM的水下洞穴环境自主三维导航

Zhenqi Wu, Yuanjie Lu, Yisheng Zhang, Miao Yu, Xuesu Xiao, Jaejeong Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) George Mason University(乔治梅森大学) University of Maryland(马里兰大学) Seoul National University(首尔大学)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract)

AI总结 该研究针对水下洞穴导航的传统方法局限,提出带CoT推理的VLM导航框架,经仿真验证可完成无碰撞的端到端三维洞穴导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27866 2026-08-31 cs.CV 新提交 77%

Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents

Iron:用于增强通用虚拟智能体的意图对齐与回溯双学习框架

Jiahe Ying, Wendong Bu, Kaihang Pan, Bingchen Miao, Siyu Chen, Wen Wang, Xueming Jiang, Juncheng Li, Siliang Tang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 Iron是用于训练GUI智能体的意图对齐与回溯双学习框架,通过逐步循环一致奖励和事后回放机制提升性能,在跨环境等任务中优于三倍数据训练的模型,未见过的网页任务获25.06%相对提升。

Comments 11 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28279 2026-08-31 cs.RO 新提交 75%

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

STEGNav:面向多模态终身目标导航的时空事件图推理

Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract)

AI总结 针对现有多模态终身导航方法的局限,本文提出无训练框架STEGNav,通过时空事件图的双轴设计优化导航性能,在多个基准数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27550 2026-08-31 cs.RO cs.CV 新提交 70%

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

超越数据缩放:面向视觉-语言-动作模型的以表示为中心的持续预训练

Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对VLA模型数据扩展的瓶颈,提出以表示为中心的持续预训练方法VLAct,在多具身机器人数据上训练后,在多项基准任务中超越现有工业级系统,在未见具身迁移任务中仅用20%数据即优于全数据基线,为VLA进展提供新方向。

Comments All models and training pipelines are publicly available at this https URL (https://starvla.github.io/VLAct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28075 2026-08-31 cs.RO 新提交 67%

Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation

动态规划:部分可观测操纵任务中用于TAMP执行的事件触发式基础模型规划

Puru Ojha, Narendhiran Vijayakumar, Nav Singhal, Girish Varma, Antony Thomas

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Center for Security, Theory and Algorithmic Research, IIIT Hyderabad(IIIT海得拉巴安全、理论与算法研究中心)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本文提出ROBUST TAMP框架,针对部分可观测操纵任务,通过事件触发式重规划机制提升TAMP执行的任务成功率,验证了其在6个RLBench/CoppeliaSim场景中的有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏