Native Video-Action Pretraining for Generalizable Robot Control
用于可泛化机器人控制的原生视频动作预训练
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
用于可泛化机器人控制的原生视频动作预训练
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。
超越描述:为具身智能体进行细粒度动作的认知基准测试
机构 * Zhejiang University(浙江大学) ; Wolf 1069 b(沃尔夫1069b) ; Sany Group(三一集团) ; The Hong Kong Polytechnic University(香港理工大学) ; Imperial College London(帝国理工学院)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出CFG-Bench基准测试,旨在评估具身智能体在物理交互中的细粒度动作能力,揭示现有MLLMs在高层次推理中的不足,并通过监督微调提升其性能。
Comments Accepted to ECCV2026
APPLV: 从视觉-语言-动作模型中自适应学习规划器参数
机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) ; Department of Engineering Science, University of South Florida(工程科学系,佛罗里达州立大学) ; Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
AI总结 本文提出APPLV,通过从视觉-语言-动作模型中自适应学习规划器参数,提升移动机器人在受限环境中的导航性能与泛化能力。
生成式动作叙事:评估合成视频中的人体运动
机构 * Boston University(波士顿大学) ; Belmont High School(贝利蒙高中) ; Canyon Crest Academy(坎波尔峡谷学院) ; Runway
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。
GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰
机构 * SAIS, UCAS(中国科学院大学人工智能学院) ; SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。
Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection
三步导航:一种用于零样本视觉-语言导航的分层全局-局部规划器
机构 * University of Southern California(南加州大学) ; NVIDIA Research(NVIDIA研究)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出三步导航方法,通过全局-局部分层规划解决零样本视觉-语言导航中的漂移和低成功率问题,无需梯度更新或微调,实现最先进的性能。
Comments Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav
Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS), 2026
Web-CogReasoner:迈向用于网络智能体的多模态知识诱导认知推理
机构 * Southwestern University of Finance and Economics(西南财经大学) ; Shanghai Jiao Tong University(上海交通大学) ; Central South University(中南大学) ; Hithink Research(Hithink研究) ; Westlake University(西湖大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; University of Manchester(曼彻斯特大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Adelaide(阿德莱德大学) ; Fudan University(复旦大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Chengdu Everimaging Science and Technology Co., Ltd(成都亿联科技有限公司)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 研究将网络智能体能力分解为知识内容学习和认知过程两阶段,提出框架分类知识,构建数据集,基于此用新推理框架开发训练智能体,实验显示其优势,还引入评估套件。
Comments Accepted to ICLR 2026. Our code and data is released at https://github.com/Gnonymous/Web-CogReasoner
MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集
机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) ; Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。
CLIP-AUTT: 基于动作单元提示的测试时个性化方法用于细粒度视频情绪识别
机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal(LIVIA, ILLS, 系统工程学院, 蒙特利尔高等技术学院) ; LIVIA, Dept. of Software and IT Engineering, ETS Montreal(LIVIA, 软件与IT工程学院, 蒙特利尔高等技术学院) ; Dept. of Computer Science, École Polytechnique(计算机科学系, 巴黎综合理工学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出CLIP-AUTT,通过动作单元提示实现测试时个性化,提升细粒度视频情绪识别的鲁棒性和个性化能力。
Comments ECCV, 2026
GAIA: 用于训练GUI测试时缩放评论模型的数据飞轮系统
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 提出GAIA数据飞轮系统,通过训练直觉评论模型(ICM)评估GUI代理动作的正确性,利用正负样本迭代提升代理测试时性能,实验表明该方法能持续改进多种模型。
Comments Accepted by ECCV 2026
V-JEPA 2.1: 解锁视频自监督学习中的密集特征
机构 * FAIR at Meta(Meta的FAIR) ; Universidad de Zaragoza(萨拉戈萨大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 提出V-JEPA 2.1系列自监督模型,通过密集预测损失、深度自监督、多模态分词器和有效缩放,学习图像和视频的密集高质量视觉表示,在多个基准上取得最优性能。
MIRAGE: 具有隐式推理和生成世界模型的移动智能体
机构 * Beihang University(北京航空航天大学) ; Northwestern Polytechnical University(西北工业大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。
QuickLAP: 为半自主代理快速语言-动作偏好学习
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。
EVA: 针对环境注入攻击的红队GUI智能体的演化语义对抗方法
机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Independent Researcher(独立研究者)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 提出EVA框架,通过演化语义对抗载荷攻击多模态大语言模型驱动的GUI智能体,揭示语义欺骗是攻击成功的关键,实现85%攻击成功率且快速收敛。
Comments Accepted by
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; East China University of Science and Technology(华东理工大学) ; Huawei Celia Team(华为Celia团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenHelix Robotics
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。
Comments Accepted by ACM MM 2026
通过强化学习学习检测用户界面原则违规
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。
超越单一评判者:用于生成式UI评估的社会角色面板模拟
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 该研究针对GenUI评估问题,提出三阶段ESPP方法,通过多样化角色面板提升评估保真度,揭示用户子群体的结构性分歧,代码已公开。
世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究
机构 * Huawei Technologies(华为技术有限公司) ; University of Toronto(多伦多大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。
DSCD-Nav: 双视角协作辩论用于物体导航
机构 * School of Electronic Engineering, Xidian University, Xi' an 710071, China.(西安电子科技大学电子工程学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 DSCD-Nav通过双视角协作辩论机制提升机器人在部分可观测环境中的导航可靠性与效率。
VL-LN基准:通过主动对话实现长视界目标导向导航
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 VL-LN基准通过引入主动对话机制,提升长视界目标导向导航任务的性能和可靠性。
GeoWorldAD:用于自动驾驶的几何世界行动模型
机构 * Nanyang Technological University(南洋理工大学) ; Xiaomi EV(小米汽车) ; Zhejiang University(浙江大学) ; Harvard University(哈佛大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。
逻辑引导的社会感知机器人导航世界模型
机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) ; Department of Computer Science, Purdue University(计算机科学系,普渡大学) ; Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) ; Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。
Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version
闭环言语强化学习用于任务级机器人规划
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 提出闭环言语强化学习框架,通过大语言模型与视觉语言模型交互,在符号规划层迭代优化行为树,实现可解释的任务级规划与执行不确定性下的自适应。
Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
RoboWorld: 用于通用机器人策略评估的快速可靠神经模拟器
机构 * KAIST(韩国科学技术院) ; Config
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 提出RoboWorld自动化评估流程,结合快速自回归视频世界模型和任务进度感知视觉语言模型评分,通过Step Forcing减少训练-测试不匹配,实现与真实世界评估高度一致。
Comments Project page: https://byeongguks.github.io/RoboWorld/
BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航
机构 * The Chinese University of Hong Kong(香港中文大学) ; The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) ; University of Cambridge(剑桥大学) ; University of California, Davis(加州大学戴维斯分校)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。
DA-Nav:方向感知的城市规模视觉语言导航
机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) ; National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; XYZ Embodied AI(XYZ具身人工智能)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 研究城市规模户外导航难题,提出DA-Nav框架,利用商业导航工具方向指示,经思维链推理实现轨迹恢复,引入ReDA数据集。实验表明其在未见环境成功率高,优于现有方法,还能适应多种机器人实现稳定户外导航。
Comments 9 pages, 8 figures
XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型
机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) ; School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) ; State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。
Comments Accepted to ICML2026 as Oral
为Android应用程序自动生成高质量的缺陷报告
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出通过提供具体应用相关信息帮助LLM自动生成清晰详细的缺陷报告,提出BugScribe方法,通过评估显示其生成的报告质量更高且更准确。
Comments 12 pages, 6 figures
从单实例RGB演示中学习类别级最后米导航
机构 * University of Minnesota, Twin Cities(明尼苏达大学 Twin Cities 分校)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 提出面向对象的模仿学习框架,利用RGB观测实现四足移动机械臂在最后米阶段的精确导航,无需深度或地图先验,在类别级泛化中达到高成功率。
基于用户隐私偏好的机器人导航视觉感知设计
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出以用户为中心的隐私保护视觉感知设计方法,通过用户研究发现用户偏好隐私保护的视觉抽象和低分辨率保存机制,并据此制定可配置的隐私政策。