Enhancing Video Transformers for Action Understanding with VLM-aided Training
专题命中 GUI与屏幕智能体 :VLM(title,abstract);visual language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :VLM(title,abstract);visual language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI
Comments Accepted by 2024 IEEE International Conference on Robotics and Automation (ICRA), 7 pages, 8 figures
VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) ; Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。
MatterDoor: 使用生成模型采样零样本空间语义先验
机构 * School of Computing, Australian National University(澳大利亚国立大学计算机学院)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 针对机器人通过门缝观察时场景结构缺失的问题,提出MatterDoor方法,利用预训练生成模型(VLM引导外推、单目深度估计、语义分割)采样隐藏房间的语义3D点云先验,在Matterport3D基准上验证了零样本空间语义先验的有效性。
Comments Under Review
NoRA: 评估视觉第一人称规范性动作推理中的基于事实的合理性
机构 * The University of Sydney(悉尼大学) ; Australian National University(澳大利亚国立大学) ; RMIT University(皇家墨尔本理工大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出NoRA基准,通过事实-理由-动作支持图评估多模态模型生成合理动作并基于可见事实进行推理的能力,发现当前VLM在构建完整动作空间和绑定正确支持方面存在不足。
机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract)
Comments accepted by IROS 2025
SAIN:面向移动机器人的、结合主动对话 grounding 的结构感知交互式导航
机构 * School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院) ; Department of Mechanical Engineering, City University of Hong Kong(香港城市大学机械工程系)
专题命中 GUI与屏幕智能体 :grounding(title,title_cn)
AI总结 本文提出SAIN零样本框架,将主动对话转化为持久导航状态,在VL-LN IIGN基准上提升了导航成功率与加权成功率,无需特定任务策略训练,验证了对话转状态机制的有效性。
Comments 8 pages, 4 figures, and 4 tables
STeP:用于视觉语言模型动作生成精确规范的信号时序逻辑
机构 * University of Maryland(马里兰大学)
专题命中 GUI与屏幕智能体 :vision language model(title);VLM(abstract,abstract_cn)
AI总结 针对视觉语言动作模型缺乏可解释性及难以遵循精确自然语言指令的问题,提出用信号时序逻辑(STL)连接高级语言理解与低级机器人执行的分层框架,经实验验证该框架能提高语言条件下机器人规划的精度、可靠性和可解释性。
Comments 14 pages, 6 figures
两次测量,一次点击:通过强化学习共进化提议者和视觉评论者进行GUI定位
机构 * Zhejiang University(浙江大学) ; Tencent AI Lab(腾讯AI实验室) ; The University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过强化学习共进化提议者和视觉评论者,以提升GUI定位的准确性和鲁棒性,通过动态平衡训练目标,增强模型在复杂界面布局中的泛化能力。
动态控制屏障函数调节与视觉-语言模型用于安全、适应性和实时视觉导航
机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)
AI总结 本文提出AlphaAdj框架,利用视觉-语言模型动态调整控制屏障函数参数,以实现在动态环境中安全、高效和实时的导航。
CompliantVLA-adaptor:基于视觉-语言模型的变量阻抗控制用于安全的高接触密度操作
机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚,意大利) ; Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目和热那亚大学,热那亚,意大利) ; Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA(工业工程埃德华森学校,普渡大学,西拉法克萨,印第安纳州47907,美国) ; Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国) ; German Research Center for AI, Germany(德国人工智能研究中心,德国) ; TU Darmstadt, Darmstadt, Germany(图宾根大学,图宾根,德国) ; Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院,卡尔斯鲁厄,德国)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract)
AI总结 本文提出CompliantVLA-adaptor,通过引入基于视觉语言模型的上下文感知变量阻抗控制,提升接触密集任务的安全性和有效性。方法通过图像和自然语言解读任务上下文,调节阻抗控制器的刚度和阻尼参数,并利用实时力/扭矩反馈确保安全。实验表明在模拟和现实任务中均优于基线方法。
Comments under review
通过群体竞争学习增强轻量级视觉语言模型以实现符合社会规范的导航
机构 * Hokkaido University(北海道大学) ; The University of Tokyo(东京大学)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract)
AI总结 本文提出群体竞争学习策略,通过协调全局语义与分布正则化,提升轻量级VLMs在社交导航中的推理与决策能力,实现高准确性和高效性。
基于视觉语言模型的工业自主移动机器人测试
机构 * Simula Research Laboratory and University of Oslo(Simula研究实验室和奥斯陆大学) ; Mondragon University(蒙dragon大学) ; Simula Research Laboratory(Simula研究实验室) ; PAL Robotics(PAL机器人技术)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract)
AI总结 本文提出基于视觉语言模型的测试方法,用于生成违反功能和安全要求的机器人交互场景,以提高自主移动机器人在复杂环境中的安全性和可靠性。
基于人群映射与避让路线规划的安全移动支持系统
机构 * Graduate School of Regional Development and Creativity, Division of Engineering and Agriculture, Graduate School, Utsunomiya University(乌市大学研究生院区域发展与创意学院,工程与农业系)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract)
AI总结 本文提出利用视觉-语言模型和高斯过程回归生成动态人群密度地图,以提升自主机器人在拥挤环境中的安全导航能力。
Journal ref 2025 IEEE International Conference on Real-time Computing and Robotics (RCAR)
基于技能感知的反事实交互导航:通过技能感知视觉语言模型
机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) ; College of Design and Engineering, National University Of Singapore(新加坡国立大学设计与工程学院) ; Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract)
AI总结 CoINS通过整合技能感知推理与稳健执行,提升机器人在复杂环境中的交互导航能力。
Comments 17 pages, 13 figures
掩码教师与强化学生用于蒸馏视觉-语言模型
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 Masters通过掩码教师和强化学生的方法,解决视觉-语言模型蒸馏中的大小差距问题,提升学生模型的表示学习能力。
HyDRA:面向移动视觉语言模型的分层和动态秩适应
机构 * Liaoning Technical University(辽宁技术大学) ; University of Göttingen(哥廷根大学)
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 HyDRA通过分层和动态秩调度优化,提升移动视觉语言模型的微调效率和性能。
基于移动机器人的自主施工工地安全检查:一种多层VLM-LLM流水线
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract)
AI总结 本文提出一种多层VLM-LLM流水线,通过机器人自主导航与人工智能结合,实现施工工地安全检查的自动化报告生成。
专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract)
机构 * ETH Zürich(苏黎世联邦理工学院) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)
Comments 7 pages, 4 figures, accepted to the OWN workshop at IROS 2025
机构 * Bytedance(字节跳动) ; Peking University(北京大学) ; Peking University People’s Hospital(北京大学人民医院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科沃科学与技术研究所)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract)
Comments Accepted in IROS 2025
机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克洛科沃科学与技术研究所)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract)
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; OPPO AI Center(OPPO AI中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 GUI与屏幕智能体 :MLLM(title);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ACL 2025 (Oral)
专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract)
机构 * Cyrion Labs(塞里昂实验室)
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at IEEE/CVF Computer Society Conference on Computer Vision and Pattern Recognition Workshops 2025 (CVPRW)
机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系) ; Department of Computer Science, University of Maryland(马里兰大学计算机科学系)
专题命中 GUI与屏幕智能体 :vision language model(title);VLM(abstract);visual language model(abstract)
机构 * National University of Singapore(新加坡国立大学) ; Skywork AI ; Nanyang Technological University(南洋理工大学)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);visual language model(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)