H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos
H2R: 一种从视频中为机器人预训练的人到机器人的数据增强
专题命中 图文多模态 :image-text(abstract)
AI总结 H2R通过将人类视角视频转换为机器人视角数据,弥合人机视觉差距,提升机器人预训练效果,实验显示在模拟和现实场景中均显著提升性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
H2R: 一种从视频中为机器人预训练的人到机器人的数据增强
专题命中 图文多模态 :image-text(abstract)
AI总结 H2R通过将人类视角视频转换为机器人视角数据,弥合人机视觉差距,提升机器人预训练效果,实验显示在模拟和现实场景中均显著提升性能。
COHORT: 基于混合强化学习的多机器人系统实时协同大规模深度神经网络推理
专题命中 图文多模态 :multimodal(abstract)
AI总结 COHORT通过混合强化学习策略,优化多机器人系统在实时约束下的大规模DNN推理,降低能耗并提升GPU利用率。
Comments Recently accepted at 27th IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks ( IEEE WoWMoM 2026)
跨手的潜在表示用于视觉-语言-动作模型
专题命中 图文多模态 :multimodal(abstract)
AI总结 XL-VLA通过统一的潜在动作空间实现跨手灵巧操作的可扩展学习,提升视觉-语言-动作模型的训练效率和性能。
Comments Website: https://xl-vla.github.io
通过去校准实现高效的可信预测
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; DFKI (DSA)(德意志联邦防务研究所)
专题命中 图文多模态 :multi-modal(abstract)
AI总结 本文提出了一种基于相对似然的高效可信预测方法,通过去校准技术实现对复杂模型的高效可信集生成。
通过强化学习增强的遥控操作与混合的灵巧专家VLA实现人机操作
机构 * Shanghai Jiao Tong University(上海交通大学) ; Sharpa ; Shanghai AI Lab(上海人工智能实验室) ; Zhongguancun Academy(中关村学院) ; National University of Singapore(新加坡国立大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 图文多模态 :multimodal(abstract)
AI总结 本文提出IMCopilot和MoDE-VLA框架,通过强化学习和多模态融合提升机器人灵巧操作能力,实现接触丰富的手内任务性能提升。
Comments Project Homepage: https://sites.google.com/view/mode-vla
VISTA:面向无训练股票时间序列分析的视觉-语言推理
机构 * University of Southern California(南加州大学)
专题命中 图文多模态 :multi-modal(abstract)
AI总结 VISTA通过结合文本和视觉信息,利用无训练的视觉-语言模型实现股票时间序列预测,实验结果显示其在预测精度上显著优于传统方法。
Comments Accepted to the CVPR 2025 Workshop on Transformers for Vision (T4V): accepted-papers" target="_blank" rel="noopener">https://sites.google.com/view/t4v-cvpr25/accepted-papers
轻量级视觉推理用于社交感知机器人
机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 本研究提出了一种轻量级视觉推理模块,用于提升社交感知机器人在复杂人机交互中的表现,通过闭环反馈机制增强机器人对动态人类行为的理解和响应能力。
Comments ICRA26
SoraNav: 通过零样本VLM推理实现适应性无人机任务导向导航
机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学)
专题命中 图文多模态 :multi-modal(abstract)
AI总结 SoraNav通过零样本VLM推理实现无人机任务导向导航,解决空间-语义差距问题,提升导航成功率与效率。
视觉-语言模型在病理图像分析中的logit级不确定性量化
机构 * Department of Electrical and Electronics Engineering, Izmir Bakircay University(电气与电子工程系,伊兹密尔巴克伊大学) ; Department of Electrical Engineering and Computer Science, University of Stavanger(电气工程与计算机科学系,斯塔万格大学) ; Batten College of Engineering and Technology, Old Dominion University(工程与技术学院,老奥布良大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 本研究提出了一种基于VLMs的logit级不确定性量化框架,用于评估病理图像分析中模型的可靠性与安全性。
Comments 10 pages, 6 figures, 4 tables
SSMG-Nav: 通过语义骨架记忆图增强终身物体导航
机构 * Brain-Inspired Application Technology Center (BATC), Shanghai Jiao Tong University(脑启发应用技术中心(BATC),上海交通大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 SSMG-Nav通过语义骨架记忆图提升终身物体导航,整合多模态信息与持久记忆,优化路径效率与任务成功率。
Comments Accepted by 2026 ICRA
通过证据不确定性量化检测大视觉-语言模型的误行
机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) ; Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) ; School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) ; Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)
专题命中 图文多模态 :multimodal(abstract)
AI总结 通过证据不确定性量化检测大视觉-语言模型的误行,识别内部冲突和无知以提高模型可靠性。
Comments Accepted to ICLR 2026. Code is available at https://github.com/HT86159/EUQ
看见无线电:从零RF先验到可解释的调制识别与视觉语言模型
专题命中 图文多模态 :multimodal(abstract)
AI总结 本文提出利用视觉语言模型直接感知无线电波信号并推断调制模式,通过转换IQ流为图像数据,提升模型准确性至90%,并实现可解释的调制识别。
迈向射电天文源分析的视觉-语言助手
专题命中 图文多模态 :multimodal(abstract)
AI总结 本文提出radio-llava,一种针对射电天文的视觉-语言助手,通过指令微调提升多任务性能,但发现专用视觉模型仍更优,且微调导致通用任务性能下降。
Comments 5 pages, 3 figures, Proceedings IAU Symposium No. 397, 2025
RoboPaint:从人类示范到任何机器人和任何视角
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 RoboPaint通过真实-仿真-真实数据流程,将人类示范转化为机器人训练数据,实现高效、低成本的复杂灵巧操作训练。
Comments 17 pages
CONRep:基于置信预测的不确定性感知视觉-语言报告起草
专题命中 图文多模态 :image-text(abstract)
AI总结 CONRep通过置信预测为视觉语言模型生成的放射学报告提供不确定性量化,提升自动化报告系统的透明性和临床实用性。
Comments 17 pages, 3 figures, 3 tables
LEMON:通过模态感知优化实现局部解释
机构 * University of Bristol(布里斯托大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 LEMON是一种高效的多模态局部解释框架,通过模态感知优化生成统一解释,减少计算成本并提升解释忠实性。
知识向量削弱:高效无训练卸载方法用于大视觉-语言模型
机构 * Sogang University(ソガン大学) ; New York University(纽约大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 KVW提出了一种无需训练的高效卸载方法,通过削弱模型中被激活的知识向量,有效防止模型利用有害知识,提升计算效率。
接触丰富机器人任务的安全学习:从经典学习方法到安全基础模型的综述
机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genova, Italy(人类-机器人接口与交互实验室,意大利技术研究院,热那亚,意大利) ; Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目(DRIM)和热那亚大学,热那亚,意大利) ; Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN, USA(工业工程埃德华森学校,普渡大学,西拉法伊斯,美国)
专题命中 图文多模态 :multimodal(abstract)
AI总结 本文综述了接触丰富机器人任务的安全学习方法,探讨了从经典学习方法到安全基础模型的发展,分析了安全探索与执行的关键技术及未来方向。
Comments version 2
FedSM: 用于在长尾数据联邦学习中减少偏见的语义引导特征混合
专题命中 图文多模态 :image-text(abstract)
AI总结 FedSM通过语义引导的特征混合和轻量级分类器重训练,有效减少联邦学习中长尾数据的偏见问题。
Journal ref IEEE Internet of Things Journal, 2026
RLLaVA: 一种面向语言和视觉助手的强化学习中心框架
机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与电子技术学院,人工智能研究院,北京航空航天大学,北京,中国) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) ; Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)
专题命中 图文多模态 :multi-modal(abstract)
AI总结 RLLaVA 提出了一种强化学习中心框架,通过解耦算法逻辑与模型架构,实现高效训练和多任务扩展,提升视觉-语言模型性能。
Comments The code is available at https://github.com/TinyLoopX/RLLaVA
聚焦:一种高效的视觉-语言模型流式集中架构
专题命中 图文多模态 :cross-modal(abstract)
AI总结 Focus提出了一种高效的视觉-语言模型流式集中架构,通过分层压缩和细粒度冗余消除,实现2.4倍速度提升和3.3倍能效提升。
Comments HPCA 2026
视觉语言推理中测试时扩展的极限与收益
专题命中 图文多模态 :multimodal(abstract)
AI总结 研究探讨了测试时扩展在视觉语言推理中的效果,发现其在不同任务和模型上表现不一,需根据具体需求定制策略。
Comments Mohammadjavad Ahmadpour and Amirmadhi Meighani contributed equally to this work
令牌扩展-合并:面向视觉-语言-动作模型的免训练 令牌压缩
机构 * College of Science and Engineering, Hamad Bin Khalifa University(1 科学与工程学院,哈马德·本·卡西姆大学) ; Mohamed bin Zayed University of Artificial Intelligence(2 摩萨·本·扎耶德人工智能大学) ; College of Computer Science and Technology, Zhejiang University(3 计算机科学与技术学院,浙江大学)
专题命中 图文多模态 :multimodal(abstract)
AI总结 TEAM-VLA通过动态令牌扩展与合并机制,实现无需训练的视觉-语言-动作模型高效推理,提升速度并保持任务性能。
Comments 8 pages, 5 figures
GLaD:面向视觉-语言-动作模型的几何潜在蒸馏
机构 * MBZUAI ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 图文多模态 :multimodal(abstract)
AI总结 GLaD通过引入几何意识的预训练机制,提升了视觉-语言-动作模型的空间推理和策略泛化能力,无需依赖深度传感器或3D标注。
RobustVLA: 为视觉-语言-动作模型引入鲁棒性感知的强化学习后训练
机构 * Westlake University(西湖大学)
专题命中 图文多模态 :multi-modal(abstract)
AI总结 RobustVLA通过引入鲁棒性感知的强化学习后训练方法,提升视觉-语言-动作模型在环境不确定性下的鲁棒性和可靠性。
机构 * Tsinghua University(清华大学) ; Goertek Inc(歌尔股份有限公司)
专题命中 图文多模态 :multimodal(abstract)
Comments 23 pages, 13 figures, 7 tables
机构 * School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) ; National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) ; School of Computer Science and Engineering, Southeast University, Nanjing, China(计算机科学与工程学院,东南大学)
专题命中 图文多模态 :multi-modal(abstract)
机构 * Zhejiang University(浙江大学)
专题命中 图文多模态 :cross-modal(abstract)
专题命中 图文多模态 :image-text(abstract)
Comments 5pages,4figures
机构 * The University of Tokyo(东京大学) ; Sony Group Corporation(索尼集团公司) ; Sony AI(索尼人工智能)
专题命中 图文多模态 :multi-modal(abstract)