arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 178 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 178 篇

2606.02802 2026-06-09 cs.AI 版本更新 57%

ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Models for Grounded Clinical Reasoning

ChatHealthAI: 将电子健康记录表示与大语言模型对齐以实现基于临床的推理

Bo-Hong Wang, Baicheng Peng, Ruilin Wang, Jun Bai, Ziyang Song, Yue Li

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出ChatHealthAI框架,通过任务感知重采样器将预训练的EHR基础模型的结构化表示与冻结的大语言模型语义空间对齐,实现可解释的临床推理并保持预测性能。

Comments Main paper with appendix, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17855 2026-06-09 cs.AI cs.RO 版本更新 57%

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents

QuickLAP: 为半自主代理快速语言-动作偏好学习

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03381 2026-06-08 cs.LG cs.AI 版本更新 57%

Proxy Reconstruction Pre-training for Ramp Flow Prediction at Highway Interchanges

高速公路立交匝道流量预测的代理重建预训练

Yongchao Li, Jun Chen, Zhuoxuan Li, Chao Gao, Yang Li, Chu Zhang, Changyin Dong

机构 * Southeast University(东南大学) Institute of Telecommunications and Information Sciences, China(中国电信与信息科学研究院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出时空解耦自编码器(STDAE),通过跨模态重建预训练从主线数据恢复匝道流量,结合GWNet等模型提升预测精度,在真实数据集上超越13个基线。

Comments Accepted at Applied Soft Computing Journal

Journal ref Applied Soft Computing Journal 200 (2026) 115462

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-08-21 eess.IV 版本更新 50%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Lei Yu, Xiao Wang, Min Liu, Lin Wang, Xiangqian Wu

专题命中 视频多模态 :multimodal(abstract)

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23037 2026-08-19 cs.LG physics.flu-dyn 版本更新 50%

Open datasets and machine learning for two-phase heat transfer: a review following a spatial-temporal taxonomy

用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件

Christy Dunlap, Ridwan Olabiyi, Firas Al-Hindawi, Hari Pandey, Stephen Pierson, Daniel Curl, Braden Stevens, Mohammad Ishraq Hossain, Annapurna Parjuli, Chinmaya Joshi, Ashif Iquebal, Han Hu

机构 * Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文介绍了一个由NED3实验室开发的开放多模态数据集和开源软件生态系统,提出了空间加时间维度(S+TD)分类框架,并重点描述了SeqReg序列回归库,以推动可复现的AI赋能热流体研究。

Comments Accepted manuscript replacing arXiv:2605.23037 (v1). Substantially expanded from the original preprint and published in Transport Phenomena 2026, 1(3), 20260081. https://doi.org/10.1515/tp-2026-0081

Journal ref Transport Phenomena 2026, 1(3), 20260081

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13015 2026-08-18 cs.RO 版本更新 50%

Learning Versatile Humanoid Manipulation with Touch Dreaming

通过触觉梦想学习多功能人形操作

Yaru Niu, Zhenlong Fang, Binghong Chen, Shuai Zhou, Revanth Krishna Senthilkumaran, Hao Zhang, Bingqing Chen, Chen Qiu, H. Eric Tseng, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) UT Arlington(UT阿灵顿) Bosch Center for AI(博世人工智能中心)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出HTD模型,结合触觉、视觉和本体感觉,通过触觉梦想增强学习实现高灵活性的人形操作,实验证明在五个真实任务中成功率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19264 2026-08-18 physics.med-ph 版本更新 50%

A novel method for analysis of transient morphological changes in quasiperiodic physiological signals and their neurogenic correlates

一种用于分析准周期生理信号瞬态形态变化及其神经源性关联的新方法

Tomasz Gradowski, Damian Waląg, Tomir Domański, Teodor Buchner

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种新的可视化方法,用于分析准周期生理信号的瞬态形态变化及其神经源性关联,通过二维地毯图同时评估心跳节律和信号特征。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10780 2026-08-17 cs.RO 版本更新 50%

StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation

JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新 50%

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

专题命中 视频多模态 :image-text(abstract)

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06833 2026-08-11 cs.RO 版本更新 50%

Unordered Landmark Visual Navigation

无序地标视觉导航

Hao Ren, Junzhe Zhu, Yihan Li, Zetong Bi, Le Zheng, Zhi Li, Yiqing Yuan, Zhaoliang Wan, Dizhe Zhang, Lu Qi, Hui Cheng

专题命中 视频多模态 :multimodal(abstract)

AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。

Comments ECCV2026 Oral & Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22505 2026-08-11 q-bio.QM cs.HC 版本更新 50%

Loom: Multi-Region Analysis of Spatial Transcriptomics with Local Neighborhoods and Global Trajectories

Loom:利用局部邻域和全局轨迹对空间转录组学进行多区域分析

Siyuan Zhao, Nafiul Nipu, Hossein Fathollahian, Olga Karginova, Hao Chen, Ameen Salahudeen, G. Elisabeta Marai

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Loom是用于空间转录组学分析的视觉计算系统,利用新颖图形符号和计算框架,应对多模态整合挑战,经案例研究和可用性研究评估,有效支持细胞转变及时空表达动态发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 50%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24804 2026-08-05 cs.IR cs.LG 版本更新 50%

Bumblebee: Interleaved Mixed-Layer Building Blocks for Large-Scale Recommendation Systems

大黄蜂:用于大规模推荐系统的交错混合层构建块

David Bauer, Cancan Zhang, Wenshun Liu, Xiaoyi Zhang, Weijia Liu, Wanli Ma, Yue Weng, Wei Li, Rui Li, Jing Qian, Huayu Li, Xiaoyi Liu, Linhong Zhu, Jerry Fu

专题命中 视频多模态 :cross-modal(abstract)

AI总结 研究针对推荐系统发展的两条轨道缺乏交互的问题,提出大黄蜂架构,通过交错可堆叠块设计,结合多种技术,实现模态混合与信息丰富,经实验验证该方法优于基线模型,证明交错异构单元是有前途的推荐架构范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13489 2026-08-04 eess.SP 版本更新 50%

Feasibility of simultaneous EEG-fMRI at 0.55 T: Recording, Denoising, and Functional Mapping

0.55T下同时进行EEG-fMRI可行性的研究:记录、去噪与功能映射

Parsa Razmara, Takfarinas Medani, Majid Abbasi Sisara, Anand A. Joshi, Rui Chen, Woojae Jeong, Ye Tian, Krishna S. Nayak, Richard M. Leahy

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究证明在0.55T下同时进行EEG-fMRI的可行性,通过去噪和功能映射展示了多模态神经成像的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23749 2026-07-31 cs.HC 版本更新 50%

StateScribe: Towards Accessible Change Awareness Across Real-World Revisits

StateScribe: 向现实世界重访中的可访问性变化意识迈进

Ruei-Che Chang, Xirui Jiang, Rosiana Natalie, Hao Chen, Vlad Roznyatovskiy, Jianzhong Zhang, Kang G. Shin, Ke Sun, Anhong Guo

专题命中 视频多模态 :multimodal(abstract)

AI总结 StateScribe通过双层记忆架构实现跨重访的现实变化感知,提高盲人和低视力用户对环境变化的认知能力,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08757 2026-07-28 cs.RO 版本更新 50%

A Visuo-Tactile Data Collection System with Haptic Feedback for Coarse-to-Fine Imitation Learning

一种带有触觉反馈的视觉-触觉数据采集系统用于粗到细模仿学习

Yeseung Kim, Nayoung Oh, Jun Park, Teetat Thamronglak, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种视觉-触觉数据采集系统,生成时间结构丰富的接触密集演示,用于模仿学习。通过直接驱动夹具和触觉阵列,保留自然触觉反馈,结合实时注释,生成多模态数据集以支持粗到细学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06700 2026-07-24 cs.CR 版本更新 50%

Facade: High-Precision Insider Threat Detection Using Deep Contextual Anomaly Detection

Facade:使用深度上下文异常检测的高精度内部威胁检测

Alex Kantchelian, Casper Neo, Ryan Stevens, Hyungwon Kim, Zhaohao Fu, Sadegh Momeni, Birkett Huber, Cem Topcuoglu, Senaka Buthpitiya, Elie Bursztein, Yanis Pavlidis, Martin Cochran, Massimiliano Poletto

专题命中 视频多模态 :multi-modal(abstract)

AI总结 研究内部人员特权访问带来的威胁,提出Facade系统,通过考虑事件上下文、基于多模态模型及对比学习策略检测可疑事件,能高精度检测内部威胁且误报率极低,可用于大型企业环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15579 2026-07-22 cs.RO cs.HC 版本更新 50%

PACE: Persona Adaptation through Conversational Elicitation in Human-Robot Interaction

PACE:通过人机交互中的对话启发实现角色适应

Peizhen Li, Longbing Cao, Megani Rajendran, Timothy Liu, Aik Beng Ng, Simon See

机构 * Macquarie University(麦考瑞大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究如何让类人机器人有可适应角色,提出PACE框架,通过用户问答动态生成角色,经提高结构化提示,经系统集成转化为行为,实证评估显示其对人机交互多方面有积极影响,为部署个性化等身份开辟途径。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14194 2026-07-20 eess.SP cs.LG cs.SY eess.SY 版本更新 50%

Boosted Enhanced Quantile Regression Neural Networks with Spatiotemporal Permutation Entropy for Complex System Prognostics

增强型分位数回归神经网络与时空排列熵用于复杂系统预测

David J Poland

机构 * University of Hertfordshire(赫特福德大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种基于时空排列熵分析与增强型分位数回归神经网络的新型框架,用于模式预测和系统预测。通过结合基于熵的复杂性度量与先进神经架构,实现多维系统复杂动态模式的理解,提升预测精度和不确定性量化能力。

Comments Preliminary version of a predictive maintenance framework using spiking neural networks and entropy-based analysis. To be expanded in future publications with hardware implementations and real-time drift detection modules. arXiv admin note: substantial text overlap with arXiv:2501.05087

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27792 2026-07-16 cs.RO 版本更新 50%

Motubrain: An Advanced World Action Model for Robot Control

MotuBrain: 一种先进的世界动作模型用于机器人控制

Motubrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, Jun Zhu

机构 * MotuBrain Team(MotuBrain团队)

专题命中 视频多模态 :multimodal(abstract)

AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23087 2026-07-07 cs.RO 版本更新 50%

CoLA-Flow Policy: Temporally Coherent Imitation Learning via Continuous Latent Action Flow Matching for Robotic Manipulation

CoLA-Flow Policy: 通过连续潜在动作流匹配实现机器人操作的时序一致模仿学习

Wu Songwei, Jiang Zhiduo, Sun Wandong, Xie Guanghu, Zhao Rui, Liu Hong, Liu Yang

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学) The University of Sydney(悉尼大学) Honor Device Co., Ltd.(荣耀设备有限公司)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出CoLA-Flow Policy,一种基于连续潜在动作空间的轨迹级模仿学习框架,通过学习显式的潜在空间流,解耦全局运动结构与低层控制噪声,从而实现平滑可靠的长时程执行,并结合几何感知点云条件和执行时多模态调节,提升现实环境的鲁棒性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27039 2026-07-07 stat.ME 版本更新 50%

Measuring Human Behavior Through Controlled Perturbations: A Framework for Behavioral System Identification

通过受控扰动测量人类行为:行为系统识别的框架

Pietro Cipresso

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出基于受控扰动的行为测量框架,通过动态系统视角重构测量问题,整合多模态数据与沉浸技术,推动从描述性模型向生成行为机制识别的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11475 2026-07-07 cs.LG cs.NI 版本更新 50%

Deep Learning Network-Temporal Models For Traffic Prediction

用于流量预测的深度学习网络-时间模型

Yufeng Xin, Ethan Fan

专题命中 视频多模态 :multi-modal(abstract)

AI总结 针对多元时间序列预测问题,提出拓扑感知学习框架,用图注意力模型捕捉相关性,评估微调大语言模型,引入聚类预处理,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06480 2026-06-26 cs.RO 版本更新 50%

History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation

基于历史条件的时空视觉令牌剪枝用于高效视觉-语言导航

Qitong Wang, Yijun Liang, Ming Li, Tianyi Zhou, Christopher Rasmussen

机构 * Department of Computer and Information Sciences at the University of Delaware(德克萨斯大学达勒姆分校计算机与信息科学系) University of Maryland’s Department of Computer Science(马里兰大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出一种无需训练的时空视觉令牌剪枝框架,通过空间令牌选择和时空压缩减少冗余计算,在保持导航精度的同时显著提升推理效率,并在真实机器人上验证了低延迟指令跟随导航。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22126 2026-06-23 cs.RO 版本更新 50%

EasyUUV: An LLM-Enhanced Universal and Lightweight Sim-to-Real Reinforcement Learning Framework for UUV Attitude Control

EasyUUV:一种用于UUV姿态控制的LLM增强通用轻量级仿真到现实强化学习框架

Guanwen Xie, Jingzehua Xu, Jiwei Tang, Yubo Huang, Zixi Wang, Shuai Zhang, Dongfang Ma, Juntian Qu, Xiaofan Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Civil Engineering, Southwest Jiaotong University(西南交通大学土木工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Ocean College, Zhejiang University(浙江大学海洋学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出EasyUUV框架,结合并行强化学习与混合控制架构,并集成多模态大语言模型自适应调整参数,实现UUV姿态控制的鲁棒性和泛化性,经仿真与实船验证。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23340 2026-06-23 cs.SI cs.DC cs.LG 版本更新 50%

CrediBench: Building Web-Scale Network Datasets for Information Integrity

CrediBench: 构建用于信息完整性的网络规模数据集

Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) AITHYRA Research Institute(AITHYRA研究院) Université de Montréal(蒙特利尔大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 针对现有数据集忽略网络拓扑、时序和文本内容等关键模态的问题,提出包含八个月网络图数据的CrediBench数据集,支持回归和分类任务,多模态模型显著提升性能。

Comments 16 pages,4 figures

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27583 2026-06-17 q-bio.NC cs.RO 版本更新 50%

Simulating Infant First-Person Sensorimotor Experience via Motion Retargeting from Babies to Humanoids

通过从婴儿到类人机器人的运动重定向模拟婴儿第一人称感觉运动经验

Francisco M. López, Hoshinori Kanazawa, Ondrej Fiala, Yakov Balashov, Valentin Marcel, Lukas Rustler, Miles Lenz, Dongmin Kim, Yasuo Kuniyoshi, Jochen Triesch, Matej Hoffmann

机构 * German Research Foundation(德国研究基金会) Johanna Quandt foundation(约翰娜·克文特基金会) Czech Science Foundation(捷克科学基金)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出一种从单视频重建婴儿3D姿态并映射到物理/虚拟类人平台的方法,实现亚厘米级精度的多感觉流模拟,为发育研究和神经发育障碍早期检测提供新工具。

Comments Accepted at IEEE ICDL 2026. 8 pages, 6 figures. Cite as: F. M. López, H. Kanazawa, O. Fiala, Y. Balashov, V. Marcel, L. Rustler, M. Lenz, D. Kim, Y. Kuniyoshi, J. Triesch, and M. Hoffmann, "Simulating infant first-person sensorimotor experience via motion retargeting from babies to humanoids'', in 2026 IEEE International Conference on Development and Learning (ICDL). IEEE, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09580 2026-06-08 cs.RO cs.LG 版本更新 50%

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows

SERNF: 通过动作块评论家和归一化流实现样本高效的真实世界灵巧策略微调

Chenyu Yang, Denis Tarasov, Davide Liconti, Romain Guntz, Hehui Zheng, Robert K. Katzschmann

机构 * Soft Robotics Lab, D-MAVT(软机器人实验室,D-MAVT) ETH Zurich(苏黎世联邦理工学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出SERNF框架,结合归一化流策略和动作块评论家,实现真实世界灵巧操作策略的样本高效微调,解决多模态动作分布和信用分配问题。

Comments https://srl-ethz.github.io/SERNF/

详情

展开后加载摘要…

URL PDF HTML 收藏