arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-28 至 2026-08-28 共收录 48 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2608.26545 2026-08-28 cs.RO 新提交 74%

Memory Anchors for Continual Robot Learning

用于持续机器人学习的记忆锚点

Maximilian Du, Zhanyi Sun, Chen Xu, Paarth Shah, Masha Itkina, Shuran Song

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究所)

专题命中 机器人学习 :robot learning(title);分类 cs.RO

AI总结 本文针对持续机器人学习的灾难性遗忘问题,提出记忆锚点方法,在重放缓冲器中保留关键经验,可降低63%高冲突任务遗忘,提升真实机器人的持续学习性能。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 15 篇

2608.26645 2026-08-28 cs.RO 新提交 88%

FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation

FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架

Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li

机构 * The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Duke University(杜克大学) Sun Yat-sen University(中山大学) TengenX(天工科技) Tencent Robotics X(腾讯Robotics X实验室) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 针对视觉-语言机器人操纵中VLAs无法从执行错误恢复的问题,提出含“重试”“重置”范式的FLARE框架,结合MLLM实现故障恢复,显著提升接触密集型操纵任务的成功率与鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26800 2026-08-28 cs.RO 新提交 86%

Rapid On-Robot Learning for Dynamic Manipulation Skills: Robot Juggling

面向动态操作技能的机器人快速在线学习:机器人杂耍

Taeyoon Lee, Chunpeng Wang, Christopher G. Atkeson, Alfred A. Rizzi, Nicolas Rojas

机构 * Robotics and AI Institute (RAI)(机器人与人工智能研究所(RAI)) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人操作 :robot learning(title,abstract);manipulation(title);分类 cs.RO

AI总结 本研究提出基于正则化记忆的在线学习框架,使双臂机器人在不到5分钟内安全掌握五种三球杂耍模式,核心是利用不完美先验知识实现高效稳定的真实世界动态操作技能学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27079 2026-08-28 cs.RO 新提交 79%

GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation

GRAFT:面向精细机器人操作的 grounded 高效在线强化适应

Yibo Qiu, Haoliang Ye, Shu'ang Sun, Zan Huang, Ronald X Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 GRAFT是一种高效在线VLA适应框架,通过特定视角视觉锚点聚焦任务相关线索,在四项生物医学操作任务中提升25个百分点成功率并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26883 2026-08-28 cs.RO 新提交 79%

Active Surface-Driven Reconfigurable Gripper: Robust Grasping and Sequential Manipulation of Thin Objects

主动表面驱动的可重构夹爪:薄物体的稳健抓取与顺序操作

Ziyi Zheng, Keqi Zhu, Hao Wu, Yanzhe Wang, Huixu Dong

机构 * Zhejiang University(浙江大学) Torch Kernel Co., Ltd.(炬芯科技股份有限公司)

专题命中 机器人操作 :manipulation(title);robotic(abstract);分类 cs.RO

AI总结 该研究针对现有机械夹爪抓取薄物体时稳健性不足的问题,提出主动表面驱动的可重构欠驱动夹爪,通过设计、建模、优化及实验验证,实现薄物体的可靠抓取与顺序操作。

Comments Accepted by RSS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26673 2026-08-28 cs.RO 新提交 79%

PredVLA: A Sub-Million-Parameter Predictive-Coding Policy for Robot Manipulation

PredVLA:用于机器人操作的亚百万级参数预测编码策略

Hiroki Sawada, Shunichi Kasahara

机构 * Sony Computer Science Laboratory(索尼计算机科学实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 PredVLA是仅0.68M参数的无机器人数据预训练预测编码策略,在LIBERO基准上远超参数匹配的Transformer、LSTM策略,实现强语言条件机器人操作性能且具备显式在线修正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27088 2026-08-28 cs.RO cs.AI 新提交 79%

Active sensing to characterize the heterogeneity of plant stress

主动传感用于表征植物胁迫的异质性

Ayman Laaroussi, Peter Hanappe, David Colliaux

机构 * Paris Research, Sony Computer Science Laboratories(索尼计算机科学实验室巴黎研究所)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出一种结合3D重建、几何分析与运动规划的自主机器人平台,用于对植物叶片进行靶向荧光测量,实现自动化的空间分辨生理测量,为高分辨率植物表型及自主农业检测提供新方法。

Comments UR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26359 2026-08-28 cs.PL cs.HC 新提交 78%

Direct Manipulation and Natural Language Programming, Together at Last?

直接操作与自然语言编程,终于能结合了?

Parker Ziegler, David Minh-Duy Cao, Justin Lubin, Sarah E. Chasins

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 该研究提出了支持直接操作与自然语言编程结合的编辑框架,通过被试内研究发现用户更倾向直接操作,为混合编辑模态的编程系统研究提供了方向。

Comments 32 pages, 5 figures, OOPSLA2 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26265 2026-08-28 cond-mat.supr-con cond-mat.mes-hall 新提交 78%

Supercurrent detection and manipulation of topological phase transitions in Shiba-Majorana hybrid systems

Shiba-Majorana混合系统中超流对拓扑相变的探测与操控

Debika Debnath, Ioannis Ioannidis, Paramita Dutta, Mircea Trif, Thore Posske

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 该研究针对Shiba-Majorana混合系统,提出通过超流探测拓扑非平凡吸附原子系统基态宇称变化的非侵入式方案,揭示临界电流的特征不连续性,验证了结果在有限温度和不同隧穿 regime下的鲁棒性。

Comments 17 pages, 7 figures, Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27221 2026-08-28 cs.RO 新提交 70%

Tensegrity Continuum Robots Enable Task-Adaptive Morphologies for Cooperative Behaviors

张拉整体连续体机器人可实现任务自适应形态以达成协同行为

Mahmud Hasan Saikot, Sydney Spiegel, Sudheera Akalanka Kariyawasam, Andrew Stefka, Josh Chrisler, Jianguo Zhao

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究提出结合张拉整体柔顺主体与爪式连接机构的模块化可重构机器人,可自重构为不同形态完成协同任务,为多功能机器人群体应用奠定基础。

Comments 22 pages, 6 figures, Accepted to Nature Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27033 2026-08-28 cs.RO 新提交 70%

Riemann-1.0: An Embodied World Action Model for Physical AI

Riemann-1.0:面向物理人工智能的具身世界动作模型

Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

机构 * Riemann Dynamics(黎曼动力公司)

专题命中 机器人操作 :manipulation(abstract);robot policy(abstract);分类 cs.RO

AI总结 本研究提出Riemann-1.0具身世界动作模型,通过统一建模与渐进式具身预训练,在多个模拟及真实机器人操作基准任务中取得最优性能,实现大规模具身经验向可泛化机器人操作能力的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26622 2026-08-28 cs.RO 新提交 61%

Relaxation-Aware Multimodal Sensing of Soft Gripper Driven by Structure-Perception-Learning

基于结构-感知-学习的软夹持器的松弛感知多模态感知

Yanzhe Wang, Hao Wu, Ziyi Zheng, Huixu Dong

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Torch Kernel Co., Ltd.(炬芯科技股份有限公司)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 该研究针对软夹持器抓取力因粘弹性松弛衰减的问题,提出结构-感知-学习框架,结合变刚度设计与温度耦合粘弹性力表征,使280秒力控抓取误差降低80%至95%,实现稳定持续抓取。

Comments 11 pages, 9 figures. Published in Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26766 2026-08-28 cs.RO 新提交 57%

MeshPriorDiT: Hierarchical Modeling for Action-Conditioned Cloth Dynamics

MeshPriorDiT:面向动作条件布料动力学的分层建模

Zihang Wang, Jianming Hu, Shang Su, Hao Huang, Mengkai Shi, Jun Gao, Shuo Feng

机构 * Tsinghua University(清华大学) Dense-AI University of Michigan(密歇根大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出MeshPriorDiT分层动力学模型,结合网格GNN与残差DiT,在布料操作任务的15步自回归滚动预测中,显著降低了全局均方误差,同时保持了良好的边缘应变性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26108 2026-08-28 cs.SE 新提交 50%

Agentic AI Containment Architecture for Security Hardening

用于安全加固的智能体AI containment架构

Mohamed ElBendary

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。

Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27060 2026-08-28 cond-mat.mtrl-sci 新提交 50%

THz-induced phonomagnetism in diamagnetic quantum paraelectric KTaO$_3$

太赫兹诱导抗磁性量子顺电体KTaO$_3$中的声磁效应

C. Kadlec (1), F. Kadlec (1), D. Repček (1), P. Kužel (1), M. Basini (2,3), J.-C. Deinert (4), S. Kovalev (4,5), T. Tadano (6), M. Udina (7,8), I. Ilyakov (4), T.V.A.G. de Oliveira (4), A. Ponomaryov (4), A. Arshad (4), A. Maia (1), S. Bonetti (2,9), S. Kamba (1) ((1) Institute of Physics, Czech Academy of Sciences, Prague, Czech Republic, (2) Department of Physics, Stockholm University, Stockholm, Sweden, (3) Department of Physics, ETH Zurich, Zurich, Switzerland (4) Institute of Radiation Physics, Helmholtz-Zentrum Dresden - Rossendorf (HZDR), Dresden, Germany, (5) Department of Physics, TU Dortmund University, Dortmund, Germany, (6) National Institute for Materials Science, Tsukuba, Ibaraki, Japan, (7) CESQ-ISIS (UMR 7006), Universite de Strasbourg and CNRS, (8) Universite Paris Cite, CNRS, Laboratoire Materiaux et Phenomenes Quantiques, Paris, France Strasbourg, France, (9) Department of Molecular Sciences and Nanosystems, Ca Foscari University of Venice, Venice, Italy)

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过太赫兹泵浦-光学探测技术,利用圆偏振太赫兹脉冲共振激发KTaO$_3$的软极性声子,实现抗磁体中类磁响应的诱导,揭示其温度依赖特性并建立理论模型。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26364 2026-08-28 cond-mat.mtrl-sci 新提交 50%

Laser-Induced Rashba Spin-Orbit Torques in Multiferroic Semiconductor (Ge,Mn)Te

多铁半导体(Ge,Mn)Te中的激光诱导Rashba自旋轨道矩

Zeynab Sadeghi, Tomas Ostatnicky, Eva Schmoranzerova, Jozef Kimak, Dominik Kriegner, Helena Reichlova, Lukas Nadvornik, Gunther Sprinhgholtz, J. Hugo Dil, Juraj Krempasky, Petr Nemec

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究针对多铁半导体(Ge,Mn)Te,利用时间分辨磁光光谱发现两种激光诱导的自旋轨道矩,其中第二种为该材料特有,为自旋电子器件的磁有序全光操控提供了新途径。

Comments v1: preprint; licence: CC BY 4.0; Supplementary material is a part of this submission

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 8 篇

2608.26496 2026-08-28 cs.RO cs.AI cs.CV 新提交 82%

RTNav: Towards Real-Time Zero-Shot Object Navigation

RTNav:迈向实时零样本目标导航

Easop Lee, Lingyu Zhang, Boyuan Chen

机构 * Duke University(杜克大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对零样本目标导航方法在现实实时场景下的性能下降问题,提出RTNav架构,在HM3D系列数据集的实时变体上实现了成功率与完成时间加权成功率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27158 2026-08-28 cs.LG 新提交 79%

Diffusion Policies for Short-Horizon Planning in Robot Crowd Navigation

用于机器人人群导航短程规划的扩散策略

Wendong Li, Jochen Garcke

机构 * Institute for Numerical Simulation(数值模拟研究所) University of Bonn(波恩大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.LG

AI总结 针对机器人人群导航中现有方法难以表征多样化短期避障策略的问题,提出PDPO框架,生成短程动作块并引入边界约束,在基准测试中取得更好导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27152 2026-08-28 cs.LG 新提交 70%

Ultra Low-Power, Lightweight, Probabilistic RSS-Based Path Reconstruction: A System for Landscape-Scale Bee Tracking

超轻量、超低功耗、基于概率RSS的路径重建:用于景观尺度蜜蜂追踪的系统

Christopher J. Noroozi, Joseph L. Woodgate, Michael Mangan, Michael T. Smith

机构 * University of Sheffield(谢菲尔德大学) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.LG

AI总结 本研究提出一种基于RSS的概率路径重建方法,实现了对38毫克低功耗设备的景观尺度追踪,精度达10-15米,可用于欧洲熊蜂归巢飞行的追踪研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26669 2026-08-28 cs.RO cs.CV 新提交 62%

Beyond the Proving Ground: Independent Public-Road Testing of Assisted Lane Change Systems using LiDAR

超越试验场:基于激光雷达的辅助变道系统独立公开道路测试

Marcello Cellina, Akos Kriston, Antonio Migneco, Davide Maggi, Stefano Favelli, Fabrizio Re, Fabrizio Minarini, Andrea Nuovo, Riccardo Dona, Biagio Ciuffo

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出公共道路独立测试辅助变道系统的方法,在法国A31高速开展测试,发现部分系统操作未达UNECE第79号法规安全距离要求,验证了LiDAR传感的适用性,可支持市场监管与法规修订。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27456 2026-08-28 cs.CV 新提交 57%

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

UrbanGround:从局部感知到真实城市中的空间能动性

Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) Shanghai University(上海大学) University of Oxford(牛津大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出首个基于香港3D地理空间数据构建的UrbanGround沙盒,探究MLLM智能体在真实城市中从局部感知转化为可靠行动的程度,发现其长时间探索时错误累积的缺陷,为相关研究提供支撑。

Comments 35 pages, 11 figures, 7 tables. Project Page: this https URL (https://urbanground.github.io), Code Repository: this https URL (https://github.com/UrbanGround/UrbanGround)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26551 2026-08-28 eess.SY 新提交 50%

Nonlinear Model Predictive Control for Guidance Law with Target Input Estimation

结合目标输入估计的制导律非线性模型预测控制

Minho Jang, Minjeong Kim, Sungsu Park

专题命中 具身导航 :navigation(abstract)

AI总结 本文针对捷联导引头导弹,提出结合目标输入估计的MPCG制导律,通过LGRPM离散化OCP并处理约束,仿真显示其拦截性能优于PPNG。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26525 2026-08-28 eess.SY 新提交 50%

Fusion Based Dynamic Platform Magnetic Compensation Beyond the Tolles Lawson Approach

基于融合的超越Tolles-Lawson方法的动态平台磁补偿

Rong Yang, Yaakov Bar-Shalom

专题命中 具身导航 :navigation(abstract)

AI总结 本文针对经典Tolles-Lawson框架的不足,提出两阶段磁补偿框架,利用增广线性化模型和无地图KFF算法,在公开数据集上将平均补偿误差降至12.3nT,提升了航空磁补偿性能。

Comments 16 pages, 10 figures, submitted to Journal of Advances in Information Fusion (JAIF) on 3rd Aug 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26211 2026-08-28 cs.SE 新提交 50%

Characterizing the Landscape of Open-Source Satellite Software

开源卫星软件的全景特征分析

Jinfeng Wen, Qi Liang, Yuehan Sun, Federica Sarro, Ao Zhou, Xuanzhe Liu, Shangguang Wang

专题命中 具身导航 :navigation(abstract)

AI总结 本文对22286个GitHub开源卫星软件项目开展特征研究,构建软件目标分类体系,揭示其流行度提升、异构专业化的特点,为相关人员提供启示。

Comments This paper has been accepted for publication in ASE 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 9 篇

2608.26190 2026-08-28 cs.AI 新提交 89%

Predicting Consequences and Reinforcing Navigation Policies with Latent World Models

用潜世界模型预测后果并强化导航策略

Zengmao Wang, Wei Gao, Shuhan Shen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 具身推理 :world model(title,abstract);navigation(title,abstract);分类 cs.AI

AI总结 本研究提出用于机器人导航的兼容性预测潜世界模型(LWM),通过预测动作条件下的潜特征兼容性评估动作后果,可从无标注视频监督策略学习并经强化学习改进,在多机器人导航数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26239 2026-08-28 cs.RO 新提交 85%

WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression

WALL-SS:通过下一尺度自回归扩展来缩放长视界世界模型

Maeve Zhang, Rain Sun, Xiang Wang, Cyril Zhang, Shalfun Li, Meng Cao, Howard Lu, Ethan Chen, Harry Jhou, KZ Zheng, Lights Shi, Regis Cheng, Lorenzin, Robert Wang, Victor Yao, Gody Li, Elise Mon, Yohann Tang, Ryan Yu, PS Zhang, Vincent Chen, Hang Su, Roy Gan, Hao Wang, Qian Wang

机构 * X Square Robot(X Square机器人)

专题命中 具身推理 :world model(title,abstract);robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出WALL-SS世界模型,通过尺度自回归扩展实现动作可控的长视界机器人仿真,经实验验证其可提升动作跟随与轨迹精度,减少动作漂移和长视界不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27406 2026-08-28 cs.RO cs.AI cs.CV 新提交 85%

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

CLAP:跨具身视频世界模型是零样本物理模拟器

Kechen Liu, Ola Shorinwa

机构 * Princeton University(普林斯顿大学)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 CLAP是跨具身动作条件视频生成框架,可在人类与机器人的多样化视频上训练,能接近或超越单具身视频模型性能,开源代码与模型,为训练单具身视频世界模型提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27367 2026-08-28 cs.CV cs.AI 新提交 84%

Successive Capacity Growth: Task-Complexity-Driven Width and Depth Expansion for Vision Transformer Encoders in JEPA World Models

连续容量增长:面向JEPA世界模型的视觉Transformer编码器的任务复杂度驱动的宽度与深度扩展

Frederik Berenz

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出SCG方法,使JEPA世界模型的视觉Transformer编码器可按需连续扩展宽度或深度,在多任务上提升性能并实现更高参数效率,且零误扩展。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26214 2026-08-28 cs.CV 新提交 83%

Surgical Video Generation From Diffusion to World Models: A Survey

手术视频生成:从扩散模型到世界模型:综述

Fuxiang Huang, Chenxu Zhang, Liang Han, Lei Zhang

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.CV

AI总结 该综述梳理2024-2026年手术视频生成领域文献,分三类总结方法,指出生成任务从合成帧转向建模场景因果动态,分析瓶颈并提供实验参考,为相关交叉领域研究者提供参考。

Comments 4 pages, 1 figures, 3 tables. Accepted for oral presentation at the 2026 3rd International Conference on Intelligent Perception and Pattern Recognition (IPPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27345 2026-08-28 cs.CV cs.AI 新提交 81%

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

PAWBench:我们离概率对齐的世界建模还有多远?

Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Krea AI Huggingface Shanghai Innovation Institute(上海创新研究院) Tongyi Lab(通义实验室) The University of Hong Kong(香港大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本研究针对当前视频生成器未满足概率对齐世界建模要求的问题,提出PAWBench基准与PAWEval协议,经50种场景和11个系统测试发现无模型达要求,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏