arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8673 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8673 篇

2508.00518 2025-12-10 cs.CV cs.CL 57%

Fine-grained Spatiotemporal Grounding on Egocentric Videos

细粒度眼动视频时空定位

Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出EgoMask基准和EgoMask-Train数据集,针对眼动视频细粒度时空定位的挑战,通过微调提升模型性能。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12695 2025-12-10 cs.RO cs.SY eess.SY 57%

CDKFormer: Contextual Deviation Knowledge-Based Transformer for Long-Tail Trajectory Prediction

CDKFormer: 基于上下文偏差知识的长尾轨迹预测变换器

Yuansheng Lian, Ke Zhang, Meng Li

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 CDKFormer通过引入上下文偏差知识和双查询解码器,提升自动驾驶车辆在长尾轨迹预测中的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07309 2025-12-09 cs.IT cs.AI math.IT 57%

Radiance-Field Reinforced Pretraining: Scaling Localization Models with Unlabeled Wireless Signals

基于辐射场的强化预训练:利用未标记无线信号扩展定位模型

Guosheng Wang, Shen Wang, Lei Yang

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong, China(计算系,香港理工大学,香港,中国)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出RFRP框架,通过结合大规模未标记无线信号数据提升定位模型的跨场景泛化能力,实验表明其显著降低定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07211 2025-12-09 cs.CV 57%

Object Pose Distribution Estimation for Determining Revolution and Reflection Uncertainty in Point Clouds

点云中确定旋转和反射不确定性时的物体姿态分布估计

Frederik Hagelskjær, Dimitrios Arapis, Steffen Madsen, Thorbjørn Mosekjær Iversen

机构 * SDU Robotics(SDU机器人研究所) The Mærsk Mc-Kinney Møller Institute(马士基麦金尼莫勒研究所) University of Southern Denmark(南部丹麦大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出了一种基于深度学习的点云姿态分布估计方法,无需RGB输入,用于评估旋转和反射的不确定性。

Comments 8 pages, 8 figures, 5 tables, ICCR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20415 2025-12-09 cs.CV 57%

MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts

魔法城:基于语言的美学自适应城市生成与可控3D资产和布局

Zilong Huang, Jun He, Xiaobin Huang, Ziyi Xiong, Yang Luo, Junyan Ye, Weijia Li, Yiping Chen, Ting Han

机构 * Sun Yat-sen University(中山大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 MajutsuCity通过可控3D资产和布局生成逼真城市,结合语言驱动和美学自适应,实现高保真度和风格多样性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06865 2025-12-09 cs.CV 57%

Spatial Retrieval Augmented Autonomous Driving

空间检索增强的自动驾驶

Xiaosong Jia, Chenhe Zhang, Yule Jiang, Songbur Wong, Zhiyuan Zhang, Chen Chen, Shaofeng Zhang, Xuanhe Zhou, Xue Yang, Junchi Yan, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Jiao Tong University(上海交通大学) Key Laboratory of Target Cognition and Application Technology, Aerospace Information Research Institute, Chinese Academy of Sciences(目标认知与应用技术重点实验室,航天信息研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出空间检索范式,通过引入离线地理图像提升自动驾驶任务性能,扩展nuScenes数据集并建立多个基准测试。

Comments Demo Page: https://spatialretrievalad.github.io/ with open sourced code, dataset, and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06555 2025-12-09 cs.CR cs.AI cs.CY 57%

BEACON: A Unified Behavioral-Tactical Framework for Explainable Cybercrime Analysis with Large Language Models

BEACON:一种结合大语言模型的可解释性网络犯罪分析统一行为-战术框架

Arush Sachdeva, Rajendraprasad Saravanan, Gargi Sarkar, Kavita Vemuri, Sandeep Kumar Shukla

机构 * International Institute of Information Technology Hyderabad(国际信息研究所海得拉巴)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 BEACON通过整合行为心理学与网络犯罪战术生命周期,利用大语言模型实现网络犯罪的可解释性分析,提升分类准确率和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11210 2025-12-09 cs.CV 57%

STONE: Pioneering the One-to-N Universal Backdoor Threat in 3D Point Cloud

STONE:开创性地探索3D点云中的一对多通用后门威胁

Dongmei Shan, Wei Lian, Chongxia Wang

机构 * Changzhi University(长治大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 STONE首次提出3D点云中一对多通用后门威胁,通过可配置球形触发器设计实现高攻击成功率,为多目标后门威胁提供理论与实证基础。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09241 2025-12-09 cs.RO 57%

Unveiling the Impact of Data and Model Scaling on High-Level Control for Humanoid Robots

揭示数据与模型扩展对双足机器人高层控制的影响

Yuxi Wei, Zirui Wang, Kangning Yin, Yue Hu, Jingbo Wang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) University of Michigan(密歇根大学)

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO

AI总结 SCHUR通过大规模数据集和可扩展学习框架,提升了双足机器人高层控制的运动生成和文本-运动对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05418 2025-12-08 cs.CV 57%

Performance Evaluation of Deep Learning for Tree Branch Segmentation in Autonomous Forestry Systems

深度学习在自主林业系统中树枝分割性能评估

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) Victoria University of Wellington(惠灵顿维多利亚大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) University of Canterbury(坎特伯雷大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文评估了不同深度学习方法在自主林业系统中树枝分割的性能,发现U-Net+MiT-B3在高分辨率下表现最佳,PSPNet在效率上最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05240 2025-12-08 cs.CV 57%

IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction

IE2Video: 适配预训练扩散模型以实现事件视频重建

Dmitrii Torbunov, Onur Okuducu, Yi Huang, Odera Dim, Rebecca Coles, Yonggang Cui, Yihui Ren

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 IE2Video通过适配预训练扩散模型,实现从单帧和事件数据重建RGB视频,提升视频重建质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04535 2025-12-08 cs.AI 57%

GTM: Simulating the World of Tools for AI Agents

GTM: 为AI代理模拟工具世界

Zhenzhen Ren, Xinpeng Zhang, Zhenxing Qian, Yan Gao, Yu Shi, Shuxin Zheng, Jiyan He

机构 * Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Computer Science, Fudan University, Shanghai, China(计算机学院,复旦大学,上海,中国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 GTM通过模拟工具提升AI代理训练效率,实现快速且低成本的工具交互模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10599 2025-12-08 cs.RO 57%

Ergodic Trajectory Optimization on Generalized Domains Using Maximum Mean Discrepancy

在广义域上使用最大均值偏差进行耗散轨迹优化

Christian Hughes, Houston Warren, Darrick Lee, Fabio Ramos, Ian Abraham

机构 * Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) School of Mathematics, The University of Edinburgh(爱丁堡大学数学学院) NVIDIA

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于最大均值偏差的通用耗散轨迹优化方法,无需领域特定知识即可生成覆盖轨迹,适用于多种应用领域。

Comments 6 pages (excluding references), 1 table, 8 figures, submitted to ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2025-12-05 cs.CV 57%

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments Project Page: https://19reborn.github.io/Bullet4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05060 2025-12-05 cs.CV 57%

4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer

4DLangVGGT: 4D语言-视觉几何 grounded Transformer

Xianfeng Wu, Yajing Bai, Minghan Li, Xianzu Wu, Xueqi Zhao, Zhongyuan Lai, Wenyu Liu, Xinggang Wang

机构 * State Key Laboratory of Precision Blasting, Jianghan University(江汉大学精密爆破重点实验室) Harvard AI and Robotics Lab, Harvard University(哈佛大学AI与机器人实验室) School of EIC, Huazhong University of Science and Technology(华中科技大学电子信息学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) School of Mathematics and Statistics, Hubei University of Education(湖北省教育学院数学与统计学学院)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 4DLangVGGT是一种基于Transformer的统一框架,用于4D语言 grounding,通过整合几何感知和语言对齐,提升4D场景理解的泛化能力和部署效率。

Comments Code: https://github.com/hustvl/4DLangVGGT, Webpage: https://hustvl.github.io/4DLangVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04568 2025-12-05 cs.CV 57%

Prompt2Craft: Generating Functional Craft Assemblies with LLMs

Prompt2Craft: 基于LLM生成功能性的手工艺装配

Vitor Hideyo Isume, Takuya Kiyokawa, Natsuki Yamanobe, Yukiyasu Domae, Weiwei Wan, Kensuke Harada

机构 * Graduate School of Engineering Science, Osaka University(大阪大学工学研究科) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 Prompt2Craft利用LLM生成手工艺装配,通过识别可见部分、检索模板网格并优化姿态,最终生成功能性的手工艺作品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03558 2025-12-04 cs.CV cs.CL 57%

CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding

CartoMapQA: 一个评估视觉-语言模型在制图地图理解上的基础基准数据集

Huy Quang Ung, Guillaume Habault, Yasutaka Nishimura, Hao Niu, Roberto Legaspi, Tomoki Oya, Ryoichi Kojima, Masato Taya, Chihiro Ono, Atsunori Minamikawa, Yan Liu

机构 * KDDI Research, Inc.(KDDI研究公司) University of Southern California(南加州大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 CartoMapQA通过问答任务评估视觉-语言模型在制图地图理解上的能力,揭示了模型在地图语义和地理推理方面的不足。

Comments Accepted at SIGSPATIAL 2025 (Best paper candidates), 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02282 2025-12-03 cs.AI cs.HC cs.MA 57%

DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses

DialogGuard: 多智能体心理社会安全评估框架用于敏感LLM响应

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Department of Industrial Engineering and Management(工业工程与管理系) Ben-Gurion University of the Negev(贝内尔·加隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 DialogGuard通过多智能体框架评估LLM响应的心理社会风险,提供高准确性的风险检测与可解释的评估结果,支持安全提示设计和脆弱用户应用的监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02443 2025-12-03 cs.GR cs.CV 57%

PRIMU: Uncertainty Estimation for Novel Views in Gaussian Splatting from Primitive-Based Representations of Error and Coverage

PRIMU:基于原始体表示的误差与覆盖度的不确定性估计

Thomas Gottwald, Edgar Heinert, Peter Stehr, Chamuditha Jayanga Galappaththige, Matthias Rottmann

机构 * Department of Mathematics(数学系) University of Wuppertal(乌珀塔尔大学) Institute of Computer Science(计算机科学研究所) University of Osnabrück(奥斯纳布吕克大学) Centre for Robotics(机器人中心) Queensland University of Technology(昆士兰理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 PRIMU通过基于原始体的误差和覆盖度表示,实现了高斯点扩散中对新视图不确定性的有效估计,优于现有方法,尤其在深度和前景物体估计上表现突出。

Comments Revised writing and figures; additional Gaussian Splatting experiments; added baselines and datasets; active view-selection experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02009 2025-12-02 cs.CV 57%

AirSim360: A Panoramic Simulation Platform within Drone View

AirSim360:无人机视角下的全景模拟平台

Xian Ge, Yuling Pan, Yuhang Zhang, Xiang Li, Weijun Zhang, Dizhe Zhang, Zhaoliang Wan, Xin Lin, Xiangkai Zhang, Juntao Liang, Jason Li, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(Insta360研究机构) Wuhan University(武汉大学) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) University of California, Merced(加州大学默塞德分校) Shenzhen University(深圳大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 AirSim360 是一个基于无人机视角的全景模拟平台,通过渲染对齐的数据标注、交互式行人建模和自动轨迹生成,实现全方位场景采样和空间智能研究。

Comments Project Website: https://insta360-research-team.github.io/AirSim360-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01897 2025-12-02 cs.RO cs.SY eess.SY 57%

NeuroHJR: Hamilton-Jacobi Reachability-based Obstacle Avoidance in Complex Environments with Physics-Informed Neural Networks

NeuroHJR: 基于Hamilton-Jacobi可达性的复杂环境障碍物避障方法与物理引导神经网络

Granthik Halder, Rudrashis Majumder, Rakshith M R, Rahi Shah, Suresh Sundaram

机构 * Department of Physical Science, Indian Institute of Science Education and Research(物理科学系,印度科学教育与研究学院) Department of Aerospace Engineering, Indian Institute of Science(航空航天工程系,印度科学研究院) Department of Computer Science and Engineering, Shiv Nadar University(计算机科学与工程系,施瓦斯纳大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 NeuroHJR利用物理引导神经网络近似Hamilton-Jacobi可达性方法,实现复杂环境中高效实时障碍物避障。

Comments Author-accepted version. Accepted at IEEE 11th Indian Control Conference (ICC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01048 2025-12-02 cs.CV 57%

TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models

TRoVe: 发现时间视觉-语言模型中的错误引发静态特征偏差

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

机构 * Stanford University(斯坦福大学) HOPPR

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 TRoVe通过识别时间视觉-语言模型中的错误引发静态特征偏差,提升模型在下游任务中的表现。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00752 2025-12-02 cs.CV 57%

Charts Are Not Images: On the Challenges of Scientific Chart Editing

图表不是图像:关于科学图表编辑挑战的探讨

Shawn Li, Ryan Rossi, Sungchul Kim, Sunav Choudhary, Franck Dernoncourt, Puneet Mathur, Zhengzhong Tu, Yue Zhao

机构 * University of Southern California(南加州大学) Adobe Research(Adobe研究院) Texas A&M University(德克萨斯A&M大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出FigEdit基准测试,揭示科学图表编辑中结构转换的重要性,并指出传统像素操作方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00547 2025-12-02 cs.CV 57%

Asset-Driven Sematic Reconstruction of Dynamic Scene with Multi-Human-Object Interactions

基于资产的动态场景语义重建与多人类-物体交互

Sandika Biswas, Qianyi Wu, Biplab Banerjee, Hamid Rezatofighi

机构 * Monash University(墨尔本大学) Indian Institute of Technology(印度理工学院)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出混合方法,结合3D生成模型、语义感知变形和GS优化,实现动态场景中多人类-物体交互的高保真重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00022 2025-12-02 cs.RO 57%

XFlowMP: Task-Conditioned Motion Fields for Generative Robot Planning with Schrodinger Bridges

XFlowMP:基于施特林桥的任务条件运动场用于生成式机器人规划

Khang Nguyen, Minh Nhat Vu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·扎耶德人工智能大学) Automation & Control Institute (ACIN), TU Wien(自动化与控制研究所) Austrian Institute of Technology (AIT) GmbH(奥地利技术研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 XFlowMP通过施特林桥建模任务条件下的运动场,实现生成式机器人规划,提升轨迹平滑度、减少能耗并提高规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23377 2025-12-01 cs.CV 57%

DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline

DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线

Rui Zhang, Hongxia Wang, Hangqing Liu, Yang Zhou, Qiang Zeng

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。

Comments 13pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23241 2025-12-01 cs.CV 57%

Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods

合成工业目标检测:GenAI与基于特征的方法

Jose Moises Araya-Martinez, Adrián Sanchis Reig, Gautham Mohan, Sarvenaz Sardari, Jens Lambrecht, Jörg Krüger

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本研究比较了GenAI与基于特征的方法在合成工业目标检测中的效果,发现简单方法在准确性和效率上优于复杂GenAI方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 57%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12465 2025-12-01 cs.CV 57%

PhysX-3D: Physical-Grounded 3D Asset Generation

PhysX-3D:基于物理的3D资产生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 PhysX-3D提出一种基于物理的3D资产生成方法,通过构建物理标注数据集和双分支框架,提升生成资产的物理合理性和几何质量。

Comments Accepted by NeurIPS 2025, Spotlight Project page: https://physx-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09082 2025-12-01 cs.CV 57%

Taming generative video models for zero-shot optical flow extraction

驯服生成视频模型以实现零样本光流提取

Seungwoo Kim, Khai Loong Aw, Klemen Kotar, Cristobal Eyzaguirre, Wanhee Lee, Yunong Liu, Jared Watrous, Stefan Stojanov, Juan Carlos Niebles, Jiajun Wu, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出KL-tracing方法,通过反事实提示实现生成视频模型的零样本光流提取,无需微调即可在现实和合成数据集上竞争现有最佳模型。

Comments Project webpage: https://neuroailab.github.io/projects/kl_tracing

详情

展开后加载摘要…

URL PDF HTML 收藏