arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2205.14090 2026-05-28 stat.ML cs.LG 57%

Surrogate modeling for Bayesian optimization beyond a single Gaussian process

超越单一高斯过程的贝叶斯优化代理建模

Qin Lu, Konstantinos D. Polyzos, Bingcong Li, Georgios B. Giannakis

机构 * Dept. of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电子与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 提出一种基于高斯过程集成(EGP)的自适应代理模型,结合汤普森采样(TS)进行贝叶斯优化,以增强表达能力和并行性,并建立了贝叶斯遗憾分析。

Comments This version added some minor corrections and clarifications to the proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26629 2026-05-27 cs.CV 57%

DelowlightSplat: Feed-Forward Gaussian Splatting for Lowlight 3D Scene Reconstruction

DelowlightSplat: 面向低光照3D场景重建的前馈高斯泼溅

Fuzhen Jiang, Zengtian Xie, Zhuoran Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhuhai College of Science(珠海科技学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出DelowlightSplat,一种低光照感知的前馈高斯泼溅框架,通过轻量级低光照适配器和成本体积多视图推理,从稀疏有噪声图像中直接预测干净3D高斯,实现高质量新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26256 2026-05-27 cs.AI 57%

Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions

个性化具身多模态大语言模型代理在长期用户交互中的应用

Jeongeun Lee, Chanyoung Park, Dongha Lee

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 提出POLAR框架,通过多模态知识图谱记忆机制增强具身代理在长期交互中的个性化能力,显著提升多步推理和用户上下文跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19673 2026-05-27 cs.CV 57%

InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement

InHabit: 利用图像基础模型实现可扩展的3D人体放置

Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll

机构 * Bosch Center of Artificial Intelligence(博世人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 提出InHabit方法,通过渲染-生成-提升流程利用2D基础模型知识自动生成3D场景中与几何一致的人体交互数据,并构建大规模数据集InHabitants,显著提升3D人体-场景重建和接触估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14640 2026-05-27 cs.CL cs.AI 57%

Fact4ac at the Financial Misinformation Detection Challenge Task: Reference-Free Financial Misinformation Detection via Fine-Tuning and Few-Shot Prompting of Large Language Models

Fact4ac在金融虚假信息检测挑战赛中的方法:通过微调和少样本提示的大语言模型实现无参考金融虚假信息检测

Cuong Hoang, Le-Minh Nguyen

机构 * KaiNKaiho

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出一种结合零样本/少样本提示和LoRA参数高效微调的大语言模型框架,用于无外部证据的金融虚假信息检测,在公开和私有测试集上分别达到95.4%和96.3%的准确率,获得竞赛第一名。

Journal ref Proceedings of the 2nd Workshop on Misinformation Detection in the Era of LLMs (MisD 2026), 20th International AAAI Conference on Web and Social Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07284 2026-05-27 cs.RO 57%

AdaMorph: Unified Motion Retargeting via Embodiment-Aware Adaptive Transformers

AdaMorph: 通过具身感知自适应变换器实现统一运动重定向

Haoyu Zhang, Shibo Jin, Lusong Li, Jun Li, Liang Lin, Xiaodong He, Zecui Zeng

机构 * JD Explore Academy(京东探索学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 提出AdaMorph统一框架,利用具身感知自适应变换器将人体运动重定向到多种机器人形态,实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09606 2026-05-27 cs.CV 57%

SpaceVista: All-Scale Visual Spatial Reasoning from mm to km

SpaceVista:从毫米到公里的全尺度视觉空间推理

Peiwen Sun, Shiqiang Lang, Dongming Wu, Yi Ding, Kaituo Feng, Huadai Liu, Zhen Ye, Rui Liu, Yun-Hui Liu, Jianan Wang, Xiangyu Yue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Beijing University of Posts(北京邮电大学) Hong Kong University of Science(香港理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出全尺度空间推理解决方案,通过结构化知识系统、尺度感知建模和渐进训练范式,构建SpaceVista-1M数据集(38K视频场景、约1M空间QA对)和SpaceVista-7B模型,在5个基准上展现强泛化能力。

Comments Project Page: https://peiwensun2000.github.io/mm2km/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02974 2026-05-27 cs.LG 57%

PLAID: A Unified Data Model for Machine Learning on Heterogeneous Physics Simulations

PLAID:面向异构物理模拟的机器学习统一数据模型

Fabien Casenave, Xavier Roynard, Brian Staber, Alexandre Devaux-Rivière, William Piat, Michele Alessandro Bucci, Nissrine Akkari, Abbas Kabalan, Xuan Minh Vuong Nguyen, Luca Saverio, Raphaël Carpintero Perez, Anthony Kalaydjian, Samy Fouché, Thierry Gonon, Ghassan Najjar, Thomas Daniel, Emmanuel Menier, Matthieu Nastorg, Giovanni Catalani, Christian Rey

机构 * EPFL(苏黎世联邦理工学院) Inria(法国国家信息与自动化技术研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 提出PLAID统一数据层,通过标准化异构物理模拟数据并发布六个基准数据集,解决机器学习代理模型缺乏大规模多样化数据集的问题。

Comments Presented at EuRIPS 2025 and accepted at the AI4Physics Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08540 2026-05-27 cs.CV 57%

Datasets for Lane Detection in Autonomous Driving: A Comprehensive Review

自动驾驶中车道检测数据集:全面综述

Jörg Gamerdinger, Sven Teufel, Oliver Bringmann

机构 * University of Tübingen, Faculty of Science, Department of Computer Science, Embedded Systems Group(图宾根大学,科学学院,计算机科学系,嵌入式系统小组)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文全面综述了20个公开车道检测数据集,通过多维质量指标分析其特性、优势和局限,并指出未来改进方向以推动鲁棒车道检测创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24728 2026-05-26 cs.AI 57%

Hylos: Operability Contracts for Model-Native Spatial Intelligence

Hylos: 面向模型原生空间智能的可操作性契约

Christopher Da Silva

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 提出Hylos系统架构,通过契约约束和空间事务管理,确保生成或编辑的3D内容具备可操作性,支持CAD、机器人等下游应用。

Comments 27 pages, 7 figures. Systems/position preprint with focused artifact study

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25598 2026-05-26 cs.CV 57%

SurfSurg6D: Geometry Consistent Dense Correspondence for Textureless Surgical Instrument Pose Estimation

SurfSurg6D:面向无纹理手术器械位姿估计的几何一致密集对应

Daiyun Shen, Shuojue Yang, Chang Han Low, Qian Li, Mengya Xu, Qi Dou, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Chinese University of Hong Kong(香港中文大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对无纹理手术器械位姿估计中的数据稀缺和几何一致性挑战,本文构建了SynSurg6D数据集并提出SurfSurg6D密集对应框架,在多个数据集上实现了优于现有方法的RGB-only位姿估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25373 2026-05-26 cs.CV 57%

Physics-Aware 3D Gaussian Editing for Driving Scene Generation

物理感知的三维高斯编辑用于驾驶场景生成

Feng Zhou, Jian Zhang, Yuhang Sun, He Wang, Qiong Wen, Debao Kong, Tieru Wu, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与生物力学国家重点实验室) China FAW Group Co., Ltd.(中国第一汽车集团有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出RoVES系统,通过单图像驱动的道路几何插入和4-DOF半车动力学模型,实现物理感知的驾驶场景编辑与车辆姿态校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25308 2026-05-26 cs.CV 57%

Stabilizing Streaming Video Geometry via Dynamic Feature Normalization

通过动态特征归一化稳定流视频几何

Xiaoyang Lyu, Muxin Liu, Xiaoshan Wu, Ruicheng Wang, Yi-Hua Huang, Yang-Tian Sun, Shaoshuai Shi, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) USTC(中国科学技术大学) Voyager Research, Didi Chuxing(滴滴出行 Voyager 研究)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 针对流式RGB输入中单目几何模型的时间不一致问题(主要表现为尺度-偏移漂移),提出轻量级因果循环模块DyFN,通过动态调制特征统计量实现稳定几何估计,仅微调2%参数即可达到SOTA时间稳定性。

Comments 16 pages, 9 Figures, page: https://shawlyu.github.io/DyFN

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24760 2026-05-26 cs.RO 57%

Geometric Workspace Analysis and Transmission-Aware Dynamics of a Serial Spherical Tool for Microsurgery

显微外科用串行球形工具的几何工作空间分析与传动感知动力学

Anestis Mablekos-Alexiou, Lyndon da Cruz, Christos Bergeles

机构 * Moorfields Eye Hospital NHS Foundation Trust(莫尔菲兹眼科医院 NHS 基础信托) King’s College London(国王学院伦敦)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出一种用于显微外科的串行球形机构(带额外平移自由度)的运动学与传动感知设计框架,通过解析工作空间公式和传动感知动力学方法实现快速设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24691 2026-05-26 cs.CV 57%

AdaFuse-Det: Adaptive Cross-Modal Fusion of Event Cameras for Robust Object Detection in Low-Light RGB Imagery

AdaFuse-Det: 自适应跨模态融合事件相机用于低光照RGB图像中的鲁棒目标检测

Raju Imandi, Chethana B, Bharatesh Chakravarthi, Yong-Guk Kim, Manipriya S, Pavan Kumar B N

机构 * SRM University AP, India(印度SRM大学AP分校) Aptiv, Bengaluru, India(印度Aptiv公司,班加罗尔) Arizona State University, USA(美国亚利桑那州立大学) Sejong University, South Korea(韩国世宗大学) Indian Institute of Information Technology Sri City, India(印度Sri City信息学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出AdaFuse-Det双流框架,通过基于最小方差线性估计的自适应跨模态融合模块融合CLAHE增强RGB与事件数据,在低光照下实现鲁棒目标检测,在LLE-VOS基准上召回率65.54%、精确率53.85%、F1分数59.12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23845 2026-05-25 cs.CV 57%

Learning a Particle Dynamics Model with Real-world Videos

利用真实世界视频学习粒子动力学模型

Chanho Kim, Suhas V. Sumukh, Li Fuxin

机构 * Oregon State University(俄勒冈州立大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出一种从无标签真实视频直接训练神经物体动力学模型的框架,结合高斯溅射技术,通过渲染监督学习粒子位置和旋转变化,避免对合成数据的依赖。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23699 2026-05-25 cs.CV 57%

CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models

CRONOS:视频模型中反事实物理一致性的基准测试

León Begiristain, Olaf Dünkel, Adam Kortylewski

机构 * University of Freiburg(弗莱堡大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) CISPA Helmholtz Center for Information Security(哈勒斯海姆信息安全中心)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出CRONOS基准,通过干预视角、场景、物体类别和外观四个因素,评估视频模型在固定物理事件类型下反事实物理一致性的表现,发现现有模型存在显著失败。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23628 2026-05-25 cs.LG 57%

How Hard is it to Rig a Benchmark? A Social Choice Analysis of Leaderboard Robustness

操纵基准测试有多难?排行榜鲁棒性的社会选择分析

Polina Gordienko, Georg Schollmeyer, Frauke Kreuter, Christoph Jansen

机构 * Department of Statistics, LMU Munich(慕尼黑大学统计系) Social Data Science Center, University of Maryland(马里兰大学社会数据科学中心) School of Computing & Communications, Lancaster University Leipzig(莱比锡兰卡斯特大学计算与通信学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文通过社会选择理论中的移位贿赂问题,将基准特定训练建模为选举操纵,证明在Borda计数和平均胜率下该问题是NP难的,并引入实例级鲁棒性度量,实验表明平均胜率最难操纵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23220 2026-05-25 cs.LG 57%

WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents

WMAttack:世界模型智能体对抗评估的自动化攻击搜索

Zhixiang Guo, Siyuan Liang, Shi Fu, Cheng Guo, Andras Balogh, Mark Jelasity, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) University of Szeged(塞格德大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 提出WMAttack框架,通过自校正攻击搜索和表征引导攻击检索,自动搜索攻击配置以高效评估世界模型智能体的对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13596 2026-05-25 cs.CV 57%

VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation

VGGT-Segmentor: 几何增强的跨视角分割

Yulu Gao, Bohao Zhang, Zongheng Tang, Jitong Liao, Wenjun Wu, Si Liu

机构 * Hangzhou International Innovation Institute of Beihang University(北航杭州国际创新研究院) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 针对不同视角下的实例分割难题,提出VGGT-Segmentor框架,结合VGGT的几何建模与新型Union分割头,通过掩码提示融合、点引导预测和迭代细化实现像素精确分割,并采用单图像自监督训练,在Ego-Exo4D基准上达到新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL 57%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22596 2026-05-22 cs.LG 57%

Factored Diffusion Policies:Compositionally Generalized Robot Control with a Single Score Network

因子扩散策略:一种单一分数网络的组成通用机器人控制

Sayan Mitra, Ege Yuceel, Noah Giles, Abhishek Pai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种因子扩散策略,通过单一共享的扩散网络实现通用机器人控制,该网络在推理时能将分数分解为各因子的加法形式,从而在训练任务预算上从因子基数的乘积减少到求和,通过轨迹管证书将分数界转化为闭环状态轨迹管,实验验证了其泛化界和证书的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21863 2026-05-22 cs.RO 57%

OCELOT: Odometry and Contact Estimation for Legged Robots

OCELOT:用于腿部机器人的步态和接触估计

Emre Girgin, Cagri Kilic

机构 * Department of Aerospace Engineering, Embry-Riddle Aeronautical University(航空航天工程系,埃默里-瑞德航空航天大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种基于误差状态扩展卡尔曼滤波器(ESEKF)的完整腿部里程计管道,通过仅使用本体感觉数据(如固定IMU、关节编码器和力传感器)来实现准确的里程计估计,核心贡献是融合接触检测和不确定性量化模块,用于显式识别并拒绝滑动。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01851 2026-05-22 cs.CV 57%

How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing

模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准

Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang, Haochen Tian, Haodong Li, Ruichuan An, Yifan Zhang, Anna Korhonen, Zhang Zhang, Liang Wang, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Peking University(北京大学) South China University of Technology(华南理工大学) Nanjing University(南京大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出VIBE基准,用于评估视觉指令驱动的图像编辑模型,通过三级交互层次评估指涉 grounding、形态操作和因果推理,并发现专有模型在早期阶段表现优异但随着任务难度增加性能下降。

Comments https://vibe-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20566 2026-05-21 cs.RO 57%

Conflict-Aware Active Perception and Control in 3D Gaussian Splatting Fields via Control Barrier Functions

基于控制屏障函数的3D高斯点云场中冲突感知与控制

Amirhossein Mollaei Khass, Athanasios Cosse, Vivek Pandey, Nader Motee

机构 * Department of Mechanical Engineering and Mechanics, Lehigh University(机械工程与力学系,莱恩大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于控制屏障函数的冲突感知与控制框架,用于在3D高斯点云场环境中安全导航并获取信息以减少地图不确定性,通过统一的安全关键和感知感知二次规划程序解决安全与感知目标的冲突。

Comments Project website: https://sircesoc.github.io/Conflict_Aware_Active_Perception/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20561 2026-05-21 cs.RO 57%

Fault-Tolerant, Rigidity-Preserving Control of Inflatable Truss Robots

容错、保持刚性的可膨胀桁架机器人控制

James Wade, Isaac Weaver, Mihai Stanciu, Nathan Usevitch

机构 * Ira A. Fulton School of Engineering, Mechanical Engineering Department, Brigham Young University(伊拉·A·福林工程学院,机械工程系, Brigham Young 大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种容错控制框架,用于可膨胀机器人桁架,能够在电机故障的情况下保持功能,通过三个关键贡献:扩展运动学优化以处理任意电机故障组合,引入离散时间控制屏障函数约束以保证结构刚性,以及利用 onboard 编码器反馈和基于正向运动学的状态估计器实现闭环位置控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17776 2026-05-21 cs.RO 57%

CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization

CosFly-Track: 一个大规模多模态数据集,用于通过多约束轨迹优化的无人机视觉跟踪

Xiangyue Wang, Hanxuan Chen, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出CosFly-Track数据集,用于无人机视觉跟踪任务,通过多约束轨迹优化生成大规模多模态数据,提升了动态目标跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15305 2026-05-21 cs.GR cs.LG 57%

WorldParticle: Unified World Simulation of Lagrangian Particle Dynamics via Transformer

WorldParticle:通过Transformer实现拉格朗日粒子动力学的统一世界模拟

Caoliwen Wang, Minghao Guo, Siyuan Chen, Heng Zhang, Mengdi Wang, Xingyu Ni, Hanson Sun, Kunyi Wang, Zherong Pan, Kui Wu, Lingjie Liu, Yin Yang, Chenfanfu Jiang, Taku Komura, Wojciech Matusik, Peter Yichen Chen

机构 * University of British Columbia(不列颠哥伦比亚大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Georgia Institute of Technology(佐治亚理工学院) Inria(法国国家信息与自动化技术研究院) Meta Independent Researcher(独立研究者) University of Pennsylvania(宾夕法尼亚大学) University of Utah(犹他大学) University of California Los Angeles(加州大学洛杉矶分校) University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出基于Transformer架构的粒子模拟器,能够统一模拟布料、弹性固体、牛顿流体、非牛顿流体、颗粒材料和分子动力学等不同物理现象,通过预测-校正设计和粒子表示,实现高效的模拟与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19728 2026-05-20 cs.CV 57%

Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls

Aero-World: 从惯性控制生成动作条件的空中视频

Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出Aero-World,一种将预训练图像到视频扩散模型转换为可控空中视频生成器的方法,通过注入加速度和角速度序列,利用冻结的物理探测器提供惯性一致性监督,从而提高生成视频对低级动作信号的符合度和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19663 2026-05-20 cs.AI 57%

Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models

基于伪代码的结构化推理用于自动化可靠推理在视觉-语言模型中

Weicong Ni, Tianbao Jiang, Linlin Wang

机构 * East China Normal University(东华师范大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 本文提出了一种基于伪代码的结构化推理框架(PStar),旨在通过自适应选择结构化伪代码推理路径,提高视觉-语言模型在复杂任务中的可靠性和鲁棒性,从而减少幻觉现象并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏