arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2605.13129 2026-05-14 cs.GR cs.CV 57%

Rigel3D: Rig-aware Latents for Animation-Ready 3D Asset Generation

Rigel3D: 基于姿态的潜变量用于动画准备的3D资产生成

Nikitas Chatzis, Marios Loizou, Evangelos Kalogerakis

机构 * Technical University of Crete(希腊克里特技术大学) CYENS Center of Excellence(CYENS卓越中心) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 Rigel3D通过联合建模几何和骨架结构,生成可动画化的3D资产,优于现有rigging基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13041 2026-05-14 cs.CV 57%

EgoForce: Robust Online Egocentric Motion Reconstruction via Diffusion Forcing

EgoForce:通过扩散强迫实现鲁棒的在线自体视角运动重建

Inwoo Hwang, Donggeun Lim, Hojun Jang, Young Min Kim

机构 * Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出EgoForce框架,通过扩散强迫方法实现从噪声自体视角输入中鲁棒的长时间全身体运动重建,优于现有在线和离线方法。

Comments Project page: https://inwoohwang.me/EgoForce

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12673 2026-05-14 cs.AI cs.CR 57%

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15743 2026-05-14 cs.LG astro-ph.EP astro-ph.IM 57%

Connecting the Dots: A Machine Learning Ready Dataset for Ionospheric Forecasting Models

连接点:为电离层预报模型准备的机器学习数据集

Linnea M. Wolniewicz, Halil S. Kelebek, Simone Mestici, Michael D. Vergalla, Giacomo Acciarini, Bala Poduval, Olga Verkhoglyadova, Madhulika Guhathakurta, Thomas E. Berger, Atılım Güneş Baydin, Frank Soboczenski

机构 * Department of Information and Computer Science(信息与计算机科学系) University of Hawai‘i at Mānoa(夏威夷大学毛纳罗亚分校) Department of Engineering Science(工程科学系) University of Oxford(牛津大学) Università degli Studi di Roma Sapienza(罗马大学) Free Flight Research Lab(自由飞行研究实验室) University of New Hampshire(新罕布什尔大学) European Space Agency (ESA)(欧洲航天局) NASA Jet Propulsion Laboratory(美国宇航局喷气推进实验室) NASA Headquarters(美国宇航局总部) Space Weather Technology, Research, and Education Center(空间天气技术、研究与教育中心) University of Colorado Boulder(科罗拉多大学博尔德分校) Department of Computer Science(计算机科学系) University of York & King’s College London(约克大学及伦敦国王学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 本文提出一个整合多种电离层和日球层数据的机器学习数据集,用于改进电离层预报模型,支持科学探索和实际应用。

Comments 8 pages, 2 figures, 2 tables. Accepted as a poster presentation in the Machine Learning for the Physical Sciences workshop at NeurIPS 2025. Dataset can be found on Zenodo (https://zenodo.org/records/18343833) or GitHub (https://github.com/FrontierDevelopmentLab/2025-HL-Ionosphere-dataset)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08571 2026-05-13 cs.RO 57%

BEACON: Cross-Domain Co-Training of Generative Robot Policies via Best-Effort Adaptation

BEACON:通过最佳努力适应进行跨领域生成机器人策略的协同训练

Antong Zhang, Han Qi, Heng Yang

机构 * Department of Computer Science, Brown University(布朗大学计算机科学系) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 BEACON提出一种理论驱动框架,通过大量源演示和有限目标演示训练生成机器人策略,通过跨领域协同训练提升鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10707 2026-05-12 cs.RO 57%

ObjView-Bench: Rethinking Difficulty and Deployment for Object-Centric View Planning

ObjView-Bench:重新思考面向对象的视图规划中的难度与部署

Sicong Pan, Hao Hu, Xuying Huang, Benno Wingender, Maren Bennewitz

机构 * University of Bonn(波恩大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出ObjView-Bench框架,通过分离视图规划评估中的三个关键因素,改进了面向对象的视图规划评估方法,并展示了部署导向的评估协议对方法性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10176 2026-05-12 cs.CR cs.AI 57%

When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架

Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi, Feng Cheng, Christoph Meinel

机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。

Comments 11 pages

Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16593 2026-05-12 cs.RO 57%

Scalable Inspection Planning via Flow-based Mixed Integer Linear Programming

基于流的混合整数线性规划的可扩展检查规划

Adir Morgan, Kiril Solovey, Oren Salzman

机构 * Technion--Israel Institute of Technology, Haifa, Israel(技术离子-以色列理工学院,海法,以色列)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出基于流的混合整数线性规划方法,解决大规模检查规划问题,提升求解效率和解的质量,适用于医疗和基础设施等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06248 2026-05-12 cs.CV 57%

Deepfake Detection that Generalizes Across Benchmarks

跨基准测试的深度伪造检测

Andrii Yermakov, Jan Cech, Jiri Matas, Mario Fritz

机构 * Czech Technical University in Prague(捷克技术大学布拉格分校) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出GenD方法,通过参数高效调整预训练视觉编码器实现跨基准测试的深度伪造检测,展示出通过微调层归一化参数和超球面特征流形增强泛化能力,优于其他复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10079 2026-05-12 cs.CV 57%

SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation

SocialDirector: 无训练的社会互动控制多人物视频生成

Liangyang Ouyang, Ruicong Liu, Caixin Kang, Yifei Huang, Yoichi Sato

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI东京研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 SocialDirector通过调节交叉注意力图提升多人物视频生成的社会互动准确性,解决演员动作不匹配和社交动态紊乱问题,实验表明其能显著提升互动真实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09678 2026-05-12 cs.AI 57%

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

荒诞世界:一种简单却强大的方法,用于将现实世界扭曲以探测LLM推理能力

Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

机构 * The Nueva School(新维学校) University of Southern California(南加州大学) Notre Dame College(诺特大学) Arizona State University(亚利桑那州立大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文提出Absurd World框架,通过扭曲现实世界来测试LLM的推理能力,验证其在简单逻辑任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09591 2026-05-12 cs.CV 57%

From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

从像素到概念:分割模型是否理解它们所分割的内容?

Shuang Liang, Zeqing Wang, Yuxian Li, Xihui Liu, Han Wang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) CASIC, The University of Hong Kong(香港大学中国科学院自动化所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出CAFE基准,评估可提示分割模型对概念的忠实性。通过属性层面的反事实操纵,测试模型在误导性提示下的表现,揭示分割模型可能依赖视觉显著但语义误导的线索。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19279 2026-05-12 cs.LG cs.CL 57%

MapFormer: Self-Supervised Learning of Cognitive Maps with Input-Dependent Positional Embeddings

MapFormer:基于输入依赖位置嵌入的自监督认知图学习

Victor Rambaud, Salvador Mascarenhas, Yair Lakretz

机构 * Institut Jean Nicod(让·内科研究所) LSCP(LSCP实验室) Département d’Études Cognitives - ENS, EHESS, CNRS, PSL University(认知研究系 - 巴黎高等师范学院,高等社会科学学院,国家科学研究中心,巴黎综合理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 MapFormer通过输入依赖的位置嵌入学习认知图,结合绝对和相对位置编码,实现事件记忆和工作记忆建模,在多个认知任务中表现出色,实现近完美的分布外泛化。

Comments 19 pages (29 with appendix), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08730 2026-05-12 cs.LG cs.CR 57%

Classification-Head Bias in Class-Level Machine Unlearning: Diagnosis, Mitigation, and Evaluation

类别级机器去学习中的分类头偏差:诊断、缓解与评估

Weidong Zheng, Kongyang Chen, Yuanwei Guo, Yatie Xiao

机构 * School of Computer Science and Cyber Engineering, Guangzhou University(计算机科学与电子工程学院,广州大学) School of Artificial Intelligence, Guangzhou University(人工智能学院,广州大学) Guangzhou Institute of Internet of Things(广州物联网研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文揭示了类别级去学习中的偏差主导捷径,提出BiasShift和两种新的机制,通过引入新的指标量化偏差依赖性,实验表明方法在保持去学习性能的同时更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-05-12 cs.CV 57%

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08695 2026-05-12 cs.CV 57%

EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics

EditSleuth:用于图像编辑取证的 grounded 推理链数据集

Van-Loc Nguyen, AprilPyone MaungMaung, Minh-Triet Tran, Isao Echizen

机构 * University of Science, Vietnam National University Ho Chi Minh City(越南胡志明市国家大学科学大学) National Institute of Informatics(国立信息研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出EditSleuth数据集,包含257,725个图像编辑三元组,用于图像编辑取证的 grounded 推理。数据集包含编辑图像、源图像、二元编辑掩码、12类编辑分类标签、难度评分和六步推理链,通过确定性方法生成,并验证了难度评分与编辑类型的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08664 2026-05-12 cs.CV 57%

IPAD-CLIP: Teaching CLIP to Detect Image Local Perceptual Artifacts

IPAD-CLIP: 教授CLIP检测图像局部感知伪影

Juan Wang, Xinyu Sun, Ke Zhang, Jin Wang, Bing Li, Weiming Hu, Liang Wang

机构 * Minzu University of China(民族大学) OPPO Co., Ltd.(OPPO公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出IPAD-CLIP框架,通过增强文本和视觉空间中的伪影判别能力,解决局部感知伪影检测问题,提出包含3520张伪影图像的基准数据集,显著优于现有方法。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07550 2026-05-11 cs.CV 57%

Mind the Gap: Geometrically Accurate Generative Reconstruction from Disjoint Views

注意间隙:从不重叠视角进行几何准确的生成重建

Grzegorz Wilczynski, Mikołaj Zielinski, Bartosz Świrta, Dominik Belter, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构) Poznań University of Technology(波兹南技术大学) Warsaw University of Technology(华沙技术大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出了一种新的生成重建范式,针对不重叠视角下的几何重建问题,提出GLADOS框架,通过生成桥梁、鲁棒粗重建和迭代上下文扩展优化,解决传统方法在零重叠场景下的失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02357 2026-05-11 cs.CV 57%

Channel-Level Relation to Attentive Aggregation with Neighborhood-Homogeneity Constraint for Point Cloud Analysis

通道级关系与具有邻域同质性约束的注意聚合在点云分析中的应用

Jiaqi Shi, Jin Xiao, Xiaoguang Hu, Wenxuan Ji, Zichong Jia, Zifan Long, Tianyou Chen, Baochang Zhang

机构 * 1School of Automation Science Electrical Engineering, Beihang University, Beijing, China 2Wuhan Leaddo Measuring \& Control Technology, Wuhan, China 3School of Artificial Intelligence, Beihang University, Beijing, China Emails

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出PointCRA网络,通过引入时间趋势变化作为新评估维度,解决现有空间和通道注意机制中权重维度坍缩导致的信息丢失问题,提升点云分析的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04939 2026-05-11 cs.CV 57%

SynthForensics: Benchmarking and Evaluating People-Centric Synthetic Video Deepfakes

SynthForensics:以人为中心的合成视频深度伪造基准测试与评估

Roberto Leotta, Salvatore Alfio Sambataro, Claudio Vittorio Ragaglia, Mirko Casu, Yuri Petralia, Francesco Guarnera, Luca Guarnera, Sebastiano Battiato

机构 * iCTLab s.r.l.(iCTLab公司) University of Catania(卡塔尼亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出SynthForensics基准测试,评估合成视频深度伪造的可检测性,通过20445个视频数据集验证了人类和算法在识别合成视频中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01105 2026-05-11 cs.LG 57%

Geometric Analysis of Neural Regression Collapse via Intrinsic Dimension

神经回归崩溃的几何分析:通过内在维度

George Andriopoulos, Zixuan Dong, Bimarsha Adhikari, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) SFSC of AI and DL, NYU Shanghai(纽约大学上海人工智能与深度学习学院) New York University(纽约大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 研究通过内在维度分析揭示神经回归崩溃的几何机制,发现过度压缩导致泛化能力下降,提出扩展或减少特征维度的策略以提升性能。

Comments 36 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09209 2026-05-11 cs.CV 57%

Surgical Visual Understanding (SurgVU) Dataset

外科视觉理解(SurgVU)数据集

Aneeq Zia, Max Berniker, Rogerio Nespolo, Xiaorui Zhang, Conor Perreault, Ziheng Wang, Benjamin Mueller, Ryan Schmidt, Kiran Bhattacharyya, Xi Liu, Anthony Jarc

机构 * Intuitive Surgical

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文介绍了用于外科数据科学的基础研究的大型外科视频数据集,包含视频及标注,展示了数据收集方法和独特属性,并提出了多个示例问题,旨在推动机器学习领域在手术数据科学中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18149 2026-05-11 cs.RO cs.SY eess.SY math.OC 57%

Code Generation and Conic Constraints for Model-Predictive Control on Microcontrollers with Conic-TinyMPC

基于锥约束的模型预测控制与代码生成:适用于微控制器的Conic-TinyMPC

Ishaan Mahajan, Khai Nguyen, Sam Schoedel, Elakhya Nedumaran, Moises Mata, Brian Plancher, Zachary Manchester

机构 * School of Engineering and Applied Science, Columbia University(哥伦比亚大学工程与应用科学学院) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Barnard College, Columbia University and Dartmouth College(哥伦比亚大学巴纳德学院和达特茅斯学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种适用于微控制器的模型预测控制方法,通过支持二次锥约束和自动生成C++代码,显著提升了嵌入式系统的求解速度和问题规模。

Comments Accepted to ICRA 2026. 4 Figures. 2 Tables. First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07388 2026-05-11 cs.CV 57%

A Marine Debris Detection Framework for Ocean Robots via Self-Attention Enhancement and Feature Interaction Optimization

面向海洋机器人的海洋垃圾检测框架:通过自注意力增强与特征交互优化

Yuyang Li, Jiashu Han, Yinyi Lai, Wenbin Kang, Zenghui Liu

机构 * Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥物质科学研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出YOLO-MD框架,通过自注意力增强模块和轻量级位移操作提升海洋垃圾检测性能,实验表明在UODM数据集上取得优异精度和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24136 2026-05-11 cs.CV eess.IV 57%

Bridging Restoration and Generation Manifolds in One-Step Diffusion for Real-World Super-Resolution

连接恢复与生成流形的单步扩散在现实世界超分辨率中的应用

Shyang-En Weng, Yi-Cheng Liao, Yu-Syuan Xu, Wei-Chen Chiu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University, Hsinchu, Taiwan MediaTek Inc., Taiwan

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出IDaS-SR框架,通过Manifold Inversion Noise Estimator和CHARIOT机制,解决单步扩散中恢复与生成流形的匹配问题,提升现实世界超分辨率的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06247 2026-05-08 cs.RO 57%

CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models

CKT-WAM: 在世界动作模型之间高效传递上下文知识

Yuhua Jiang, Yijun Guo, Hongbing Yang, Guojun Lei, Nuo Chen, Yinuo Zhang, Shaoqiang Yan, Bo Lin, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) LivsynRobotics Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 CKT-WAM通过文本嵌入空间中的紧凑上下文传递教师WAM知识,提升零样本泛化能力,在LIBERO-Plus上达到86.1%的成功率,且在现实任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12539 2026-05-05 cs.AI cs.CL 57%

MemeLens: Multilingual Multitask VLMs for Memes

MemeLens:多语言多任务VLMs用于表情包

Ali Ezzat Shahroor, Mohamed Bayan Kmainasi, Abul Hasnat, Dimitar Dimitrov, Giovanni Da San Martino, Preslav Nakov, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯") University of Padova(帕多瓦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出MemeLens,一种统一的多语言多任务解释增强视觉语言模型,用于表情包理解。通过整合38个公开数据集,建立20个任务的共享分类体系,并分析不同模型范式和数据集的表现,发现多模态训练和统一训练对表情包理解至关重要。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10580 2026-05-05 cs.RO 57%

From Fold to Function: Simulation-Driven Design of Origami Mechanisms

从折叠到功能:基于仿真的折纸机制设计

Tianhui Han, Shashwat Singh, Sarvesh Patil, Zeynep Temel

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于仿真的折纸机制设计框架,利用MuJoCo的可变形体能力,通过直观的图形用户界面实现折纸结构的仿真与优化,验证了其在折纸弹射装置中的应用效果。

Comments IEEE RoboSoft 2026 (8 Pages, 9 Figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00362 2026-05-04 cs.CV 57%

Time-series Meets Complex Motion Modeling: Robust and Computational-effective Motion Predictor for Multi-object Tracking

时间序列与复杂运动建模的交汇:多目标跟踪的鲁棒且计算高效的运动预测器

Nhat-Tan Do, Le-Huy Tu, Nhi Ngoc-Yen Nguyen, Dieu-Phuong Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology, Ho Chi Minh City, Vietnam(1* 信息科学与工程学院,信息技术大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(2 越南国家大学,胡志明市,越南)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出TCMP框架,通过改进的TCN网络实现高效多目标跟踪,实验显示其在HOTA、IDF1和AssA等指标上均优于现有方法,且计算效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00121 2026-05-04 cs.RO 57%

Predictive Spatio-Temporal Scene Graphs for Semi-Static Scenes

用于半静态场景的预测时空场景图

Miguel Saavedra-Ruiz, Charlie Gauthier, Kumaraditya Gupta, Shima Shahfar, Kirsty Ellis, Steven Parkison, Liam Paull

机构 * Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系) Mila - Quebec AI Institute(魁北克人工智能研究所) Hydro-Québec Research Institute (IREQ)(魁北克水电研究院(IREQ))

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出预测图结构,结合贝叶斯推理滤波器Perpetua,实现对半静态环境的时空语义推理,验证了其在动态导航任务中的预测性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏