arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 996 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 996 篇

2608.18507 2026-08-20 cs.RO 新提交 65%

An Experimental Study of Downwash Effects on a Continuum Manipulator Integrated with a Multirotor UAV

多旋翼无人机集成的连续体机械臂下洗效应的实验研究

Anuraj Uthayasooriyan, Krishna Manaswi Digumarti, ernando Vanegas, Felipe Gonzalez

机构 * Queensland University of Technology (QUT)(昆士兰科技大学) QUT Centre for Robotics(昆士兰科技大学机器人中心) Research Engineering Facility (REF)(研究工程设施) School of Electrical Engineering and Robotics(电气工程与机器人学院)

专题命中 机器人操作 :manipulation(abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 本文针对多旋翼无人机集成的连续体机械臂,通过实验研究了螺旋桨下洗对其位姿的影响,提出CC引导的GPR残差模型可显著提升位姿预测精度,为相关系统的下洗补偿建模提供了方法。

Comments Accepted to publish in Robotics and Automation Letters

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 9, pp. 10704-10711, Sept. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09127 2026-08-11 cs.RO cs.GR 新提交 65%

High Fidelity Capture, Reconstruction, and Transfer of Human Demonstrations for Robot-Assisted Bathing

面向机器人辅助洗澡任务的人类演示的高保真捕捉、重建与迁移

Arjun S. Lakshmipathy, Jonathan P. King, Ethan Zuo, Rohit Satishkumar, Hongyi Chen, Jeffrey Ichnowski, Dan Ding, Zackory Erickson, Nancy S. Pollard

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) School of Health and Rehabilitation Sciences, University of Pittsburgh(匹兹堡大学健康与康复科学学院)

专题命中 机器人操作 :robotics(abstract,comments);分类 cs.RO

AI总结 针对机器人辅助洗澡任务中人类演示难以迁移的问题,提出以接触区域为核心的高保真处理框架,构建含多维度同步数据的数据集,实现灵巧软手完成洗澡任务,相关材料将公开以推动pHRI研究。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Official conference page: https://www.roboticsproceedings.org/rss22/p094.pdf

Journal ref Proceedings of Robotics: Science and Systems (RSS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21204 2026-08-24 cs.RO cs.LG 新提交 62%

Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning

超越模仿:基于离线Q规划的机器人策略自改进

Varun Giridhar, Anant Khandelwal, Jeremy A. Collins, Ignat Georgiev, Animesh Garg

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出Q规划方法,为大型视觉运动BC策略配备离线Q函数,通过仅微调Q函数实现自改进,在仿真和真实机器人任务中均显著提升机器人操作性能,且优于多种对比方法。

Comments Project page with videos: this https URL (https://varungiridhar.github.io/qplanning/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20913 2026-08-24 cs.CV cs.AI 新提交 62%

Explainable Deepfake Detection with Feature-robust Augmentation and Evidence-grounded Explanation Optimization

基于特征鲁棒增强与证据支撑的解释性深度伪造检测

Zhu Xu, Jiaqi Tang, Pokai Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 该研究针对深度伪造检测的鲁棒性与可解释性缺陷,提出含特征鲁棒增强、证据支撑偏好优化的框架,在ACM Multimedia 2026相关任务中获第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20084 2026-08-21 cs.RO cs.AI 新提交 62%

Evidence-Gated Task and Motion Planning with Vision-Language Models

基于视觉语言模型的证据门控任务与运动规划

Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

机构 * Waseda University(早稻田大学) Flinders University(弗林德斯大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人执行自然语言指令长时操纵任务时的部分可观测问题,提出 EAFG 框架,通过视觉证据获取与可行性门控提升食谱完成率并减少无效操纵尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18938 2026-08-20 cs.AI cs.LG 新提交 62%

Breaking the weakest link to evade vision language models

打破最弱环节以规避视觉语言模型

Ilan Zini, Boussad Addad, Katarzyna Kapusta

机构 * ESILV(ESILV高等工程师学院) Thales(泰雷兹集团)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对视觉语言模型(VLMs)提出仅优化视觉编码器的梯度攻击方法,在Qwen2.5-VL等模型上验证微小扰动可规避模型,凸显其对抗操纵的脆弱性并呼吁强化安全机制。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16159 2026-08-18 cs.CR cs.AI cs.LG 新提交 62%

Digital Twin Degradation: Detecting Cyber Physical Attacks via Temporal Inconsistencies

数字孪生退化:通过时间不一致性检测网络物理攻击

Konstantinos E. Kampourakis, Vasileios Gkioulos, Sokratis Katsikas

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出一种基于多时间范围特征与无监督密度模型的检测框架,利用数字孪生与物理系统的时间不一致性,在无需攻击标签的情况下实现工业控制系统的可靠攻击检测,误报率低且对数字孪生退化场景有效。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14944 2026-08-18 cs.RO cs.CL cs.LG 新提交 62%

SkillComposer: Learning Reusable Skills for Natural-Language Robot Programming

SkillComposer:学习可复用技能的自然语言机器人编程系统

John Woods, Hasti Seifi

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 SkillComposer是一款仿真环境下的交互式自然语言机器人编程系统,采用生成-测试架构,通过在线库学习算法生成可复用宏技能,经实验验证可提升任务成功率与可用性并减少用户工作量。

Comments 8 pages, 6 figures. Submitted to IEEE Humanoids 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11749 2026-08-13 cs.LG cs.AI stat.ML 新提交 62%

MOON: Multi-Objective OrthoNormalized Updates for Multitask Learning

MOON:面向多任务学习的多目标正交归一化更新方法

Shiji Zhou, Kunlin Lyu, Lei Zhang, Ruodong Wang, Yifan Sun

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对现有多任务学习方法忽略现代架构矩阵结构、优化效率受限的问题,提出MOON方法,在谱-核范数几何下进行梯度操作,理论与实验均表明其可提升优化效率和多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09270 2026-08-11 cs.CV cs.AI cs.IR cs.MM 新提交 62%

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

GRASP:面向无人机视角细粒度跨模态理解的粒度感知区域对齐与语义原型学习

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 机器人操作 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 针对无人机视角细粒度跨模态理解的背景杂波干扰与视觉同构歧义问题,提出GRASP框架,通过RFA和SPEM策略提升性能,在相关基准数据集上验证了有效性。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM Multimedia 2026, MM '26). 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03127 2026-08-05 cs.RO cs.AI 新提交 62%

DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units

DigitCode:基于解剖单元的手部运动符号分词

Haoyu Gu, Haotian Lu, Jingrun Du, Xiao-Ping Zhang

专题命中 机器人操作 :robot learning(abstract);分类 cs.RO、cs.AI

AI总结 本文提出DigitCode,沿手部解剖单元层次结构调整HL字母表以构建离散符号表征,将量化误差降低四分之三,发布HandTok测试平台,可用于修复生成的畸形手部及机器人重定向等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01899 2026-08-04 cs.CV cs.CL cs.LG 新提交 62%

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

SpatioLM:面向视觉-语言模型的通用物理空间智能

Jing Wu, Jianhua Wu, Jiayi Guan, Jiahong Chen, Jinghui Lu, Hangjun Ye, Bingzhao Gao, Long Chen

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 SpatioLM是一种参数高效的视觉-语言模型,通过内置空间视觉模块和伪深度、相机监督提升空间智能,在VSI-Bench获71.6分,还可迁移至具身操纵任务,同时保留通用能力。

Comments 27 pages,13 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00931 2026-08-04 cs.RO cs.CV 新提交 62%

Stipple: Real-Time Incremental Gaussian Splatting with Visual-Inertial Tracking

Stipple:基于视觉-惯性跟踪的实时增量高斯溅射技术

Kilian Northoff, Mateo de Mayo, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Stipple方法,结合Basalt视觉-惯性跟踪系统与Brush增量3D高斯溅射技术,实现实时同步跟踪重建,替代3DGS繁重步骤,为机器人与XR的实时3D重建提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28405 2026-07-31 cs.AI cs.LG 新提交 62%

QuantWAMs: Calibrating at the Right Granularity for World Action Models

QuantWAMs:为世界动作模型校准至合适粒度

Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantWAMs框架,通过三种校准策略优化后训练量化,在WAMs上实现内存大幅降低与速度提升,同时保持与FP16接近的性能,验证了部署可行性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28229 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 62%

EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

EMBL AI Librarian:面向AI智能体的生命科学知识层

Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar, Matt Jeffryes, Daljit Nijjer, Vittorio Perera, Ola Spjuth, Julio Saez-Rodriguez, Melissa Harrison, Fabio Petroni

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出EMBL AI Librarian,为AI智能体升级Europe PMC接口,通过LLM统筹检索,在多基准任务中提升性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22890 2026-07-28 cs.GR cs.CV cs.LG 新提交 62%

Meshless Domain Randomization via Explicit Parameter Perturbation of 3D Gaussian Splatting

通过显式参数扰动3D高斯喷溅实现无网格域随机化

Felipe Nunes Carbone de Carvalho, Joyce de Morais Souza, Alan de Aguiar, Charles Morphy D. Santos, João Paulo Gois

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 针对复杂有机物体提取和渲染纹理网格的挑战,提出基于3D高斯喷溅参数空间的无网格域随机化框架,用两个独立扰动管道合成随机训练数据集,为复杂几何形状生成强大数据集提供无网格替代方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22355 2026-07-27 cs.CV cs.AI 新提交 62%

SiPhy: Single-Image Physical Property Reasoning

SiPhy:单图像物理属性推理

Hoang Le, Joonwoo Kwon, Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

机构 * Michigan State University(密歇根州立大学)

专题命中 机器人操作 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 研究从单图像推断物理属性,核心方法是引入SiPhy框架,将视觉线索与材料知识对齐,通过采样、提取特征等操作及对比聚合器、重量感知细化来实现。在多个数据集上取得领先性能,还验证了其在真实交互数据集上作为数据标注引擎的潜力。

Comments Accepted to ECCV 2026 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21820 2026-07-27 cs.SD cs.AI cs.CR cs.LG 新提交 62%

Probing Speaker Identity Sensitivity in Audio Deepfake Detectors

探究音频深度伪造检测器中的说话者身份敏感性

Daniyal Kabir Dar, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究音频深度伪造检测器对说话者身份的敏感性问题,提出身份敏感性分数(ISS),该方法无需真实标签,通过计算检测器分数变化量化身份敏感程度,能有效预测错误分类,为基于说话者的故障分析提供实用诊断。

Comments Accepted at IEEE/IAPR International Joint Conference on Biometrics (IJCB) 2026. 8 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17757 2026-07-21 cs.RO cs.AI 新提交 62%

Seg2Grasp: A Robust Modular Suction Grasping in Bin Picking

Seg2Grasp:一种用于无序抓取的稳健模块化吸力抓取方法

Hye-Jung Yoon, Juno Kim, Yesol Park, Jun-Ki Lee, Byoung-Tak Zhang

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) Artificial Intelligence Institute, Seoul National University(首尔国立大学人工智能研究所) Department of Computer Science, Seoul National University(首尔国立大学计算机科学系)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对非结构化环境中无序抓取难题,提出Seg2Grasp模块化方法,经分割、抓取、分类三步流程,利用多种技术确定吸力点与识别物体,实际实验证明该方法在成功率和适应性上优于现有方法,是工业自动无序抓取有力工具。

Comments 7 pages, 6 figures, 2 tables. Published in the 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2024)

Journal ref 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024, pp. 2921-2927

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14341 2026-07-17 cs.RO cs.AI 新提交 62%

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

超越视觉抓取:从检测到执行的复杂抓取基准测试

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zurich University of Applied Science(苏黎世应用科学大学) Indian Institute of Science(印度科学研究所) University of Information Technology(信息技术大学) The University of Tokyo(东京大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对现有抓取基准未涵盖复杂多步推理和语义理解任务的问题,提出GCA-Bench基准,实现多种基线方法并进行实证研究,给出新评估指标等,为开发更强大通用的抓取策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14271 2026-07-17 cs.LG cs.AI 新提交 62%

Local Additive Feature Attribution: A Mathematical Taxonomy and Reporting Checklist

局部加法特征归因:一种数学分类法和报告清单

Rebecca Afriyie Sarpong, Daniel Commey

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究围绕五个规范选择组织多种局部加法特征归因方法,通过公理矩阵比较,将常见失败模式与假设关联,为使用局部加法归因的研究提出十项报告清单,强调归因结果依数学假设而定且假设应报告

Comments 35 pages, 7 figures, and 19 tables. Ancillary files include the axiom matrix, reporting checklist, related-survey scoring, and review-corpus summary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13475 2026-07-16 cs.RO cs.LG 新提交 62%

Deformable State Estimation for Autonomous Surgical Tissue Retraction Under Partial Observability

部分可观测性下自主手术组织牵开的可变形状态估计

Everest Yang, Skye Thompson, George D. Konidaris

机构 * Brown University(布朗大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 研究部分可观测下自主手术组织牵开的可变形状态估计问题,提出结合多层感知器与低维PCA潜在表示、用几何感知正则化训练的状态估计器,在二维模拟中评估,结果显示该估计器在多步牵开中性能良好,能支持有效可变形操作。

Comments Accepted to the ICRA 2026 RASEI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12861 2026-07-15 cs.RO cs.AI cs.SY eess.SY 新提交 62%

Unveiling Complex Collective Behaviors from Simple Rewards

从简单奖励中揭示复杂的集体行为

Yize Mi, Jianan Li, Liang Li, Shiyu Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) WINDY Lab, School of Engineering, Westlake University(西湖大学工程学院风语实验室) Shanghai AI Laboratory(上海人工智能实验室) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) Department of Computer and Information Science, University of Konstanz(康斯坦茨大学计算机与信息科学系) Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究中心) Department of Biology, University of Konstanz(康斯坦茨大学生物系)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究多智能体强化学习中简单奖励与复杂集体行为的关系,提出两阶段EEC解释框架及智能体响应图,通过合作与竞争两个任务验证,揭示了MARL策略背后隐藏的几何结构。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10014 2026-07-14 cs.RO cs.LG cs.MA cs.SY eess.SY 新提交 62%

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤

Alex Zongo, Peng Wei

专题命中 机器人操作 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。

Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08436 2026-07-10 cs.RO cs.AI 新提交 62%

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM:利用野外自我中心人类数据超越像素的世界行动模型

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究利用野外自我中心人类数据训练机器人操纵模型,引入EgoWAM框架,固定部分设置仅改变世界预测目标,比较不同方法。结果表明WAM协同训练更有效,DINO和3D流提升显著,为机器人操纵提供新训练思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26428 2026-07-10 cs.RO cs.AI 新提交 62%

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

Play2Perfect:灵巧操作预训练对精密装配的关键因素

Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出Play2Perfect框架,通过任务无关的玩耍预训练获取可复用的操作先验,再微调用于精密装配,在稀疏奖励和接触密集任务中实现33倍样本效率提升。

Comments 22 pages, 12 figures, 4 tables. Project page: https://play2perfect.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交 62%

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04645 2026-07-07 cs.CL cs.AI cs.CR cs.LG 新提交 62%

Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations

追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示

Samira Hajizadeh

机构 * Columbia University(哥伦比亚大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04184 2026-07-07 cs.AI cs.LG 新提交 62%

A Clustering-Based Framework for Identifying Suspicious Trading Patterns in Capital Market

一种基于聚类的资本市场可疑交易模式识别框架

Asif Zaman, Romona Magdalene Sarkar, Sabiha Khair Ohi, Iftekharul Mobin

机构 * Department of Computer Science & Engineering(计算机科学与工程系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对资本市场操纵股价问题,运用K-Means++聚类实现无监督欺诈检测工具,用2012至2024年约百万金融交易数据集,提出聚类流程识别欺诈交易并分类,给出各类型占比且模型表现获验证。

Comments Accepted for publication in IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN), 2026. This is the authors preprint version. The final version is available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏