arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2606.31639 2026-07-01 cs.CR cs.AI cs.GT cs.LO 新提交 57%

A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems

大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题

Seyed Bagher Hashemi Natanzi, Bo Tang

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25949 2026-07-01 cs.RO 版本更新 57%

FalconApp: Rapid iPhone Deployment of End-to-End Perception via Automatically Labeled Synthetic Data

FalconApp:通过自动标注的合成数据实现端到端感知的快速iPhone部署

Yan Miao, Will Shen, Sayan Mitra

机构 * Department of Electrical and Computer Engineering, University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 FalconApp通过自动标注的合成数据实现端到端感知的快速iPhone部署,利用手机拍摄的刚体对象生成感知模块,实现遮挡检测和6自由度姿态估计,实验显示其在模拟和现实评估中姿态精度优于PnP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16424 2026-07-01 cs.RO cs.NA cs.SY eess.SY math.NA 版本更新 57%

Early-Terminable Energy-Safe Iterative Coupling for Parallel Simulation of Partitioned Port-Hamiltonian Systems

用于分区端口-哈密顿系统并行仿真的早期可终止节能迭代耦合

Qi Wei, Jianfeng Tao, Hongyu Nie, Wangtao Tan

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械与动力工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对并行仿真中分区耦合可能注入虚假能量的问题,提出基于Douglas-Rachford分裂的早期可终止节能耦合接口,利用Fejér单调性提供算法耗散,保证离散无源性并收敛到整体离散化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30268 2026-06-30 cs.RO 57%

ConCent: Contact-Centric Real-to-Sim-to-Real Learning from One Demonstration

ConCent: 基于接触中心的真实-仿真-真实学习,仅需一次演示

Heecheol Kim, Namiko Saito, Katsushi Ikeuchi, Yasuyuki Matsushita

机构 * Microsoft Research Asia - Tokyo(微软亚洲研究院-东京) The University of Tokyo(东京大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出接触中心真实-仿真-真实强化学习框架,利用真实演示中的接触事件序列作为学习目标,优化仿真中物体的接触几何,实现更稳定的策略迁移。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29948 2026-06-30 cs.RO 57%

Heterogeneous Tactile Transformer

异构触觉Transformer

Jianxin Bi, Qiang Wang, Jayaram Reddy, Kelvin Lin, Soibkhon Khajikhanov, Ruihan Gao, Harold Soh

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出异构触觉Transformer(HTT),通过传感器特定编码器和共享Transformer主干学习跨异构传感器的共享触觉表示,利用新HPT数据集预训练,在感知和操作任务中实现可迁移表示。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29784 2026-06-30 stat.ME cs.AI econ.EM 57%

HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data

HERO: 利用历史数据提升生成模型评估的可靠性与敏感性

Xinrui Ruan, Zhenyu Zhao, Waverly Wei, Yueshan Zhang, Zeyu Zheng, Sui Huang, Jingshen Wang

机构 * Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系) Roblox Corporation(Roblox公司) Department of Data Sciences and Operations, University of Southern California(南加州大学数据科学与运营系) School of Mathematical Sciences, Nankai University(南开大学数学科学学院) Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校工业工程与运筹学系)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 提出HERO框架,通过历史数据校准噪声标签并锚定协变量,降低模型评估的偏差和方差,提升可靠性与敏感性。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29374 2026-06-30 cs.CV cs.GR 57%

L2D2-GS: Learning to Densify for Feedforward Dynamic Gaussian Scene Reconstruction

L2D2-GS: 学习致密化以实现前馈动态高斯场景重建

Zetian Song, Chenming Wu, Junnan Liu, Chitian Sun, Liangliang He, Hangjun Ye, Jiaqi Zhang, Siwei Ma, Wen Gao

机构 * Xiaomi EV, Beijing(小米电动车,北京)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出L2D2-GS框架,将可泛化重建转化为迭代优化与致密化过程,通过自监督致密化策略和几何正则化机制,实现动态城市场景的高保真重建,在PandaSet和Waymo数据集上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV 57%

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29278 2026-06-30 cs.AI cs.CL 57%

The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling

复杂性天花板基准:深度缩放下顺序推理的多领域评估

Shubh Chapra, Dhruv Kumar, Murari Mandal, Yash Sinha

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出复杂性天花板基准(CCB),通过控制任务语义内容、仅改变推理深度N,评估语言模型在三个结构不同领域中的顺序推理衰减,发现几何级数衰减和领域天花板差异,并引入跟踪级指标TFBC。

Comments 12 pages, 6 figures. Accepted to the 1st Workshop on Combining Theory and Benchmarks (CTB), CTB@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28769 2026-06-30 cs.LG 57%

Generative Learning as a Tool to Improve Perception of Emotional Body Motion Expressions

生成式学习作为改善情感身体动作表达感知的工具

Huakun Liu, Miao Cheng, Xin Wei, Felix Dollack, Victor Schneider, Hideaki Uchiyama, Chia-huei Tseng, Yoshifumi Kitamura, Monica Perusquia-Hernandez

机构 * Nara Institute of Science and Technology(奈良科学技術研究所) Tohoku University(东北大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 研究使用基于Transformer的生成模型从文化特定的动作捕捉数据中隐式学习情感身体动作,无需显式情感-动作指导,并通过机器和人类评估验证其有效性,同时展示了在情感识别增强、模式提取和情感强度过渡合成中的实用价值。

Comments Accepted by ACII 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21526 2026-06-30 cs.CV 57%

VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection

VIGIL:基于部分的结构化推理用于通用深度伪造检测

Xinghan Li, Junhao Xu, Jingjing Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 VIGIL通过计划-检验流程,结合部分级证据和结构化推理,提升深度伪造检测的可解释性和泛化能力。

Comments Project Page: https://vigil.best

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00940 2026-06-30 cs.CV 57%

Learning to Segment Liquids in Real-world Images

在现实图像中学习液体分割

Jonas Li, Michelle Li, Luke Liu, Xiaohui Yuan, Heng Fan

机构 * University of North Texas(北德克萨斯大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出LQDM模型,通过跨注意力机制提升液体分割效果,构建LQDS数据集,实验证明在液体分割任务中优于现有方法,推动相关研究与机器人应用。

Comments 6 figures, 7 pages, IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10342 2026-06-30 cs.CV 57%

CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

CoSPlan: 通过场景图增量更新实现纠正式序列规划

Shresth Grover, Priyank Pathak, Akash Kumar, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学(UCF)人工智能研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 CoSPlan基准测试要求视觉语言模型在初始场景到目标场景间规划视觉动作序列,通过引入错误动作检测与纠正机制,评估模型在复杂视觉任务中的能力。

Comments The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21545 2026-06-30 cs.CV 57%

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除

Sanghyun Jo, Donghwan Lee, Eunji Jung, Seong Je Oh, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20606 2026-06-30 cs.CV 57%

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

探查并利用视频扩散变换器特征以实现稳健的点跟踪

Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Google DeepMind(谷歌DeepMind)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文探讨了视频扩散变换器在点跟踪中的优势,提出DiTracker框架,通过整合视频DiT特征提升跟踪鲁棒性,实验证明其在挑战性场景下表现优异。

Comments Project Page: https://cvlab-kaist.github.io/DiTracker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21256 2026-06-30 cs.CV 57%

LaGen: Towards Autoregressive LiDAR Scene Generation

LaGen:迈向自主驾驶的自回归激光雷达场景生成

Sizhuo Zhou, Xiaosong Jia, Fanrui Zhang, Junjie Li, Juyong Zhang, Yukang Feng, Jianwen Sun, Songbur Wong, Junqi You, Junchi Yan

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出LaGen,首个支持长时交互生成的自回归框架,能基于单帧输入生成高保真4D激光雷达场景,并通过场景解耦和噪声调节模块提升生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02393 2026-06-30 cs.CV cs.GR 57%

PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection

PLOT:通过物体跟踪进行伪标签的单目3D目标检测

Seokyeong Lee, Sithu Aung, Junyong Choi, Seungryong Kim, Ig-Jae Kim, Junghyun Cho

机构 * Korea Institute of Science and Technology (KIST)(韩国科学技术研究院) KAIST AI(韩国科学技术院人工智能系) VRG, FEE, Czech Technical University in Prague(布拉格捷克理工大学电气工程学院视觉识别组) Samsung Research(三星研究院) AI-Robotics, KIST School, University of Science and Technology (UST)(科学技术联合大学院KIST学院人工智能机器人系) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学延世-KIST融合研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 PLOT通过物体跟踪生成单目视频中的3D标注,无需辅助传感器或模型重训练,实现了在自动驾驶、机器人和监控等领域的可靠3D目标检测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08319 2026-06-30 eess.SY cs.RO cs.SY 57%

Differentiable Physics-Informed Adaptive Koopman Control for Stable Flight under Unknown Disturbances

可微物理信息自适应柯普曼控制:在未知干扰下稳定飞行

Ao Jin, Qiujin Liang, Tao Zhang, Panfeng Huang, Fan Zhang

机构 * Research Center for Intelligent Robotics, School of Astronautics, Northwestern Polytechnical University(西北工业大学航天学院智能机器人研究中心) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出DEKC框架,结合物理模型与深度神经网络,通过学习干扰的动态演化来预测并补偿未来干扰,提升机器人在未知干扰下的控制精度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27944 2026-06-29 cs.MM cs.AI cs.CR 新提交 57%

It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents

它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用

Yiming Sun, Chen Chen, Zifan Zhou, Mi Zhang

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27883 2026-06-29 cs.RO 新提交 57%

Swarm sign language: motion-based communication between drones

群体手语:基于运动的无人机间通信

Thomas Rey, Julien Moras, Alexandre Eudes, Antoine Manzanera

机构 * DTIS, ONERA, Université Paris-Saclay(法国国家航空航天研究机构ONERA,巴黎-萨克雷大学) U2IS, ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院,ENSTA)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对隐身约束下的群体机器人,提出利用模块化平面轨迹作为视觉信号进行运动通信,设计3DTrajDecoder解码器实现轨迹分类与分割,并通过在线程序生成管道训练,经真实测试与仿真验证系统有效性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 57%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06205 2026-06-29 cs.RO 版本更新 57%

KISS-IMU: Self-supervised Inertial Odometry with Motion-balanced Learning and Uncertainty-aware Inference

KISS-IMU:基于运动平衡学习与不确定性感知推理的自监督惯性里程计

Jiwon Choi, Hogyun Kim, Geonmo Yang, Juhui Lee, Younggun Cho

机构 * Electrical and Computer Engineering, Inha University(信息电子工程学院,印斯大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出KISS-IMU自监督框架,通过运动平衡训练和不确定性加权推理消除对真值依赖,仅用LiDAR作为轻量监督信号,实现鲁棒惯性里程计。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10764 2026-06-29 cs.CV 版本更新 57%

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

SurgXBench: 可解释的视觉-语言模型手术基准

Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) Intel Labs(英特尔实验室) Duke University(杜克大学) University of Miami(迈阿密大学) University of California, Merced(加州大学默塞德分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27375 2026-06-26 cs.RO 新提交 57%

Scalable Behavior Cloning with Open Data, Training, and Evaluation

基于开放数据、训练和评估的可扩展行为克隆

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出ABC开源行为克隆栈,包含最大遥操作数据集ABC-130K(3500小时/13万片段/195任务),并开源硬件、训练和仿真流程,通过协同训练实现仿真与真实评估关联,验证DiT和VLA模型设计,成功执行折纸盒、取信用卡等灵巧任务。

Comments 30 pages. Project page: https://abc.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26829 2026-06-26 cs.CV 新提交 57%

Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction

识别未知:面向机器人-物体交互的无提示开放词汇异常识别

Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter

机构 * University of Hamburg(汉堡大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 提出AnomNOVIC框架,结合掩码自编码器与无提示开放词汇分类器,实现机器人对未知物体的实时识别,在多个数据集上显著超越现有基线。

Comments International Conference on Artificial Neural Networks 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19274 2026-06-26 cs.RO 版本更新 57%

GO: The Great Outdoors Multimodal Dataset

GO: 大户外多模态数据集

Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli

机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。

Comments 7 pages, 7 figures, accepted at IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 57%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25782 2026-06-25 cs.CL cs.AI 新提交 57%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25430 2026-06-25 cs.CV 新提交 57%

PRISM: Feed-Forward Single-Image 3D Reconstruction via Geometric Warp-Residual Modeling

PRISM: 基于几何扭曲残差建模的前馈式单图像三维重建

Zhijie Zheng, Xinhao Xiang, Jiawei Zhang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出PRISM前馈框架,将多视角潜在预测分解为无参数几何先验和可学习残差校正,无需扩散采样,推理时间仅36秒/场景,重建质量与扩散方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25427 2026-06-25 cs.CV 新提交 57%

Gastroendoscopy View Synthesis: A New Real Dataset and Evaluation

胃内镜视图合成:一个新的真实数据集与评估

Masaki Minai, Yusuke Monno, Masatoshi Okutomi, Sho Suzuki

机构 * Department of Systems and Control Engineering, School of Engineering, Institute of Science Tokyo(东京科学大学工学院系统与控制工程系) Department of Gastroenterology, International University of Health and Welfare Ichikawa Hospital(国际医疗福祉大学市川医院消化内科)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 为解决胃内镜新视角合成数据集不足的问题,提出首个真实胃镜数据集GastroNVS,并评估多种3DGS方法,为未来发展指明挑战。

Comments Accepted for EMBC 2026. Project page: http://www.ok.sc.e.titech.ac.jp/res/GastroNVS/GastroGS/

详情

展开后加载摘要…

URL PDF HTML 收藏