arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 497 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 497 篇

2607.03069 2026-07-07 cs.CV 新提交 57%

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 57%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 57%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01766 2026-07-03 cs.AI 新提交 57%

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds: 一个用于动态3D场景创建的多智能体系统

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) University of California, Merced(加州大学默塞德分校)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。

Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 57%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01139 2026-07-02 cs.CV 新提交 57%

SD-RouteFusion: Ego-Trajectory Prediction with SD-Map Route Conditioning

SD-RouteFusion:基于SD地图路线条件的自车轨迹预测

Sviatoslav Voloshyn, Bruno K. W. Martens, Wangxin Liu, Jakob Vinkås, Junsheng Fu

机构 * Zenseact

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出SD-RouteFusion,融合前视相机、车辆动力学和SD地图导航路线进行自车轨迹预测,无需HD地图,通过双假设设计和门控分类器实现鲁棒融合,在8秒预测时ADE降低16.9%。

Comments 9 pages, 4 figures, 29th International Conference on Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00569 2026-07-02 cs.RO 新提交 57%

[Preprint] Dynamic Modeling, Gait Synthesis, and Control of a Novel Subsurface Bore Propagator

[预印本] 一种新型地下钻孔推进器的动力学建模、步态合成与控制

Lina van Brügge, Shruti Kotpalliwar, Anton Koval, Akshit Saradagi, George Nikolakopoulos

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对模块化地下机器人,提出基于蚯蚓锚定推进和隧道掘进机挖掘的动力学模型与步态合成控制策略,通过Unity仿真和实验验证了3个步态周期内30毫米的土壤推进。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交 57%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00399 2026-07-02 cs.CV 新提交 57%

DriveVer: Lightweight Trajectory Evaluator as Test-Time Verifier for Autonomous Driving

DriveVer: 自动驾驶的轻量级轨迹评估器作为测试时验证器

Chong He, Yuechen Luo, Fang Li, Shaoqing Xu, Fuxi Wen

机构 * Tsinghua University(清华大学) University of Macau(澳门大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出DriveVer,一种轻量级即插即用的测试时验证器,通过双头架构融合候选轨迹与多视图视觉特征,预测安全置信度和几何修正向量,在不增加训练成本下提升规划模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31410 2026-07-02 cs.AI 新提交 57%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27962 2026-07-02 cs.RO 新提交 57%

Building a Scalable, Reproducible, Evaluatable, and Closed-Loop Simulation Environment Foundation for Embodied Intelligence

构建可扩展、可复现、可评估、闭环的具身智能仿真环境基础:面向具身智能训练、评估和数据收集的云原生仿真基础设施

Junwu Xiong, Yongjian Guo, Mingxi Luo, Ning Qiao, Lei Kang, Song Wang, Yince Gao, Chenfeng Gu, Zhen Sun, Haoran Li, Wei Lu, Yucheng Guo, Shuai Di, Xiaodong Bai, Haoran Sun, Jing Long, Jiaxuan Gao, Hui Zhang, Peng Hao, Lu Lu

机构 * AI Infra Team at JDT(京东科技AI基础设施团队) Tsinghua University(清华大学) Peking University(北京大学) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出一种云原生仿真基础设施框架,通过弹性资源调度、容器化仿真等技术,实现大规模、标准化、可复现的具身智能训练、评估与数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31639 2026-07-01 cs.CR cs.AI cs.GT cs.LO 新提交 57%

A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems

大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题

Seyed Bagher Hashemi Natanzi, Bo Tang

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27944 2026-06-29 cs.MM cs.AI cs.CR 新提交 57%

It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents

它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用

Yiming Sun, Chen Chen, Zifan Zhou, Mi Zhang

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27883 2026-06-29 cs.RO 新提交 57%

Swarm sign language: motion-based communication between drones

群体手语:基于运动的无人机间通信

Thomas Rey, Julien Moras, Alexandre Eudes, Antoine Manzanera

机构 * DTIS, ONERA, Université Paris-Saclay(法国国家航空航天研究机构ONERA,巴黎-萨克雷大学) U2IS, ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院,ENSTA)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对隐身约束下的群体机器人,提出利用模块化平面轨迹作为视觉信号进行运动通信,设计3DTrajDecoder解码器实现轨迹分类与分割,并通过在线程序生成管道训练,经真实测试与仿真验证系统有效性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 57%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27375 2026-06-26 cs.RO 新提交 57%

Scalable Behavior Cloning with Open Data, Training, and Evaluation

基于开放数据、训练和评估的可扩展行为克隆

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出ABC开源行为克隆栈,包含最大遥操作数据集ABC-130K(3500小时/13万片段/195任务),并开源硬件、训练和仿真流程,通过协同训练实现仿真与真实评估关联,验证DiT和VLA模型设计,成功执行折纸盒、取信用卡等灵巧任务。

Comments 30 pages. Project page: https://abc.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26829 2026-06-26 cs.CV 新提交 57%

Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction

识别未知:面向机器人-物体交互的无提示开放词汇异常识别

Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter

机构 * University of Hamburg(汉堡大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 提出AnomNOVIC框架,结合掩码自编码器与无提示开放词汇分类器,实现机器人对未知物体的实时识别,在多个数据集上显著超越现有基线。

Comments International Conference on Artificial Neural Networks 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 57%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25782 2026-06-25 cs.CL cs.AI 新提交 57%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25430 2026-06-25 cs.CV 新提交 57%

PRISM: Feed-Forward Single-Image 3D Reconstruction via Geometric Warp-Residual Modeling

PRISM: 基于几何扭曲残差建模的前馈式单图像三维重建

Zhijie Zheng, Xinhao Xiang, Jiawei Zhang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出PRISM前馈框架,将多视角潜在预测分解为无参数几何先验和可学习残差校正,无需扩散采样,推理时间仅36秒/场景,重建质量与扩散方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25427 2026-06-25 cs.CV 新提交 57%

Gastroendoscopy View Synthesis: A New Real Dataset and Evaluation

胃内镜视图合成:一个新的真实数据集与评估

Masaki Minai, Yusuke Monno, Masatoshi Okutomi, Sho Suzuki

机构 * Department of Systems and Control Engineering, School of Engineering, Institute of Science Tokyo(东京科学大学工学院系统与控制工程系) Department of Gastroenterology, International University of Health and Welfare Ichikawa Hospital(国际医疗福祉大学市川医院消化内科)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 为解决胃内镜新视角合成数据集不足的问题,提出首个真实胃镜数据集GastroNVS,并评估多种3DGS方法,为未来发展指明挑战。

Comments Accepted for EMBC 2026. Project page: http://www.ok.sc.e.titech.ac.jp/res/GastroNVS/GastroGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24191 2026-06-24 cs.RO 新提交 57%

The Evaluation Cost of Task Specialization in Evolutionary Multi-Robot Systems

进化多机器人系统中任务专业化的评估成本

Paolo Leopardi, Heiko Hamann, Jonas Kuckling, Tanja Katharina Kaiser

机构 * University of Konstanz(康斯坦茨大学) Centre for the Advanced Study of Collective Behaviour(集体行为高级研究中心) Department of Computer and Information Science(计算机与信息科学系) University of Technology Nuremberg(纽伦堡工业大学) Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 研究在进化多机器人系统中,任务专业化与通用行为相比所需的评估预算成本,发现随着系统规模增大,更少的预算即可使专业化表现优于通用化。

Comments Accepted for publication at GECCO '26 Companion: Proceedings of the Genetic and Evolutionary Computation Conference Companion. Supplementary video: https://youtu.be/U5LNICts7Ek

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24124 2026-06-24 cs.AI 新提交 57%

VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹

Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale, Sriram Vishwanath

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。

Comments Accepted at LM4Plan Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22597 2026-06-24 cs.CV 新提交 57%

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

MapReason-OSM:视觉语言模型能否从街道地图中做出可图验证的移动决策?

Srinivas Venkatanarayanan, Clement Pakkam Isaac

机构 * NVIDIA(英伟达) University of Central Florida(中佛罗里达大学) University of South Florida(南佛罗里达大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出MapReason-OSM基准,通过自渲染OpenStreetMap面板和隐藏街道图,评估VLM在路由、设施定位等任务中做出可图验证的移动决策的能力,发现模型在图形成本推理和跨缩放一致性上表现不佳。

Comments 9 pages, 7 figures. Submitted to ACM SIGSPATIAL 2026 (Industrial Track). Code and data: https://github.com/Vi-Sri/mapreason-osm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23634 2026-06-23 cs.CV 新提交 57%

Pose Anything Anywhere:Model-free Object Poses from Arbitrary References

Pose Anything Anywhere: 任意参考图像下的无模型物体姿态估计

Hongli Xu, Jiaqi Hu, Junwen Huang, Boyang Zhong, Peter KT Yu, Nassir Navab, Benjamin Busam, Slobodan Ilic

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Siemens AG(西门子股份公司) XYZ Robotics ROBOX

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出PANY,一种统一的无模型框架,通过多视图变换器学习视图一致几何和跨视图对齐,支持单/稀疏参考视图和RGB-D输入,在YCB-V和LM-O上分别提升姿态精度12%和20%以上。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22918 2026-06-23 cs.CV cs.GT 新提交 57%

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

各有所尺:发现用于物理视频评估的每VLM分类体系

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Darwin Research Center(华为达尔文研究中心) Imperial College London(伦敦帝国理工学院)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22813 2026-06-23 cs.AI 新提交 57%

Active Inference as the Test-Time Scaling Law for Physical AI Agents

主动推理作为物理AI代理的测试时缩放定律

Omar Hashash, Christo Kurisummoottil Thomas, Walid Saad, Merouane Debbah, Karl Friston, Adeel Razi

机构 * Bradley Department of Electrical and Computer Engineering(布拉德利电气与计算机工程系) Institute for Advanced Computing(先进计算研究所) Virginia Tech(弗吉尼亚理工大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Worcester Polytechnic Institute(沃思堡理工学院) Khalifa University of Science and Technology(卡利法科学与技术大学) CentraleSupelec(中央超导研究所) University Paris Saclay(巴黎萨克雷大学) Queen Square Institute of Neurology(伦敦大学学院神经科学研究所) School of Psychological Sciences(心理学系) Monash University(莫纳什大学) CIFAR Global Scholars Program(CIFAR全球学者计划) Queen Square Institute of Neurology, University College London(伦敦大学学院神经科学研究所)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 提出基于主动推理第一性原理的测试时缩放定律,使物理AI代理通过世界模型推理在非平稳环境中泛化,并利用变分推理更新策略,在自动驾驶任务中提升36%以上推理效率。

Comments 53 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21438 2026-06-23 cs.RO 新提交 57%

Temporal logics and formal synthesis for robot planning and control

机器人规划与控制的时间逻辑与形式化综合

Jana Tumova, Joris Verhagen, Matti Vahs

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文介绍线性时间逻辑和信号时间逻辑作为机器人行为的规范语言,并讨论从离散图/游戏到采样运动规划、轨迹优化和控制证书的形式化综合方法,最后指出实际部署中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21108 2026-06-23 cs.CV 新提交 57%

SARIF: Segment Anything for Robust Image Forensics

SARIF: 用于鲁棒图像鉴别的 Segment Anything

Dong-Hyun Moon, Ju-Hyeon Nam, Sang-Chul Lee

机构 * Department of Electrical and Computer Engineering, Inha University(仁荷大学电气与计算机工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出SARIF框架,利用Segment Anything Model的提示架构和泛化能力,通过反馈引导掩码解码器和双编码器设计提取伪造痕迹,实现自动伪造定位,在跨数据集和图像退化下表现鲁棒。

Comments Accepted to ECCV 2026. Equal contribution: Dong-Hyun Moon and Ju-Hyeon Nam. Corresponding author: Sang-Chul Lee. Code: https://github.com/Inha-CVAI/SARIF_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21082 2026-06-23 cs.CL cs.AI cs.CR 新提交 57%

Scalable Hierarchical Attention Transformers for Multi-Turn Jailbreak Detection in Long Conversations

可扩展的层次注意力Transformer用于长对话中的多轮越狱检测

Chenhui Hu, Muhammed Salih, Sudipto Guha, Subramanian Srinivasan

机构 * Zscaler, Inc.(Zscaler公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出一种层次化检测器,通过紧凑的轮次表示和轻量级对话模块捕捉跨轮推理,在14,038条对话上F1达0.9394,超越Claude Opus 4.7,误报率减半。

详情

展开后加载摘要…

URL PDF HTML 收藏