arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8673 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8673 篇

2510.04714 2026-03-20 cs.CV 57%

Object-Centric Representation Learning for Enhanced 3D Semantic Scene Graph Prediction

面向增强三维语义场景图预测的对象感知表示学习

KunHo Heo, GiHyun Kim, SuYeon Kim, MyeongAh Cho

机构 * Kyung Hee University(庆熙大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出一种高判别性的对象特征编码器和对比预训练策略,提升三维语义场景图预测的准确性和关系预测能力,实验表明在3DSSG数据集上优于现有方法。

Comments Accepted by NeurIPS 2025. Code: https://github.com/VisualScienceLab-KHU/OCRL-3DSSG-Codes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09565 2026-03-19 cs.RO 57%

ReTac-ACT: A State-Gated Vision-Tactile Fusion Transformer for Precision Assembly

ReTac-ACT:一种基于状态门控的视觉-触觉融合Transformer用于精密装配

Minchi Ruan, LiangQing Zhou, Hongtong Li, Zongtao Wang, ZhaoMing Lu, Jianwei Zhang, Bin Fang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出ReTac-ACT,通过双向交叉注意力、体感条件门控网络和触觉重建目标,解决视觉反馈失效下的精密装配问题,实现90%的成功率,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16626 2026-03-18 cs.RO cs.MA 57%

Routing and Control for Marine Oil-Spill Cleanup with a Boom-Towing Vessel Fleet

用于海洋油污清理的拖曳浮标船队路由与控制

Snir Carmeli, Adir Morgan, Kiril Solovey

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种多机器人框架,用于协调多个自主水面车辆对多处油污进行 containment 和清理,通过混合整数线性规划和 warm-start 策略实现近最优路由计划,设计了拖曳浮标船队的反馈线性化控制器和 PID 控制器,模拟结果验证了路径跟踪的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16536 2026-03-18 cs.RO 57%

Kamino: GPU-based Massively Parallel Simulation of Multi-Body Systems with Challenging Topologies

Kamino:基于GPU的多体系统大规模并行模拟器,适用于具有挑战性的拓扑结构

Vassilios Tsounis, Guirec Maloisel, Christian Schumacher, Ruben Grandia, Agon Serifi, David Müller, Chris Amevor, Tobias Widmer, Moritz Bächer

机构 * Disney Research, Zurich, Switzerland(迪士尼研究所以苏黎世,瑞士) NVIDIA, Zurich, Switzerland(NVIDIA,苏黎世,瑞士)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 Kamino通过GPU实现异构高耦合机械系统的并行模拟,支持复杂机械系统中的闭环拓扑结构,利用先进约束优化算法提升仿真精度,实现高效并行模拟与强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16207 2026-03-18 cs.AI 57%

Proactive Rejection and Grounded Execution: A Dual-Stage Intent Analysis Paradigm for Safe and Efficient AIoT Smart Homes

主动拒绝与 grounded 执行:一种双阶段意图分析范式用于安全高效的 AIoT 智能家居

Xinxin Jin, Zhengwei Ni, Zhengguo Sheng, Victor C. M. Leung

机构 * School of Information and Electronic Engineering (Sussex Artificial Intelligence Institute), Zhejiang Gongshang University(信息与电子工程学院(Sussex人工智能研究院),浙江工商大学) Sussex Artificial Intelligent Institute, Zhejiang Gongshang University(Sussex人工智能研究院,浙江工商大学) Department of Engineering and Design, University of Sussex(工程与设计系, Sussex大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学) Department of Electrical and Computer Engineering, The University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出双阶段意图感知框架,通过语义防火墙和确定性验证器,解决LLM在IoT中的可靠性与交互效率问题,提升家居任务执行精度与用户干扰最小化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09551 2026-03-18 cs.CV 57%

Label-supervised surgical instrument segmentation using temporal equivariance and semantic continuity

基于时间等变性和语义连续性的标注监督手术器械分割

Qiyuan Wang, Yanzhe Liu, Shang Zhao, Rong Liu, S. Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生物医学工程学院,生命科学与医学系) Center for Medical Imaging, Robotics, Analytic Computing & Learning(MIRACLE), Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州先进研究院医学影像中心、机器人与分析计算与学习中心) Key Laboratory of Precision and Intelligent Chemistry, University of Science and Technology of China(中国科学技术大学精密与智能化学重点实验室) Key Lab of Intelligent Information Processing of Chinese Academy of Sciences(CAS), Institute of Computing Technology, CAS(中国科学院智能信息处理重点实验室,计算技术研究所) Faculty of Hepato-Biliary-Pancreatic Surgery, The First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院肝胆胰外科系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出一种两阶段弱监督分割方法,通过时间等变性和语义连续性提升手术视频中器械分割的准确性,实验验证了其在两个手术数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15714 2026-03-18 cs.CR cs.AI 57%

How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition

AI代理对间接提示注入攻击的易受攻击性有多大?来自大规模公开竞赛的见解

Mateusz Dziemian, Maxwell Lin, Xiaohan Fu, Micha Nowak, Nick Winter, Eliot Jones, Andy Zou, Lama Ahmad, Kamalika Chaudhuri, Sahana Chennabasappa, Xander Davies, Lauren Deason, Benjamin L. Edelman, Tanner Emek, Ivan Evtimov, Jim Gust, Maia Hamin, Kat He, Klaudia Krawiecka, Riccardo Patana, Neil Perry, Troy Peterson, Xiangyu Qi, Javier Rando, Zifan Wang, Zihan Wang, Spencer Whitman, Eric Winsor, Arman Zharmagambetov, Matt Fredrikson, Zico Kolter

机构 * Gray Swan AI OpenAI Meta Anthropic US CAISI(美国CAISI) UK AISI(英国AISI) Carnegie Mellon University(卡内基梅隆大学) Center for AI Safety(人工智能安全中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文通过大规模公开竞赛评估了AI代理在工具调用、编程和计算机使用中的双重目标,发现所有模型均易受间接提示注入攻击,攻击成功率从0.5%到8.5%不等,并揭示了指令遵循架构的根本性弱点。

Comments 38 pages, 16 figures. Newer version to cover Q1 competition results on latest models in progress. Code at https://github.com/grayswansecurity/ipi_arena_os Partial Dataset at https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13883 2026-03-18 cs.LG cs.CY cs.SE 57%

Leveraging Imperfect Sources to Detect Fairwashing in Black-Box Auditing

利用不完美源检测黑盒审计中的公平洗白

Jade Garcia Bourrée, Erwan Le Merrer, Gilles Tredan, Benoît Rottembourg

机构 * Inria, University of Rennes, Rennes, France(法国国家信息与自动化技术研究院,雷恩大学,雷恩) Inria, Paris, France(法国国家信息与自动化技术研究院,巴黎) LAAS, CNRS, Toulouse, France(法国国家科学研究中心拉正确斯实验室,图卢兹)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出Two-Source Audit Model,通过交叉验证独立可信流与审计API,解决单一源审计无法检测公平洗白的问题,实现高检测力和可靠预算条件。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15583 2026-03-17 cs.CV 57%

Grounding World Simulation Models in a Real-World Metropolis

将世界模拟模型扎根于现实世界中的城市

Junyoung Seo, Hyunwook Choi, Minkyung Kwon, Jinhyeok Choi, Siyoon Jin, Gayoung Lee, Junho Kim, JoungBin Lee, Geonmo Gu, Dongyoon Han, Sangdoo Yun, Seungryong Kim, Jin-Hwa Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(成均馆大学人工智能研究所)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出Seoul World Model,通过检索增强的条件生成真实城市场景,解决时间错位和轨迹多样性问题,生成高保真、时序一致的长时景视频。

Comments project page: https://seoul-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15445 2026-03-17 cs.RO 57%

Zero-Shot Generalization from Motion Demonstrations to New Tasks

从运动示范到新任务的零样本泛化

Kilian Freitag, Alvin Combrink, Nadia Figueroa

机构 * Department of Electrical Engineering, Chalmers University of Technology(楚基默斯技术大学电气工程系) GRASP Lab, University of Pennsylvania(宾夕法尼亚大学GRASP实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出通过共享工作空间整合孤立示范,实现对新任务的泛化,引入Gaussian Graph框架,结合连续控制与离散图搜索,提出Stitching和Chaining两种方法,在仿真和真实机器人实验中展现良好泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15397 2026-03-17 cs.CR cs.AI 57%

SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration

SFCoT:通过主动安全评估和校准实现更安全的推理链

Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si, Guangquan Xu, Bin Wu

机构 * Department College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) NSFOCUS Technologies Group Co., Ltd.(NSFOCUS技术集团有限公司) College of Management and Economics(管理与经济学院) School of Cyber Security(网络安全学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出SFCoT框架,通过实时评估和校准潜在不安全的推理步骤,有效降低对抗攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15019 2026-03-17 cs.CV 57%

Reference-Free Omnidirectional Stereo Matching via Multi-View Consistency Maximization

无参考全景立体匹配 via 多视角一致性最大化

Lehuai Xu, Weiming Zhang, Yang Li, Sidan Du, Lin Wang

机构 * Nanjing University, Nanjing, China(南京大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出FreeOmniMVS框架,通过多视角一致性最大化实现无参考全景立体匹配,解决传统方法在几何关系和全局依赖性方面的不足,提升遮挡和基线变化下的鲁棒性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09783 2026-03-17 cs.RO cs.SY eess.SY 57%

Lightweight 3D LiDAR-Based UAV Tracking: An Adaptive Extended Kalman Filtering Approach

轻量级基于3D激光雷达的无人机跟踪:一种自适应扩展卡尔曼滤波方法

Nivand Khosravi, Meysam Basiri, Rodrigo Ventura

机构 * Institute for Systems and Robotics(系统与机器人研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种轻量级基于3D激光雷达的无人机跟踪系统,采用自适应扩展卡尔曼滤波框架,解决稀疏、噪声和非均匀点云数据的跟踪问题,适用于小无人机的严格载荷约束。

Comments Presented at the 19th International Conference on Intelligent Autonomous Systems, IAS-19, Genoa, Italy, June 30 to July 4, 2025. To appear in the Springer post-proceedings of the conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03481 2026-03-17 cs.RO cs.SY eess.SY 57%

Optimization-Based Robust Permissive Synthesis for Interval MDPs

基于优化的区间马尔可夫决策过程的鲁棒宽容合成

Khang Vo Huynh, David Parker, Lu Feng

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于优化的框架,用于解决区间马尔可夫决策过程中的鲁棒宽容合成问题,通过混合整数线性规划直接编码鲁棒贝尔曼约束,提升策略的灵活性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14550 2026-03-17 cs.LG 57%

Learning to Order: Task Sequencing as In-Context Optimization

学习排序:任务序列作为上下文优化

Jan Kobiolka, Christian Frey, Arlind Kadra, Gresa Shala, Josif Grabocka

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.LG

AI总结 本文提出通过元学习方法解决任务序列排序问题,证明深度神经网络能从合成数据中学习到最优任务序列,实现少样本泛化。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 57%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14236 2026-03-17 cs.RO cs.DC 57%

AeroGen: Agentic Drone Autonomy through Single-Shot Structured Prompting & Drone SDK

AeroGen:通过单次结构提示与无人机SDK实现代理无人机自主性

Kautuk Astu, Yogesh Simmhan

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出AeroGen框架,通过结构化提示和AeroDaaS SDK实现无人机自主控制程序的可靠生成,验证了其在多种环境下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06999 2026-03-17 cs.CV 57%

TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models

TrajPred: 基于轨迹的联合嵌入预测用于视觉-语言模型中手术器械-组织交互识别

Jiajun Cheng, Xiaofan Yu, Subarna Tripathi, Sainan Liu, Shan Lin

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出TrajPred框架,通过编码器械轨迹融入时间运动线索,并基于轨迹引入预测模块生成更精确的视觉语义嵌入,提升手术器械-组织交互识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13770 2026-03-17 cs.CV 57%

PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment

PhysAlign:通过特征和3D表示对齐实现物理一致的图像到视频生成

Zhexiao Xiong, Yizhi Song, Liu He, Wei Xiong, Yu Yuan, Feng Qiao, Nathan Jacobs

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 PhysAlign通过特征和3D表示对齐,解决图像到视频生成中的物理一致性问题,提升复杂物理推理和时间稳定性,同时保持零样本视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13560 2026-03-17 eess.SP cs.LG 57%

Task-Oriented Wireless Transmission of 3D Point Clouds: Geometric Versus Semantic Robustness

面向任务的无线3D点云传输:几何鲁棒性与语义鲁棒性

Vukan Ninkovic, Tamara Sobot, Vladimir Vincan, Gorana Gojic, Dragisa Miskovic, Dejan Vukobratovic

机构 * Serbian Ministry of Science, Technological Development and Innovation(塞尔维亚科学技术发展与创新部) National Key Research & Development Program of China(中国国家重点研发计划)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 本文提出面向任务的无线3D点云传输框架,研究几何重建精度与语义鲁棒性在信道干扰下的关系,揭示任务执行无需高精度几何重建的结论。

Comments Submitted to Global 6G Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13284 2026-03-17 cs.LG stat.ML 57%

Do Diffusion Models Dream of Electric Planes? Discrete and Continuous Simulation-Based Inference for Aircraft Design

扩散模型是否梦想着电动飞机?基于模拟的推断用于飞机设计

Aurelien Ghiglino, Daniel Elenius, Anirban Roy, Ramneet Kaur, Manoj Acharya, Colin Samplawski, Brian Matejek, Susmit Jha, Juan Alonso, Adam Cobb

机构 * Computer Science Laboratory, SRI(SRI计算机科学实验室) Aerospace Design Laboratory, Stanford University(斯坦福大学航空航天设计实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本文基于模拟推断方法,生成电动垂直起降飞机的概念设计,引入两级概率模型,结合扩散模型加速设计生成并发现飞机设计中的物理规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22956 2026-03-17 cs.RO 57%

SPICE-HL3: Single-Photon, Inertial, and Stereo Camera dataset for Exploration of High-Latitude Lunar Landscapes

SPICE-HL3:单光子、惯性与立体相机数据集用于探索高纬度月球地貌

David Rodríguez-Martínez, Dave van der Meer, Junlin Song, Abishek Bera, C. J. Pérez-del-Pulgar, Miguel Angel Olivares-Mendez

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 该研究提出了一个用于模拟高纬度月球环境的数据集,包含图像、惯性测量和轮式里程数据,支持视觉导航和科学成像任务,适用于未来月球高纬度探索任务。

Comments 12 pages, 7 figures, dataset

Journal ref Scientific Data, 13, 374 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12849 2026-03-16 eess.SP cs.RO 57%

AoI-FusionNet: Age-Aware Tightly Coupled Fusion of UWB-IMU under Sparse Ranging Conditions

AoI-FusionNet:在稀疏测距条件下基于UWB-IMU的年龄感知紧密耦合融合

Tehmina Bibi, Anselm Köhler, Jan-Thomas Fischer, Falko Dressler

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出AoI-FusionNet,通过直接融合UWB测距与IMU数据实现三维轨迹估计,采用年龄信息衰减模块和自适应注意力机制提升定位精度,通过数据增强策略提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12733 2026-03-16 cs.AI 57%

On Using Machine Learning to Early Detect Catastrophic Failures in Marine Diesel Engines

利用机器学习早期检测海洋柴油机灾难性故障

Francesco Maione, Paolo Lino, Giuseppe Giannino, Guido Maione

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出一种基于随机森林的机器学习方法,通过分析传感器读数与预期值的偏差导数,提前检测柴油机灾难性故障,从而避免严重损失和危险事件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12690 2026-03-16 cs.CV 57%

CM-Bench: A Comprehensive Cross-Modal Feature Matching Benchmark Bridging Visible and Infrared Images

CM-Bench:一个综合的跨模态特征匹配基准,连接可见图像和红外图像

Liangzheng Sun, Mengfan He, Xingyu Shao, Binbin Li, Zhiqiang Yan, Chunyu Li, Ziyang Meng, Fei Xing

机构 * School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出CM-Bench,涵盖30种跨模态特征匹配算法,用于评估同源性估计、相对姿态估计和基于特征匹配的地理定位,包含自适应预处理和新的红外-卫星跨模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21251 2026-03-16 cs.CV 57%

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。

Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27475 2026-03-16 cs.CV cs.MM 57%

Referee: Reference-aware Audiovisual Deepfake Detection

审稿人:基于参考的音频视觉深度伪造检测

Hyemin Boo, Eunsang Lee, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software, Ewha Womans University(人工智能与软件系,世女子大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出Referee方法,通过建模单次示例中说话者特定特征的关联一致性,实现跨数据集和语言的音频视觉深度伪造检测,达到99.4%的AUC表现。

Comments In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17476 2026-03-16 cs.CV 57%

The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文

Yuchen Zhang, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07791 2026-03-13 cs.CV 57%

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

GTR-Bench:评估视觉-语言模型中的地理时间推理

Qinghongbing Xie, Zhaoyuan Xia, Feng Zhu, Lijun Gong, Ziyue Li, Rui Zhao, Long Zeng

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Peking University(北京大学) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。

Comments ICLR 2026, 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10538 2026-03-12 cs.CV 57%

DSFlash: Comprehensive Panoptic Scene Graph Generation in Realtime

DSFlash:实时生成全景场景图

Julian Lorenz, Vladyslav Kovganko, Elias Kohout, Mrunmai Phatak, Daniel Kienzle, Rainer Lienhart

机构 * University of Augsburg(奥格斯堡大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 DSFlash是一种低延迟、资源高效的实时全景场景图生成模型,能够以高帧率处理视频流并提供更丰富的上下文信息。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏