arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8686 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8686 篇

2603.08521 2026-07-28 cs.CV cs.RO eess.IV 版本更新 62%

OccTrack360: 4D Panoptic Occupancy Tracking from Surround-View Fisheye Cameras

OccTrack360: 从环视鱼眼相机实现4D全景占用跟踪

Yongzhi Lin, Kai Luo, Yuanfan Zheng, Hao Shi, Mengfei Duan, Yang Liu, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(极端光子学与仪器国家重点实验室,浙江大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 OccTrack360提出新的4D全景占用跟踪基准及FoSOcc框架,解决鱼眼成像中的球面投影和体素定位问题,提升占用跟踪性能。

Comments Accepted to IEEE/RSJ IROS 2026. The benchmark and source code will be made publicly available at https://github.com/YouthZest-Lin/OccTrack360

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19349 2026-07-28 cs.CV cs.AI 版本更新 62%

UP-Fuse: Uncertainty-guided LiDAR-Camera Fusion for 3D Panoptic Segmentation

UP-Fuse:基于不确定性引导的激光雷达-摄像头融合用于3D全景分割

Rohit Mohan, Florian Drews, Yakov Miron, Daniele Cattaneo, Abhinav Valada

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 UP-Fuse通过不确定性引导的融合框架,提升激光雷达与摄像头在3D全景分割中的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00967 2026-07-28 cs.CV cs.RO 版本更新 62%

Phenology-based learning framework for yield estimation and harvest forecasting of raspberry fruits

基于物候学的树莓果实产量估计与收获预测学习框架

Parham Jafary, Lesley G. Campbell, Anna Bazangeya, Michelle Pham, Sajad Saeedi, Kourosh Zareinia, Habiba Bougherara

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对树莓产量预测和收获时间估计难题,本文开展物候学研究,构建数据集,开发综合基准,建立定制深度学习模型,能提前28至33天估计产量,提供可用数据集和可扩展框架,实现92.2%检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22345 2026-07-27 cs.RO cs.AI 新提交 62%

Teachy Mini: Development and Preliminary Evaluation of a Knowledge-Based Generative Social Robot for Higher Education

Teachy Mini:用于高等教育的基于知识的生成式社交机器人的开发与初步评估

Stephan Vonschallen, Karim Kaufmann, Dominique Oberle, Friederike Eyssel, Theresa Schmiedel

机构 * Institute of Information Systems, Zurich University of Applied Sciences(苏黎世应用科学大学信息系统研究所) Center for Cognitive Interaction Technology, Bielefeld University(比勒费尔德大学认知交互技术中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究针对生成式社交机器人在高等教育辅导中的风险,基于知识的设计要求开发Teachy Mini系统,经初步评估,该系统在负责任辅导行为及个性化等方面表现更佳,虽在部分方面与对照无显著差异,但显示出基于知识的设计对学习效果有积极作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22325 2026-07-27 cs.CV cs.RO 新提交 62%

Geometric 2D Scene Graph Generation

几何二维场景图生成

Christoph Jahn, Urs Waldmann, Bastian Goldluecke

机构 * Mercedes-Benz AG(梅赛德斯-奔驰股份公司) Department of Computer and Information Science, University of Konstanz(康斯坦茨大学计算机与信息科学系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 针对消费品生产及机器人装配中部件装配关系表示问题,提出不依赖语义数据、可处理小数据集的方法。利用Faster R-CNN输出经处理生成邻接矩阵,输入基于aGCN架构的暹罗网络表征连接,在玩具模型部件数据集上验证了该方法。

Comments Accepted at the 18th International Conference on Agents and Artificial Intelligence ICAART 2026, Marbella, Spain

Journal ref Jahn, C., Waldmann, U. and Goldluecke, B. (2026). Geometric 2D Scene Graph Generation. In Proceedings of the 18th International Conference on Agents and Artificial Intelligence - ICAART 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21856 2026-07-27 cs.LG cs.AI cs.CL 新提交 62%

LeAct: Learning to Reason from Expert Actions

LeAct:从专家行动中学习推理

Ziran Yang, Chengshuai Shi, Raj Ghugare, Benjamin Eysenbach, Karthik Narasimhan, Chi Jin

机构 * Princeton University(普林斯顿大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 研究如何从专家行动中恢复思维链,提出LeAct方法,通过优化潜在变量,让学生为专家行动采样候选思维链并保留有效链。该方法在多个博弈和机器人基准测试中表现出色,使专家系统成为基础模型推理教师的新来源。

Comments 27 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21071 2026-07-24 cs.CV cs.MM cs.RO 新提交 62%

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。

Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20493 2026-07-24 cs.AI cs.LG 新提交 62%

Attention-based Experience Replay Framework for Continual Learning of Agnostic Time Series Forecasting Models

基于注意力的经验回放框架用于不可知时间序列预测模型的持续学习

Quentin Besnard, Nicolas Ragot

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 针对神经网络依赖固定数据集无法适应动态环境的问题,提出基于注意力机制引导经验回放策略的持续时间序列预测框架,能动态适应新环境保留知识,减轻遗忘,在多数据集上评估显示可提高预测性能、降低成本和数据需求。

Journal ref CAp & RFIAP, Jul 2026, Montpellier, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 62%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19865 2026-07-23 cs.AI cs.CL cs.LG 新提交 62%

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

DocOps:复杂文档操作中自主智能体的可验证基准

Jiazhen Jiang, Boxi Cao, Lingyong Yan, Yaojie Lu, Hongyu Lin, Shuaiqiang Wang, Dawei Yin, Xianpei Han, Le Sun

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02694 2026-07-23 cs.CV cs.AI 版本更新 62%

DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning

DocShield:通过证据导向的智能代理推理实现AI文档安全

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Weibin Yao, Joey Tianyi Zhou, Jianshu Li, Ying Yan

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。

Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06442 2026-07-22 cs.CV cs.RO 版本更新 62%

WHU-PCPR: A cross-platform heterogeneous point cloud dataset for place recognition in complex urban scenes

WHU-PCPR:用于复杂城市场景中地点识别的跨平台异构点云数据集

Xianghong Zou, Jianping Li, Yandi Yang, Weitong Wu, Yuan Wang, Qiegen Liu, Zhen Dong

机构 * School of Advanced Manufacturing, Nanchang University(南昌大学先进制造学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Department of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系) School of Earth Sciences and Engineering, Hohai University(河海大学地球科学与工程学院) School of Geography and Environment, Jiangxi Normal University(江西师范大学地理与环境学院) School of Information Engineering, Nanchang University(南昌大学信息工程学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Hubei Luojia Laboratory(湖北省珞珈实验室)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 针对现有PCPR数据集在场景、平台和传感器方面缺乏多样性的问题,建立跨平台异构点云数据集WHU-PCPR,其具备独特特征。基于此对几种PCPR方法评估分析,讨论关键挑战与未来方向,推动相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18230 2026-07-21 cs.CV cs.AI 新提交 62%

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化

Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究现代视觉语言模型中像素级图像篡改检测的域泛化,提出基于平衡小批量采样和后期注入策略的简单训练框架,大幅提升平均gIoU和cIoU,增强了篡改定位和分布外鲁棒性。

Comments Our code is available at https://github.com/VILA-Lab/PIXAR-DG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 62%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16015 2026-07-21 cs.CV cs.RO 版本更新 62%

PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects

PIXIE:用于具有装配缺陷的未见物体的零样本纹理不变6D姿态估计框架

Leon Jungemeyer, Alejandro Magaña, Gautham Mohan, Matthias Karl, Daniel Werdehausen

机构 * Carl Zeiss AG(卡尔蔡司股份公司) Carl Zeiss Digital Innovation(卡尔蔡司数字创新公司)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 PIXIE是用于有装配缺陷的未见物体的零样本纹理不变6D姿态估计框架,仅用无纹理3D模型从RGB图像估计姿态,通过合成深度和法线图匹配关键点,基于PnP估计姿态,对光照和纹理变化鲁棒,在基准测试中取得好结果并引入新数据集。

Comments This work has been accepted for publication in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10879 2026-07-21 cs.RO cs.CV 版本更新 62%

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments

3D场景图预测:从部分观测环境生成层次模型

Siyi Hu, Jared Strader, Hyungtae Lim, Luca Carlone

机构 * Laboratory for Information & Decision Systems (LIDS), Massachusetts Institute of Technology(信息与决策系统实验室(LIDS),麻省理工学院) Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人部分观测环境的场景预测问题,提出自上而下框架合成含房间层和物体层的3D场景图,用混合域图扩散模型等方法,相比其他方法对分布外部分平面图泛化性更好,能在真实场景预测。

Comments Accepted at IROS 2026. Main paper: 8 pages, 3 figures, 3 tables. Includes a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15935 2026-07-20 cs.RO cs.LG 新提交 62%

Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark

基于强化学习的到达-回避任务学习:矢量化仿真与基准测试

Jonas Weihing, Shahram Eivazi

机构 * Tübingen university(图宾根大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究深度强化学习在机器人手臂到达-回避任务中的应用,利用MuJoCo MJX物理引擎和Brax库构建基准,展示多种任务设置,取得最优结果,发现此前深度强化学习在现实场景中性能不佳,强调解决该任务仍需更多研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15620 2026-07-20 cs.RO cs.AI 新提交 62%

AEGIS: Assay-Aware Protocol Validation and Runtime Monitoring for Open-Source Liquid Handling Robots

AEGIS:用于开源液体处理机器人的检测感知协议验证和运行时监测

Priyanka V. Setty, Arvind Ramanathan, Ian Foster, Rick Stevens

机构 * Data Science and Learning Division, Argonne National Laboratory(阿贡国家实验室数据科学与学习部) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI

AI总结 研究开源液体处理机器人运行问题,提出AEGIS两层防护系统。一层结合检测规则库与大语言模型验证协议,二层用主成分分析模型监测运行轨迹,经实验验证有效,统一了检测感知验证与视觉监测,且开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15163 2026-07-17 cs.RO cs.AI 新提交 62%

Scaling Behavior Foundation Model for Humanoid Robots

人形机器人的缩放行为基础模型

Weishuai Zeng, Kangning Yin, Xiaojie Niu, Shunlin Lu, Weixiang Zhong, Jiahe Chen, Feiyu Jia, Xiao Chen, Zirui Wang, Furui Xu, Ming Zhou, Kailin Li, Weinan Zhang, He Wang, Li Yi, Dahua Lin, Jiangmiao Pang, Jingbo Wang

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 研究人形机器人行为基础模型的缩放问题,通过协调运动跟踪学习范式、策略展开数量与参考运动多样性的协同、人形Transformer模型架构这三个核心组件,显著提升控制保真度和任务泛化能力,降低测试集误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15058 2026-07-17 cs.CV cs.RO 新提交 62%

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA:扩大用于CAD到图像对齐的特征学习

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,卢森堡大学跨学科安全、可靠性与信任中心(SnT)) Faculty of Science, Technology, and Medicine, University of Luxembourg(卢森堡大学科学、技术与医学学院) I3A, Universidad de Zaragoza(萨拉戈萨大学I3A)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在解决CAD到图像对齐问题,提出弱监督框架SUFLECA。通过归一化物体坐标监督扩大特征学习,结合几何一致匹配算法,能准确快速对齐,在ScanNet25k上取得优异成绩,优于零样本基线并超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14728 2026-07-17 cs.CV cs.RO 新提交 62%

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

VQ-Touch:一种跨传感器和场景的数据高效触觉生成框架

Kailin Lyu, Long Xiao, Jianing Zeng, Di Wu, Lin Shu, Jie Hao

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在解决现有触觉生成方法依赖特定传感器数据集且泛化能力不足的问题。提出VQ-Touch框架,含DM-VQGAN提取特征及离散扩散解码器支持多模态生成,经少样本混合训练增强泛化能力,实验显示其在多任务中超越现有方法。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14439 2026-07-17 cs.LG cs.RO 新提交 62%

Active Real-World Factor-Based Evaluation for Generalist Robot Policies

基于因子的通用机器人策略的主动真实世界评估

Andrew Liao, Hanchen Cui, Karthik Desingh, Aryan Deshwal

机构 * University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 研究通用机器人策略评估难题,提出主动评估框架,将策略评估当作顺序实验设计问题,通过拟合概率替代模型、自适应选评估配置,高效表征策略行为并识别易失败区域,相比随机测试节省大量试验次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08639 2026-07-17 cs.RO cs.CV 版本更新 62%

Native Video-Action Pretraining for Generalizable Robot Control

用于可泛化机器人控制的原生视频动作预训练

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22030 2026-07-17 cs.AI cs.CL cs.IR cs.LG 版本更新 62%

When Does Belief-Based Agent Memory Help? Reliability-Conditional Updating and Provenance-Capped Poisoning Defense

Nous:一种用于长期智能体记忆的预测世界模型

Pranav Singh

机构 * Indian Institute of Technology Ropar(印度理工学院罗巴尔分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出Nous记忆架构,基于知识即预测而非存储的原则,通过贝叶斯更新维护概率分布,以信息论惊喜度评分并记录信念变化,在LoCoMo基准上取得优于对比方法的F1分数。

Comments Preprint. 10 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13801 2026-07-16 cs.CR cs.AI cs.LG 新提交 62%

Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection

基于大语言模型的网络入侵检测的流量感知随机平滑

Zhenpeng Li

机构 * Guangzhou Health Science College(广州健康科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的网络入侵检测系统对流量操纵的鲁棒性,提出流量感知随机平滑方法TA-RS,通过在特定子空间注入噪声,提升认证准确率,不同数据集表现有差异,还探究了方法局限性及改进策略。

Comments 44 pages, 14 figures, 14 tables. Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13234 2026-07-16 cs.CV cs.AI 新提交 62%

Continuously Evolving Deepfake Detection: An Architecture and Public-Benchmark Evaluation of a Dynamic Detection System

持续演进的深度伪造检测:动态检测系统的架构与公开基准评估

Ken Jon Miyachi, Dylan Uys

机构 * BitMind(比特思维)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究针对深度伪造检测器在现实与学术基准表现差异的问题,提出通过Bittensor SN34训练的BitMind Forensics,在多数据集评估中表现优异,能持续演进提升检测能力,且评估工具公开可独立验证。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02317 2026-07-16 cs.LG cs.AI cs.CY 62%

Defining and Evaluating Physical Safety for Large Language Models

定义和评估大语言模型的物理安全性

Yung-Chen Tang, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无人机控制的全面基准,评估大语言模型在物理安全方面的风险与权衡,揭示了模型在安全性和实用性之间的不理想平衡。

Journal ref Communications of the ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09785 2026-07-14 cs.CV cs.AI 新提交 62%

Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models

终身表示:视觉模型持续自监督学习综述

Sergi Masip, Alicja Dobrzeniecka, Jonathan Swinnen, Joachim Collin, Bartłomiej Twardowski, Szymon Łukasik, Tinne Tuytelaars

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 综述视觉领域持续自监督学习(CSSL),分析现有评估协议问题,探讨自监督目标抗灾难性遗忘原因,基于遗忘缓解策略对方法分类,识别如可扩展性等挑战,提出推进CSSL需转向大规模持续预训练范式。

Comments This work has been accepted for publication in IEEE EAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06279 2026-07-14 cs.CV cs.RO eess.IV 版本更新 62%

Can we Trust Unreliable Voxels? Exploring 3D Semantic Occupancy Prediction under Label Noise

我们能信任不可靠的体素吗?在标签噪声下的3D语义占用预测探索

Wenxin Li, Kunyu Peng, Di Wen, Junwei Zheng, Jiale Wei, Mengfei Duan, Yuheng Zhang, Rui Fan, Kailun Yang

机构 * School of Artificial Intelligence and Robotics(人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心) Institute for Anthropomatics and Robotics(人机一体化与机器人研究所) Karlsruhe Institute of Technology(卡尔斯鲁厄技术大学) INSAIT College of Electronic and Information Engineering(电子与信息学院) Shanghai Institute of Intelligent Science and Technology(智能科学与技术上海研究院) Shanghai Research Institute for Intelligent Autonomous Systems(智能自主系统上海研究院) Shanghai Key Laboratory of Intelligent Autonomous Systems(智能自主系统上海重点实验室) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出DPR-Occ框架,通过双源部分标签推理解决3D语义占用预测中的标签噪声问题,实验表明其在高噪声环境下仍能保持性能。

Comments Accepted to IROS 2026. The benchmark and source code will be made publicly available at https://github.com/mylwx/OccNL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09503 2026-07-13 cs.CV cs.AI 新提交 62%

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

VGGT 对重叠的理解:探索共可见性的几何基础模型

Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 研究三维重建和机器人定位中共可见性问题,通过探索 VGGT 模型,发现其隐式编码共可见性及层间特性,引入 Co-VGGT 方法,该方法冻结 VGGT 并训练轻量级头,在基准测试中表现出色,提升了共可见性分类效果。

详情

展开后加载摘要…

URL PDF HTML 收藏