arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-09-01 至 2026-09-01 共收录 30 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 30 篇

2608.17027 2026-09-01 cs.RO 版本更新 87%

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

FetchMan:基于模拟经验学习人形机器人视觉 locomotion-manipulation(移动操作)策略

Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 机器人数据与评测 :manipulation(title,title_cn);robotics(abstract);分类 cs.RO

AI总结 该研究提出 FetchMan,通过端到端 sim-to-real 流水线训练人形机器人视觉移动操作策略,在 FetchMan-Bench 评估中,其单物体抓取策略在 Unitree G1 上零样本部署成功率达73.3%,并扩展至多物体训练。

Comments Project website: https://orayyan.com/fetchman

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28718 2026-09-01 cs.RO cs.AI cs.CV cs.ET cs.SY eess.SY 新提交 87%

RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction

RoboPhys-3D:通过三维重建进行全面的具身世界模型评估

Tianyi Wang, Jiazhou Chen, Yiming Xu, Xiangyu Li, Tianyi Zeng, Chih-Hsien Chou, Ning Lu, Liang Peng, Junfeng Jiao, Christian Claudel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学) Futurewei Technologies, Inc(星纪时代科技公司)

专题命中 机器人数据与评测 :world model(title,abstract);embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究推出基于RoboTwin 2.0的三维具身世界模型基准RoboPhys-3D,含50个操作任务等数据,提出两个评估分数,发现Cosmos 3的RoboPhyscore最高,该分数与人类评估一致性强。

Comments 66 pages, 12 figures, 55 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29100 2026-09-01 cs.RO 新提交 83%

Agri-Sim: Agricultural Simulation Platform for Embodied Intelligence Evaluation in Greenhouse Robotics

Agri-Sim:用于温室机器人具身智能评估的农业仿真平台

Shuhan Shi, Zhenfeng Xue, Minghao Mei, Chao Zheng, Nan Li, Zhonghua Miao

机构 * School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) Sino-European School of Technology of Shanghai University(上海大学中欧工程技术学院) School of Future Technology (Institute of Artificial Intelligence), Shanghai University(上海大学未来技术学院(人工智能研究院))

专题命中 机器人数据与评测 :robotics(title);manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 研究针对农业机器人开发所需的仿真环境需求,提出基于Unity和ROS2的Agri-Sim平台,通过实验验证其可支持导航与操纵工作流的闭环集成及可重复功能评估,为后续相关研究提供实用基础。

Comments 13 pages, 9 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28967 2026-09-01 cs.RO cs.LG 新提交 81%

Brain-Language-Action (BLA) Models: Language-Conditioned EEG for Robotics Control

脑-语言-动作(BLA)模型:用于机器人控制的语言条件化脑电图

Alexandr Plashchinsky

机构 * VECTOR Labs(VECTOR实验室)

专题命中 机器人数据与评测 :robotics(title);robotic(abstract);分类 cs.RO、cs.LG

AI总结 该研究提出脑-语言-动作(BLA)模型,通过语言条件化扩展EEG机器人控制范围,基于BCI数据集开发无人机控制BLA,经两阶段训练后在840种映射中达到90%每标记准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29516 2026-09-01 cs.RO 新提交 79%

Task-Relevant Feature-Dynamics Fidelity Enables Zero-Shot Sim-to-Real Transfer for Robotic Ultrasound Scanning

任务相关特征动力学保真度实现机器人超声扫描的零样本仿真到真实迁移

Yizhao Qian, Jiayuan Luo, Wanyi Zhu, Yameng Zhang, Max Q. -H. Meng, Yixuan Yuan, Li Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Great Bay University(大湾区大学) Dongguan Great Bay Institute for Advanced Study(东莞大湾区先进研究院) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 该研究提出任务相关特征动力学保真度(TR-FDF),开发面向TR-FDF的超声模拟器,实现仅仿真训练的机器人超声策略在体模实验中400次零样本部署成功390次,提升零样本仿真到真实迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-09-01 cs.RO cs.AI cs.CV 版本更新 75%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Shang Wu, Jiayi Wang, Jianshu Zhang, Jihai Zhao, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :robot learning(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

Comments v2:Expanded the supplementary materials by adding three sections-Scene YAML, Robot Embodiment List, and Atomic Skill List-corrected typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30804 2026-09-01 cs.LG 新提交 74%

Geometric Attractor Monitoring: A Robust and Frugal Framework for Multi-modal Industrial Robotic Cycles

几何吸引子监测:一种针对多模态工业机器人周期的鲁棒且经济的框架

Martin Bonsergent-Brachet, Jesse Read, Dany Abboud

机构 * LIX, École Polytechnique, Institut Polytechnique de Paris(巴黎综合理工学院LIX实验室,巴黎理工学院) Renault(雷诺公司)

专题命中 机器人数据与评测 :robotic(title);分类 cs.LG

AI总结 针对多模态工业机器人周期及故障数据稀缺的挑战,提出基于相空间重构的几何吸引子监测框架,用离散支持估计构建健康指标,在真实与合成数据集上性能优于深度学习基线。

Comments 17 pages, 6 figures. Accepted at ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07837 2026-09-01 cs.RO 版本更新 74%

RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI

RLinf-USER: 一个统一且可扩展的系统,用于具身人工智能中的现实世界在线策略学习

Hongzhi Zang, Shu'ang Yu, Hao Lin, Tianxing Zhou, Zefang Huang, Zhen Guo, Xin Xu, Jiakai Zhou, Yuze Sheng, Shizhe Zhang, Feng Gao, Wenhao Tang, Yufeng Yue, Quanlu Zhang, Xinlei Chen, Chao Yu, Yu Wang

专题命中 机器人数据与评测 :embodied AI(title);分类 cs.RO

AI总结 RLinf-USER是一个统一且可扩展的系统,用于现实世界中的在线策略学习,通过统一硬件抽象层和异步框架实现多机器人协调与长时训练。

Comments Accepted to RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29596 2026-09-01 cs.AI cs.LG cs.MA 新提交 73%

Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security

面向智能体技能的系统基础:架构、生命周期与安全性

Sanket Badhe, Deep Shah, Priyanka Tiwari, Nehal Kathrotia

机构 * Google LLC(谷歌有限责任公司) Purdue University(普渡大学)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文为智能体技能生态建立统一系统基础与参考架构,界定其九阶段生命周期,探讨安全威胁与防御机制,分类多领域系统实现,确立智能体技能为自主语言智能体的基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29881 2026-09-01 cs.CV 新提交 70%

OptiGeo: Efficient Monocular Geometry for Embodied Perception in Optically Challenging Scenes

OptiGeo:面向光学挑战性场景具身感知的高效单目几何方法

Muxin Liu, Tianbo Liu, Jing Xia, Xiaoyang Lyu, Xiaoshan Wu, Bo Wang, Peng Dai, Zhongrui Wang, Shaoshuai Shi, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Voyager Research, DiDi Chuxing(滴滴出行 Voyager 研究院) Southern University of Science and Technology(南方科技大学)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 OptiGeo是一种感知偏差的训练框架,利用小目标渲染集修正局部几何畸变,在透明场景基准上性能远超更大规模模型,可作为光学挑战性场景的高效感知模块。

Comments Project Page: https://mx-liu6.github.io/OptiGeo-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-09-01 cs.RO 版本更新 70%

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16862 2026-09-01 cs.CV cs.RO 版本更新 68%

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization

InLiER:通过中间混合基数结构关键点令牌化实现无学习的异构激光雷达地点识别

Nikolaos Stathoulopoulos, George Nikolakopoulos

专题命中 机器人数据与评测 :robotic(abstract);robotics(comments,journal_ref);分类 cs.RO、cs.CV

AI总结 研究针对机器人平台结合多种激光雷达致现有描述符性能下降的问题,提出无学习管道InLiER,通过混合基数令牌ID编码关键点信息,经三个检索阶段处理,在相关数据集和实验中表现出色,优于基于学习的基线。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 8 figures

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 10, pp. 11275-11282, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29601 2026-09-01 cs.RO cs.CV cs.LG 新提交 67%

$\mathcal{N}_0$-Foundation: Towards the Age of Tactile Intelligence

$\boldsymbol{\tau}_0$-基础模型:迈向触觉智能时代

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI(尼奥特人工智能)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本研究提出$\boldsymbol{\tau}_0$-基础模型,构建大规模视触觉数据集及视触觉表征模型,结合真实与模拟套件形成评估基准,助力触觉具身操控研究。

Comments 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-09-01 cs.CV cs.AI cs.RO 版本更新 67%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

Comments v2:Expanded the experiment section with more baselines and add more experiments in supplementary--corrected some typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30858 2026-09-01 cs.RO cs.CV 新提交 62%

GAFT: Geo-Anchored Fine-Tuning for Hazard Identification from Rare Failures

GAFT:用于从罕见故障中识别危险的地理锚定微调

Yanran Xu, Chuanhang Qiu, Yue Wang, Wenbo Wu, Zhaoxing Li

机构 * University of Southampton(南安普顿大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 针对越野导航罕见故障导致的危险识别难题,提出参数高效的GAFT方法,通过几何先验指导LoRA适配,在森林危险基准上显著提升了留一场景重复平均F₂

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交 62%

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28664 2026-09-01 cs.RO cs.CV cs.MM 新提交 62%

The Potential of Haptic Foundation Models

触觉基础模型的潜力

Jianquan Wang, Haiwei Dong, Abdulmotaleb El Saddik

机构 * University of Ottawa(渥太华大学) Dayan Technologies(大眼科技)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对具身AI中通用触觉感知的瓶颈,探索触觉基础模型(HFMs)的潜力,阐述其需从被动大模型转变的四个核心维度,并在TacBench上对多个触觉基准开展三类任务评估。

Comments accepted by IEEE Consumer Electronics Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07392 2026-09-01 cs.RO cs.CV 版本更新 62%

NGD-SLAM: Towards Real-Time Dynamic SLAM without GPU

NGD-SLAM:无需GPU的实时动态SLAM系统

Yuhao Zhang, Mihai Bujanca, Mikel Luján

机构 * University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) Qualcomm Technologies XR Labs, Austria(Qualcomm Technologies XR 研究所,奥地利)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出仅在CPU运行的实时动态SLAM系统,通过掩码传播机制解耦跟踪与掩码生成,结合ORB特征与光流的混合跟踪策略,在笔记本CPU上实现60 FPS跟踪帧率,保持动态环境高定位精度,代码公开。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30714 2026-09-01 cs.CV 新提交 57%

SegWave: Wavelet-Driven Segmentation of Tampered Regions

SegWave:基于小波的篡改区域分割

Siddhi Pravin Lipare, Vishesh Kumar, Akshay Agarwal

机构 * IIIT-Hyderabad(印度国际信息技术研究所海得拉巴分校) IISER-Bhopal(印度科学教育与研究研究所博帕尔分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对图像真实性验证难题,提出SegWave混合框架,结合Transformer与DWT并引入ASA模块,经多基准数据集实验,其性能优于现有最先进的篡改检测方法。

Comments Accepted at the PFATCV Workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30536 2026-09-01 cs.RO 新提交 57%

Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

Behavior-Skill:用于评估长 horizon 任务中视觉-语言-动作策略的细粒度基准

Chunyun Ma, Lun Luo, Xingjian Luo, Xiexing Feng, Hang Zhang, Wei Liu, Feng Qiao, Yaonan Wang, Huimin Lu, Xieyuanli Chen

机构 * XPeng Inc.(小鹏汽车) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本研究提出细粒度基准 Behavior-Skill,含 235492 个技能实例,引入轨迹与技能级指标,实验发现接触丰富操作技能是长 horizon VLA 策略瓶颈,可用于分析改进该类策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30451 2026-09-01 cs.CV 新提交 57%

SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

SeqAlign3DVG:用于3D视觉定位的序列对齐基准与体素推理框架

Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 针对现有3D视觉定位基准的文本-观测对齐松散、忽略时间顺序的问题,提出SeqAlign3DVG基准及含ROVM、PLVF的体素推理框架,在无深度协议下实现最优性能,提升复杂关系目标定位效果。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29475 2026-09-01 cs.CV 新提交 57%

Seeing Through Extreme Visual Sparsity: Surface Understanding from a Single Random Visual Patch

从极端视觉稀疏性中洞察:基于单个随机视觉斑块的表面理解

Sindhuja Penchala, Sudip Mittal, Noorbakhsh Amiri Golilarz

机构 * The University of Alabama(阿拉巴马大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 该研究提出SSUF框架,适配四种预训练架构,在仅保留10%可见区域的Touch-and-Go数据集上,实现极端视觉稀疏下的表面重建与材质分类,各模型表现不同且均达实时推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29396 2026-09-01 cs.RO 新提交 57%

Toward Trustworthy Robot-Assisted Sliding Palpation for Shallow Vessel Localisation with a Calibrated Digital Twin

面向基于校准数字孪生的浅血管定位的可信机器人辅助滑动触诊

Piotr Blaszyk, Wen Fan, Kaizhong Deng, Daniel Elson, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出带校准数字孪生的机器人辅助滑动触诊框架,结合时空图神经网络实现浅血管定位,在三类数据集上验证了模拟到真实的定位精度,为可信触觉触诊提供了进展。

Comments ECCV workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-09-01 cs.CV 版本更新 57%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31048 2026-09-01 eess.IV 新提交 56%

OmniRAS: Standardizing Foundation Model Training and Evaluation in Robot-Assisted Surgery

OmniRAS:标准化机器人辅助手术领域的基础模型训练与评估

Leonardo Borgioli, Neil Getty, Wenli Xiu, Jessica Cassiani, Alvaro Ducas, Carlos Agustin Orda, Hira Waris, Fangfang Xia, Rick Stevens, Pier Cristoforo Giulianotti, Milos Zefran

专题命中 机器人数据与评测 :robotic(abstract);robotics(comments)

AI总结 本文针对机器人辅助手术领域基础模型稀缺的问题,提出OmniRAS系列V-JEPA-2.1编码器,发布专属数据集并完成大规模预训练与多任务评估,取得最优适配结果。

Comments 18 pages, 11 figures, 4 tables. Under review at IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30526 2026-09-01 cs.HC 新提交 50%

User Experience in Human-Machine Interaction: Insights from Field Studies in Autonomous Mobility

人机交互中的用户体验:来自自主移动实地研究的见解

Helen Schneider, Svetlana Pavlitska, J. Marius Zöllner

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本研究针对AVs用户接受度研究的场景局限,通过144名参与者的真实交通实地研究,验证多模态传感在乘客情感推断中的实用性,提供相关研究工具,为自主系统用户中心设计奠定基础。

Comments Accepted for publication at ABAW Workshop at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19741 2026-09-01 cs.CL cs.DB 版本更新 50%

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

单次成功并非可靠:Thinkingbox——面向有状态业务工作流智能体的沙箱与基准测试集

Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

机构 * University of Pittsburgh(匹兹堡大学) Northwestern University(西北大学) University of California Irvine(加州大学欧文分校) Microsoft(微软公司)

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 研究人员推出面向有状态业务工作流智能体的沙箱Thinkingbox及基准测试集Thinkingbox-bench,发现现有智能体在该基准上可靠完成任务的表现远逊于单次成功表现,凸显了端到端任务可靠评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21457 2026-09-01 cs.CR 版本更新 50%

SoK: Systematizing Generation, Characteristics, and Defenses in LLM-Generated Phishing

SoK:揭示大语言模型生成钓鱼攻击的生成与检测差距

Fengchao Chen, Tingmin Wu, Van Nguyen, Carsten Rudolph

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文首次全面分析大语言模型生成的钓鱼内容,揭示其逃避检测、强调人类认知操控的特点,并指出防御策略与生成方法间的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09439 2026-09-01 cs.MM 版本更新 50%

Identity-Aware Vision-Language Model for Explainable Face Forgery Detection

用于可解释人脸伪造检测的身份感知视觉语言模型

Junhao Xu, Jingjing Chen, Yang Jiao, Jiacheng Zhang, Zhiyu Tan, Hao Li, Yu-Gang Jiang

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 针对人脸伪造检测的实际局限,提出轻量身份感知VLM,动态编码身份信息并结合检测适配器,在仅10个额外令牌下实现优于传统方法和通用VLM的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11764 2026-09-01 cs.MM 版本更新 50%

Identity-Driven Multimedia Forgery Detection via Reference Assistance

基于身份驱动的参考辅助多媒体伪造检测

Junhao Xu, Jingjing Chen, Xue Song, Feng Han, Haijun Shan, Yugang Jiang

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 针对现有媒体伪造数据集的局限,提出含54位名人视频的IDForge数据集,设计参考辅助多模态伪造检测网络R-MFDN,实验验证其在多媒体伪造检测任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏