arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 497 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 497 篇

2606.21270 2026-06-23 physics.optics cs.CV 新提交 57%

Non-line-of-sight imaging with arbitrary relay surface geometries via 3D Gaussian Transient Rendering

基于3D高斯瞬态渲染的任意中继曲面几何非视距成像

Yi Wang, Ziyu Zhan, Yuran Wang, Hao Wang, Qiang Liu, Zuoqiang Shi, Lingyun Qiu, Xing Fu

机构 * Department of Precise Instrument, Tsinghua University(清华大学精密仪器系) Department of Electrical Engineering, City University of Hong Kong(香港城市大学电子工程系) Yau Mathematical Science Center, Tsinghua University(清华大学姚期智科学中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对非视距成像中中继曲面形状任意且采样稀疏的问题,提出一种无几何假设的LOS引导NLOS成像方法,利用3D高斯原语和可微分瞬态渲染实现端到端优化,在真实数据上达到最先进的重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19928 2026-06-19 cs.RO 新提交 57%

SWAP: Symmetric Equivariant World-Model for Agile Robot Parkour

SWAP: 用于敏捷机器人跑酷的对称等变世界模型

Kaixin Lan, Ze Wang, Hongyi Li, Lei Jiang, Chaojie Fu, Chengkai Su, Choi Lam Wong, Yongbin Jin, Hongtao Wang

机构 * Center for X-Mechanics, Zhejiang University(浙江大学交叉力学中心) ZJU-Hangzhou Global Scientific and Technology Innovation Center(浙江大学杭州国际科创中心) Mirrorme Technology Co., Ltd.(魔镜科技有限公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO

AI总结 提出SWAP框架,将对称等变性嵌入世界模型和演员-评论家网络,实现四足机器人跑酷记录突破(跨越2.13米间隙、攀爬1.63米平台),并展现出对未见镜像地形的几何泛化与零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16057 2026-06-19 cs.RO cs.SY eess.SP eess.SY 新提交 57%

A Smart-Scheduled Hybrid (SSH) EKF-FGO State Estimation

一种智能调度混合(SSH)EKF-FGO状态估计方法

Eric Levy, Soosan Beheshti

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文通过智能调度混合EKF-FGO框架,实验性地将优化调度作为独立设计变量,研究其在平衡估计精度与计算成本中的作用,并在平面SLAM仿真中验证了调度对预优化漂移、瞬态误差和运行时间的显著影响。

Comments This work has been accepted for presentation/publication at the 2026 IEEE Canadian Conference on Electrical and Computer Engineering (CCECE). The final published version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19122 2026-06-18 cs.RO 新提交 57%

Monocular 3D Occupancy Perception for Robots on Sidewalks via Hybrid 2D-3D Learning

基于混合2D-3D学习的人行道机器人单目3D占用感知

Yukai Ma, Joe Lin, Liu Liu, Honglin He, Lulu Ricketts, Brad Squicciarini, Yong Liu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) Coco Robotics(Coco机器人) Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 提出WalkOCC框架,通过混合射线行进单目3D占用感知,结合LiDAR-RGB配对数据与大规模无配对单目图像学习,提升人行道机器人导航的预测精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19089 2026-06-18 cs.RO 新提交 57%

ART-VS: Adaptive Resolution Tiling for Vision Transformer Visual Servoing

ART-VS:用于视觉Transformer伺服的自适应分辨率分块

Alessandro Scherl, Bernhard Neuberger, Simon Schwaiger, David Mulero-Pérez, Lucas Muster, Jose Garcia-Rodriguez

机构 * Department of Computer Technology, University of Alicante(阿尔瓦登特技术系,阿利坎特大学) Department of Industrial Engineering, UAS Technikum Vienna(工业工程系,维也纳技术学院) Automation and Control Institute, TU Wien(自动化与控制研究所,维也纳技术大学) Institute of Software Engineering and Artificial Intelligence, Graz University of Technology(软件工程与人工智能研究所,格拉茨技术大学) Institute for Integrative Nature Conservation Research, University of Natural Resources and Life Sciences Vienna(整合自然保护研究 institute,维也纳自然资源与生命科学大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出ART-VS方法,通过粗-精两阶段自适应调整特征粒度,在不需任务特定训练下提升视觉伺服鲁棒性和精度,显著降低定位误差并提高速度。

Comments Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19023 2026-06-18 cs.CR cs.LG 新提交 57%

Lifecycle-Aware Dynamic Analysis for Secure ML Model Execution

生命周期感知的动态分析用于安全ML模型执行

Gabriele Digregorio, Marco Di Gennaro, Francesco Pastore, Stefano Zanero, Stefano Longari, Michele Carminati

机构 * Politecnico di Milano(米兰理工大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 提出Moat,一种动态生命周期感知方法,通过监控模型执行各阶段与宿主系统的结构化交互来检测恶意行为,在多个框架上实现零误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18943 2026-06-18 cs.CV 新提交 57%

Physics-IQ Verified

物理智力验证

Tim Rädsch, Yuki M Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, Carsten T. Lüth

机构 * Anates Labs(Anates实验室) Technical University of Munich(慕尼黑技术大学) University of Technology Nuremberg(纽伦堡技术大学) Tuebingen AI Center, University of Tuebingen(图宾根大学人工智能中心) Helmholtz AI, Munich(慕尼黑海德堡人工智能研究所) Google DeepMind research(谷歌DeepMind研究)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出Physics-IQ Verified基准,通过改进提示和地面真实质量及引入样本级评分系统,提升视频生成模型对物理现实的理解评估,验证结果表明基准提升了57.6%的样本和34.8%的提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18867 2026-06-18 cs.LG cs.CY stat.ML 新提交 57%

Strategic Feature Selection

战略特征选择

Jivat Neet Kaur, Pratik Patil, Divya Shanmugam, Emma Pierson, Michael I. Jordan, Nika Haghtalab, Meena Jagadeesan, Ahmed Alaa, Serena Wang

机构 * University of California, Berkeley(加州大学伯克利分校) University of Texas, Austin(德克萨斯大学奥斯汀分校) Cornell Tech(康奈尔科技) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学) Inria, Paris(巴黎Inria)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 研究通过特征选择和岭正则化应对战略操纵的分类问题,发现仅基于可操纵性排除特征通常次优,提出联合优化特征集与正则化水平的算法,并在医疗支付基准上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18310 2026-06-18 cs.CR cs.AI 新提交 57%

Conflict-Aware Retriever Editing for Knowledge Injection Attacks on LLM-Based RAG Systems

冲突感知检索器编辑:针对基于LLM的RAG系统的知识注入攻击

Xinru Liu, Xianglong Zhang, Di Cai, Zhumin Chen, Pengfei Hu, Xin Xin

机构 * Shandong University, China(山东大学,中国) Tsinghua University, China(清华大学,中国)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出冲突感知检索器编辑框架CAREATTACK,通过模型中心攻击将恶意知识注入RAG系统,利用图检测和参数编辑投影解决冲突,并轻量校准保持攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17978 2026-06-17 cs.AI 新提交 57%

MoCo-AIS: A Contrastive Learning Framework for Similarity Computation of Vessel Trajectories

MoCo-AIS: 一种用于船舶轨迹相似度计算的对比学习框架

Ruixin Song, Md Mahbub Alam, Zahra Sadeghi, Amilcar Soares, José F. Rodrigues-Jr, Gabriel Spadon

机构 * Dalhousie University(达尔豪斯大学) Linnaeus University(林奈大学) University of Sao Paulo(圣保罗大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 提出基于动量对比(MoCo)的统一对比学习框架MoCo-AIS,通过正负轨迹对学习嵌入,在真实AIS数据集上评估多种深度学习模型,显著提升轨迹相似度学习性能。

Comments Under review at SIGSPATIAL'26

Journal ref arXiv preprint arXiv:2606.17978, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17935 2026-06-17 cs.CV 新提交 57%

MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization

MoonSplat: 基于Sim(3)全局优化的单目在线高斯泼溅

Guo Pu, Yixuan Han, Haofeng Li, Yao Zhang, Hui Zhou, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Beijing Hydrogen Intelligent Tech. Co., Ltd.(北京氢元智能科技有限公司)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出一种结合Sim(3)全局优化的在线体素化3DGS框架,通过颜色残差学习策略加速收敛,实现鲁棒的相机跟踪和全局闭环,在室内外数据集上达到SOTA性能。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17309 2026-06-17 cs.RO 新提交 57%

Abstention-Aware Personalized Object Rearrangement via Uncertainty-Guided LLM Assistance

基于不确定性引导的LLM辅助的弃权感知个性化物体重排

Sam Collin, Ali Ayub

机构 * Concordia University(康考迪亚大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出APOLLO框架,结合轻量级个性化嵌入模型与选择性大语言模型辅助,通过不确定性估计在模糊决策时调用LLM,实现高效、隐私保护的弃权感知物体重排。

Comments Accepted at the 2026 IEEE 35th International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 57%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16767 2026-06-16 cs.CV 新提交 57%

Text-Vision Co-Instructed Image Editing

文本-视觉协同指导的图像编辑

Chenxi Xie, Yuhui Wu, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16101 2026-06-16 cs.MM cs.CV 新提交 57%

Effective and Low-cost Lane-based Map Localization for Vehicle-Centric Route Generation

基于车道的地图定位实现以车辆为中心的路线生成:一种有效且低成本的方法

Hong-Shiang Lin, Jung-Hsin Chen, Yu-Luen Tzeng, Wei-Hao Chen, Yi-Chen Lee, Li-Jhe Chen, Peng-Yuan Chen

机构 * National Taipei University(台北国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出OLRA框架,通过匹配导航路线与摄像头检测的车道线,以低成本地图定位生成驾驶员视角路线,提升定位精度和路线一致性,在nuScenes数据集上优于OpenPilot。

Comments 14 pages, 18 figures. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15550 2026-06-16 cs.RO 新提交 57%

Robots as Tokens: Unified Diffusion Transformer for Coordinated Multi-Robot Trajectory Generation

机器人作为令牌:面向协调多机器人轨迹生成的统一扩散Transformer

Ruofei Bai, Jie Chen, Yuxin Cai, Jun Li, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(新加坡科技研究局) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 提出Roken框架,将每个机器人表示为离散令牌,通过扩散Transformer直接生成满足安全和连通性约束的多机器人轨迹,无需迭代后处理。

Comments 23 pages, 13 figures; \textbf{Project page:} \href{https://bairuofei.github.io/roken-project-page/}{\texttt{bairuofei.github.io/roken-project-page}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15287 2026-06-16 cs.CV 新提交 57%

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition

G2IA: 几何引导的实例感知跨模态地点识别检索与精炼

Xianyun Jiao, Jingyi Xu, Zhongmiao Yan, Xieyuanli Chen, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Defense Technology(国防科技大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出G2IA框架,通过几何引导的实例感知检索和跨模态局部形状与空间布局验证,解决图像到点云地点识别中的模态差异和感知混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15255 2026-06-16 cs.RO 新提交 57%

OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration

OSDAG: 面向高效多机器人协作的在线调度

Thanh Nguyen Canh, Thang Tran Viet, Phuc Van Dinh, Xiem HoangVan, Nak Young Chong

机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) Hanyang University(汉阳大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15077 2026-06-16 cs.AI cs.CL 新提交 57%

Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation

风险感知的LLM智能体用于地理空间数据检索:设计与初步对抗性评估

Kyle Gao, Joel Cumming, Jonathan Li, Linlin Xu, David A. Clausi

机构 * Dept. of Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系) SkyWatch Dept. of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系) Dept. of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出一种基于LLM的框架,通过自然语言查询从云地理空间目录检索遥感数据,集成三个智能体实现安全、意图解析和API调用生成,初步对抗实验表明提示级安全指令提升鲁棒性但需系统级防御。

Comments Accepted for publication in the International Archives of the Photogrammetry, Remote Sensing and Spatial Information Sciences (ISPRS Archives), ISPRS Congress 2026

Journal ref Int. Arch. Photogramm. Remote Sens. Spatial Inf. Sci., XLIX-B3-2026, 1419-1426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14862 2026-06-16 cs.RO 新提交 57%

TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations

TacStyle: 使用结构化行为表示个性化触觉机器人策略

Kevin Robledo, Matías I. Torres Galaz, Kumar Dixhant Rai, Shelly Sara Ulman, Tasmia Tasrin, Heramb Nemlekar

机构 * Department of Computer Science, California State University, Northridge(加州州立大学北岭分校计算机科学系) Department of Mechanical Engineering, California State University, Northridge(加州州立大学北岭分校机械工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出通过结构化潜在表示组织用户偏好,结合基础模型解释语言指令,实现机器人行为精细调整,减少偏好标签需求。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14739 2026-06-16 cs.ET cs.LG cs.SY eess.SY 新提交 57%

An RRAM-based Hardware Implementation of a Radial Basis Function Neuron for Edge Classifiers

基于RRAM的径向基函数神经元硬件实现用于边缘分类器

Georgios Papandroulidakis, Shady Agwa, Themis Prodromakis

机构 * Centre for Electronics Frontiers, Institute of Micro and Nano Systems(电子前沿中心,微纳系统研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 提出一种基于金属氧化物RRAM的模拟内容可寻址存储器(ACAM)硬件设计,通过可配置感受野神经元实现边缘设备上的度量分类和在线自适应,在MNIST上达到89.1%准确率,每单元每操作能耗185fJ。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14720 2026-06-16 cs.CV 新提交 57%

AI for Maritime Security: Comparative Evaluation of CNN and Vision Transformer Architectures for Maritime Object Detection

AI用于海上安全:CNN与Vision Transformer架构在海上目标检测中的比较评估

Ismet Gocer, Zakirul Bhuiayn, Shakeel Ahmad, Raza Hasan

机构 * Southampton Solent University School of Technology and Maritime Industries(索马顿桑德兰大学技术与海洋工业学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 研究利用CNN和Vision Transformer等六种深度学习模型,在多种天气条件下检测海面船只,ViT达到100%准确率且处理速度最快,展示了AI视觉系统在海上监视中的潜力。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13731 2026-06-15 cs.AI cs.MA 新提交 57%

TwinBI: An Agentic Digital Twin for Efficient Augmented Interactions with Business Intelligence Dashboards

TwinBI:一种用于与商业智能仪表盘高效增强交互的智能数字孪生

Jisoo Jang Wen-Syan Li

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出TwinBI框架,通过LLM代理与可执行仪表盘状态耦合,统一对话、操作、语义和溯源,提升多步分析中状态一致性,将精确匹配准确率从43.3%提升至63.3%,超时率从40%降至10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12614 2026-06-12 cs.RO 新提交 57%

DARRMS -- An Efficient Algorithm for Dynamic Attention Radius in Resource-Constrained Multi-Agent Systems

DARRMS——资源受限多智能体系统中动态注意力半径的高效算法

Benjamin Alcorn, Eman Hammad

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 提出DARRMS算法,通过优化注意力半径和决策,在资源受限下降低计算需求,提升协调性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12366 2026-06-11 cs.RO 新提交 57%

APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies

APT: 动作专家预训练提升视觉-语言-动作策略的指令泛化能力

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 针对连续动作专家模型对分布外语言指令泛化差的问题,提出APT两阶段训练方法,先预训练动作专家作为视觉-动作先验,再通过门控融合注入语言,显著提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11880 2026-06-11 cs.CV 新提交 57%

SG2Loc: Sequential Visual Localization on 3D Scene Graphs

SG2Loc: 基于3D场景图的顺序视觉定位

Nicole Damblon, Olga Vysotska, Federico Tombari, Marc Pollefeys, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) TU Munich(慕尼黑工业大学) Microsoft(微软)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出一种轻量级顺序视觉定位方法,利用紧凑的3D场景图表示环境,通过粒子滤波和语义匹配实现高效定位,显著降低存储需求。

Comments The code will be available at https://github.com/DmblnNicole/sg2loc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11464 2026-06-11 cs.RO 新提交 57%

Bridging the sim2real gap in the table tennis robot with a transformer-based ball states predictor

基于Transformer的乒乓球状态预测器弥合仿真到现实的差距

Yin Bi, Christian Conti, Bilan Yang, Alexander Sigrist, Peter Dürr, Naoya Takahashi

机构 * Sony AI, Zürich, Switzerland(索尼AI,苏黎世,瑞士) Sony AI, Tokyo, Japan(索尼AI,东京,日本)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出基于Transformer的乒乓球状态预测框架,利用注意力机制建模长程时间依赖,结合大规模真实数据集,并引入SPAD策略替换仿真器,无需重新训练即可缩小sim2real差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11419 2026-06-11 cs.RO 新提交 57%

A Modular Dual-Camera Pipeline for Micro-Inspection Using Aerial Robots

一种用于空中机器人微检测的模块化双相机流水线

S. H. Mirtajadini, N. Rublein, R. M. Ramakrishnan, G. ter Maat, M. Aldibaja, A. Y. Mersha

机构 * Netherlands Organization for Scientific Research (NWO)(荷兰科学研究组织) Saxion University of Applied Sciences(萨克逊应用科学大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 提出一种模块化双相机空中微检测流水线,通过变焦云台相机和广角立体导航相机协同工作,结合视觉反馈回路,实现对树木和温室粘虫板等非结构目标的鲁棒微检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11314 2026-06-11 cs.CV cs.GR 新提交 57%

TRON: Tracing Rays to Orchestrate a Neural Renderer for 3D Gaussian Reconstructions

TRON:追踪光线以编排用于3D高斯重建的神经渲染器

Or Perel, Hassan Abu Alhaija, Zian Wang, Jacob Munkberg, Matan Atzmon, Sanja Fidler, Masha Shugrina

机构 * NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出TRON框架,结合3D高斯光线追踪与神经渲染,实现真实世界3D场景在新光照、动态物体运动、物体插入和材质编辑下的逼真可控渲染,通过内在分解先验和光线追踪辐射引导,弥合物理渲染与神经渲染的差距。

Comments Project page: https://research.nvidia.com/labs/sil/projects/tron/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11200 2026-06-11 cs.CL cs.CV 新提交 57%

Detecting AI-Generated Content on Social Media with Multi-modal Language Models

使用多模态语言模型检测社交媒体上的AI生成内容

Chenyang Yang, Shen Yan, Yibo Yang, Litao Hu, Yuchen Liu, Yuan Zeng, Hanchao Yu, Yinan Zhu, Sumedha Singla, Brian Vanover, Huijun Qian, Zihao Wang, Fujun Liu, Aashu Singh, Jianyu Wang, Xuewen Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对AI生成内容检测的泛化性差、单模态依赖和缺乏可解释性问题,提出基于多模态数据的紧凑视觉-语言模型,实现检测与解释,在公开基准和内部数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏