arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-08-25 至 2026-08-25 共收录 5
2608.22039 2026-08-25 cs.CV 新提交

ORBIT++: Benchmarking SfM in the Wild with 360° Video

ORBIT++: 基于360°视频的野外运动恢复结构(SfM)基准测试

Sara Sabour, Linyi Jin, Richard Tucker, Amir Hertz, Marcus Brubaker, Saurabh Saxena, Junhwa Hur, Andrea Tagliasacchi, Deqing Sun, David J. Fleet, Richard Szeliski, Noah Snavely

机构 * Google DeepMind(谷歌DeepMind) Simon Fraser University(西蒙菲莎大学) University of Toronto(多伦多大学)

AI总结 该研究针对现有SfM方法在复杂视频中失效且缺乏对应可靠基准的问题,提出基于360°视频的ORBIT基准,实验显示多种SfM方法在该基准上表现不佳,为相关研究提供了测试平台。

Comments A revision was Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01063 2026-08-25 cs.AI 版本更新

MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention

MindClaw: 用于精确干预的闭环具身心理状态推理

Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang, Chenghao Yu, Hongxia Xie, Wen-Huang Cheng, Jianlong Fu

机构 * Jilin University(吉林大学) Microsoft Asia(微软亚洲) National Taiwan University(国立台湾大学)

AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。

Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22225 2026-08-25 cs.CV cs.AI 版本更新

ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

ExtrinSplat:解耦几何与语义以实现3D高斯散射中的开放词汇理解

Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Guangdong Bohua UHD Innovation Center Co., Ltd.(广东博华超高清创新中心有限公司)

AI总结 ExtrinSplat通过解耦几何与语义,利用视觉语言模型生成轻量文本假设,提升3D高斯散射中开放词汇物体选择和语义分割的性能和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2026-08-25 cs.CV 版本更新

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments CVPR 2026, Project Page: this https URL (https://19reborn.github.io/Bullet4D/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23928 2026-08-25 cs.LG cs.AI 版本更新

HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models

HiViS: 为视觉语言模型中的推测解码隐藏视觉标记

Zhinan Xie, Peisong Wang, Shuang Qiu, Jian Cheng

机构 * C 2 DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) AIRIA City University of Hong Kong(香港城市大学)

AI总结 HiViS通过隐藏视觉标记,提升视觉语言模型在推测解码中的生成效率和速度。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏