Reinforcing Video Reasoning Segmentation to Think Before It Segments
强化视频推理分割以在分割前思考
AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。
Comments 12 pages
Journal ref CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
强化视频推理分割以在分割前思考
AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。
Comments 12 pages
Journal ref CVPR 2026
D2Dewarp: 基于双维度几何表示学习的文档图像去畸变
机构 * Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) ; PengCheng Laboratory(鹏城实验室)
AI总结 D2Dewarp通过双维度几何表示学习提升文档图像去畸变效果,提出细粒度变形感知模型和自动标注方法,构建新数据集并验证方法有效性。
Comments Accepted by CVPR 2026
薛定谔的相机:迈向基于量子的隐私保护相机的第一步
AI总结 本文提出了一种基于量子态的隐私保护图像存储方法,并利用双深度Q学习算法实现对图像匿名化的控制,展示了在量子基础上平衡隐私与效用的可行性。
Journal ref 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 18-27
跨视觉协同的统一大视觉模型建模
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
AI总结 PolyV通过统一架构和协同训练方法,实现了跨视觉模态的协同推理,显著提升了多模态视觉任务的性能。
Comments 21 pages, 9 figures, 16 tables, CVPR
DuoMo:用于世界空间人体重建的双动差分
机构 * Meta Reality Labs ; University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 DuoMo通过双扩散模型实现世界空间人体运动重建,有效处理噪声和不完整输入,提升重建精度。
Comments CVPR 2026. Project page: https://yufu-wang.github.io/duomo/
NOVA:无配对视频编辑的稀疏控制与密集合成
机构 * Nanjing University(南京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; WeChat, Tencent(微信、腾讯) ; The University of Hong Kong(香港大学)
AI总结 NOVA提出了一种无配对视频编辑框架,通过稀疏控制与密集合成提升编辑保真度和时间一致性。
Comments Accepted by CVPR 2026
HiLoRA: 分层低秩适应用于个性化联邦学习
机构 * Beijing Normal University(北京师范大学) ; Zhengzhou University(郑州大学)
AI总结 HiLoRA通过分层低秩适应框架,解决联邦学习中客户端结构忽视问题,提升个性化和泛化性能。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
OnlineX: 一种基于主动到稳定状态演化的统一在线3D重建与理解方法
机构 * Tsinghua University(清华大学)
AI总结 OnlineX通过解耦主动到稳定状态演化范式,实现基于流式图像的统一在线3D重建与理解,提升重建质量和实时推理效率。
Comments Accepted by CVPR Finding 2026 (Project page: https://xiac20.github.io/OnlineX/)
SimRecon: 从真实视频中实现模拟准备的组合场景重建
机构 * Tsinghua University(清华大学) ; Galbot Project(Galbot项目)
AI总结 SimRecon通过引入主动视角优化和场景图合成器,解决了从真实视频中重建复杂场景时的视觉和物理真实性问题,实现了感知-生成-模拟的全流程流水线。
Comments Accepted by CVPR 2026 (Project page: https://xiac20.github.io/SimRecon/ )
递归思考-回答过程用于LLMs和VLMs
AI总结 本文提出递归思考-回答过程(R-TAP)以提升LLMs和VLMs的推理准确性,通过置信度生成器和双奖励机制实现迭代推理,减少错误输出并提高推理稳定性。
Comments CVPR 2026 Findings, Project page: https://litcoderr.github.io/rtap_page/
ShiftLUT: 基于空间位移增强的查找表用于高效的图像修复
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
AI总结 ShiftLUT通过引入可学习空间位移模块和不对称双分支架构,实现了更大的感受野和更高的修复效率,同时保持低存储和计算开销。
Comments Accepted to CVPR 2026
差分隐私的2D人体姿态估计
机构 * School of Computing Science, University of Glasgow(计算机科学学院,格拉斯哥大学)
AI总结 本文提出了一种结合投影DP-SGD和特征差分隐私的混合框架,实现差分隐私下的2D人体姿态估计,有效平衡隐私与性能。
Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026
从更少样本到更少位数:将数据集蒸馏重新框架化为精度和紧凑性的联合优化
机构 * InterDigital Communications, Inc.(InterDigital通讯公司)
AI总结 QuADD通过联合优化数据集紧凑性和精度,在固定位预算下提升数据集蒸馏的效率和性能。
Comments Accepted to CVPR 2026 - Findings Workshop
OpenMarcie:工业环境中的多模态动作识别数据集
机构 * DFKI Kaiserslautern(DFKI凯撒斯劳滕) ; RPTU Kaiserslautern-Landau(RPTU凯撒斯劳滕-兰道) ; Korea University(韩国大学)
AI总结 OpenMarcie是首个大规模多模态数据集,用于工业环境中的动作识别,包含36名参与者在不同任务中的多模态数据,支持活动分类、开放词汇描述和跨模态对齐任务。
Comments Accepted in CVPR 2026
超越基于描述的查询的视频时刻检索
机构 * University of Barcelona(巴塞罗那大学) ; Computer Vision Center(计算机视觉中心) ; University of Bristol(布里斯托大学)
AI总结 本文提出了一种改进视频时刻检索方法,通过解决语言和多时刻查询的泛化问题,提升了搜索查询的性能。
Comments CVPR 2026 Camera-ready version
HAMMER: 通过跨模态整合利用大语言模型进行意图驱动的3D affordance grounding
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 HAMMER通过跨模态整合多模态大语言模型,实现意图驱动的3D affordance grounding,提升3D表示的准确性和鲁棒性。
Comments Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer
超越提示退化:基于原型的双池提示法用于增量物体检测
机构 * Northwestern Polytechnical University(西北工业大学)
AI总结 PDP提出双池提示解耦框架,通过分离任务通用和特定提示以缓解提示退化,提升增量物体检测的性能和稳定性。
Comments Our paper has been accepted to CVPR 2026
类增量学习中正负监督的时间不平衡
机构 * Purdue University(普渡大学)
AI总结 本文提出时间调整损失(TAL)以解决类增量学习中正负监督的时间不平衡问题,通过动态加权负监督减少灾难性遗忘并提升性能。
Comments Accepted to CVPR 2026
PromptStereo: 通过结构和运动提示实现零样本立体匹配
机构 * Huazhong University of Science and Technology(华中科技大学) ; Optics Valley Laboratory(光谷实验室)
AI总结 PromptStereo通过结构和运动提示提升零样本立体匹配的泛化性能,提出PRU模块增强单目深度模型的潜在表示。
Comments Accepted to CVPR 2026
连续曝光时间建模用于真实大气湍流合成
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
AI总结 本文提出ET-MTF模型,通过连续曝光时间建模生成真实大气湍流数据集,提升图像恢复和泛化能力。
Comments Accepted to CVPR 2026!
马尔可夫尺度预测:视觉自回归生成的新时代
机构 * Tongji University(同济大学) ; University of Bristol(布里斯托大学) ; Macquarie University(麦考瑞大学)
AI总结 马尔可夫-VAR通过非全上下文马尔可夫过程提升视觉自回归生成的效率与效果
Comments Accepted to CVPR 2026
AdaBet: 无梯度层选择用于深度神经网络高效训练
机构 * MIT(麻省理工学院) ; Nokia Bell Labs(诺基亚贝尔实验室) ; University of Glasgow(格拉斯哥大学)
AI总结 AdaBet通过无梯度方法选择重要层,提升深度神经网络在边缘设备上的训练效率和准确率。
Comments Full Version accepted at CVPR 2026
SABER: 用于鸟瞰检测器的时空一致的3D通用对抗对象
机构 * School of Electronics and Information, Northwestern Polytechnical University & Shaanxi Key Laboratory of Information Acquisition and Processing, Xi’an, China(电子工程学院,西北工业大学 & 陕西省信息采集与处理重点实验室,西安,中国) ; School of Computing, Australian National University(计算学院,澳大利亚国立大学)
AI总结 SABER提出了一种生成通用、非侵入式且3D一致的对抗对象的方法,以揭示BEV 3D目标检测器的漏洞,并提供评估自动驾驶系统鲁棒性的实用流程。
Comments Accepted to CVPR 2026
多模态故障检测的自适应置信度正则化
机构 * Technical University of Munich(慕尼黑技术大学) ; ETH Zürich(苏黎世联邦理工学院) ; EPFL(苏黎世联邦理工学院) ; Fraunhofer IKS(弗劳恩霍夫研究所)
AI总结 本文提出自适应置信度正则化方法,通过检测多模态预测中的置信度退化,提升故障识别的可靠性。
Comments Accepted by CVPR 2026
重新思考相机选择:关于机器人操作中鱼眼相机属性的实证研究
AI总结 本文通过实证研究发现鱼眼相机在机器人操作中需考虑视场角、环境复杂性和随机尺度增强策略以提升性能。
Comments 22 pages, 15 figures, Accecpted by CVPR 2026
OmniLottie:通过参数化Lottie令牌生成向量动画
AI总结 OmniLottie通过参数化Lottie令牌生成高质量向量动画,结合多模态指令与大规模数据集提升动画生成能力。
Comments Accepted by CVPR 2026. Project Page: https://openvglab.github.io/OmniLottie/
FluxMem: 用于流视频理解的自适应分层内存
机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) ; University of Maryland, College Park(马里兰大学 College Park 分校)
AI总结 FluxMem通过自适应分层内存压缩技术,在流视频理解中实现了高效处理,提升了实时性能和离线表现。
Comments Accepted at CVPR 2026. Project page: https://yiwengxie.com/FluxMem/
面向源感知的对象交换的初始噪声扰动
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 SourceSwap通过初始噪声扰动实现自监督对象交换,无需额外数据即可实现高质量跨对象对齐和零样本推理。
Comments This paper is accepted by CVPR 2026 Findings
tttLRM:面向长上下文和自回归3D重建的测试时间训练
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Adobe Research(Adobe 研究) ; UCI(加州大学欧文分校)
AI总结 tttLRM通过测试时间训练实现长上下文自回归3D重建,提升重建质量和收敛速度。
Comments Accepted by CVPR 2026. Project Page: https://cwchenwang.github.io/tttLRM
衰减步骤的力量:提升基于符号的优化器的攻击稳定性和可迁移性
AI总结 本文提出MDCS方法,通过衰减步长提升基于符号优化器的攻击稳定性和可迁移性,理论证明其收敛率最优。
Comments CVPR 2026