KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing
KVSmooth: 通过键值平滑缓解多模态大语言模型中的幻觉
AI总结 KVSmooth通过键值平滑技术有效缓解多模态大语言模型中的幻觉问题,提升生成精度和召回率。
Comments Accepted by CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
KVSmooth: 通过键值平滑缓解多模态大语言模型中的幻觉
AI总结 KVSmooth通过键值平滑技术有效缓解多模态大语言模型中的幻觉问题,提升生成精度和召回率。
Comments Accepted by CVPR 2026
PvP: 通过体感优先对比表示实现数据高效的类人机器人学习
机构 * HK PolyU(香港理工大学) ; LimX Dynamics ; EIT, Ningbo(宁波工程学院) ; USTC(中国科学技术大学) ; ZJU-UIUC(浙江大学-UIUC) ; ZGCA(浙江工业大学)
AI总结 PvP通过体感优先对比学习提升类人机器人学习的样本效率和性能。
Comments 15 pages, 17 figures
Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯文生) ; Peking University(北京大学)
AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。
Comments Accepted by CVPR 2026
超低比特率感知图像压缩与浅层编码
机构 * University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 本文提出了一种非对称极值图像压缩框架,利用浅层编码器和单步扩散解码器实现超低比特率下的高保真度重建,同时提升编码效率和解码速度。
Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026
TEAR:面向文本到视频模型的时序感知自动化红队测试
机构 * University of Electronic Science and Technology of China(电子科学与技术大学) ; University of Manchester(曼彻斯特大学) ; Ant Group(蚂蚁集团) ; Nanyang Technological University(南洋理工大学) ; Jilin University(吉林大学)
AI总结 TEAR通过时序感知自动化红队测试框架,有效识别文本到视频模型中的安全风险,实验显示攻击成功率高达80%
Comments CVPR 2026
MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并
机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)
AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。
Comments Accepted to CVPR 2026
X-WIN:通过预测感知构建胸片世界模型
AI总结 X-WIN通过预测感知构建胸片世界模型,利用体积数据提炼3D解剖知识,提升CXR的表示学习和诊断能力。
Comments Accepted by CVPR 2026
REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Peking University(北京大学)
AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。
Comments CVPR 2026 Accepted
重新思考指认多目标跟踪中的两阶段指认跟踪:使其更强大
AI总结 本文提出FlexHook,一种改进的两阶段指认跟踪框架,通过改进特征构建和对应关系建模,实现了对当前最先进方法的全面超越。
Comments Accepted to the CVPR 2026
基于视觉-语言模型的点云地图定位
AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。
Comments CVPR 2026
VarSplat: 一种具有不确定性的3D高斯点划法用于鲁棒的RGB-D SLAM
机构 * Department of Computer Science(计算机科学系)
AI总结 VarSplat通过显式学习每个点划的外观方差,提升RGB-D SLAM的鲁棒性和稳定性,实现更可靠的跟踪与建图。
Comments Accepted to CVPR 2026
ParTY: 部分引导用于表达性文本到运动合成
机构 * Kyung Hee University(庆熙大学)
AI总结 ParTY通过部分引导网络、部分感知文本定位和整体-部分融合,提升文本到运动合成中部分表现力和动作连贯性。
Comments Accepted by CVPR 2026. Code: https://github.com/VisualScienceLab-KHU/ParTY
BinaryAttention: 一比特QK-注意力用于视觉和扩散变换器
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 BinaryAttention通过1比特QK-注意力实现视觉和扩散变换器的高效加速,有效提升计算效率并保持准确性。
Comments Accepted by CVPR 2026
复兴 ConvNeXt 以实现高效的卷积扩散模型
机构 * KAIST(韩国科学技术院) ; ETH Zürich(苏黎世联邦理工学院) ; ISTI-CNR(意大利国家研究理事会信息与自动化研究所) ; University of Pisa(比萨大学)
AI总结 本文提出全卷积扩散模型 FCDM-XL,通过使用 ConvNeXt 结构实现高效扩散模型,以更少的 FLOPs 和训练步骤达到与 DiT-XL 相当的性能。
Comments CVPR 2026. Official implementation: https://github.com/star-kwon/FCDM
用更短的高斯列表加速3D高斯学习
机构 * Machine Perception Lab, Wayne State University(机器感知实验室,韦恩州立大学)
AI总结 通过缩短高斯列表提升3D高斯学习效率,采用尺度重置和熵约束优化渲染效率。
Comments Accepted to CVPR 2026. Project page: https://github.com/MachinePerceptionLab/ShorterSplatting
从网络视频中隐式几何表示的视觉-语言导航
机构 * Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(计算机视觉系,Mohamed Bin Zayed人工智能大学) ; School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区)
AI总结 本研究提出基于网络视频的隐式几何表示方法,用于视觉-语言导航,通过提升数据利用率和鲁棒性,实现更广泛的应用。
Comments Extension of CVPR 2025 RoomTour3D with implicit geometric representations
点云作为多模态大语言模型的外语
机构 * Concordia University(康科迪亚大学)
AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。
Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026
X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力
机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)
AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。
Journal ref CVPR 2026
VirtueBench: 在长视频理解中评估在不确定性下的可信度
AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。
Comments Accepted to CVPR 2026
通过方向解耦对齐缓解偏好模式崩溃在扩散强化学习中
机构 * Tsinghua University(清华大学) ; AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)
AI总结 本文提出D²-Align框架,通过方向解耦对齐缓解扩散强化学习中的偏好模式崩溃,提升生成多样性。
Comments Accepted by CVPR 2026
当机器人服从补丁:对视觉-语言-动作模型的通用可转移补丁攻击
机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University(罗思实验室,跨学科研究生项目,南洋理工大学) ; ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(罗思实验室,电子与电气工程学院,南洋理工大学) ; CCDS, Nanyang Technological University(CCDS,南洋理工大学) ; DSO National Laboratories(国防科学局实验室)
AI总结 本文提出UPA-RFAS框架,通过鲁棒特征、注意和语义方法,实现对视觉-语言-动作模型的通用可转移补丁攻击,揭示了基于补丁的攻击面并为未来防御提供基线。
Comments Accepted by CVPR 2026
V-Attack:针对解耦价值特征的可控对抗攻击LVLMs
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhejiang University(浙江大学)
AI总结 V-Attack通过精准操控LVLMs中的价值特征,提升对抗攻击的成功率,揭示视觉语言理解的关键漏洞。
Comments Accepted by CVPR 2026
SPAN: 用于单目3D目标检测的空间-投影对齐
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; School of Mathematics and Statistics, University of Glasgow(格拉斯哥大学数学与统计学学院) ; Basic Algorithm Center, PCG, Tencent(腾讯计算机系统有限公司基础算法中心)
AI总结 SPAN通过空间点对齐和3D-2D投影对齐解决单目3D目标检测中几何一致性不足的问题,提升检测性能。
Comments Accepted by CVPR 2026
LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全
机构 * Southeast University(东南大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Zhejiang University of Technology(浙江工业大学) ; Tsinghua University(清华大学) ; RealAI
AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。
Comments Accepted to CVPR 2026
半监督置信预测与未标记非一致性评分
机构 * Southern University of Science and Technology(南方科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 本文提出SemiCP,通过结合标记和未标记数据提升置信预测的覆盖性能,实验表明在有限标记数据下可显著降低覆盖差距。
Comments Accept by CVPR 2026
MVTec AD 2数据集:面向无监督异常检测的高级场景
AI总结 MVTec AD 2数据集提供8000张高分辨率图像,包含工业检测中未被考虑的挑战性场景,用于评估无监督异常检测方法的性能和鲁棒性。
Comments paper under review; dataset first released for the VAND3.0 challenge @ CVPR 2025 https://sites.google.com/view/vand30cvpr2025/challenge
TIMotion: 时空交互框架用于高效的人机运动生成
机构 * Zhejiang University(浙江大学) ; Youtu Lab, Tencent(腾讯优图实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 TIMotion提出一种高效框架,通过因果交互注入、角色演变扫描和局部模式放大,实现高效的人类交互运动生成。
Comments Accepted to CVPR 2025. Project page: https://aigc-explorer.github.io/TIMotion-page/
视觉-语言模型编码临床指南以实现基于概念的医学推理
机构 * Queen’s University(女王大学) ; University of British Columbia(不列颠哥伦比亚大学) ; McMaster University(麦马斯特大学) ; Vector Institute(向量研究所)
AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。
Comments CVPR 2026 Findings
Talking Together: 从音频流合成共处的3D对话
机构 * University of Washington(华盛顿大学) ; Google(谷歌) ; University of Rochester(罗切斯特大学)
AI总结 本文提出了一种双流架构,通过文本描述控制相对头部姿态,生成逼真且空间感知的双人3D对话动画。
Comments Accepted to CVPR 2026
StreamReady: 在长视频流中学习何时回答
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) ; Microsoft Research(微软研究院)
AI总结 StreamReady通过引入答案准备度评分,统一时间推理与及时回答,实现对长视频流中何时回答的高效学习与准确判断。
Comments Accepted in CVPR 2026