Large Multimodal Models as General In-Context Classifiers
大多模态模型作为通用上下文分类器
AI总结 本文提出CIRCLE方法,通过伪标签迭代优化,使LMM在开放世界分类中超越VLM,展示LMM作为统一分类器的潜力。
Comments CVPR Findings 2026. Project website at https://circle-lmm.github.io/
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
大多模态模型作为通用上下文分类器
AI总结 本文提出CIRCLE方法,通过伪标签迭代优化,使LMM在开放世界分类中超越VLM,展示LMM作为统一分类器的潜力。
Comments CVPR Findings 2026. Project website at https://circle-lmm.github.io/
TriLite: 基于通用视觉特征和三区域解耦的高效弱监督物体定位
机构 * University of Antwerp(安特卫普大学) ; sqIRL/IDLab ; imec Antwerp(Antwerp imec)
AI总结 TriLite通过自监督学习和三区域解耦实现高效弱监督物体定位,无需端到端训练,参数更高效且训练更简单。
Comments This paper consists of 8 pages including 6 figures. Accepted at CVPR 2026
迈向少标签多模态领域泛化的研究
机构 * Zhengzhou University(郑州大学) ; ETH Zürich(苏黎世联邦理工学院) ; MBZUAI(马克斯·普朗克智能系统研究所)
AI总结 本文提出SSMDG框架,通过三个关键组件实现少标签多模态领域泛化,提升跨模态鲁棒性和领域不变性。
Comments Accepted to CVPR 2026
GraspLDP: 通过潜在扩散实现通用抓取策略
机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) ; School of Computer Science and Engineering(计算机科学与工程学院)
AI总结 GraspLDP通过引入潜在扩散框架和抓取先验知识,提升了抓取策略的精度和泛化能力,实验表明其在动态抓取任务中表现优异。
Comments Accepted to CVPR 2026
面容时间旅行者:无需丢失身份即可穿越年龄
机构 * Sony Research India(索尼印度研究实验室) ; IIIT Hyderabad(Hyderabad 研究学院)
AI总结 FaceTT通过基于扩散的框架实现高保真身份一致的年龄变换,引入了Face-Attribute-Aware Prompt Refinement策略、无调优的Angular Inversion方法和自适应注意力控制机制,提升了年龄变换的精度和稳定性。
Comments Accepted at CVPR 2026 (Findings Track)
HulluEdit: 单次通过证据一致子空间编辑用于缓解大视觉-语言模型中的幻觉
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Jiaotong University(北京交通大学)
AI总结 HulluEdit通过单次通过的正交子空间编辑方法,有效缓解大视觉-语言模型中的幻觉问题,实现了最先进的幻觉减少效果。
Comments accepted at CVPR 2026
SoPE: 基于球坐标的位置嵌入:增强3D大视觉-语言模型的空间感知
机构 * University of Macau(澳门大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiaotong University(上海交通大学) ; Hefei University of Technology(合肥工业大学) ; National University of Singapore(新加坡国立大学)
AI总结 SoPE通过基于球坐标的位置嵌入提升3D LVLMs的空间感知能力,结合多尺度频率混合策略,增强几何表示的一致性和表达性。
Comments CVPR 2026
TextPecker: 通过奖励结构异常量化提升视觉文本渲染
机构 * Huazhong University of Science and Technology(华中科技大学) ; ByteDance(字节跳动)
AI总结 TextPecker通过结构异常感知强化学习策略提升视觉文本渲染的结构忠实度和语义对齐度。
Comments Accepted by CVPR 2026; Code: https://github.com/CIawevy/TextPecker
超越像素模拟:通过诊断语义标记和原型控制生成病理图像
机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) ; Fudan University(复旦大学) ; Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) ; University of Science and Technology Beijing(北京科技大学) ; ByteDance(字节跳动) ; School of Computer Science and Technology(计算机科学与技术学院) ; Xi’an Jiaotong University(西安交通大学)
AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。
Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables
超越标签:基于推理增强的LMMs的无词汇细粒度识别
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 FiNDR通过推理增强的LMMs实现无词汇细粒度识别,提出三步流程生成候选标签、过滤排名并构建轻量级分类器,取得显著性能提升。
Journal ref CVPR 2026 (main conference)
无需CLIP、无需标签的无监督概念瓶颈模型
机构 * Max-Planck-Institut für Informatik(马克斯·普朗克研究所) ; ETRO Department, Vrije Universiteit Brussel(自由大学布鲁塞尔分校ETRO部门)
AI总结 无需CLIP和标签的无监督概念瓶颈模型,通过无监督方式推导线性分类器,提升图像分类和零样本描述性能。
Comments CVPR 2026 (Findings)
编码的E2LF:从事件中获取4D光场
机构 * Nagoya University, Japan(名古屋大学,日本) ; Osaka University, Japan(大阪大学,日本)
AI总结 本文提出Coded-E2LF方法,通过编码孔径和事件-only相机实现4D光场的像素级精确重建,首次证明仅使用事件数据即可获得高精度光场。
Comments accepted to CVPR 2026
因果运动扩散模型用于自回归运动生成
机构 * LY Corporation(LY公司) ; Waseda University(早稻田大学)
AI总结 本文提出因果运动扩散模型,通过因果扩散变换器实现高质量运动生成,提升语义保真度与时间平滑度,同时减少推理延迟。
Comments Accepted to CVPR 2026, Project website: https://yu1ut.com/CMDM-HP/
AeroDGS:基于物理的动态高斯点溅技术用于单序列航空4D重建
AI总结 AeroDGS通过物理引导的4D高斯点溅技术,解决单目无人机视频中动态物体的4D重建问题,提升重建精度与稳定性。
Comments Accepted to CVPR 2026
WeaveTime: 从早期帧中流式传输以形成涌现记忆在视频LLMs中
机构 * ShanghaiTech University(上海科技大学) ; School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算科学与数据科学学院)
AI总结 WeaveTime通过引入时间重建目标和动态关注缓存,提升视频LLMs在流式场景中的时间感知能力,减少延迟并提高准确性。
Comments Accepted at CVPR 2026 (preview; camera-ready in preparation)
Lumosaic:通过主动照明和编码曝光像素实现高光谱视频
机构 * Department of Computer Science, University of Toronto, Canada(计算机科学系,多伦多大学) ; Department of Electrical & Computer Engineering, University of Toronto, Canada(电气与计算机工程系,多伦多大学)
AI总结 Lumosaic通过主动照明和编码曝光像素技术,实现高光谱视频的实时捕捉与高保真重建。
Comments Accepted to CVPR 2026
NESTOR:基于嵌套MOE的神经算子用于大规模PDE预训练
机构 * School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) ; School of Computer Science and Technology, Anhui University, Hefei, China(计算机科学与技术学院,安徽大学,合肥,中国)
AI总结 NESTOR提出基于嵌套MOE框架的神经算子,通过全局与局部依赖性捕捉提升大规模PDE预训练的泛化能力与迁移性能。
Comments Accepted by CVPR 2026
全局感知的边缘优先级化用于姿态图初始化
机构 * Visual Recognition Group, FEE, Czech Technical University in Prague(捷克技术大学布拉格分校视觉识别组) ; Computer Vision and Geometry Group, ETH Zurich(苏黎世联邦理工学院计算机视觉与几何组) ; HUN-REN SZTAKI(匈牙利-人匈牙利科学院)
AI总结 本文提出一种全局感知的边缘优先级化方法,通过图神经网络预测边可靠性,结合多最小生成树构建姿态图,提升稀疏和高速场景下的重建精度。
Comments accepted to CVPR 2026
几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文
机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) ; TeleAI ; MUST
AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。
Comments Accepted by CVPR 2026
DynamicGTR: 利用图拓扑表示偏好提升视觉语言模型在图问答中的能力
机构 * Southern University of Science and Technology(南方科技大学) ; Hong Kong University of Science and Technology(香港理工大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Beihang University(北京航空航天大学)
AI总结 DynamicGTR通过动态选择最优图拓扑表示,提升视觉语言模型在图问答中的零样本性能及跨任务迁移能力。
Comments CVPR 2026
超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准
机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) ; Peking University(北京大学) ; Fudan University(复旦大学)
AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。
Comments 16 pages, 9 figures. Submitted to CVPR 2026
LiREC-Net:一种无需目标且基于学习的激光雷达、RGB和事件校准网络
机构 * RPTU – University Kaiserslautern-Landau(莱茵-威斯法伦大学(科布伦茨-劳埃希恩)) ; DFKI – German Research Center for Artificial Intelligence(德国人工智能研究中心)
AI总结 LiREC-Net是一种基于学习的多传感器校准网络,通过统一框架联合校准激光雷达、RGB和事件数据,提升多传感器融合的精度和效率。
Comments Accepted in CVPR 2026
GeCo-SRT: 基于几何的持续适应用于机器人跨任务仿真到现实迁移
机构 * Beijing Forestry University(北京林业大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部)
AI总结 GeCo-SRT通过几何感知的持续适应方法,实现跨任务仿真到现实迁移的高效和有效适应,提升新任务性能并提高数据效率。
Comments Accepted By CVPR 2026
面向变化的视觉令牌丢弃以加速更大的视觉-语言模型
机构 * Sichuan University(四川大学) ; EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; Zhejiang University(浙江大学)
AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。
Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}
学习关键要素:通过相对误差驱动的样本选择进行优先概念学习
机构 * Mila - Québec AI Institute(魁北克人工智能研究所) ; University of British Columbia(不列颠哥伦比亚大学) ; Université de Montréal(蒙特利尔大学) ; Vector Institute for AI(人工智能矢量研究所) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
AI总结 PROGRESS通过相对误差驱动的样本选择,实现高效视觉-语言模型的指令微调,减少数据和计算需求,提升学习效率和泛化能力。
Comments CVPR 2026
E-comIQ-ZH: 一种用于评估电子商务海报细粒度的对齐人类数据集和基准
机构 * Taobao & Tmall Group, Alibaba Group(淘宝与天猫集团、阿里巴巴集团)
AI总结 E-comIQ-ZH提出了一种针对中文电子商务海报生成的对齐人类评估框架,通过构建多维评分数据集和专家校准的链式推理模型,实现了细粒度的自动化评估。
Comments 21pages, 19figures, accepted by CVPR 2026
VecGlypher: 一种基于语言模型的统一向量图形单元生成方法
机构 * Meta AI
AI总结 VecGlypher通过多模态语言模型直接生成高质量向量图形,无需位图中间步骤,显著提升字体创建效率和可编辑性。
Comments Accepted to CVPR'26. Project page: https://xk-huang.github.io/VecGlypher/
视图合成变换器的扩展
机构 * MIT(麻省理工学院) ; Adobe(Adobe公司)
AI总结 本文提出了一种可扩展的视图合成模型,通过系统研究扩展规律,实现了计算最优的NVS模型,并在减少训练计算的情况下超越了现有最先进方法。
Comments Project page: https://www.evn.kim/research/svsm
Journal ref Conference on Computer Vision and Pattern Recognition (CVPR), 2026
RAYNOVA:在射线空间中实现尺度-时间自回归世界建模
机构 * Applied Intuition ; UC Berkeley(加州大学伯克利分校)
AI总结 RAYNOVA通过双因果自回归框架实现尺度-时间自回归世界建模,在驾驶场景中实现多视角视频生成,具有更高的吞吐量和可控性。
Comments Accepted by CVPR 2026; Project website: https://raynova-ai.github.io/
双曲Busemann神经网络
机构 * University of Trento(特伦托大学) ; MPI-IS(马克斯·普朗克研究所)
AI总结 本文提出双曲Busemann神经网络,通过Busemann函数将MLR和FC层提升到双曲空间,提升图像分类、基因序列学习等任务的有效性和效率。
Comments Accepted to CVPR 2026