MacTok: Robust Continuous Tokenization for Image Generation
MacTok: 图像生成中的鲁棒连续分词
机构 * Fudan University(复旦大学)
AI总结 MacTok通过引入图像掩码和表征对齐,防止后验崩溃,实现高效且高保真的连续分词,仅需64或128个token,在ImageNet上取得优异成绩。
Journal ref CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
MacTok: 图像生成中的鲁棒连续分词
机构 * Fudan University(复旦大学)
AI总结 MacTok通过引入图像掩码和表征对齐,防止后验崩溃,实现高效且高保真的连续分词,仅需64或128个token,在ImageNet上取得优异成绩。
Journal ref CVPR 2026
一种可证明的能量引导测试时间防御提升大视觉-语言模型的对抗鲁棒性
机构 * OmnAI Lab, Computer Science Department, Sapienza University of Rome, Italy(罗马大学计算机科学系OmnAI实验室,意大利) ; Weizmann Institute of Science, Israel(魏茨曼科学研究所,以色列)
AI总结 本文提出ET3,一种轻量且无需训练的防御方法,通过最小化输入样本的能量提升模型鲁棒性,实验显示其在分类和提升大视觉-语言模型鲁棒性方面表现优异。
Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Main Conference
SafeDrive: 为稀疏世界中的端到端驾驶进行细粒度安全推理
机构 * Seoul National University(首尔大学)
AI总结 SafeDrive提出了一种端到端规划框架,通过轨迹条件化的稀疏世界模型进行显式且可解释的安全推理,实现了在开放循环和闭合循环基准上的最佳性能,有效降低了碰撞率。
Comments Accepted to CVPR 2026, 19 pages, 9 figures
ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Southeast University(东南大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; National University of Singapore(新加坡国立大学) ; Wuhan AI Research(武汉人工智能研究院) ; Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)
AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。
Comments Accepted to CVPR 2026
SIMPACT:基于视觉-语言模型的仿真增强动作规划
机构 * UMD(马里兰大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Harvard(哈佛大学) ; Amazon FAR(亚马逊FAR) ; UPenn(宾夕法尼亚大学)
AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。
Comments Accepted to CVPR 2026; camera-ready version
量化与统一自适应蒸馏用于在边缘设备上实现多LoRA基于的通用生成视觉模型
机构 * Samsung Research Institute Bangalore, India(三星研究所班加罗尔,印度)
AI总结 本文提出统一框架,通过单共享模型在边缘设备上实现多任务生成式AI推理,采用动态任务切换和QUAD量化策略,减少内存占用和延迟,保持高质量生成效果。
Comments Accepted at the Mobile AI Workshop, CVPR 2026
VecAttention: 向量级稀疏注意力用于加速长上下文推理
机构 * SCS, Peking University(北京大学计算机科学技术学院) ; Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) ; Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出VecAttention,一种向量级稀疏注意力框架,通过动态选择信息向量提升视频模型的精度与效率,实测在视频理解和生成任务中比全注意力快2.65倍,比现有稀疏注意力方法快1.83倍且精度相当。
Comments Accepted at CVPR 2026
看到证据,却错失答案:基于工具引导的视觉语言模型在视觉错觉中的应用
机构 * Wayne State University(韦恩州立大学) ; University of Michigan(密歇根大学)
AI总结 本文提出一种工具引导的推理框架,通过通用图像处理工具和提示系统,解决视觉语言模型在处理视觉错觉时的系统性偏差问题,并展示其在不同结构错觉变体上的跨结构泛化能力。
Comments CVPR 2026 DataCV Workshop, code: https://github.com/Davidxswang/cvpr_2026_datacv_submission
AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)
AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。
Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}
Extend3D:城镇级3D生成
机构 * Seoul National University(首尔国立大学)
AI总结 本文提出Extend3D,一种无需训练的3D场景生成方法,通过扩展潜在空间并结合SDEdit实现3D补全与优化。
Comments CVPR 2026, Project Page: http://seungwoo-yoon.github.io/extend3d-page
基于大语言模型的运动轨迹生成与验证的自一致性
机构 * Stanford University(斯坦福大学)
AI总结 本文提出利用自一致性技术提升大语言模型生成运动轨迹的准确性,通过聚类和几何变换实现轨迹的一致性验证,提升生成精度4-6%并验证精度11%。
Comments Accepted to CVPR 2026
MotionScale:通过可扩展的4D高斯点划法重建动态场景的外观、几何和运动
机构 * National University of Singapore(新加坡国立大学)
AI总结 本文提出MotionScale框架,通过可扩展的4D高斯点划法实现动态场景的高保真重建,解决复杂环境中3D几何和时间一致运动的恢复问题。
Comments Accepted to CVPR 2026
通过视觉记忆机制扩展多模态大语言模型的长视频理解
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) ; National University of Defense Technology(国防科技大学)
AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。
Comments CVPR 2026
扩散心理平均
机构 * VISTEC(泰国威斯泰克科学技术研究院)
AI总结 本文提出扩散心理平均(DMA),通过在扩散模型语义空间内平均生成样本,解决传统方法在生成相同提示下的模糊问题,实现一致且逼真的概念平均。
Comments CVPR 2026. Project page: https://diffusion-mental-averages.github.io/
SLVMEval: 合成元评估基准用于文本到长视频生成
机构 * Tohoku University(东北大学) ; LY Corporation
AI总结 本文提出SLVMEval基准,用于元评估文本到视频系统,通过合成降质视频对评估系统在长视频质量评估中的可靠性,实验显示人类评估准确率高于现有系统。
Comments Accepted to CVPR 2026
基于特征高斯点云的层次视觉重定位
机构 * Southern University of Science and Technology(南方科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 本文提出SplatHLoc框架,利用特征高斯点云进行层次视觉重定位,通过自适应视角检索和混合特征匹配提升重定位精度与鲁棒性。
Comments Accepted to CVPR 2026
双不平衡持续学习用于现实世界的食物识别
机构 * University of Michigan(密歇根大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
AI总结 本文提出DIME框架,解决持续学习中食物类别样本不平衡与新增类别数量不平衡问题,通过轻量适配器和谱合并策略提升效率,实验显示性能提升超3%。
Comments Accepted to 3rd MetaFood at CVPR 2026. Code is available at https://github.com/xiaoyanzhang1/DIME
隐式神经表示中噪声预训练的意外有效性
机构 * Rice University(莱斯大学) ; University of California, Riverside(加州大学河滨分校)
AI总结 本文通过噪声预训练探索隐式神经表示的特性,发现无结构噪声预训练显著提升信号拟合能力,但对去噪效果不佳,而经典自然图像频谱结构的噪声则在信号拟合与逆向成像间取得平衡。
Comments Accepted to CVPR 2026. Project page: https://kushalvyas.github.io/noisepretraining.html
MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成
机构 * University of North Texas(北德克萨斯大学)
AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT
时空神经帧建模用于高分辨率脑动态研究
机构 * Fudan University(复旦大学) ; Southern University of Science and Technology(南方科技大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出一种基于EEG条件的框架,用于高保真重建动态fMRI,通过引入空域中间帧重建解决采样不规则问题,提升时空连续性与应用性。
Comments CVPR 2026
Points-to-3D: 基于点云先验的结构感知3D生成
机构 * Australian Institute for Machine Learning, University of Adelaide, Australia(澳大利亚阿德莱德大学澳大利亚机器学习研究所)
AI总结 本文提出Points-to-3D框架,利用点云先验生成可控的3D资产和场景,通过结构修复网络和分阶段采样策略提升几何精度和渲染质量。
Comments Accepted by CVPR 2026
ArtLLM: 通过3D语言模型生成拟合资产
机构 * ShanghaiTech University(上海科技大学) ; Tencent Hunyuan(腾讯混元) ; HKUST(香港科技大学)
AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。
Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/
可信神经辐射场
机构 * Yale University(耶鲁大学)
AI总结 本文提出可信神经辐射场,通过单次前向传递直接量化aleatoric和epistemic不确定性,提升三维场景建模的可靠性与精度。
Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026
通过半监督率减少实现多模态表示学习的通用类别发现
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)
AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。
Comments 15 pages, accepted by CVPR 2026
MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; ByteDance(字节跳动) ; Tianjin University of Science and Technology(天津科技大学)
AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。
Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/
MovieRecapsQA: 一种多模态开放式视频问答基准
机构 * Cornell University(康奈尔大学)
AI总结 本文提出MovieRecapsQA基准,通过电影回顾视频生成8200个开放式问题及事实,构建无参考评估指标,评估多模态能力,发现视觉感知是主要瓶颈。
Comments CVPR 2026
通过自身内部动态引导扩散变换器
机构 * University of Electronic Science and Technology of China(电子科技大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-sen University(中山大学) ; North China Institute of Computer Systems Engineering(华北计算机系统工程研究所)
AI总结 本文提出内部引导策略,通过训练过程中中间层的辅助监督和采样时的中间层输出扩展,提升训练效率和生成质量,在ImageNet上取得显著效果。
Comments Accepted to CVPR 2026. Project Page: https://zhouxingyu13.github.io/Internal-Guidance/
EMMA:具有综合语义度量和多样类别的概念擦除基准
机构 * The University of Osaka(大阪大学)
AI总结 EMMA通过13项指标评估五种概念擦除方法,揭示其在隐含提示和视觉相似非目标概念下的鲁棒性问题,发现部分方法加剧性别和种族偏见。
Comments Accepted by CVPR 2026
更强的无归一化变换器
机构 * Princeton University(普林斯顿大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出Derf函数,通过大规模搜索找到更有效的归一化替代方案,其在视觉识别、语音表示和DNA序列建模中均优于LayerNorm、RMSNorm和DyT。
Comments Published in CVPR 2026
可解释且可操控的概念瓶颈稀疏自编码器
机构 * University of California, San Diego(加州大学圣迭戈分校) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
AI总结 本文提出CB-SAE框架,通过剪枝低效神经元和增加概念瓶颈提升LVLMs和图像生成任务的可解释性和可操控性,效果提升分别为32.1%和14.5%。
Comments CVPR 2026