VGGT-$Ω$
VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据
机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) ; Meta AI
AI总结 VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据。
Comments CVPR 2026 (Oral)
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据
机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) ; Meta AI
AI总结 VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据。
Comments CVPR 2026 (Oral)
AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) ; Stanford University(斯坦福大学) ; University of Central Florida(佛罗里达中央大学) ; University of Surrey(萨里大学)
AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。
Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026
基于自监督的多尺度预测用于场景文本识别
机构 * Nankai University(南开大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Department of Automation and BNRist, Tsinghua University(清华大学自动化系和清华大学脑科学与智能技术研究院)
AI总结 本文提出MNSP框架,通过跨尺度结构演化建模提升场景文本识别性能,实现86.2%的Union14M基准准确率。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 Findings Track.10 pages, 4 figures
SuperADD: 无需训练的类无关异常分割 -- CVPR 2026 VAND 4.0 工业赛道挑战
机构 * Fraunhofer IOSB(弗劳恩霍夫智能系统研究所)
AI总结 本文提出无需训练的类无关异常分割方法,通过改进鲁棒性以应对分布偏移,适用于工业场景,实现MVTec AD 2数据集上的高F1分数。
Comments Technical report for the CVPR 2026 VAND 4.0 workshop challenge industrial track
StyleTextGen: 多语言场景文本生成的风格条件化方法
机构 * Nankai University(南开大学) ; University of Trento(特伦特大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
AI总结 本文提出StyleTextGen框架,解决多语言场景文本生成中风格提取与一致性维持问题,通过双分支编码器、一致性损失和掩码引导推理策略提升生成质量。
Comments This paper has been accepted to CVPR 2026
连接大脑与语义:一种用于语义增强的fMRI到视频重建的分层框架
机构 * Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团) ; Ant Group(蚂蚁集团)
AI总结 本文提出CineNeuron框架,通过分层结构解决fMRI信号与视频内容间的语义鸿沟问题,结合底部向上语义丰富和顶部向下记忆整合,提升视频重建效果。
Comments Accepted to CVPR 2026
VerbalValue:面向销售驱动直播电商的社会智能虚拟主持人
机构 * Cornell University(康奈尔大学)
AI总结 本文提出VerbalValue,一种以销售转化为导向的虚拟主持人,通过构建产品知识库和销售术语词典,结合大语言模型微调,提升直播电商中的信息传达和说服力。
Comments Accepted to the CVPR 2026 HiGen Workshop
CoReDiT:基于空间一致性引导的令牌剪枝与重建用于高效的扩散变换器
机构 * Qualcomm AI Research(高通人工智能研究)
AI总结 CoReDiT通过空间一致性引导的令牌剪枝与重建,显著降低扩散变换器的计算量,提升推理速度,同时保持高质量视觉输出。
Comments 8 pages, 8 figures, CVPR workshop
Journal ref 2026 CVPR Workshop of EDGE
多模态多智能体推理的分层攻击
AI总结 本文提出HAM³框架,通过感知、通信、推理三层分层攻击,评估多智能体系统在不同推理范式下的攻击成功率,揭示多模态多智能体系统的安全漏洞。
Comments Accepted to CVPR 2026
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
解耦稳定性与可塑性以实现多模态测试时适应
机构 * Zhejiang University(浙江大学)
AI总结 本文提出DASP框架,通过解耦多模态测试时适应中的稳定性与可塑性,解决现有方法在无偏模态中的负迁移和有偏模态中的灾难性遗忘问题。
Comments Accepted to CVPR 2026
多模态因果驱动表示学习用于通用化医学图像分割
机构 * City University of Hong Kong(香港城市大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所) ; UESTC(电子科技大学) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
AI总结 本文提出MCDRL框架,结合因果推理与VLM解决医学图像分割的领域泛化问题,通过文本提示识别病变区域并消除领域特定影响,提升分割准确性与泛化能力。
Comments Accepted by CVPR 2026
重新审视模型反向评估:从误导性标准到可靠的隐私评估
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; University of Maryland College Park(马里兰大学学院公园分校)
AI总结 本文重新审视模型反向攻击的评估框架,揭示其存在虚假正例问题,并提出基于大规模语言模型的新评估方法以提升隐私评估的可靠性。
Comments Accepted to CVPR Findings 2026
TeDiO:基于时间对角优化的训练自由一致视频扩散
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Futurewei Technologies Inc(未来科技有限公司) ; UCSD(加州大学圣迭戈分校)
AI总结 TeDiO通过优化内部注意力模式提升视频生成的时序一致性,无需训练或外部监督,实现更流畅的动态表现。
Comments CVPR'26 Workshop on Agentic AI for Visual Media
SToRe3D:ViTs中稀疏令牌相关性用于高效多视角3D目标检测
机构 * University of Toronto(多伦多大学) ; Zoox Inc(Zoox公司)
AI总结 SToRe3D通过联合选择2D图像令牌和3D目标查询,实现高效多视角3D目标检测,在nuScenes和新基准上达到3倍加速,保持精度。
Comments Accepted to CVPR 2026
受限数据下的掩码自编码器:它有效吗?一项细粒度生物声学案例研究
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
AI总结 本文研究了在有限数据下使用掩码自编码器进行生物声学分类的效果,发现预训练数据规模在中等规模细粒度任务中起主导作用,而领域特定数据的额外预训练可能降低性能。
Comments Workshop on Fine-Grained Visual Categorization (FGVC) at CVPR 2026. 8 pages, 6 figures
快速且稳健的网格简化用于生成和现实世界的3D资产
AI总结 本文提出了一种针对现代3D资产的全面网格简化流程,通过引入新的多项式误差公式,实现了快速且稳健的网格简化,保留精细几何结构和高质量外观,适用于大规模真实世界数据集。
Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshop on 3D Geometry Generation for Scientific Computing (3D4S) 2026 (Best Paper Award Runner-up)
Realiz3D: 通过领域感知学习实现逼真3D生成
机构 * Technion(技术学院) ; Meta AI
AI总结 Realiz3D通过分离控制信号与视觉领域,提升生成图像的逼真度和3D一致性,适用于文本到多视角生成和3D输入纹理生成。
Comments Accepted to CVPR 2026. Project page: https://idosobol.github.io/realiz3d/