arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-28 至 2026-04-28 共收录 37
2603.14882 2026-04-28 cs.CV

LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models

LLMind: 基于生物启发的无训练自适应视觉表示用于视觉-语言模型

Soumyaratna Debnath, Bui Duc Manh, Zinan Liu, Lin Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 LLMind通过生物启发的自适应采样策略,实现视觉-语言模型在有限像素预算下的高效自适应表示,实验显示在多个基准测试中性能显著提升。

Comments CVPR 2026, Highlight, 10 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19035 2026-04-28 cs.CV

OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness

OpenVO:具有时间动态意识的开放世界视觉里程计

Phuc D. A. Nguyen, Anh N. Nhu, Ming C. Lin

机构 * University of Maryland, College Park, USA(马里兰大学帕克分校)

AI总结 OpenVO通过时间动态信息编码和3D几何先验,提升在有限输入条件下对单目行车记录仪视频的现实尺度自我运动估计,实现鲁棒轨迹数据集构建。

Comments Main paper CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22177 2026-04-28 cs.LG cs.CV

Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage

通过REINFORCE与James-Stein收缩设计实例级采样计划

Peiyu Yu, Suraj Kothawade, Sirui Xie, Ying Nian Wu, Hongliang Fei

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) UCLA(加州大学洛杉矶分校)

AI总结 本文提出通过REINFORCE学习实例级采样计划,结合James-Stein收缩估计器提升高维策略学习的梯度估计精度,实现文本图像对齐和生成质量提升。

Comments CVPR 2026; 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00956 2026-04-28 cs.CV

RefTon: Reference person shot assist virtual Try-on

RefTon:参考人物辅助虚拟试穿

Liuzhuozheng Li, Yue Gong, Shanyuan Liu, Dengyang Jiang, Zanyi Wang, Bo Cheng, Yuhang Ma, Leibucha Wu, Dawei Leng, Yuhui Yin

机构 * The University of Tokyo(东京大学) AI Research(360AI研究院) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 RefTon提出一种基于流的人到人的虚拟试穿框架,通过无配对视觉参考提升服装真实感,无需复杂辅助输入或结构引导,利用额外参考图像优化纹理对齐和服装细节。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10113 2026-04-28 cs.CV

ImmerIris: A Large-Scale Dataset and Benchmark for Off-Axis and Unconstrained Iris Recognition in Immersive Applications

ImmerIris:用于沉浸式应用中非轴向和无约束虹膜识别的大型数据集和基准

Yuxi Mi, Qiuyang Yuan, Zhizhou Zhong, Xuan Zhao, Jiaogen Zhou, Fubao Zhu, Jihong Guan, Shuigeng Zhou

机构 * Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理关键实验室) Fudan University(复旦大学) Huaiyin Normal University(淮阴师范学院) Zhengzhou University of Light Industry(郑州轻工业学院) Tongji University(同济大学)

AI总结 本文提出ImmerIris数据集,包含546名受试者499,791张虹膜图像,是目前最大的公开虹膜数据集,用于评估沉浸式应用中的虹膜识别系统,提出无预处理的虹膜识别方法,提升了识别鲁棒性。

Comments CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26158 2026-04-28 cs.CV cs.AI

Towards Continual Expansion of Data Coverage: Automatic Text-guided Edge-case Synthesis

迈向数据覆盖的持续扩展:自动文本引导的边缘案例合成

Kyeongryeol Go

机构 * Superb AI Seoul, South Korea(首尔超凡AI研究所,韩国)

AI总结 本文提出自动文本引导的边缘案例合成方法,通过预训练语言模型生成多样化提示,提升模型鲁棒性,优于传统增强方法。

Comments Accepted in CVPR 2026 Workshop on How Do Vision Models Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04468 2026-04-28 cs.CV

NVILA: Efficient Frontier Visual Language Models

NVILA:高效的前沿视觉语言模型

Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Vishwesh Nath, Jinyi Hu, Sifei Liu, Ranjay Krishna, Daguang Xu, Xiaolong Wang, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, Yao Lu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Tsinghua University(清华大学)

AI总结 NVILA通过'缩放后再压缩'方法提升效率与准确性,降低训练和推理成本,适用于高分辨率图像和长视频处理。

Comments CVPR 2025. Project page: https://z-lab.ai/projects/nvila/

详情

展开后加载摘要…

URL PDF HTML 收藏