arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-22 至 2026-05-22 共收录 14
2605.22816 2026-05-22 cs.RO cs.CV

AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

AwareVLN: 基于自感知的视觉语言导航推理

Wenxuan Guo, Xiuwei Xu, Yichen Liu, Xiangyu Li, Hang Yin, Huangxing Chen, Wenzhao Zheng, Jianjiang Feng, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

AI总结 本文提出AwareVLN框架,通过自感知推理机制实现端到端的视觉语言导航,解决了传统方法在理解代理、指令和场景关系上的不足,并在多个数据集上实现了优于现有方法的性能。

Comments Accepted to CVPR 2026. Project page: https://gwxuan.github.io/AwareVLN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22767 2026-05-22 cs.CV

Synthetic Data Alone is Enough? Rethinking Data Scarcity in Pediatric Rare Disease Recognition

合成数据足够吗?重新思考儿科罕见病识别中的数据稀缺性

Ganlin Feng, Yuxi Long, Erin Lou, Lianghong Chen, Zihao Jing, Pingzhao Hu, Wei Xu

机构 * Western University(西方大学) University of Toronto(多伦多大学)

AI总结 本研究探讨了在儿科罕见病识别中,仅使用合成数据是否足以克服数据稀缺问题,通过实验发现高保真合成数据能模拟临床有意义的分布,从而为遗传咨询提供隐私保护的视觉资源。

Comments CVPR 2026 CV4CHL workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22677 2026-05-22 cs.CV

Slimmable ConvNeXt: Width-Adaptive Inference for Efficient Multi-Device Deployment

Slimmable ConvNeXt: 适用于高效多设备部署的宽度自适应推理

Janek Haberer, Jon Eike Wilhelm, Olaf Landsiedel

机构 * Kiel University(基尔大学) Hamburg University of Technology (TUHH)(汉堡工业大学) UNU-INWEH

AI总结 本文提出Slimmable ConvNeXt,通过训练包含多个嵌套子网络的共享权重集,实现宽度自适应推理,从而在不同资源约束的设备上高效部署模型。该方法利用ConvNeXt的现代设计,如LayerNorm和倒置瓶颈结构,实现了通道宽度压缩,减少了归一化开销,并提供了更简单的训练流程。

Comments Accepted at Mobile AI Workshop 2026 (CVPR'26 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22658 2026-05-22 cs.CV cs.LG cs.MM eess.IV

SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

SegCompass: 探索通过稀疏自编码器实现可解释对齐以增强推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Haoqian Kang, Yan Feng, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(美团,北京) University of Chinese Academy of Sciences(中国科学院大学) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

AI总结 本文提出SegCompass,一种通过稀疏自编码器实现可解释对齐的端到端模型,以提升推理分割的性能和可解释性。

Comments Accepted by CVPR 2026. 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22492 2026-05-22 cs.CV

Training-Free Fine-Grained Semantic Segmentations in Low Data Regimes: A FungiTastic Baseline

无需训练的细粒度语义分割在低数据环境下:一个FungiTastic基线

Sebastian Cavada, Francesco Pelosin, Lapo Faggi

机构 * Covision Lab(Covision实验室)

AI总结 本文提出了一种无需训练的两阶段框架,用于在低数据环境下实现细粒度语义分割,通过宏分类提示生成蘑菇掩码,并利用嵌入空间中的原型匹配进行细粒度标签分配,提高了可扩展性和分割成本。

Comments Accepted at the 13th Workshop on Fine-Grained Visual Categorization, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22455 2026-05-22 cs.CV cs.AI cs.LG physics.optics

Making the Discrete Continuous: Synthetic RAW Augmentations for Fine-Grained Evaluation of Person Detection Performance in Low Light

使离散的成为连续的:合成RAW增强用于细粒度评估人检测性能在低光环境

Valeria Pais, Malena Mendilaharzu, Daniele Faccio, Luis Oala, Christoph Clausen, Bruno Sanguinetti

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

AI总结 本文提出了一种合成RAW增强方法,用于在低光条件下更准确地评估人检测模型的性能,通过生成与相机传感器噪声模型匹配的低光样本,以改善基准测试的数据覆盖。

Comments Accepted non-archival paper at the CVPR 2026 AUTOPILOT Workshop (Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22269 2026-05-22 cs.CV cs.AI cs.MM

MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering

MuKV:多粒度KV缓存压缩用于长流视频问答

Junbin Xiao, Jiajun Chen, Tianxiang Sun, Xun Yang, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MuKV,一种多粒度KV缓存压缩方法,通过半分层检索方法提升长流视频问答的效率和准确性,实验表明其在答案准确率、内存使用和在线问答效率方面均优于基线方法。

Comments To appear at CVPR'26. Code is available at https://github.com/IMBALDY/MuKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07603 2026-05-22 cs.CV

UIKA: Fast Universal Head Avatar from Pose-Free Images

UIKA:从无姿态图像快速生成通用头身模型

Zijian Wu, Boyao Zhou, Liangxiao Hu, Hongyu Liu, Yuan Sun, Xuan Wang, Xun Cao, Yujun Shen, Hao Zhu

机构 * Nanjing University(南京大学) Ant Group(蚂蚁集团) HKUST(香港科技大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出UIKA,一种从任意数量的无姿态输入(包括单张图像、多视角捕捉和手机拍摄视频)生成可动画的高斯头身模型。与传统头身模型不同,UIKA通过模型表示、网络设计和数据准备重新思考任务,引入了UV引导的头身建模策略,设计了可学习的UV标记,并通过聚合所有输入视角的UV信息解码为标准高斯属性。

Comments CVPR 2026 Highlight. Code: https://github.com/ant-research/UIKA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20538 2026-05-22 cs.CV

AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment

AlignPose: 通过多视角特征-度量对齐实现通用的6D位姿估计

Anna Šárová Mikeštíková, Médéric Fourmy, Martin Cífka, Josef Sivic, Vladimir Petrik

机构 * Czech Institute of Informatics, Robotics and Cybernetics(捷克信息学、机器人学与控制学研究院) Czech Technical University in Prague(布拉格捷克技术大学)

AI总结 本文提出AlignPose,一种无需特定对象训练或对称标注的多视角6D位姿估计方法,通过多视角特征-度量细化优化单一一致的世界坐标系位姿,实验表明其在六个数据集上优于其他方法,尤其在工业数据集上表现突出。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20785 2026-05-22 cs.CV

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

LongVT: 通过原生工具调用激励'通过长视频思考'

Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

AI总结 本文提出LongVT,一种端到端的代理框架,通过交错的多模态工具链式思考实现'通过长视频思考',通过利用LMM的固有时间定位能力作为原生视频裁剪工具,以解决长视频推理中的幻觉问题,并通过VideoSIAH数据集提升训练和评估效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22017 2026-05-22 cs.CV

Diverse Yet Consistent: Context-Guided Diffusion with Energy-Based Joint Refinement for Multi-Agent Motion Prediction

多样且一致:基于能量的联合细化的上下文引导扩散用于多智能体运动预测

Lei Chu, Yuhuan Zhao

机构 * University of Southern California(南加州大学)

AI总结 本文提出了一种基于扩散的框架,通过利用历史轨迹中的丰富上下文信息来改进多智能体运动预测,通过引导机制增强预测动作的多样性和表达性,并引入基于能量的公式来细化联合轨迹分布,同时保持个体轨迹的合理性,实验表明该方法在多个基准数据集上均优于现有方法。

Comments MEIS-- CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21869 2026-05-22 cs.CV cs.AI cs.HC

Two-Stage Multimodal Framework for Emotion Mimicry Intensity Prediction

双阶段多模态框架用于情感模仿强度预测

Dinithi Dissanayake, Shaveen Silva, Ovindu Atukorala, Prasanth Sasikumar, Suranga Nanayakkara

机构 * Augmented Human Lab, National University of Singapore, Singapore(新加坡国立大学增强人类实验室) University of Moratuwa, Sri Lanka(斯里兰卡穆拉图瓦大学)

AI总结 本文提出了一种双阶段多模态框架,用于从真实视频片段中预测六个连续情绪强度维度,通过结合文本、音频和视觉表示,并可选运动分支,提供了一个实用且可复现的基线。

Comments 10th Affective & Behavior Analysis in-the-wild, CVPR Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21625 2026-05-22 cs.CV cs.AI cs.CL

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

Flat-Pack Bench: 通过家具组装评估大视觉-语言模型的时空理解

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) MBZUAI(麦吉尔-伯克利-浙江大学人工智能研究院) UC Berkeley(伯克利大学)

AI总结 本文提出Flat-Pack Bench基准,用于评估大视觉-语言模型在复杂视频场景中的时空理解能力,发现当前模型在细粒度时空推理上存在显著不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01760 2026-05-22 cs.CV

MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement

MagicFuse: 单图像融合用于视觉与语义增强

Hao Zhang, Yanping Zha, Zizhuo Li, Meiqi Gong, Jiayi Ma

机构 * Electronic Information School, Wuhan University, China(武汉大学电子信息学院) Suzhou Institute of Wuhan University, China(武汉大学苏州研究院) School of Automation, Wuhan University, China(武汉大学自动化学院)

AI总结 本文提出MagicFuse单图像融合框架,通过扩散模型生成跨光谱场景表示,实现视觉与语义的双重约束,实验表明其性能优于多模态融合方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏