arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Computer Vision · 会议 · Computer Vision

2026-02-03 至 2026-02-03 共收录 4
2507.16403 2026-02-03 cs.CV

ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering

ReasonVQA: 一个带有结构知识的多跳推理问答基准数据集

Duong T. Tran, Trung-Kien Tran, Manfred Hauswirth, Danh Le Phuoc

机构 * Bosch Center for AI(博世人工智能中心) Technical University of Berlin(柏林技术大学) Fraunhofer FOKUS(弗劳恩霍夫研究所)

AI总结 ReasonVQA是一个结合结构知识的多跳推理问答基准数据集,通过生成复杂问题挑战现有VQA模型,推动领域发展。

Comments Accepted at the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00618 2026-02-03 cs.CV

Tune-Your-Style: Intensity-tunable 3D Style Transfer with Gaussian Splatting

Tune-Your-Style: 可调强度的3D风格迁移与高斯点散布

Yian Zhao, Rushi Ye, Ruochong Zheng, Zesen Cheng, Chaoran Feng, Jiashu Yang, Pengchong Qiao, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(电子与计算机工程学院,北京大学深圳校区) Pengcheng Laboratory, Shenzhen, China(鹏城实验室) AI for Science (AI4S)-Preferred Program, Peking University Shenzhen Graduate School, China(人工智能科学(AI4S)优选计划,北京大学深圳研究生院) Department of Automation and BNRist, Tsinghua University, Beijing, China(自动化系和BNRist,清华大学,北京,中国) Dalian University of Technology, China(大连理工大学)

AI总结 Tune-Your-Style通过可调强度的3D风格迁移方法,实现灵活的内容-风格平衡,提升3D风格迁移的定制性。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15388 2026-02-03 cs.CV cs.AI cs.CL

LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型

Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

机构 * UCF(佛罗里达大学) UW-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) UIC(伊利诺伊大学香槟分校)

AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。

Comments Accepted to ICCV 2025. First Version is released in 2024/03

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00108 2026-02-03 cs.CV cs.AI

SITUATE -- Synthetic Object Counting Dataset for VLM training

SITUATE -- 合成物体计数数据集用于视觉语言模型训练

René Peinl, Vincent Tischler, Patrick Schröder, Christian Groth

AI总结 SITUATE是一个用于训练视觉语言模型计数任务的数据集,通过控制遮挡和空间组成,提升模型对非分布图像的泛化能力。

Comments accepted at 21st International Conference on Computer Vision Theory and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏