arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-07 至 2026-07-07 共收录 96
2510.17801 2026-07-07 cs.RO cs.CV 版本更新

Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

Robobench:作为具身大脑的多模态大语言模型的综合评估基准

Yulin Luo, Chun-Kai Fan, Menghang Dong, Jiayu Shi, Xiangju Mi, Mengdi Zhao, Bo-Wen Zhang, Cheng Chi, Jiaming Liu, Gaole Dai, Rongyu Zhang, Ruichuan An, Kun Wu, Zhengping Che, Shaoxuan Xie, Guocai Yao, Zhongxia Zhao, Pengwei Wang, Guang Liu, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) University of Science and Technology Beijing(北京科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24181 2026-07-07 cs.CV 版本更新

Combining Discrepancy-Confusion Uncertainty and Calibration Diversity for Active Fine-Grained Image Classification

结合差异-混淆不确定性和校准多样性用于主动细粒度图像分类

Yinghao Jin, Xi Yang

机构 * Jilin University(吉林大学)

AI总结 研究针对细粒度图像分类中可靠评估样本信息难的问题,提出DECERN方法,结合差异-混淆不确定性和校准多样性来衡量样本信息,经加权聚类和校准多样性,提升主动学习性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12046 2026-07-07 cs.CV cs.AI 版本更新

Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking

通过结构化掩码的布局条件自回归文本到图像生成

Zirui Zheng, Takashi Isobe, Tong Shen, Xu Jia, Jianbin Zhao, Xiaomin Li, Mengmeng Ge, Baolu Li, Qinghe Wang, Haiwen Diao, Dong Li, Dong Zhou, Yunzhi Zhuge, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices Inc.(超威半导体公司) Dalian University of Technology(大连理工大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

AI总结 提出SMARLI框架,通过结构化掩码策略将布局约束注入自回归生成过程,并采用GRPO后训练缓解曝光偏差,实现高质量布局控制图像生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23102 2026-07-07 eess.IV cs.CV 版本更新

Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation

区域感知多模态大语言模型:基于慢快标记化与伪掩码引导的3D CT报告生成

Sunggu Kyung, Jinyoung Seo, Hyunseok Lim, Dongyeong Kim, Hyungbin Park, Jimin Sung, Jihyun Kim, Wooyoung Jo, Yoojin Nam, Namkug Kim

机构 * Department of Convergence Medicine, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院融合医学系) University of Ulsan College of Medicine, Seoul, Republic of Korea(韩国首尔蔚山大学医学院) Department of Radiology and Research Institute of Radiology, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院放射科与放射学研究所)

AI总结 提出MedRegion-CT框架,通过区域慢快标记器联合建模全局与细粒度信息、伪掩码引导关注诊断关键区域、结构化病变信息提示,实现高质量CT报告生成,在多项指标上达到最优。

Comments Accepted to ECCV 2026. 15 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09484 2026-07-07 cs.CV 版本更新

Purify then Guide: Rethinking Domain Generalization for Multimodal Face Anti-Spoofing

净化然后引导:重新思考多模态人脸反欺骗的领域泛化

Yingjie Ma, Xun Lin, Zitong Yu, Haonan Wang, Ruixin Zhang, Shouhong Ding, Xin Liu, Xiaochen Yuan, Weicheng Xie, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息科技学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息处理重点实验室) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室) Tencent Youtu Lab(腾讯优图实验室) School of Psychology, Shanghai Jiao Tong University(上海交通大学心理学院) Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究多模态人脸反欺骗中领域泛化问题,提出MMDA框架,利用CLIP零样本泛化能力,通过去噪和对齐机制提升跨模态对齐泛化性能,含多个模块及策略,实验表明优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.14019 2026-07-07 cs.CV cs.AI cs.HC cs.LG 版本更新

Domain Knowledge-Informed Self-Supervised Representations for Workout Form Assessment

用于健身动作形式评估的领域知识驱动自监督表示

Paritosh Parmar, Amol Gharat, Helge Rhodin

机构 * University of British Columbia(不列颠哥伦比亚大学) FlexAI Inc.(FlexAI公司)

AI总结 研究健身动作形式评估问题,提出基于领域知识的自监督方法,利用动作谐波运动及多因素差异学习强大表示,创建新数据集,实验表明自监督表示优于现有方法且可用于其他领域。

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏