arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-22 至 2026-07-22 共收录 4
2606.26615 2026-07-22 cs.CV eess.IV 版本更新

TaskTok: Delving into Task Tokens for Task-driven Image Restoration

TaskTok: 深入探究任务驱动图像恢复中的任务令牌

Hongjae Lee, Sojung Kang, Jaeseong Yu, Seung-Won Jung

机构 * Korea University(高丽大学)

AI总结 提出TaskTok框架,通过可学习的令牌开关和轻量级令牌细化模块选择性恢复任务相关令牌,在提升下游任务性能的同时保持高计算效率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11704 2026-07-22 cs.CV 版本更新

ScaleMoGen: Autoregressive Next-Scale Prediction for Human Motion Generation

ScaleMoGen:基于人类动作生成的自回归多尺度预测

Inwoo Hwang, Hojun Jang, Bing Zhou, Jian Wang, Young Min Kim, Chuan Guo

机构 * Seoul National University(首尔国立大学) Snap Inc.(Snap公司) Meta Reality Labs(Meta现实实验室)

AI总结 ScaleMoGen提出了一种多尺度自回归框架,通过自回归预测生成动作,实现了更精细的动作生成,同时在HumanML3D和SnapMoGen数据集上取得最佳性能。

Comments Accepted to ECCV 2026. Project page: https://inwoohwang.me/ScaleMoGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15280 2026-07-22 cs.CV cs.AI 版本更新

Why Do Vision Language Models Struggle To Recognize Human Emotions?

为什么视觉语言模型难以识别人类情绪?

Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara, Steven McDonagh

机构 * The University of Edinburgh, UK(爱丁堡大学)

AI总结 本文探讨视觉语言模型在识别人类情绪上的不足,指出面部表情识别任务的连续性和动态性导致模型存在连续性和时间信息处理的漏洞,提出改进采样策略和多阶段上下文增强方法以提升情绪识别能力。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏