TaskTok: Delving into Task Tokens for Task-driven Image Restoration
TaskTok: 深入探究任务驱动图像恢复中的任务令牌
机构 * Korea University(高丽大学)
AI总结 提出TaskTok框架,通过可学习的令牌开关和轻量级令牌细化模块选择性恢复任务相关令牌,在提升下游任务性能的同时保持高计算效率。
Comments ECCV 2026
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
TaskTok: 深入探究任务驱动图像恢复中的任务令牌
机构 * Korea University(高丽大学)
AI总结 提出TaskTok框架,通过可学习的令牌开关和轻量级令牌细化模块选择性恢复任务相关令牌,在提升下游任务性能的同时保持高计算效率。
Comments ECCV 2026
ScaleMoGen:基于人类动作生成的自回归多尺度预测
机构 * Seoul National University(首尔国立大学) ; Snap Inc.(Snap公司) ; Meta Reality Labs(Meta现实实验室)
AI总结 ScaleMoGen提出了一种多尺度自回归框架,通过自回归预测生成动作,实现了更精细的动作生成,同时在HumanML3D和SnapMoGen数据集上取得最佳性能。
Comments Accepted to ECCV 2026. Project page: https://inwoohwang.me/ScaleMoGen
为什么视觉语言模型难以识别人类情绪?
机构 * The University of Edinburgh, UK(爱丁堡大学)
AI总结 本文探讨视觉语言模型在识别人类情绪上的不足,指出面部表情识别任务的连续性和动态性导致模型存在连续性和时间信息处理的漏洞,提出改进采样策略和多阶段上下文增强方法以提升情绪识别能力。
Comments European Conference on Computer Vision (ECCV) 2026
阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准
机构 * Turing Inc.(Turing公司) ; The University of Tokyo(东京大学) ; Institute of Science Tokyo(东京科学研究院) ; Tohoku University(东北大学)
AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。
Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/
BrainFIBRE:基于信息分解的脑微结构基础模型
机构 * National University of Singapore(新加坡国立大学)
AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。
Comments ECCV 2026. Author name corrected in V2
H-Adapter: 通过注意力导出的源对齐头发掩码实现姿态鲁棒的发型迁移
机构 * SNOW Corp.(SNOW公司)
AI总结 提出H-Adapter,利用区域特定损失解耦头发与非头发目标,导出源对齐头发编辑掩码引导扩散修复,实现大姿态差异下的鲁棒发型迁移,在FID、FID_CLIP和CLIP-I指标上取得最优。
Comments Accepted at ECCV 2026. Project page: https://sanghunpark.github.io/hadapter_page/
曲率自适应一致性流匹配:基于强化学习的自主轨迹优化
机构 * Tsinghua University(清华大学)
AI总结 提出曲率自适应一致性流匹配(CACFM),利用强化学习代理动态构建效率导向课程,优先处理关键区域,在FLUX和SDXL等大规模模型上实现最先进结果,极少数步下保持高视觉保真度。
Comments Accepted by ECCV 2026
NaP-Control: 为多功能和快速字符控制导航扩散先验
机构 * ETH Zurich(苏黎世联邦理工学院)
AI总结 本文提出NaP-Control方法,通过强化学习操控任务无关的扩散策略先验的潜在噪声,实现快速、鲁棒且高保真的字符控制,同时通过环境交互优化任务奖励,提升成功率并适应挑战性场景。
Comments ECCV 2026. Project page: https://chiawenchen.github.io/nap-control-project/
GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; Huawei(华为)
AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。
Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/
IoUCert: 基于锚点的目标检测器鲁棒性验证
AI总结 IoUCert通过改进的坐标变换和区间边界传播方法,首次实现了对基于锚点的目标检测模型在多种输入扰动下的鲁棒性验证。
Comments ECCV 2026
音频视觉持续测试时间适应无需遗忘
AI总结 本文提出AVReCAP方法,在测试时无需源数据即可提升模型性能,通过动态检索最佳融合层参数减少灾难性遗忘。
Comments ECCV 2026 & ICML 2026 Workshop Continual Adaptation at Scale: Towards Sustainable AI
利用全局和局部语义重新绑定潜在信息以进行纠缠扩散
机构 * University of West Attica(西阿提卡大学) ; VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学)
AI总结 研究针对潜在扩散模型语义监督不足问题,提出REGLUE框架,联合建模VAE图像潜在信息、局部VFM语义和全局[CLS]令牌,用轻量级卷积语义压缩器聚合特征,经实验验证该框架能提升FID并加速收敛。
Comments ECCV 2026
OmniX:从统一全景生成与感知到适用于图形的3D场景
机构 * University of Hong Kong(香港大学) ; Kuaishou Technology(快手科技) ; Tencent(腾讯)
AI总结 研究基于全景的2D提升技术,提出OmniX框架,利用跨模态适配器结构和循环空间算子,将预训练2D流匹配先验用于多模态联合建模,构建数据集,实现适用于图形的3D场景生成,为虚拟世界创建开辟新可能。
Comments ECCV 2026; Project page: https://yukun-huang.github.io/OmniX/
用于多目标跟踪的重识别特征的历史感知变换
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 该研究针对多目标跟踪中ReID特征应用问题,提出历史感知特征变换方法,将轨迹历史特征作上下文,用定制FLD投影特征到特定空间,免训练提升特征判别力,证明特定上下文表示对MOT更优,推动ReID特征定制探索。
Comments Accepted by ECCV 2026. Without bells and whistles, achieving 80.8 HOTA on SportsMOT
生成模型了解空间:解锁隐式3D先验用于场景理解
机构 * Huazhong University of Science and Technology(华中科技大学) ; Baidu Inc.(百度公司)
AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。
Comments Accepted by ECCV 2026
视频流思考:VideoLLMs可以同时观看和思考
机构 * Huazhong University of Science and Technology(华中科技大学) ; MiLM Plus Xiaomi Inc.(小米公司)
AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。
Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/
MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi EV(小米电动车)
AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。
Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/
利用现成生成模型实现目标检测器的零样本量化
机构 * Seoul National University(首尔大学) ; LG Electronics(LG电子)
AI总结 提出GoodQ框架,利用现成生成模型构建训练集,通过信息密集提示、内在分布感知选择和教师引导自适应降噪,解决零样本量化目标检测中的多实例、类别不平衡和伪标签噪声问题,在低比特(W4A4)达到最优性能。
Comments Published at ECCV 2026
通过概念引导实现鲁棒的上下文分割
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)
AI总结 提出概念引导的上下文分割(CG-ICS),通过提取参考图像的高层语义概念而非仅依赖低层视觉匹配,结合文本概念与视觉示例,显著提升分割准确性和鲁棒性。
Comments ECCV 2026
ME-IQA: 通过重新排序增强的记忆图像质量评估
机构 * City University of Hong Kong(香港城市大学) ; ByteDance Inc.(字节跳动公司)
AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。
Comments Published as a conference paper at ECCV 2026
WorldWander:在视频生成中连接自我中心和外中心世界
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)
AI总结 研究聚焦视频生成中自我中心与外中心世界转换,提出WorldWander框架,基于视频扩散变换器,整合上下文视角对齐与协作位置编码,精心策划数据集,实验证明该框架在视角同步、角色一致性和泛化能力上表现卓越,设定了新基准。
Comments Accepted by ECCV 2026; Code: https://github.com/showlab/WorldWander
FoundationGeo:学习用于单目度量几何的空间逐像素场
机构 * The University of Hong Kong(香港大学) ; Voyager Research, DiDi Chuxing(滴滴出行探索研究院)
AI总结 FoundationGeo是两阶段框架,第一阶段学习高保真几何模型,第二阶段引入校准场生成3D点图。它还解决相机固有覆盖问题,通过合成数据提高鲁棒性。在多基准零射击评估中,该方法增强跨域鲁棒性,性能优于其他基线。
Comments Accepted to ECCV 2026. Project page: https://mx-liu6.github.io/FoundationGeo-web/
在潜在空间中通过跨模态对齐实现精确的视频到音频生成
机构 * FPT Software AI Center(FPT软件人工智能中心) ; NVIDIA Corporation(NVIDIA公司)
AI总结 研究视频到音频生成问题,提出Flowley架构,结合视觉特征与文本提示,通过渐进软掩码交叉注意力实现视听同步,无额外计算成本,还提出SoundCap字幕,该方法在多个指标及零样本音频质量上达先进水平。
Comments Accepted to ECCV 2026
你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成
机构 * Huawei Central Research Institute(华为中央研究院) ; Guangdong University of Technology(广东技术大学)
AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。
Comments ECCV 2026
SOMA:从表面观察到肌肉解剖
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区) ; TU Dortmund University(多特蒙德工业大学)
AI总结 提出SOMA模型,从多视角RGB相机获取的表面信号推断时空肌肉行为,并构建SKIM数据集,首次实现从多视角RGB数据恢复肌肉变形,提供可扩展的低成本解剖动画方案。
Comments Accepted at ECCV 2026
整体最优标签选择用于在部分标签下的鲁棒提示学习
机构 * Shandong University, Jinan, China(山东大学(济南,中国))
AI总结 本文提出Holistic Optimal Label Selection方法,通过局部密度过滤和全局最优传输策略,提升部分标签下的提示学习性能,实验表明其在八个基准数据集上表现优异。
Comments ECCV 2026
触觉模态融合用于视觉-语言-动作模型
AI总结 本文提出TacFiLM,一种轻量级模态融合方法,将视觉-触觉信号整合到视觉-语言-动作(VLA)模型中。通过特征级线性调制(FiLM)对中间视觉特征进行条件化,提升接触丰富操作行为的性能。
Comments Accepted to the European Conference on Computer Vision (ECCV), 2026, 20 pages, 5 figures
FFAvatar: 从稀疏肖像图像进行前馈4D头部化身重建
机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology, Wuhan 430074, China(华中科技大学电子信息与通信学院,武汉430074,中国)
AI总结 提出基于Transformer的3D高斯框架FFAvatar,通过交替注意力机制和稀疏到密集学习范式,从一张或多张参考图像高效构建高质量、可动画的4D头部化身,支持增量重建和动态个性化。
Comments Accepted to ECCV 2026. Project page: https://jj-yao.github.io/ffavatar/
WristMimic:基于手腕引导操作的全身人形机器人控制
机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学)
AI总结 研究如何将人类物体交互演示重定向到物理模拟,提出WristMimic框架,分离无接触身体运动与手部操作,通过手腕引导,让手指从物体跟踪和接触结果学习行为,实验显示该框架在跨手部模型重定向时效果良好。
Comments Accepted to ECCV 2026
MAVIN:具有叙事控制的多镜头视听生成
机构 * Peking University(北京大学) ; Kling Team, Kuaishou Technology(快手团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Sun Yat-sen University(中山大学)
AI总结 提出MAVIN框架,通过边界感知注意力、ID感知传播和多智能体脚本管线,实现多镜头视听生成中的叙事控制,解决时间错位、可控性差和脚本不完整问题。
Comments Accepted to ECCV 2026