GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位
机构 * University at Buffalo(布法罗大学) ; Adobe Research(Adobe研究院)
AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。
大厂专区
GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位
机构 * University at Buffalo(布法罗大学) ; Adobe Research(Adobe研究院)
AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。
G2P:面向边界感知3D分割的高斯到点属性对齐
机构 * Kyungpook National University(庆北国立大学) ; Korea Electronics Technology Institute(韩国电子技术研究院) ; Adobe Research(Adobe研究院) ; Zhejiang University(浙江大学)
AI总结 提出G2P方法,通过将3D高斯泼溅的属性(如不透明度和尺度)传递到点云,解决几何特征无法区分外观相似物体的问题,实现边界感知的3D分割。
Comments Accepted to ECCV 2026. Camera-ready version
Φeat: 物理基础的材料特征表示
机构 * Adobe Research, France(Adobe研究院(法国))
AI总结 提出Φeat视觉骨干网络,通过对比同一材料在不同光照和几何下的观测,学习对材料身份敏感的表征,提升材料选择与分类等任务性能。