arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Qualcomm(高通)

2026-05-15 至 2026-05-15 共收录 3
2512.13609 2026-05-15 cs.CV cs.LG

Do-Undo Bench: Reversibility for Action Understanding in Image Generation

Do-Undo基准:图像生成中动作理解的可逆性

Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli

机构 * York University(约克大学) Vector Institute for AI(人工智能向量研究所) Qualcomm AI Research(高通人工智能研究)

AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。

Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14191 2026-05-15 cs.CV

CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers

CoReDiT:基于空间一致性引导的令牌剪枝与重建用于高效的扩散变换器

Zhuojin Li, Hsin-Pai Cheng, Hong Cai, Shizhong Han, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 CoReDiT通过空间一致性引导的令牌剪枝与重建,显著降低扩散变换器的计算量,提升推理速度,同时保持高质量视觉输出。

Comments 8 pages, 8 figures, CVPR workshop

Journal ref 2026 CVPR Workshop of EDGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04499 2026-05-15 cs.CV

FALO: Fast and Accurate LiDAR 3D Object Detection on Resource-Constrained Devices

FALO:在资源受限设备上快速且准确的激光雷达3D目标检测

Shizhong Han, Hsin-Pai Cheng, Hong Cai, Jihad Masri, Soyeb Nagori, Fatih Porikli

机构 * Qualcomm AI Research(高通AI研究)

AI总结 本文提出FALO,一种适用于资源受限设备的激光雷达3D目标检测方法,结合大核卷积、Hadamard乘积和线性层,实现高精度与快速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏