arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2025-12-08 至 2025-12-08 共收录 4
2512.05941 2025-12-08 cs.CV cs.AI cs.CL

Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding

聚焦,点击:解锁和评估缩放在GUI定位中的潜力

Zhiyuan Jiang, Shenghao Xie, Wenyi Li, Wenqiang Zu, Peihang Li, Jiahao Qiu, Siqi Pei, Lei Ma, Tiejun Huang, Mengdi Wang, Shilong Liu

机构 * Xi’an Jiaotong University(西安交通大学) Princeton University(普林斯顿大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) Michigan State University(密歇根州立大学)

AI总结 本文提出ZoomClick方法,通过引入缩放先验知识提升GUI定位性能,实现动态空间聚焦与自适应上下文切换,并在多个基准上取得最佳结果。

Comments Code is available at https://github.com/Princeton-AI2-Lab/ZoomClick

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05754 2025-12-08 cs.CV

USV: Unified Sparsification for Accelerating Video Diffusion Models

USV:统一稀疏化以加速视频扩散模型

Xinjian Wu, Hongmei Wang, Yuan Zhou, Qinglin Lu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元)

AI总结 USV通过统一稀疏化策略提升视频扩散模型的效率,实现去噪速度提升83.3%和端到端加速22.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05511 2025-12-08 cs.CV

Rethinking Infrared Small Target Detection: A Foundation-Driven Efficient Paradigm

重新思考红外小目标检测:一种基础驱动的高效范式

Chuang Yu, Jinmiao Zhao, Yunpeng Liu, Yaokun Li, Xiujun Shu, Yuanhao Feng, Bo Wang, Yimian Dai, Xiangyu Yue

机构 * Key Laboratory of Opto-Electronic Information Processing, Chinese Academy of Sciences(光电信息处理重点实验室,中国科学院) Shenyang Institute of Automation, Chinese Academy of Sciences(沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Tencent(腾讯) Nankai University(南开大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

AI总结 本文提出FDEP范式,通过基础模型冻结表示与任务特征融合,提升红外小目标检测精度,构建综合评估指标,实现多数据集SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04563 2025-12-08 cs.CV

COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence

COOPER:一种用于空间智能中协作感知与推理的统一模型

Zefeng Zhang, Xiangzhao Hao, Hengzhu Tang, Zhenyu Zhang, Jiawei Sheng, Xiaodong Li, Zhenyang Li, Li Gao, Daiting Shi, Dawei Yin, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

AI总结 COOPER是一种统一的多模态大语言模型,通过整合深度和分割等辅助模态,提升空间感知与推理能力,实现空间智能的增强。

详情

展开后加载摘要…

URL PDF HTML 收藏