arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2025-12-08 至 2025-12-08 共收录 3
2512.05965 2025-12-08 cs.CV

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: 解锁任何图像编辑器的迭代推理

Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu

机构 * Beihang University(北航大学) Meituan(美团) CUHK MMLab CUHK IMIXR Tsinghua University(清华大学)

AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。

Comments Project page: https://appletea233.github.io/think-while-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05578 2025-12-08 cs.RO

A Hyperspectral Imaging Guided Robotic Grasping System

基于超光谱成像的机器人抓取系统

Zheng Sun, Zhipeng Dong, Shixiong Wang, Zhongyi Chu, Fei Chen

机构 * Department of Mechanical and Automation Engineering, T-Stone Robotics Institute, The Chinese University of Hong Kong, Hong Kong SAR(机械与自动化工程系,T-Stone机器人研究所,香港中文大学,香港特别行政区) School of Instrumentation and Optoelectronic Engineering, Beihang University(仪器与光电工程学院,北航大学)

AI总结 本文提出一种基于超光谱成像的机器人抓取系统,通过PRISM和SpectralGrasp框架提升纺织品识别和分拣效率。

Comments 8 pages, 7 figures, Accepted to IEEE Robotics and Automation Letters (RA-L) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01826 2025-12-08 cs.CV

GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer

GLDiTalker: 基于图潜在扩散变换器的语音驱动3D面部动画

Yihong Lin, Zhaoxin Fan, Xianjia Wu, Lingyu Xiong, Liang Peng, Xiandong Li, Wenxiong Kang, Songju Lei, Huang Xu

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Huawei Cloud(华为云) Nanjing University(南京大学)

AI总结 GLDiTalker通过图潜在扩散变换器解决语音驱动3D面部动画中的模态不一致问题,提升唇形同步精度和运动多样性。

Comments 9 pages, 5 figures

Journal ref the 34th International Joint Conference on Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏