arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-17 至 2025-12-17 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2512.14061 2025-12-17 cs.CV 79%

Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution

弥合保真度与现实的差距:可控制的一步扩散用于图像超分辨率

Hao Chen, Junyang Chen, Jinshan Pan, Jiangxin Dong

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 CODSR通过LQ引导特征调制、区域自适应生成先验激活和文本匹配指导策略,提升图像超分辨率的保真度与感知质量。

Comments Project page: https://github.com/Chanson94/CODSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07712 2025-12-17 cs.CV 57%

UnCageNet: Tracking and Pose Estimation of Caged Animal

UnCageNet: 有笼动物的跟踪与姿态估计

Sayak Dutta, Harish Katti, Shashikant Verma, Shanmuganathan Raman

机构 * Indian Institute of Technology Gandhinagar(印度古吉拉特邦理工学院加尔各答分校) National Institutes of Health (NIH)(美国国家卫生研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 UnCageNet通过三阶段预处理流程有效解决笼子结构和遮挡对动物跟踪与姿态估计的影响,提升姿态估计和关键点检测精度。

Comments 9 pages, 2 figures, 2 tables. Accepted to the Indian Conference on Computer Vision, Graphics, and Image Processing (ICVGIP 2025), Mandi, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14217 2025-12-17 cs.CV cs.RO 57%

DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Freiburg(弗赖堡大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DRAW2ACT通过深度感知的轨迹条件视频生成框架,生成可控且一致的机器人演示视频,提升机器人操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14162 2025-12-17 cs.CV 57%

FastDDHPose: Towards Unified, Efficient, and Disentangled 3D Human Pose Estimation

FastDDHPose: 向统一、高效且解耦的3D人体姿态估计迈进

Qingyuan Cai, Linxin Zhang, Xuecai Hu, Saihui Hou, Yongzhen Huang

机构 * Watrix Technology Limited Company Ltd(沃特克斯技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FastDDHPose通过解耦扩散模型提升3D人体姿态估计的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2025-12-17 cs.CV 57%

Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14291 2025-12-17 cs.SD 50%

GLM-TTS Technical Report

GLM-TTS 技术报告

Jiayan Cui, Zhihan Yang, Naihan Li, Jiankun Tian, Xingyu Ma, Yi Zhang, Guangyu Chen, Runxuan Yang, Yuqing Cheng, Yizhi Zhou, Guochen Yu, Xiaotao Gu, Jie Tang

机构 * Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 GLM-TTS通过优化的语音分词器和多奖励强化学习框架,实现高效可控的生产级语音生成系统,同时支持参数高效定制和混合输入方案。

详情

展开后加载摘要…

URL PDF HTML 收藏