arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-23 至 2025-12-23 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2512.18772 2025-12-23 cs.CV 79%

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19020 2025-12-23 cs.CV cs.LG 70%

CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization

CETCAM: 通过一致且可扩展的分词实现相机可控的视频生成

Zelin Zhao, Xinyu Gong, Bangya Liu, Ziyang Song, Jun Zhang, Suhui Wu, Yongxin Chen, Hao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) ByteDance(字节跳动) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 CETCAM通过一致且可扩展的分词方案实现相机可控的视频生成,提高了几何一致性和视觉真实性,同时支持额外的控制模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19661 2025-12-23 cs.CV 57%

Over++: Generative Video Compositing for Layer Interaction Effects

Over++:用于层交互效果的生成视频合成

Luchao Qi, Jiaye Wu, Jun Myeong Choi, Cary Phillips, Roni Sengupta, Dan B Goldman

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Maryland(马里兰大学) Industrial Light & Magic(工业光魔)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Over++是一种生成视频合成方法,通过文本提示和输入视频层生成逼真的环境效果,同时保留原始场景,无需假设相机姿态或深度信息。

Comments Project page: https://overplusplus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20431 2025-12-23 cs.CV cs.RO 57%

BRIC: Bridging Kinematic Plans and Physical Control at Test Time

BRIC: 在测试时弥合运动计划与物理控制之间的差距

Dohun Lim, Minji Kim, Jaewoon Lim, Sungchan Kim

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BRIC通过结合测试时适应与轻量级引导机制,实现长期人体运动生成的物理合理性和一致性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13031 2025-12-23 cs.CV 57%

Towards 3D Object-Centric Feature Learning for Semantic Scene Completion

面向语义场景补全的3D物体感知特征学习

Weihua Wang, Yubo Cui, Xiangru Lin, Zhiheng Li, Zheng Fang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Ocean框架,通过分解场景为独立物体实例,提升语义场景补全的精度和性能。

Comments Accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14428 2025-12-23 cs.CV cs.AI 57%

Comp-Attn: Present-and-Align Attention for Compositional Video Generation

Comp-Attn: 为组合视频生成的呈现与对齐注意力

Hongyu Zhang, Yufan Deng, Shenghai Yuan, Yian Zhao, Peng Jin, Xuehan Hou, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua University, Beijing, China(清华大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19148 2025-12-23 cs.RO 50%

A Flexible Field-Based Policy Learning Framework for Diverse Robotic Systems and Sensors

一种灵活的基于场的策略学习框架,适用于多样化的机器人系统和传感器

Jose Gustavo Buenaventura Carreon, Floris Erich, Roman Mykhailyshyn, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种灵活的基于场的策略学习框架,通过整合扩散策略控制与3D语义场景表示,实现跨机器人系统的高效泛化与任务成功率提升。

Comments 6 pages, 7 figures, conference: SII 2026. Cancun, Mexico

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18815 2025-12-23 cs.LG cs.AI physics.ao-ph physics.geo-ph 50%

Controllable Probabilistic Forecasting with Stochastic Decomposition Layers

可控制的概率预报与随机分解层

John S. Schreck, William E. Chapman, Charlie Becker, David John Gagne, Dhamma Kimpara, Nihanth Cherukuru, Judith Berner, Kirsten J. Mayer, Negin Sobhani

机构 * NSF National Center for Atmospheric Research(国家大气科学研究中心) University of Colorado(科罗拉多大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 通过随机分解层将确定性天气模型转化为概率集合系统,提升预测的准确性和可解释性,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏