arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-24 至 2025-11-24 共收录 42 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 24 篇

2409.20347 2025-11-24 math.OC math.PR 50%

A mean field Jacobi process for modeling sustainable tourism

均场雅可比过程用于可持续旅游业建模

Hidekazu Yoshioka

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出均场雅可比过程用于建模可持续旅游业,通过随机控制框架在不确定性下设计可持续旅游业,并探讨其在不同参数下的应用与结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14513 2025-11-24 cond-mat.soft 50%

Deep learning-based computational method for soft matter dynamics: Deep Onsager-Machlup method

基于深度学习的软物质动力学计算方法:深度Onsager-Machlup方法

Zhihao Li, Boyi Zou, Haiqin Wang, Jian Su, Dong Wang, Xinpeng Xu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于深度学习的软物质动力学计算方法,结合深度神经网络与变分原理,用于解决复杂多尺度的软物质动态问题。

Comments 30 pages, 7 figures

Journal ref Commun. Comput. Phys. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 5 篇

2511.16900 2025-11-24 eess.SY cs.SY 78%

When Motion Learns to Listen: Diffusion-Prior Lyapunov Actor-Critic Framework with LLM Guidance for Stable and Robust AUV Control in Underwater Tasks

当运动学会倾听:带有LLM引导的扩散先验Lyapunov动作-批评者框架用于水下任务中稳定和鲁棒的AUV控制

Jingzehua Xu, Weiyi Liu, Weihang Zhang, Zhuofan Xi, Guanwen Xie, Shuai Zhang, Yi Li

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出一种结合扩散模型、Lyapunov批评者和LLM的框架,用于提升水下机器人控制的稳定性与鲁棒性,通过生成-过滤-优化机制实现高效探索和多目标优化。

Comments This paper is currently under review and does not represent the final version. Jingzehua Xu, Weiyi Liu and Weihang Zhang are co-first authors of this paper, with Zhuofan Xi as the second author

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17450 2025-11-24 cs.CV cs.AI cs.CL 57%

Planning with Sketch-Guided Verification for Physics-Aware Video Generation

基于草图引导验证的物理感知视频生成规划

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) FieldAI Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchVerify通过草图验证和动态轨迹优化提升物理感知视频生成的效率与质量。

Comments website: https://sketchverify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17269 2025-11-24 cs.CV cs.AI 57%

Range-Edit: Semantic Mask Guided Outdoor LiDAR Scene Editing

Range-Edit: 基于语义掩码的户外激光雷达场景编辑

Suchetan G. Uppur, Hemant Kumar, Vaibhav Kumar

机构 * GeoAI4Cities Lab(GeoAI4Cities实验室) IISER Bhopal(印度比哈尔理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Range-Edit通过语义掩码指导生成高质量的激光雷达点云,提升自动驾驶系统的鲁棒性与泛化能力。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16825 2025-11-24 cs.CV cs.AI 57%

WorldGen: From Text to Traversable and Interactive 3D Worlds

WorldGen: 从文本到可遍历和交互的3D世界

Dilin Wang, Hyunyoung Jung, Tom Monnier, Kihyuk Sohn, Chuhang Zou, Xiaoyu Xiang, Yu-Ying Yeh, Di Liu, Zixuan Huang, Thu Nguyen-Phuoc, Yuchen Fan, Sergiu Oprea, Ziyan Wang, Roman Shapovalov, Nikolaos Sarafianos, Thibault Groueix, Antoine Toisoul, Prithviraj Dhar, Xiao Chu, Minghao Chen, Geon Yeong Park, Mahima Gupta, Yassir Azziz, Rakesh Ranjan, Andrea Vedaldi

机构 * Reality Labs, Meta(Meta现实实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 WorldGen通过结合LLM、程序生成和扩散模型,实现从文本到可交互3D世界的自动创建,提升虚拟空间的生成效率与表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17121 2025-11-24 math.OC 50%

Robustness of optimal control for controlled regime-switching diffusions with incorrect models

受控切换扩散过程最优控制的鲁棒性

Somnath Pradhan, Dinesh Rathia

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了受控切换扩散过程的鲁棒性,通过分析价值函数和最优策略的连续性,扩展了鲁棒性框架至更广泛的混合系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2511.11989 2025-11-24 cs.CV 79%

BeyondFacial: Identity-Preserving Personalized Generation Beyond Facial Close-ups

超越面部:身份保持的个性化生成超越面部特写

Songsong Zhang, Chuanqi Tang, Hongguang Zhang, Guijian Tang, Minglong Li, Xueqiong Li, Shaowu Yang, Yuanxi Peng, Wenjing Yang, Jing Zhao

机构 * DIDS, NUDT, China(国防科技大学) TJU, China(天津大学) Unit 32010 of the Chinese PLA(中国解放军第三二零一零单位)

专题命中 个性化与一致性 :personalized generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种突破面部特写限制的IPPG方法,通过双线推断和身份自适应融合策略,提升身份保真度和场景语义生成能力。

Comments 16 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10135 2025-11-24 cs.AI 75%

CharCom: Composable Identity Control for Multi-Character Story Illustration

CharCom:多角色故事插图的可组合身份控制

Zhongsheng Wang, Ming Lin, Zhedong Lin, Yaser Shakib, Qian Liu, Jiamou Liu

机构 * Wuhan University of Communication(武汉通信大学) University of Auckland(奥克兰大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 CharCom通过可组合的LoRA适配器实现多角色故事插图中的角色一致性,提高了保真度和语义对齐,适用于动画和故事插图等实际应用。

Comments Accepted by ACM MMAsia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04482 2025-11-24 cs.CV 57%

A Training-Free Style-Personalization via SVD-Based Feature Decomposition

基于SVD特征分解的无训练风格个性化生成

Kyoungmin Lee, Jihun Park, Jongmin Gim, Wonhyeok Choi, Kyumin Hwang, Jaeyeul Kim, Sunghoon Im

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于SVD特征分解的无训练风格个性化图像生成方法,通过主特征混合和结构注意力校正模块实现风格调控和结构一致性,提升生成效果与部署效率。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 2 篇

2506.00820 2025-11-24 cs.CV 57%

QuantFace: Efficient Quantization for Face Restoration

QuantFace: 面部修复的高效量化方法

Jiatong Li, Libo Zhu, Haotong Qin, Jingkai Wang, Linghe Kong, Guihai Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 QuantFace通过低比特量化和自适应策略提升面部修复效率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05093 2025-11-24 physics.bio-ph 50%

Physical interactions enable energy-efficient Turing patterns

物理相互作用使能效 Turing 模式

Cathelijne ter Burg, David Zwicker

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究通过引入热力学一致的 Turing 系统模型,发现排斥相互作用显著降低能量需求,揭示物理相互作用在形成自然模式中的关键作用。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏