arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-27 至 2026-08-27 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2607.00609 2026-08-27 cs.CV 版本更新 79%

Diffusion-Based Multi-Class Normality for OOD Detection: An Application to CDP Authentication

基于扩散的多类正态性用于OOD检测:在CDP认证中的应用

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior

机构 * CNRS(法国国家科学研究中心) INSA Lyon(里昂国立应用科学学院) LIRIS, UMR 5205(LIRIS实验室,UMR 5205)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出扩散多类正态性框架,用单一条件ControlNet训练于多类真实CDP,通过重构误差检测伪造,并引入双模板掩码提升性能。

Comments IEEE International Conference on Advanced Visual And Signal-Based Systems, Aug 2026, Lecce, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20803 2026-08-27 cs.CV 版本更新 79%

ARGenSeg: Image Segmentation with Autoregressive Image Generation Model

ARGenSeg:基于自回归图像生成模型的图像分割

Xiaolong Wang, Lixiang Ru, Ziyuan Huang, Kaixiang Ji, Dandan Zheng, Jingdong Chen, Jun Zhou

机构 * Ant Group(蚂蚁集团)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 该研究提出ARGenSeg框架,将图像生成融入MLLM,通过并行生成视觉令牌实现高效图像分割,在多数据集上性能优于现有方法且推理速度显著提升。

Comments Accepted to NeurIPS 2025, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25862 2026-08-27 cs.CV 新提交 57%

Learning Late, Guiding Early: Timestep-Decoupled Semantic Guidance for Fair Face Generation

晚学习,早引导:用于公平人脸生成的时间步解耦语义引导

Subir Kumar Parida, Rajbabu Velmurugan, Ketan Kotwal, R.S. Sengar, Swati Hiremath

机构 * Bhabha Atomic Research Centre (B.A.R.C.)(巴巴原子研究中心) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出语义边界预测器(SBP),通过时间步解耦实现公平人脸生成,无需重训练或外部数据集,在CelebA-HQ上大幅降低人口统计公平差距且保持图像质量,计算开销小易集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25734 2026-08-27 cs.CV 新提交 57%

InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control

InteractGesture:用于连续流协同语音手势控制的渐进式分块引导

Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

机构 * Meta University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对现有协同语音手势生成模型缺乏单关节细粒度空间可控性的问题,提出模型无关的推理时方法InteractGesture,通过渐进式分块引导解决分块依赖问题,在BEAT2数据集上实现多关节空间控制提升。

Comments ECCV 2026 Workshop - Interactive Social Avatars

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-27 cs.CV cs.AI 新提交 57%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25461 2026-08-27 cs.GR 新提交 57%

GLOSS: Geometric Local Self-Similarity Learning for Faithful Reference-Guided Texture Fill

GLOSS:用于忠实参考引导纹理填充的几何局部自相似性学习

Chenyue Cai, Anita Hu, James Lucas, Szymon Rusinkiewicz, Masha Shugrina

专题命中 可控生成 :inpainting(abstract);分类 cs.GR

AI总结 本研究提出GLOSS模型,利用几何局部自相似性,以数据需求低、可控性强的方式实现忠实参考引导的纹理填充,在3D纹理生成任务中表现优于或媲美基线模型,且作为Blender插件获专业人员认可。

Comments 22 pages, 17 figures, project page this https URL (https://chenyuecai.github.io/gloss-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-27 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: this https URL (https://github.com/boschresearch/TASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-08-27 cs.RO 版本更新 50%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Shiqin Dai, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 13 pages, 5 figures, 8 tables. Project page: this https URL (https://advanced-robotics-lab.github.io/SANTS/)

详情

展开后加载摘要…

URL PDF HTML 收藏