arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-28 至 2026-08-28 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2608.05745 2026-08-28 cs.CV cs.AI 版本更新 70%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26971 2026-08-28 cs.CV cs.MM 新提交 62%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26737 2026-08-28 cs.CV cs.LG cs.RO 新提交 57%

Generative Semantic Scene Completion

生成式语义场景补全

Shi Chen, Weifeng Ge

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对户外激光雷达语义场景补全的类别不平衡问题,提出生成式语义场景补全框架,通过PS³、SGSC、S²D²方法提升性能,在SemanticKITTI测试集取得当前最佳单扫描单样本结果。

Comments 18 pages, 12 figures, 4 tables. Supplementary material (29 pages) is included as an ancillary file. Project page: this https URL (https://shichen.world/GSSC-project-page/) - Code, models and the PS$^3$ dataset: this https URL (https://github.com/BillyChern/GSSC-S2D2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26656 2026-08-28 cs.CV cs.AI 新提交 57%

CoGeo-GS: Concept-Driven and Geometry-Aware Multi-Object Removal in 3D Scenes

CoGeo-GS:3D场景中基于概念驱动与几何感知的多物体移除方法

Yuanxiang Ni, Xianliang Huang, Chenhang Ma, Chen Xiao, Yuewen Ma, Ruxin Wang, Hao Zhang

机构 * Southern University of Science and Technology(南方科技大学) ByteDance(字节跳动) Zhejiang University(浙江大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对3D场景多物体移除的挑战,提出CoGeo-GS框架,通过概念感知语义标签与几何感知补全流水线实现可控多物体移除,在视觉质量与重建保真度上优于现有方法。

Comments 6 pages, 4 figures, accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25862 2026-08-28 cs.CV 版本更新 57%

Learning Late, Guiding Early: Timestep-Decoupled Semantic Guidance for Fair Face Generation

晚学习,早引导:用于公平人脸生成的时间步解耦语义引导

Subir Kumar Parida, Rajbabu Velmurugan, Ketan Kotwal, R.S. Sengar, Swati Hiremath

机构 * Bhabha Atomic Research Centre (B.A.R.C.)(巴巴原子研究中心) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出语义边界预测器(SBP),通过时间步解耦实现公平人脸生成,无需重训练或外部数据集,在CelebA-HQ上大幅降低人口统计公平差距且保持图像质量,计算开销小易集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-28 cs.CV cs.AI 版本更新 57%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27151 2026-08-28 cs.RO 新提交 50%

Planning a Shared Modular Fixture Layout Across Robotic Disassembly Stages

面向机器人拆卸阶段的共享模块化夹具布局规划

Haohui Pan, Takuya Kiyokawa, Kensuke Harada

机构 * The University of Osaka(大阪大学) The National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究所(AIST))

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究针对机器人拆卸中支撑布局需适配阶段变化的问题,提出基于去噪扩散概率模型与贝叶斯优化的模块化真空夹具系统,实现螺丝刀、剃须刀拆卸的共享布局,稳定裕度达66.9%和81.6%,验证了方案的可行性与稳定性。

Comments 15 pages, 9 figures. Submitted to IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-28 cs.RO 版本更新 50%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏