arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-25 至 2026-08-25 共收录 12 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 12 篇

2608.23140 2026-08-25 cs.CV cs.RO 新提交 79%

MIVIFI: Bridging Perspective and Fisheye Domains for Training Multi-View Fisheye Image Generation Models

MIVIFI:弥合透视域与鱼眼域以训练多视图鱼眼图像生成模型

Matthias Neuwirth-Trapp, Begüm Altunbas, Jiayi Wang, Yan Xia, Maarten Bieshaar, Xinyu Huang, Daniel Cremers

机构 * ETH Zurich(苏黎世联邦理工学院) Bosch Research(博世研究中心) Technical University of Munich(慕尼黑工业大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本研究针对多视图鱼眼图像生成问题,提出SyntheOcc-FE与MIVIFI两种方法,其中MIVIFI利用跨域学习缓解鱼眼数据稀缺问题,实现高保真的多视图鱼眼图像生成。

Comments Accepted at the IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23238 2026-08-25 cs.CV 新提交 70%

Mover360: Controllable Object Manipulation in 360° Panoramic Images

Mover360:360°全景图像中的可控物体操作

Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers, Taehyun Rhee

机构 * Victoria University of Wellington(惠灵顿维多利亚大学) University of New South Wales(新南威尔士大学) The University of Melbourne(墨尔本大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 Mover360是针对360°全景图像的可控物体操作框架,以物体平移为核心,支持插入、移除辅助任务,在多域多评估协议下优于相关强基线,代码与基准数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22329 2026-08-25 cs.MM cs.CV 新提交 62%

ReART: Reference-Guided Retrieval and Refinement for Emotion-Aware Art Generation

ReART:用于情感感知艺术生成的参考引导检索与细化

Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

AI总结 ReART框架通过参考引导检索与AAS驱动的细化,在AffectiveArt 2026挑战赛Track 1中获第2,实现1.00的AAS与0.78总分,用于情感感知艺术生成。

Comments Accepted by ACM Multimedia 2026 (Grand Challenge Track 1), 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23549 2026-08-25 cs.CV 新提交 57%

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

FixAnything:基于视频生成先验的3D一致性渲染优化

Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。

Comments Appearing in ECCV 2026. Project page: this https URL (https://fix-anything.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22828 2026-08-25 cs.CV 新提交 57%

VeCAS: Vessel-Focused Contrast-Free Angiogram Synthesis for Vascular Interventions

VeCAS:面向血管介入的聚焦血管的无造影剂血管造影合成

De-Xing Huang, Chen-Yu Wang, Hao Liang, Xiao-Hu Zhou, Mei-Jiang Gui, Tian-Yu Xiang, Qin-Yi Zhang, Chen Wang, Xiao-Liang Xie, Shi-Qi Liu, Ming-Yuan Liu, Zhen-Chang Wang, Zeng-Guang Hou

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出VeCAS框架,通过两阶段合成实现无造影剂血管造影,在下肢数据集实验中优于对比方法,还可缩短机器人导丝导航的时间与步骤,具临床应用潜力。

Comments 10 pages, 8 figures, 5 tabels, supplementary material: this https URL (https://dxhuang-casia.github.io/data/vecas_supplementary_material.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21659 2026-08-25 cs.CV 新提交 57%

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) Shenzhen University(深圳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-08-25 cs.CV 版本更新 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Accepted by ECCV 2026. Project Page: this https URL (https://yunhe24.github.io/langdrivectrl/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18422 2026-08-25 cs.CV 版本更新 57%

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: this https URL (https://codeysun.github.io/generated-reality)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2026-08-25 cs.CV 版本更新 57%

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments CVPR 2026, Project Page: this https URL (https://19reborn.github.io/Bullet4D/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22367 2026-08-25 cs.CL 新提交 50%

Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs

上下文感知集群解码:dMLLMs中的语义锚驱动连贯性

Yikai Zhao, Qiyan Zhao, Jiaquan Zhang, Xiaofeng Zhang, Xiaosong Yuan, Pengzhou Cheng

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Alibaba Group(阿里巴巴集团) Shanghai University(上海大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 针对 dMLLMs 生成长文本时的语义漂移与重复问题,提出上下文感知集群解码方法,结合置信度与邻域邻近度评分,在多模型多基准上实现质量提升并减少幻觉。

Comments This paper is accepted by EMNLP 2026. 19 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-25 cs.RO 版本更新 50%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18699 2026-08-25 cs.CL cs.AI 版本更新 50%

Semantic Substrate Dynamics Theory: An Operator-Theoretic Framework for Geometric Semantic Drift

语义基质理论:几何语义漂移的算子理论框架

Stephen Russell

机构 * Intelligent Systems and Robotics Department(智能系统与机器人系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出语义基质理论,通过算子理论框架分析几何语义漂移,引入桥质量预测未来邻居重排,并提供理论与测试合同。

详情

展开后加载摘要…

URL PDF HTML 收藏