arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3184 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 210 篇

2606.08946 2026-06-16 stat.CO physics.chem-ph physics.comp-ph 新提交 78%

A Diffusion Monte Carlo algorithm employing depth first traversal and a stack instead of a swarm

一种采用深度优先遍历和栈而非群体的扩散蒙特卡罗算法

Bastiaan J. Braams

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出基于深度优先遍历和栈的扩散蒙特卡罗算法(DMCD),通过栈管理分裂历史,相比传统广度优先群体方法更节省内存,并统一了特征值问题与线性方程问题的算法处理。

Comments 12 pages. The code in the original (v1) Arxiv submission could randomly get trapped in a cycle where the same walker is all the time restarted with ever decreasing weight. The issue is described and addressed in this (v2) submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15819 2026-06-16 cs.CV cs.AI 新提交 77%

SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models

SACE: 视觉自回归模型中的语义奇点概念擦除

Siya Yang, Nanxiang Jiang, Zhaoxin Fan, Yunfeng Diao

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对视觉自回归模型应用现有擦除技术导致语义崩溃和视觉伪影的问题,提出语义奇点公理并通过增量语义显著性分析验证,进而引入首个尺度感知的概念擦除框架SACE,在首尺度耦合熵正则化擦除目标与恢复性保存损失,实现精确概念擦除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14025 2026-06-15 cs.CV 新提交 77%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06601 2026-06-08 cs.CV cs.AI cs.LG 新提交 77%

Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

通过分解视觉代理实现直接3D感知物体插入

Jingbo Gong, Yikai Wang, Yushi Lan, Yuhao Wan, Ziheng Ouyang, Rui Zhao, Ming-Ming Cheng, Qibin Hou, Chen Change Loy

机构 * Google(谷歌) Black Forest Labs(黑森林实验室)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出DIRECT框架,通过分解外观、几何和上下文引导,实现可控制3D姿态的物体插入,在几何可控性和视觉质量上优于现有方法。

Comments ICML 2026; Project Page: https://gong1130.github.io/DIRECT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交 76%

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.GR

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09357 2026-08-11 cs.CV 新提交 74%

ControlRadio: Prompt-Driven Controllable Diffusion for Cross-Modal Radio Map Generation

ControlRadio:用于跨模态无线电地图生成的提示驱动可控扩散模型

Kangjun Liu, Xiying Pan, Shuhang Zhang, Xiang Xiang, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 可控生成 :diffusion(title);分类 cs.CV

AI总结 ControlRadio是一种可控生成框架,可根据自然语言描述和环境布局生成无线电地图,在不同城市场景中精度和泛化能力领先,计算时间较传统方法减少四个数量级以上,为无线环境建模提供新范式。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26016 2026-07-09 cs.CV 新提交 74%

MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

MIMFlow:将掩码图像建模与归一化流集成用于端到端图像生成

Yang Chen, Xiaowei Xu, Shuai Wang, Xinwen Zhang, Qiushi Guo, Tiezheng Ge, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Alibaba Group(阿里巴巴集团) Shanghai AI Lab(上海人工智能实验室)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 提出MIMFlow框架,通过VAE编码器从掩码图像推断语义潜在变量,使归一化流专注于低频语义流形,解码器处理高频合成,解决NF容量瓶颈,在ImageNet 256×256上达到71.3%线性探测精度和2.50 FID。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31029 2026-07-01 cs.CV 新提交 74%

TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive

TerraDiT-$\Omega$:任意地理基元的卫星图像合成统一空间控制

Brian Wei, Srikumar Sastry, Daniel Cher, Eric Xing, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 可控生成 :image synthesis(title);分类 cs.CV

AI总结 提出TerraDiT-Ω框架,通过几何感知局部注意力机制,支持从任意原生地理基元(多边形、折线、边界框、点)直接生成卫星图像,在多种控制格式下优于密集和稀疏控制基线,并提升下游任务性能。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18780 2026-06-18 cs.CV cs.CL cs.MM 新提交 73%

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06498 2026-06-08 cs.GR cs.CV 新提交 73%

Semantic-Structural Alignment for Generative Pictorial Charts

生成式图形图表的语义-结构对齐

Zhida Sun, Yulin Zhang, Zheng Gu, Min Lu, Bongshin Lee, Daniel Cohen-Or, Hui Huang

机构 * Visual Computing Research Center (VCC), College of Computer Science and Software Engineering (CSSE) Shenzhen University China(视觉计算研究中心(VCC)、计算机科学与软件工程学院(CSSE)深圳大学中国)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 提出一种生成式框架,通过多模态扩散变压器中的结构对齐和语义对齐机制,实现兼具艺术表现力和结构保真度的图形图表自动合成。

Comments 11 pages, 17 figures, Accepted to ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09171 2026-06-12 cs.HC 新提交 71%

sketch-plot: Progressive Editing for Text-to-Image Academic Figures

sketch-plot:文本到图像学术图形的渐进式编辑

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Jiale Lao, Wei Chen

专题命中 可控生成 :text-to-image(title)

AI总结 提出sketch-plot系统,通过三层渐进式编辑流水线(PNG、可编辑拼图、SVG)实现文本生成学术图形的精确编辑,用户按需选择编辑层级,避免全局重绘。

Comments 6 pages, 3 figures. Submitted to the KDD 2026 Workshop on AI Data Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23238 2026-08-25 cs.CV 新提交 70%

Mover360: Controllable Object Manipulation in 360° Panoramic Images

Mover360:360°全景图像中的可控物体操作

Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers, Taehyun Rhee

机构 * Victoria University of Wellington(惠灵顿维多利亚大学) University of New South Wales(新南威尔士大学) The University of Melbourne(墨尔本大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 Mover360是针对360°全景图像的可控物体操作框架,以物体平移为核心,支持插入、移除辅助任务,在多域多评估协议下优于相关强基线,代码与基准数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20929 2026-08-24 cs.CV 新提交 70%

GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization

GAP-SAM:用于通用AI生成图像篡改定位的全局伪影先验

Haozhen Yan, Siyuan Shan, Zijian Yu, Youqi Wang, Yan Hong, Jun Lan, Jianfu Zhang

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本研究针对AI生成图像篡改定位的分布外性能问题,提出GAP-SAM方法,通过构建COCO-ControlNet对齐语义与几何,利用全局伪影标记抑制语义边界捷径,在六个数据集上平均像素F1达79.8,优于现有方法且在各类图像退化下表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20691 2026-08-24 cs.CV 新提交 70%

Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

连接语言与球面空间:面向全景生成的以对象为中心的控制方法

Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对现有文本到全景生成方法难以对齐对象级方向描述的问题,提出以对象为中心的可控框架PanoCtrl,构建相关数据集并实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16100 2026-08-18 cs.CV cs.NI 新提交 70%

TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction

TISC:用于忠实重建的文本驱动图像语义通信系统

Feifan Zhang, Yuyang Du, Xiaoyan Liu, Soung Chang Liew

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出文本驱动图像语义通信框架TISC,通过树结构属性语义提取(TSASE)和初始噪声优化(INO)机制解决现有方法的语义损失与重建忠实度不足问题,经多数据集实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13478 2026-08-14 cs.CV 新提交 70%

MapRoute++: Surrogate-Guided Semantic Routing for Visual Concept Unlearning

MapRoute++:用于视觉概念遗忘的代理引导语义路由

Ashok Urlana, L. D. M. S. Sai Teja, Vivek Hruday Kavuri, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad(印度信息技术学院海得拉巴分校) TCS Research(塔塔咨询服务公司研究院) NIT Silchar(锡尔卡尔国家理工学院)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对Genμ 2.0挑战视觉概念遗忘任务,在MapRoute基础上引入新训练目标、概念表示及语义路由,使模型在保留相关概念的同时提升概念移除效果,在官方基准上超越SOTA基线12.1%

Comments Accepted at Unlearning and Model Editing Workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12806 2026-08-14 cs.CV cs.AI 新提交 70%

Erase but Preserve: Controllable Removal of Copyrighted Animation Characters via Optimized Semantic Anchors

擦除但保留:通过优化语义锚点实现版权动画角色的可控移除

Qiao Li, Xiaomeng Fu, Wangjia Yu, Runze He, Baisen Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型的动画角色版权问题,本文提出基于优化语义锚点的可控擦除方法,实现了更优的擦除效果与图像保真度,支持多目标移除与模型迁移。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11537 2026-08-13 cs.CV cs.AI cs.LG eess.IV 新提交 70%

Generative Semantic Segmentation via an Observable Semantic-Image Interface and Hierarchical Generator Evidence Alignment

基于可观测语义-图像接口与分层生成器证据对齐的生成式语义分割

Weize Cai, Yongqi Dong, Zhida Shao, Zixin Fu

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Semantic Prism框架,通过可观测语义-图像接口与分层生成器证据对齐实现生成式语义分割,在Cityscapes等数据集上提升了分割精度与像素误差排名性能。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06878 2026-08-10 cs.CV 新提交 70%

ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE

ControlRef:基于锚定4D-RoPE的高效布局引导多实例生成

Yunkai Yang, Yudong Zhang, Xinying Chen, Haoyuan Liang, Yizhuo Niu, Jinshuai Cheng, Kunquan Zhang, Liziyue Fang, Weitao Wan, Runmin Dong

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 ControlRef是一种高效布局引导多实例合成框架,通过UILC注意力掩码与锚定4D-RoPE提升空间对齐,在保证视觉保真度和定位精度的同时大幅降低推理延迟与内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06836 2026-08-10 cs.CV 新提交 70%

GOPI: Generation-Oriented 3D Pose Inference for Furniture Insertion from Single-View RGB-D Indoor Scenes

GOPI:面向生成的单视图RGB-D室内场景家具插入的3D位姿推理

Ruifeng Zhai, Renjie Liu, Guangrun Wang, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对单视图RGB-D室内场景家具插入的不确定性问题,提出两阶段框架GOPI,通过数据驱动迭代推理实现合理3D位姿估计,结合几何引导生成策略,在3D放置和图像合成任务上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-07 cs.CV cs.AI 新提交 70%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08879 2026-07-13 cs.CV 新提交 70%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06445 2026-07-08 cs.CV cs.AI 新提交 70%

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

代理分析:作为条件编码器的视觉语言模型中的定位信号

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。

Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06162 2026-07-08 cs.CV 新提交 70%

High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control

基于全局蓝图引导和布局控制的高分辨率艺术作品外绘画

Junha Kim, Hyunjoon Park, Donghyeon Cho

机构 * Hanyang University(汉阳大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究针对高分辨率艺术作品外绘画存在的问题,提出全局蓝图引导的两阶段扩散框架,通过布局适配器生成蓝图并提取特征,并行合成局部补丁,实现高效合成与布局控制,提升视觉保真度、语义一致性并减少推理时间。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31077 2026-07-02 cs.CV 新提交 70%

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配

Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 70%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22527 2026-06-23 cs.CV 新提交 70%

Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories

轨迹强制:具有可控语义轨迹的结构优先生成

Merve Kocabas, Gege Gao, Bernhard Schölkopf, Andreas Geiger

机构 * University of Tübingen(图宾根大学) ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute(ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出轨迹强制框架,将生成过程组织为从全局布局到细节的语义阶段,每个阶段产生可解码的潜在状态,支持局部编辑,实现结构优先的可控图像合成。

Comments Project page: https://mervekocabas.github.io/TrajectoryForcing/

Journal ref Proceedings of the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12012 2026-06-11 cs.CV 新提交 70%

FitVTON: Fit-aware Virtual Try-On via Body-Garment Size Control

FitVTON: 通过身体-服装尺寸控制实现合身感知的虚拟试穿

Yiqun Ning, Ao Shen, Chenhang He, Lei Zhang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Nuvatech

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对现有虚拟试穿忽略物理合身性的问题,提出FitVTON模型,通过结构化文本提示编码服装-身体尺寸,并引入辅助头预测服装和暴露身体掩膜,结合纹理校正阶段,在真实数据集FittingEffect3K上验证了尺寸准确性和形状保持的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05478 2026-08-07 cs.GR cs.CL cs.CV cs.HC cs.LG cs.MM 新提交 67%

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

GenGA:面向学术论文的可编辑且基于数据的图形摘要生成

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17916 2026-07-21 cs.GR cs.CV cs.MM 新提交 67%

Packet-Loss Robust 3D Gaussian Compression via Atomic Packaging and GNN-based Error Concealment

通过原子封装和基于GNN的错误隐藏实现抗丢包的3D高斯压缩

Yuxuan Tao, Xuerui Ma, Hao Zhang, Chunhua Peng

机构 * Central South University Changsha China Malanshan Audio \& Video Laboratory Changsha China Central South University Malanshan Audio \& Video Laboratory

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 研究3D高斯压缩在网络流传输中丢包问题,提出通过原子封装、分层随机分组及基于GNN的错误隐藏框架,改进丢包时的渲染效果,相比无隐藏传输有显著提升,平均PSNR退化限制在约3dB。

Comments 21 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏