arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 198 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 198 篇

2607.17638 2026-07-21 cs.CV 新提交 57%

Reviving Ancient Paintings via Poem: A Colorization Framework for Aligning Cultural Semantics

通过诗歌复兴古画:一种用于对齐文化语义的色彩化框架

Junming Gao, Biao Zhu, Xiaosong Wang, Tan Tang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对古画褪色问题,提出PoemColor框架,通过诗歌绘画投影仪和结构感知语义注意力,将诗歌文化语义与绘画恢复对齐,并构建混合数据集。实验证明该框架显著优于现有方法,能实现可控色彩化,恢复古画历史真实性与诗歌语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12433 2026-07-15 cs.CV cs.AI 新提交 57%

ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning

ARDepth:基于渐进视觉条件的自回归单目深度估计

Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) Baidu Inc.(百度公司) LightSpeed Studios, Tencent America(美国光速工作室,腾讯) School of Computer Science and Artificial Intelligence, Lanzhou University of Technology(兰州理工大学计算机科学与人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究单目深度估计问题,提出ARDepth方法,将其作为结构化自回归生成任务,通过尺度渐进条件和语义感知引导,逐步构建深度表示,实现跨尺度结构一致的深度预测,验证了自回归生成是几何建模的有前景范式。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10537 2026-07-14 cs.SD cs.MM eess.AS 新提交 57%

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

利用未配对数据和对比对齐进行预训练的舞蹈音乐生成

Ryota Kimura, Sangheon Park, Natalia Polouliakh, Taketo Akama

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Keio University(庆应义塾大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

AI总结 针对舞蹈音乐生成中高质量配对数据稀缺问题,提出利用未配对和配对数据的框架,结合预训练单峰编码器、对比预训练及控制网络模块,实验证明该方法提升了舞蹈音乐对齐和音频质量,优于现有技术。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09362 2026-07-13 cs.CV cs.AI 新提交 57%

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿

Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park

机构 * NXN Labs(NXN实验室) KAIST(韩国科学技术院)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 研究旨在解决虚拟试穿中用户对服装穿着方式控制不足的问题。提出通过VIP - SAM解决视觉实例提示分割,引入CtrlVTON可控框架,将试穿转为图像编辑问题并添加分割掩码控制布局。二者在各自任务达先进水平,CtrlVTON能更忠实地遵循用户布局且保证服装逼真度。

Comments 13 + 17 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09024 2026-07-13 cs.CV cs.AI 新提交 57%

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27071 2026-07-10 cs.CV 新提交 57%

PanoImager: Geometry-Guided Novel View Synthesis and Reconstruction from Sparse Panoramic Views

PanoImager:基于几何引导的稀疏全景视图新视角合成与重建

Zhisong Xu, Takeshi Oishi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学生产技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出PanoImager框架,无需SfM,结合前馈位姿/深度先验、几何条件扩散视图补全和深度引导3DGS优化,从稀疏全景图像实现稳定新视角合成与重建。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06871 2026-07-09 cs.CV 新提交 57%

Geometric Collapse: When Vision Models Fail to Verify Physical Causality

几何崩溃:视觉模型何时无法验证物理因果关系

Wentao Zhang, Jinhu Qi, Weiqiang Jin, Yifei Zhang, Chan-Tong Lam, Irwin King

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学) AgentecFusion Limited(AgentecFusion有限公司) School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究视觉模型在验证物理因果关系时的问题,提出“Scrambled Edges”方法,通过特定控制分离无支撑边缘证据影响,实验表明该方法使预测偏差增大,几何崩溃全局传播,为改进模型物理合理性提供依据。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交 57%

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06555 2026-07-08 cs.CV 新提交 57%

ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation

ProxyPose:通过视频到视频转换进行六自由度姿态跟踪

Ruihang Zhang, Felix Taubner, Pooja Ravi, Kiriakos N. Kutulakos, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决单目视频中6-DoF姿态跟踪问题,核心方法是将其转化为视频到视频转换,利用视频扩散模型生成代理视频,通过现成求解器恢复姿态。主要贡献是在无额外输入下实现高精度,且可扩展到多种场景。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05787 2026-07-08 cs.CV 新提交 57%

DeSeG: Decoupling Semantic Intent and Geometric Constraints for Physically Plausible Human-Scene Interaction

DeSeG:解耦语义意图和几何约束以实现物理上合理的人机场景交互

Jiakun Li, Zhe Li, Wenqiang Wu, Zheng Chang, Mingqi Gao, Jinyu Yang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Spatialtemporal AI(时空人工智能) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Sheffield(谢菲尔德大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对合成物理合理人机场景交互时语义 - 几何纠缠问题,提出DeSeG分层框架,通过残差语义规划器和物理正则化扩散执行器解耦语义意图与几何约束,实验表明该方法性能达最优,有效降低场景穿透率并提高语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 57%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02712 2026-07-07 cs.CV 新提交 57%

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

归一化物体坐标空间中用于生成视图合成的全局姿态控制

Zhibing Li, Amogh Gupta, Behnoosh Parsa, Dan Casas

机构 * The Chinese University of Hong Kong(香港中文大学) Amazon(亚马逊)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 针对现有生成模型在目标视图全局控制上的不足,提出在归一化物体坐标空间中精确相机控制的新方法,以单张或少量无姿态图像为输入,将视图合成视为图像编辑问题,提升了视图生成质量和保真度。

Comments Accepted to ECCV 2026. Project page https://lizb6626.github.io/GlobalNVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01990 2026-07-03 cs.CV 新提交 57%

Training-free Controllable Human Motion Generation under Heterogeneous Constraints

异构约束下无需训练的可控人体运动生成

Xiaofei Hui, Bo Yan, Haoxuan Qu, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Motion-Inference-as-Control框架,将扩散运动生成建模为随机控制问题,统一处理连续目标型和基于准则的约束,无需约束特定训练或可微性要求。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交 57%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00545 2026-07-02 cs.CV 新提交 57%

ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation

ECoSim:面向可控交通模拟的数据高效微调

Yu-Hsiang Chen, Wei-Jer Chang, Yi-Ting Chen, Masayoshi Tomizuka

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出轻量级控制适应框架,通过身份初始化的FiLM层调制中间特征,为预训练的扩散和自回归交通模型添加多模态控制(草图、潜在行为编码和文本),使用不到1%的配对数据实现强可控性。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00371 2026-07-02 cs.CV cs.AI 新提交 57%

MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts

MEPA: 基于专家混合的多尺度表示对齐用于视觉自回归建模

Nuoyan Zhou, Zhijun Tu, Lei Yu, Kun Cheng, Jie Hu, Nannan Wang, Xinghao Chen

机构 * State Key Laboratory of Integrated Services Networks, Xidian University(西安电子科技大学综合业务网理论及关键技术国家重点实验室) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对视觉自回归模型在多尺度表示学习中的优化冲突和语义传播问题,提出尺度感知的专家混合架构和残差特征聚合方案,提升训练效率和生成质量。

Comments 15 pages, 4 figures, 8 tables, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00293 2026-07-02 cs.CV cs.CL cs.LG 新提交 57%

Rosetta: Composable Native Multimodal Pretraining

Rosetta: 可组合的原生多模态预训练

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出Rosetta框架,通过动量锚定正交投影(MAOP)实现无损模态扩展,解决多模态预训练中的灾难性遗忘和梯度冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交 57%

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27332 2026-06-26 cs.CV 新提交 57%

RoPEMover: Depth-Aware Object Relocation via Positional Embeddings

RoPEMover: 通过位置嵌入实现深度感知的物体重定位

Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy, Aysegul Dundar

机构 * Bilkent University(比尔肯大学) Brown University(布朗大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散Transformer位置表示(RoPE)的几何感知物体运动方法,通过深度感知的2D RoPE扩展实现3D空间位移,在合成数据与少量真实图像训练下,实现物体身份保持、遮挡区域生成及阴影光照一致更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27192 2026-06-26 cs.CV 新提交 57%

LISA: Likelihood Score Alignment for Visual-condition Controllable Generation

LISA: 似然分数对齐用于视觉条件可控生成

Yanghao Wang, Hongxu Chen, Jiazhen Liu, Zhenqi He, Rui Liu, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出LISA方法,通过将侧网络中间特征与近似似然分数对齐,加速训练收敛并提升生成质量,且不增加推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25376 2026-06-25 cs.CV 新提交 57%

Transferable Attack against Face Swapping in an Extended Space

扩展空间中针对人脸交换的可迁移攻击

Mingzhi Lyu, Yi Huang, Jun Xie, Zihao Zhao, Hong Xu, Adams Wai-Kin Kong

机构 * IEEE(电气电子工程师学会) IEEE International Conference on Multimedia and Expo (ICME)(IEEE国际多媒体与展览会议)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于重光照函数的加性身份攻击(AIR),通过联合重光照和加性扰动扩展攻击空间,生成强且视觉自然的对抗样本,无需代理模型即可高效迁移攻击多种主体无关的人脸交换模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24333 2026-06-24 cs.CV 新提交 57%

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23675 2026-06-23 cs.CV 新提交 57%

IMAGIN-4D: Image-Guided Controllable Interaction Generation

IMAGIN-4D:图像引导的可控交互生成

Sai Kumar Dwivedi, Federica Bogo, Buğra Tekin, Chenhongyi Yang, Nadine Bertsch, Tomas Hodan, Michael J. Black, Dimitrios Tzionas, Shreyas Hampali

机构 * Meta, Zurich(Meta 苏黎世)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出IMAGIN-4D,一种基于扩散模型的人-物交互生成方法,通过时空分解的图像条件控制交互细节,提升细粒度交互控制能力。

Comments 15 pages, 8 figures. Project page: https://imagin4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22931 2026-06-23 cs.CV cs.AI 新提交 57%

BEV-Denoise: Learning Intrinsic Noise for Accurate Bird's-Eye-View Semantic Segmentation

BEV-Denoise:学习内在噪声以实现精确的鸟瞰图语义分割

Dooseop Choi, Kyounghwan An, Kyoung-Wook Min

机构 * Electronics and Telecommunications Research Institute (ETRI)(韩国电子通信研究院) University of Science and Technology (UST)(科学技术联合大学院大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出BEV-Denoise框架,利用UNet噪声估计模块从鸟瞰图特征中去除内在噪声,通过任务分解学习范式训练,提升多种视图变换模型的语义分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20891 2026-06-23 cs.CV cs.LG 新提交 57%

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track: 基于点追踪的视频合成与运动控制

Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

机构 * Netflix USA(Netflix美国) Eyeline Labs USA(Eyeline Labs美国) University of Oxford(牛津大学) Eyeline Labs Los Angeles USA(Eyeline Labs洛杉矶美国) University of California, Los Angeles(加州大学洛杉矶分校) Stony Brook University USA(石溪大学美国) Columbia University USA(哥伦比亚大学美国) Eyeline Labs United Kingdom(Eyeline Labs英国) Netflix Los Angeles USA(Netflix洛杉矶美国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Go-with-the-Track,通过联合条件多参考图像和参考锚定点轨迹,统一视频合成与运动控制,实现精确合成与运动控制。

Comments SIGGRAPH 2026, Project page: https://eyeline-labs.github.io/Go-with-the-Track/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20404 2026-06-19 cs.CV 新提交 57%

FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows

FlowBender: 面向自校正条件流的反馈感知训练

Daniel Gilo, Sven Elflein, Ido Sobol, Or Litany

机构 * Technion(以色列理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对条件扩散/流模型常违反任务约束的问题,提出FlowBender闭环框架,将对齐误差作为输入训练网络学习校正策略,在图像翻译、复原和3D纹理贴图中同时提升保真度与合理性。

Comments Project page: https://flow-bender.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20108 2026-06-19 cs.CV cs.LG 新提交 57%

EFIQA: Explainable Fundus Image Quality Assessment via Anatomical Priors

EFIQA: 基于解剖先验的可解释眼底图像质量评估

Pengwei Wang, José Morano, Qian Wan, Hrvoje Bogunović

机构 * Institute of Artificial Intelligence, Center for Medical Data Science, Medical University of Vienna, Austria(维也纳医科大学医学数据科学中心人工智能研究所) Christian Doppler Lab for Artificial Intelligence in Retina, Medical University of Vienna, Austria(维也纳医科大学视网膜人工智能克里斯蒂安·多普勒实验室)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 提出无需质量标签的EFIQA框架,利用解剖先验通过掩膜解剖修复学习正常结构,生成空间质量图,在多个基准上超越监督方法,兼具可解释性。

Comments Accepted in MIDL 2026. Code: https://github.com/penway/EFIQA

Journal ref Proceedings of Machine Learning Research 315:2248-2264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19958 2026-06-19 cs.CV 新提交 57%

SketchKeyAnime: Reference-anchored Sparse Key-Sketch Animation Synthesis

SketchKeyAnime:基于参考锚点的稀疏关键草图动画合成

Meixi Li, Xianlin Zhang, Yue Zhang, Xueming Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SketchKeyAnime视频扩散框架,通过双分支条件机制和可学习门控的草图交叉注意力,从单张参考RGB图像和稀疏关键草图生成结构可控、外观一致且时间连贯的动画,在Sakuga-42M数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17520 2026-06-17 cs.RO cs.CV 新提交 57%

GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments

GASE:基于高斯溅射的自动化系统用于重建具身仿真环境

Jiawei Zhang, Yiming Yan, Chao Liang, Nuo Xu, Seson Sun, Qichen Zhang, Yuhao Xu, Yantai Yang, Yingqiao Wang, Qin Jin, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学SAI学院AutoLab实验室) AIM3 Lab, School of Information, Renmin University of China(中国人民大学信息学院AIM3实验室) Research Lab, Anyverse Dynamics(Anyverse Dynamics研究实验室)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 提出GASE系统,利用全景相机阵列和多视图视频流,通过相机位姿策略提取前景物体并修复场景,独立重建后导入物理仿真器,实现高效高保真仿真环境构建,分割精度提升超10%,真实机器人部署性能差距小于10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17431 2026-06-17 cs.CV 新提交 57%

Visual Retrieval-Augmented Generation for Silhouette-Guided Animal Art

视觉检索增强生成:基于轮廓引导的动物艺术创作

Quoc-Duy Tran, Anh-Tuan Vo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国立大学理科大学) Vietnam National University, Ho Chi Minh(胡志明市国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出视觉检索增强生成(Visual-RAG)框架,通过检索与自然轮廓结构相似的动物形状,结合ControlNet和IP-Adapter引导扩散模型生成动物艺术,实现计算空想性视错觉。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏