arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4229 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4229 篇

2603.02129 2026-03-03 cs.CV cs.AI 57%

LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation

LiftAvatar:基于运动空间的表达控制3D高斯人偶动画

Hualiang Wei, Shunran Jia, Jialun Liu, Wenhui Li

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Institute of Artificial Intelligence of China Telecom(中国电信人工智能研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LiftAvatar通过多粒度表达控制和多参考条件机制,提升3D人偶动画的质量和可控性。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01950 2026-03-03 cs.LG cs.CL cs.CV 57%

Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment

语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训

Christopher Driggers-Ellis, Nachiketh Tibrewal, Rohit Bogulla, Harsh Khanna, Sangpil Youm, Christan Grant, Bonnie Dorr

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。

Comments 8 pages, 2 figures, 3 tables. Includes link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25976 2026-03-03 cs.CV cs.AI q-bio.NC 57%

Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer

通过脑交互变换器从fMRI中进行图像重建

Roman Beliy, Amit Zalcher, Jonathan Kogman, Navve Wasserman, Michal Irani

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Brain-IT通过脑交互变换器从fMRI中实现高保真图像重建,结合高层语义和低层结构特征,提升重建精度与效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24365 2026-03-03 cs.CV cs.AI 57%

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型

Jitai Hao, Hao Liu, Xinyan Xiao, Qiang Huang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Baidu Inc.(百度公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00443 2026-03-03 cs.CV 57%

SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment

SesaHand: 通过语义和结构对齐可控生成增强3D手重建

Zhuoran Zhao, Xianghao Kong, Linlin Yang, Zheng Wei, Pan Hui, Anyi Rao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Communication University of China(中国通信大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SesaHand通过语义和结构对齐提升可控手部生成,优化3D手重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12811 2026-03-03 cs.CV cs.AI cs.LG 57%

Next Visual Granularity Generation

下一步视觉粒度生成

Yikai Wang, Zhouxia Wang, Zhonghua Wu, Qingyi Tao, Kang Liao, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 NVG框架通过分层生成方法实现图像生成,优于VAR系列,提升FID分数并展示出良好的扩展性和潜在应用。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21449 2026-03-02 cs.CV 57%

Towards Generating Realistic 3D Semantic Training Data for Autonomous Driving

朝向生成逼真3D语义训练数据以实现自动驾驶

Lucas Nunes, Rodrigo Marcuzzi, Jens Behley, Cyrill Stachniss

机构 * Center for Robotics, University of Bonn, Germany(bonn大学机器人中心) RWTH Aachen, Germany(亚琛工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(lamarr机器学习与人工智能研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需投影或分离开的多分辨率模型的3D语义生成方法,生成更逼真的场景数据,提升自动驾驶训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22742 2026-02-27 cs.CV 57%

ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

ProjFlow: 基于流匹配的投影采样用于零样本精确空间运动控制

Akihisa Watanabe, Qing Yu, Edgar Simo-Serra, Kent Fujiwara

机构 * Waseda University(早稻田大学) LY Corporation(LY公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ProjFlow通过引入运动学感知度量和时间变化公式,在无需训练的情况下实现精确空间约束满足,提升运动现实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22596 2026-02-27 cs.CV cs.AI 57%

BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model

BetterScene: 一种基于表示对齐生成模型的3D场景合成

Yuci Han, Charles Toth, John E. Anderson, William J. Shuart, Alper Yilmaz

机构 * Dept. of Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) USACE ERDC GRL(美国陆军工程兵队ERDC GRL)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BetterScene通过引入时间等价性正则化和视觉基础模型对齐的表示,提升3D场景合成的视角一致性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22549 2026-02-27 cs.CV cs.AI 57%

DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation

DrivePTS: 一种结合文本和结构增强的渐进式学习框架用于驾驶场景生成

Zhechao Wang, Yiming Zeng, Lufan Ma, Zeqing Fu, Chen Bai, Ziyao Lin, Cheng Lu

机构 * XPeng Motors

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DrivePTS通过渐进式学习、多视角文本生成和频率引导结构损失,提升驾驶场景生成的保真度和可控性,生成稀有场景并增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19565 2026-02-27 cs.CV cs.AI 57%

DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

DICArt: 在离散状态空间中推进类别级拟合物体姿态估计

Li Zhang, Mingyu Mei, Ailing Wang, Xianhui Meng, Yan Zhong, Xinyuan Song, Liu Liu, Rujing Wang, Zaixing He, Cewu Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Peking University(北京大学) Emory University(埃默里大学) Hefei University of Technology(合肥工业大学) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DICArt通过离散扩散过程和层次化运动学耦合策略,提升复杂环境下类别级6D姿态估计的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21929 2026-02-26 cs.CV 57%

Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文

JiaKui Hu, Jialun Liu, Liying Yang, Xinliang Zhang, Kaiwen Li, Shuang Zeng, Yuanwei Li, Haibin Huang, Chi Zhang, Yanye Lu

机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) TeleAI MUST

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19430 2026-02-26 cs.CV 57%

TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation

TherA: 用于可控RGB到热红外转换的热感知视觉-语言提示

Dong-Guw Lee, Tai Hyoung Rhee, Hyunsoo Jang, Young-Sik Shin, Ukcheol Shin, Ayoung Kim

机构 * Seoul National University(首尔国立大学) Kyungpook National University(庆北国立大学) KENTECH

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 TherA通过热感知视觉-语言提示方法,实现了可控的RGB到热红外转换,提升了翻译性能和细粒度控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21593 2026-02-26 cs.LG cs.CR cs.CV 57%

Breaking Semantic-Aware Watermarks via LLM-Guided Coherence-Preserving Semantic Injection

破坏语义感知水印:通过LLM引导的保持连贯性语义注入

Zheng Gao, Xiaoyu Li, Zhicheng Bao, Xiaoyan Feng, Jiaojiao Jiang

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CSI攻击,利用LLM引导的语义操纵破坏语义水印的绑定,揭示当前语义水印设计在面对LLM驱动的语义扰动时的安全漏洞。

Comments Accepted by The Web Conference 2026 (Short Paper Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21365 2026-02-26 cs.CV cs.AI cs.LG eess.IV 57%

Towards Controllable Video Synthesis of Routine and Rare OR Events

面向常规和罕见OR事件可控视频合成

Dominik Schneider, Lalithkumar Seenivasan, Sampath Rapuri, Vishalroshan Anil, Aiza Maksutova, Yiqing Shen, Jan Emily Mangulabnan, Hao Ding, Jose L. Porras, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Technical University Munich(慕尼黑技术大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种可控视频合成框架,用于生成手术室中常规和罕见事件,以支持环境智能模型的发展。

Comments Accepted to IPCAI 2026 and submitted to IJCARs

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21188 2026-02-25 cs.CV 57%

Human Video Generation from a Single Image with 3D Pose and View Control

从单张图像生成人类视频:结合3D姿态和视角控制

Tiantian Wang, Chun-Han Yao, Tao Hu, Mallikarjun Byrasandra Ramalinga Reddy, Ming-Hsuan Yang, Varun Jampani

机构 * Electrical Engineering and Computer Science, University of California, Merced, CA 95343, United States.(电子工程与计算机科学系,加州大学默塞德分校) Stability AI, Los Angeles, CA 90067, United States.(Stability AI)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HVG模型,通过3D姿态和视角控制从单张图像生成高质量多视角人类视频,解决了衣物褶皱和时空一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21175 2026-02-25 cs.CV 57%

Seeing Through Words: Controlling Visual Retrieval Quality with Language Models

通过文字看见:利用语言模型控制视觉检索质量

Jianglin Lu, Simon Jenni, Kushal Kafle, Jing Shi, Handong Zhao, Yun Fu

机构 * Adobe Research(Adobe研究部) Northeastern University(东北大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 通过生成语言模型扩展短查询并控制图像质量,提升视觉检索效果和可控性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20377 2026-02-25 cs.GR 57%

Directly from Alpha to Omega: Controllable End-to-End Vector Floor Plan Generation

从Alpha到Omega:可控的端到端向量平面生成

Shidong Wang, Renato Pajarola

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

AI总结 CE2EPlan通过端到端可控模型直接从数据学习平面设计,提升生成质量与多样性,接近人类设计师的灵活性。

Comments accepted to IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20079 2026-02-24 cs.CV 57%

SemanticNVS: Improving Semantic Scene Understanding in Generative Novel View Synthesis

SemanticNVS: 提高生成式新视角合成中的语义场景理解

Xinya Chen, Christopher Wewer, Jiahao Xie, Xinting Hu, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Germany(马克斯·普朗克研究所信息学院,萨尔兰州信息学院,德国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SemanticNVS通过整合预训练语义特征提取器,提高生成式新视角合成中远距离视角下的生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19937 2026-02-24 cs.CV 57%

Learning Positive-Incentive Point Sampling in Neural Implicit Fields for Object Pose Estimation

在神经隐式场中学习正激励点采样用于物体姿态估计

Yifei Shi, Boyan Wan, Xin Xu, Kai Xu

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出结合SO(3)-等价卷积隐式网络和正激励点采样策略的方法,提升物体姿态估计的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19358 2026-02-24 cs.CV 57%

Referring Layer Decomposition

提及层分解

Fangyi Chen, Yaojie Shen, Lu Xu, Ye Yuan, Shu Zhang, Yulei Niu, Longyin Wen

机构 * Intelligent Editing Team, Intelligent Creation, ByteDance(字节跳动智能创作部)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 提及层分解任务通过预测RGBA层实现精确的视觉内容控制,结合大规模数据集和评估协议,提升图像编辑和生成的可控性与质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14720 2026-02-24 cs.CV 57%

ShapeShift: Text-to-Mosaic Synthesis via Semantic Phase-Field Guidance

ShapeShift: 通过语义相场指导实现文本到马赛克合成

Vihaan Misra, Peter Schaldenbrand, Jean Oh

机构 * Carnegie Mellon University USA(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ShapeShift通过语义相场指导实现文本到马赛克合成,结合语义指导与可行性约束解决,提升排列的语义清晰性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18817 2026-02-24 cs.CV 57%

HeRO: Hierarchical 3D Semantic Representation for Pose-aware Object Manipulation

HeRO:用于姿态感知物体操作的分层3D语义表示

Chongyang Xu, Shen Cheng, Haipeng Li, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Dexmal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HeRO通过分层语义场结合几何与语义,提升姿态感知操作的控制策略,实现多个任务的成功率提升。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18282 2026-02-23 cs.CV 57%

DEIG: Detail-Enhanced Instance Generation with Fine-Grained Semantic Control

DEIG:细节增强的实例生成与细粒度语义控制

Shiyan Du, Conghan Yue, Xinyu Cheng, Dongyu Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DEIG通过细粒度语义控制生成多实例场景,提升空间一致性与语义准确性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15922 2026-02-19 cs.RO cs.CV cs.LG 57%

World Action Models are Zero-shot Policies

世界动作模型是零样本策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

机构 * NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。

Comments Project page: https://dreamzero0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17091 2026-02-19 cs.CV cs.AI cs.LG 57%

Ctrl-GenAug: Controllable Generative Augmentation for Medical Sequence Classification

Ctrl-GenAug: 可控生成增强用于医学序列分类

Xinrui Zhou, Yuhao Huang, Haoran Dou, Shijing Chen, Ao Chang, Jia Liu, Weiran Long, Jian Zheng, Erjiao Xu, Jie Ren, Alejandro F. Frangi, Ruobing Huang, Jun Cheng, Xiaomeng Li, Wufeng Xue, Dong Ni

机构 * National-Regional Key Technology Engineering Laboratory for Medical Ultrasound(国家级区域医疗超声关键技术工程实验室) School of Biomedical Engineering(生物医学工程学院) Medical School(医学院) Shenzhen University(深圳大学) Medical UltraSound Image Computing (MUSIC) Lab(医学超声图像计算(MUSIC)实验室) School of Artificial Intelligence(人工智能学院) The Hong Kong University of Science and Technology(香港科学与技术大学) Department of Electronic and Computer Engineering(电子与计算机工程系) The University of Manchester(曼彻斯特大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学第三附属医院) Longgang District People’s Hospital of Shenzhen(深圳龙岗区人民医院) The Second Affiliated Hospital of The Chinese University of Hong Kong(香港中文大学第二附属医院) School of Biomedical Engineering and Informatics(生物医学工程与信息学学院) NIHR Manchester Biomedical Research Centre(NIHR曼彻斯特生物医学研究中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Ctrl-GenAug通过可控生成增强方法提升医学序列分类性能,解决语义和序列可控性不足及噪声样本问题。

Comments Accepted by International Journal of Computer Vision, 30 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13159 2026-02-18 cs.CV 57%

Digital Twin Generation from Visual Data: A Survey

从视觉数据生成数字孪生:一项调查

Andrew Melnik, Benjamin Alt, Giang Nguyen, Artur Wilkowski, Maciej Stefańczyk, Qirui Wu, Sinan Harms, Helge Rhodin, Manolis Savva, Michael Beetz

机构 * University of Bremen(不莱梅大学) Warsaw University of Technology(华沙技术大学) Bielefeld University(比勒菲尔德大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文综述了从视觉数据生成数字孪生的最新方法,探讨了多种技术及其挑战,为实际应用提供了全面的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05100 2026-02-16 cs.CE cs.CV cs.SC 57%

Rule-Based Spatial Mixture-of-Experts U-Net for Explainable Edge Detection

基于规则的时空专家混合U-Net可解释边缘检测

Bharadwaj Dogga, Kaaustaaub Shankar, Gibin Raju, Wilhelm Louw, Kelly Cohen

机构 * Ph.D. Candidate, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Research Student, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Postdoctoral Researcher, Department of Multidisciplinary Engineering, TA\&M University, \ Station, TX 77843, USA e-mail: Research Associate AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Director AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 基于规则的时空专家混合U-Net通过融合深度语义特征与启发式边缘信号,实现边缘检测的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12401 2026-02-16 cs.CV 57%

ZeroDiff++: Substantial Unseen Visual-semantic Correlation in Zero-shot Learning

ZeroDiff++: 零样本学习中显著的未见视觉-语义相关性

Zihan Ye, Shreyank N Gowda, Kaile Du, Weijian Luo, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) School of Computer Science, the University of Nottingham(诺丁汉大学计算机学院) Southeast University(东南大学) hi-lab of Xiaohongshu Inc(小红书公司hi实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ZeroDiff++通过扩散生成框架提升零样本学习中视觉-语义相关性,解决虚假相关性和数据稀缺问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏