arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4229 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4229 篇

2503.00741 2026-02-16 eess.IV cs.CV 57%

LesionDiffusion: Towards Text-controlled General Lesion Synthesis

LesionDiffusion:面向文本控制的通用病变合成

Wenhui Lei, Henrui Tian, Linrui Dai, Hanyu Chen, Xiaofan Zhang

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The First Hospital of China Medical University(中国医科大学第一医院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 LesionDiffusion通过文本控制生成3D CT影像中的病变及掩码,提升病变分割性能,支持多种病变类型和器官,优于现有方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12160 2026-02-13 cs.CV 57%

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

DreamID-Omni: 一体化框架用于可控的人-centric音频视频生成

Xu Guo, Fulong Ye, Qichao Sun, Liyang Chen, Bingchuan Li, Pengze Zhang, Jiawei Liu, Songtao Zhao, Qian He, Xiangwang Hou

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamID-Omni提出了一种统一框架,通过双层解耦策略和多任务训练方案,实现对可控人-centric音频视频生成的高效控制。

Comments Project: https://guoxu1233.github.io/DreamID-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13757 2026-02-13 eess.IV cs.CV cs.LG 57%

Improving the Plausibility of Pressure Distributions Synthesized from Depth Image through Generative Modeling

通过生成模型提升从深度图像合成压力分布的可信度

Neevkumar Manavar, Hanno Gerd Meyer, Joachim Waßmuth, Barbara Hammer, Axel Schneider

机构 * Hochschule Bielefeld, Interaktion(比勒菲尔德应用科学大学,交互学院) CITEC, Bielefeld University(比勒菲尔德大学,CITEC研究中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过生成模型提升从深度图像合成压力分布的可信度,采用ILS和WOL增强物理一致性,对比实验显示其在性能和效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10173 2026-02-12 cs.CV 57%

ArtisanGS: Interactive Tools for Gaussian Splat Selection with AI and Human in the Loop

ArtisanGS: 带有AI和人机协作的高斯点选择交互工具

Clement Fuji Tsang, Anita Hu, Or Perel, Carsten Kolve, Maria Shugrina

机构 * NVIDIA NVIDIA Canada(NVIDIA 加拿大) University of Toronto Canada(多伦多大学 加拿大) NVIDIA France(NVIDIA 法国) University of Toronto(多伦多大学) Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所 俄亥俄州 大致) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉吉夫·甘地大学 亚当穆克 阿鲁纳恰尔邦 印度) Tsinghua University Haidian Qu Beijing Shi China(清华大学 海淀区 北京市 中国) Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心 肯塔基州 威斯康星州 美国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ArtisanGS通过交互式工具实现高斯点选择与分割,结合AI与人工干预,提供灵活的局部编辑功能,适用于真实场景中的可控编辑。

Comments 12 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10350 2026-02-11 cs.CV 57%

Benchmarking 3D Human Pose Estimation Models under Occlusions

在遮挡下评估3D人体姿态估计模型的基准测试

Filipa Lino, Carlos Santiago, Manuel Marques

机构 * Institute for Systems and Robotics, LARSyS(系统机器人研究所、LARSyS)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文评估了九种3D人体姿态估计模型在遮挡条件下的鲁棒性,发现所有模型在遮挡下性能下降,尤其是扩散模型表现不佳,揭示了当前模型在遮挡处理上的关键限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09425 2026-02-11 cs.CV cs.LG 57%

Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification

弥合道路激光雷达的模态差距:一种无需训练的视觉-语言模型框架用于车辆分类

Yiqiao Li, Bo Shang, Jie Wei

机构 * Department of Civil Engineering, City College of New York(城市学院土木工程系) Department of Computer Science, City College of New York(城市学院计算机科学系)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的视觉-语言模型框架,用于解决道路激光雷达中稀疏点云与密集图像之间的模态差距问题,实现细粒度车辆分类。

Comments 12 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18862 2026-02-11 cs.CV cs.AI 57%

TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models

TAMMs: 卫星图像时间序列中基于时序感知的多模态模型用于变化理解和预测

Zhongbin Guo, Yuhao Wang, Ping Jian, Chengzhi Li, Xinyue Chen, Zhen Yang, Ertai E

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 TAMMs通过时序感知多模态模型统一执行卫星图像时间序列中的变化理解和未来预测,提升长程时间动态建模能力。

Comments Published as a conference paper at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08068 2026-02-10 cs.CV 57%

ReRoPE: Repurposing RoPE for Relative Camera Control

ReRoPE:将RoPE用于相对相机控制

Chunyang Li, Yuanbo Yang, Jiahao Shao, Hongyu Zhou, Katja Schwarz, Yiyi Liao

机构 * Zhejiang University(浙江大学) Independent Researcher(独立研究者)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReRoPE通过将RoPE用于相对相机控制,实现可控视频生成,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06419 2026-02-09 cs.CV 57%

Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors

通过几何查询的语义先验学习人类在3D表面上的视觉注意

Soham Pahari, Sandeep C. Kumain

机构 * UPES Dehradun(德里敦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SemGeo-AttentionNet,通过几何查询语义先验,有效建模人类在3D表面的视觉注意,实现了显著性检测与扫描路径生成的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06042 2026-02-06 cs.LG cs.CV 57%

Pseudo-Invertible Neural Networks

伪可逆神经网络

Yamit Ehrlich, Nimrod Berman, Assaf Shocher

机构 * Ben-Gurion University(本·古里安大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出伪可逆神经网络,用于解决非线性逆问题,通过非线性反向投影实现零样本逆向生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05966 2026-02-06 cs.CV cs.AI 57%

LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation

LSA:局部语义对齐用于增强交通视频生成中的时间一致性

Mirlan Karimov, Teodora Spasojevic, Markus Braun, Julian Wiederer, Vasileios Belagiannis, Marc Pollefeys

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ETH Zurich(苏黎世联邦理工学院) Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LSA通过局部语义对齐提升交通视频生成的时间一致性,无需外部控制信号。

Comments Accepted to IEEE IV 2026. 8 pages, 3 figures. Code available at https://github.com/mirlanium/LSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05534 2026-02-06 cs.CV 57%

SSG: Scaled Spatial Guidance for Multi-Scale Visual Autoregressive Generation

SSG: 多尺度视觉自回归生成的缩放空间引导

Youngwoo Shin, Jiwan Hur, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SSG通过缩放空间引导方法,在无需训练的情况下提升多尺度视觉自回归生成的保真度和多样性,同时保持低延迟。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05213 2026-02-06 cs.CV 57%

Dual-Representation Image Compression at Ultra-Low Bitrates via Explicit Semantics and Implicit Textures

通过显式语义和隐式纹理实现超低比特率的双表示图像压缩

Chuqin Zhou, Xiaoyue Ling, Yunuo Chen, Jincheng Dai, Guo Lu, Wenjun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种融合显式语义和隐式纹理的图像压缩框架,通过无训练的方式提升超低比特率下的压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03339 2026-02-04 cs.CV 57%

Composable Visual Tokenizers with Generator-Free Diagnostics of Learnability

可组合的视觉标记生成器:无生成器诊断的可学习性

Bingchen Zhao, Qiushan Guo, Ye Wang, Yixuan Huang, Zhonghua Zhai, Yu Tian

机构 * University of Edinburgh(爱丁堡大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CompTok通过训练可组合的视觉标记生成器,提升图像生成的组合性和语义编辑能力,同时引入两个度量标准评估标记空间的可学习性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03314 2026-02-04 cs.CV 57%

PQTNet: Pixel-wise Quantitative Thermography Neural Network for Estimating Defect Depth in Polylactic Acid Parts by Additive Manufacturing

PQTNet:用于通过增材制造估计聚乳酸部件缺陷深度的像素级定量热成像神经网络

Lei Deng, Wenhao Huang, Chao Yang, Haoyuan Zheng, Yinbin Tian, Yue Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PQTNet通过像素级定量热成像神经网络,实现了对增材制造聚乳酸部件缺陷深度的高精度估计,具有高精度和鲁棒性的定量缺陷表征能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03105 2026-02-04 cs.CV 57%

Gromov Wasserstein Optimal Transport for Semantic Correspondences

Gromov Wasserstein最优传输用于语义对应关系

Francis Snelgar, Stephen Gould, Ming Xu, Liang Zheng, Akshay Asthana

机构 * Seeing Machines

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出使用 Gromov Wasserstein 最优传输算法替代传统方法,提升语义对应关系任务的性能并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01905 2026-02-03 cs.CV cs.AI cs.LG 57%

Learning Sparse Visual Representations via Spatial-Semantic Factorization

通过空间-语义分解学习稀疏视觉表示

Theodore Zhengde Zhao, Sid Kiblawi, Jianwei Yang, Naoto Usuyama, Reuben Tan, Noel C Codella, Tristan Naumann, Hoifung Poon, Mu Wei

机构 * Microsoft(微软)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 STELLAR通过空间-语义分解实现稀疏视觉表示,在保持高重建质量的同时达到与密集模型相当的语义性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 57%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00570 2026-02-03 cs.CV 57%

GLAD: Generative Language-Assisted Visual Tracking for Low-Semantic Templates

GLAD: 生成式语言辅助低语义模板视觉跟踪

Xingyu Luo, Yidong Cai, Jie Liu, Jie Tang, Gangshan Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GLAD通过生成式多模态融合提升低语义模板视觉跟踪性能,实现更高效的多模态特征融合与语义增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22887 2026-02-02 cs.LG cs.AI cs.CL cs.CV 57%

MoVE: Mixture of Value Embeddings -- A New Axis for Scaling Parametric Memory in Autoregressive Models

MoVE:价值嵌入的混合——扩展自回归模型参数内存的新轴

Yangyan Li

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 MoVE通过引入价值嵌入的混合机制,实现了自回归模型参数内存的独立扩展,提升了文本和图像生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19236 2026-02-02 cs.RO cs.CV 57%

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

MemoryVLA: 视觉-语言-动作模型中用于机器人操作的感知-认知记忆

Hao Shi, Bin Xie, Yingfei Liu, Lin Sun, Fengrong Liu, Tiancai Wang, Erjin Zhou, Haoqiang Fan, Xiangyu Zhang, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学) Dexmal MEGVII Technology(MEGVII技术) Tianjin University(天津大学) Harbin Institute of Technology(哈尔滨工业大学) StepFun

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MemoryVLA通过结合感知与认知记忆机制,提升机器人操作中长时间跨度任务的性能,实现对时间依赖任务的高效处理。

Comments ICLR 2026 | The project is available at https://shihao1895.github.io/MemoryVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22455 2026-02-02 cs.CV 57%

ScribbleSense: Generative Scribble-Based Texture Editing with Intent Prediction

ScribbleSense: 基于生成的涂鸦纹理编辑与意图预测

Yudi Zhang, Yeming Geng, Lei Zhang

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 ScribbleSense通过结合多模态大语言模型和图像生成模型,实现了基于生成的涂鸦纹理编辑与意图预测,提升交互式编辑性能。

Comments Accepted by IEEE TVCG. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22522 2026-01-30 cs.LG cs.CV 57%

JointDiff: Bridging Continuous and Discrete in Multi-Agent Trajectory Generation

JointDiff: 在多智能体轨迹生成中弥合连续与离散

Guillem Capellera, Luis Ferraz, Antonio Rubio, Alexandre Alahi, Antonio Agudo

机构 * Kognia Sports Intelligence(Kognia体育智能) Visual Intelligence for Transportation, EPFL(交通视觉智能,EPFL) Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息工业研究所,CSIC-UPC)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 JointDiff通过联合生成连续和离散事件,提升多智能体轨迹生成的可控性和真实性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20425 2026-01-29 cs.CV 57%

Quartet of Diffusions: Structure-Aware Point Cloud Generation through Part and Symmetry Guidance

四重扩散:通过部件和对称性指导的结构感知点云生成

Chenliang Zhou, Fangcheng Zhong, Weihao Xia, Albert Miao, Canberk Baykal, Cengiz Oztireli

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 四重扩散通过部件和对称性指导,实现了结构感知的点云生成,首次在生成过程中整合并强制执行对称性和部件先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19461 2026-01-28 cs.CV cs.RO eess.IV 57%

Towards Gold-Standard Depth Estimation for Tree Branches in UAV Forestry: Benchmarking Deep Stereo Matching Methods

面向无人机林业作业的树枝深度估计金标准:深度立体匹配方法的基准测试

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) Victoria University of Wellington(惠灵顿维多利亚大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) University of Canterbury(坎特伯雷大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文首次系统评估了八种深度立体匹配方法在无人机林业中对树枝深度估计的性能,发现DEFOM在植被密集环境下表现最佳,成为新的金标准基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01943 2026-01-28 cs.CV 57%

Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

基于协作轨迹控制的机器人操作视频生成学习

Xiao Fu, Xintao Wang, Xian Liu, Jianhong Bai, Runsen Xu, Pengfei Wan, Di Zhang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 RoboMaster通过协作轨迹控制方法,解决多物体交互建模问题,实现机器人操作视频生成的高保真度与多物体交互建模。

Comments ICLR 2026. Project Page: https://fuxiao0719.github.io/projects/robomaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16532 2026-01-27 cs.CV 57%

AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding

AnchoredDream: 通过几何约束从单视角生成零样本360°室内场景

Runmao Yao, Junsheng Zhou, Zhen Dong, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Wuhan University(武汉大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AnchoredDream通过几何约束和外观-几何互促机制,实现从单视角零样本生成高质量360°室内场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17857 2026-01-27 cs.CV 57%

SynMind: Reducing Semantic Hallucination in fMRI-Based Image Reconstruction

SynMind:减少基于fMRI的图像重建中的语义幻觉

Lan Yang, Minghan Yang, Ke Li, Honggang Zhang, Kaiyue Pang, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) SketchX Lab, Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(SketchX实验室,视觉、语音和信号处理中心(CVSSP), Surrey大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SynMind通过整合显式语义编码与视觉先验,提升基于fMRI的图像重建质量,减少语义幻觉并提高与人类视觉感知的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17088 2026-01-27 cs.CV 57%

GlassesGB: Controllable 2D GAN-Based Eyewear Personalization for 3D Gaussian Blendshapes Head Avatars

GlassesGB: 可控的基于GAN的2D眼镜个性化技术用于3D高斯混合形状头虚拟角色

Rui-Yang Ju, Jen-Shiun Chiang

机构 * Kyoto University(京都大学) Tamkang University(Tamkang 大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 GlassesGB结合GAN与3D高斯混合形状技术,实现可控的2D眼镜个性化生成,用于3D头虚拟角色的定制化设计。

Comments IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16429 2026-01-26 cs.CV cs.AI 57%

AlphaFace: High Fidelity and Real-time Face Swapper Robust to Facial Pose

AlphaFace: 高保真和实时的面部交换器,对面部姿态具有鲁棒性

Jongmin Yu, Hyeontaek Oh, Zhongtian Sun, Angelica I Aviles-Rivero, Moongu Jeon, Jinhong Yang

机构 * University of Cambridge(剑桥大学) University of Kent(肯特大学) Tsinghua University(清华大学) Gwangju Institute of Science and Technology(全州科学技术院) Inje University(庆北大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AlphaFace通过结合视觉-语言模型和CLIP嵌入,实现高保真和实时的面部交换,提升对极端面部姿态的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏