arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-09-01 至 2026-09-01 共收录 19 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 19 篇

2511.19811 2026-09-01 cs.CV cs.CL cs.LG 版本更新 83%

TPSO: Training-Free Diverse Image Generation via Semantic Prompt Embedding Optimization

无需训练生成多样化且高保真的图像 via 提示语义空间优化

Debin Meng, Chen Jin, Zheng Gao, Yanran Li, Ioannis Patras, Georgios Tzimiropoulos

机构 * Queen Mary University of London(伦敦女王学院) Centre for AI, AstraZeneca(AstraZeneca人工智能中心) University of Bedfordshire(贝德福德大学) Samsung AI Center(三星人工智能中心)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出TPSO方法,通过优化提示语义空间提升图像生成的多样性和保真度,无需训练且适用于多种模型。

Comments Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026). 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14056 2026-09-01 cs.CV cs.AI 版本更新 79%

POCI-Diff: 3D-Layout Guided Diffusion for Controllable Synthetic Surveillance Data Generation

POCI-Diff: 通过3D布局引导扩散实现位置对象一致性和交互

Andrea Rigo, Luca Stornaiuolo, Weijie Wang, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM沃森人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 POCI-Diff通过3D布局引导扩散实现一致性和交互性的物体位置控制,提升文本到图像生成的布局一致性和编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30709 2026-09-01 cs.CV cs.AI 新提交 74%

RailSyn: Diagnosis-Guided Image Generation for Traceable Data Completion in Railway Foreign Object Detection

RailSyn:面向铁路异物检测中可追溯数据补全的诊断引导图像生成方法

Quan Hao, Chenxi Zhang, Ziyang Tao, Yuyuan Zhou, Yudong Wang, Rui Shi, Lechuan Xu, Changhao Liu, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) Pratt School of Engineering, Duke University(杜克大学普拉特工程学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 RailSyn是诊断引导的图像生成框架,通过检查器定位补全区域并明确需求,生成器满足需求,可提升RFOD检测性能,在9种主流检测器上AP50--95最高增益4.9点,具跨架构实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29473 2026-09-01 math.OC q-fin.MF 新提交 71%

Stochastic Optimal Control of Hawkes Jump-Diffusion Systems

霍克斯跳扩散系统的随机最优控制

Daria Sakhanda, Joshué Helí Ricalde-Guerrero

专题命中 可控生成 :diffusion(title)

AI总结 本文针对含环境风险的随机增长模型,扩展泊松点过程框架至标记霍克斯过程驱动的灾害,建立受控霍克斯动力学适定性,获霍克斯激发过程定量估计,证明小激发下霍克斯价值函数收敛于泊松对应值,为随机控制问题提供泊松近似并量化自激发影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30125 2026-09-01 cs.SD cs.AI cs.CL cs.CV cs.LG 新提交 70%

VIBE: Video Instruction-aligned Background music gEneration

VIBE:视频指令对齐背景音乐生成模型

Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj, Gouthaman KV, Sreyan Ghosh, Ramani Duraiswami, Lie Lu, Dinesh Manocha

机构 * Dolby Laboratories(杜比实验室) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17690 2026-09-01 cs.GR cs.AI cs.CV cs.LG cs.MM 版本更新 67%

DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation

DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度

Ziyuan Liu, Shizhao Sun, Danqing Huang, Yingdong Shi, Meisheng Zhang, Ji Li, Jingsong Yu, Jiang Bian

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) Microsoft(微软公司) ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30727 2026-09-01 cs.CV cs.AI 新提交 57%

RailGen: Improving Railway Intrusion Detection via Agent-Guided Small-Scale Foreign Object Generation

RailGen:通过智能体引导的小规模异物生成改进铁路入侵检测

Quan Hao, Ziyang Tao, Chenxi Zhang, Yudong Wang, Rui Shi, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 该研究针对铁路异物检测的长尾小样本问题,提出RailGen智能体生成高质量小异物样本,结合FocalDEIM框架优化检测,显著提升了检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29223 2026-09-01 cs.AI cs.CV 新提交 57%

Computational Depth Measurement in Thermographic Video: Overcoming Spatial Overfitting via Spatio-Temporal Decoupling

热成像视频中的计算深度测量:通过时空解耦克服空间过拟合

Zain Ul Abidin, Habeeban Memon, Junaid Ahmed

机构 * Sukkur IBA University(苏库尔IBA大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对热成像视频深度回归的空间过拟合问题,提出时空解耦架构,采用正则化XGBoost实现0.056mm MAE的高精度测量,可快速生成三维缺陷模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29003 2026-09-01 cs.CV cs.AI 新提交 57%

RoSe-SLAM: Robust Semantic-Aware Gaussian Splatting SLAM from Dynamic Monocular Videos

RoSe-SLAM:面向动态单目视频的鲁棒语义感知高斯溅射SLAM

Wenting Wang, Jiaxin Guo, Wenzhen Dong, Yun-Hui Liu, Charlie C.L. Wang, Yeung Yam

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学) Centre for Perceptual and Interactive Intelligence (CPII) Limited(感知与互动智能中心有限公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本研究提出RoSe-SLAM,利用2D基础模型语义特征与时空运动掩码等模块,结合几何与语义线索,在动态单目视频中实现更优的SLAM性能,优于现有动态RGB SLAM基线。

Comments Accepted by IEEE/RSJ INTERNATIONAL CONFERENCE ON INTELLIGENT ROBOTS & SYSTEMS (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28693 2026-09-01 cs.RO cs.CV 新提交 57%

RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

RoboGesture:面向人形机器人交互的实时语义对齐式伴随语音手势生成

Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Galbot Inc.(Galbot公司) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海智知研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出 RoboGesture 框架,构建专属数据集并设计相关算法,使人形机器人可实时生成语义对齐的伴随语音手势,在 Unitree G1 机器人上的实验表明其性能优于现有最优方法。

Comments Accepted at ECCV 2026. Project page: this https URL (https://RoboGesture.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21659 2026-09-01 cs.CV 版本更新 57%

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow:基于CLIP潜在空间中GMM先验流的零样本矢量草图生成

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence(广东省视觉媒体与多维智能重点实验室) Shenzhen University(深圳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchFlow是基于CLIP潜在空间的零样本矢量草图生成框架,通过GMM先验流匹配与混合扩散解码器,实现了优于基线的视觉质量与零样本泛化能力。

Comments Accepted to SIGGRAPH Asia 2026 Conference Papers. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18560 2026-09-01 cs.HC cs.CV 版本更新 57%

SemanticSlider3D: Training-Free Continuous Semantic Editing for 3D Objects

SemanticSlider3D:无需训练的3D物体连续语义编辑

Ru Wang, Rahul Jain, Koichiro Niinuma, Aakar Gupta

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Fujitsu Research of America(富士通美国研究所)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SemanticSlider3D是一种无需训练的3D物体连续语义编辑技术,通过在先进3D生成模型潜空间构建语义编辑方向,在技术验证与用户研究中均表现优于基线方法,可作为现有3D创作工作流的有效补充。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00663 2026-09-01 cs.CV 版本更新 57%

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成

Chenggong Hu, Shaoyin Ma, Yi Wang, Li Sun, Mingli Song, Jie Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。

Comments 17 pages, 11 figures, accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23649 2026-09-01 cs.RO cs.CV 版本更新 57%

RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion

RoboMirror: 在模仿之前理解以实现视频到仿人运动

Zhe Li, Boan Zhu, Yangyang Wei, Shuanghao Bai, Yuheng Ji, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, S.-H. Gary Chan, Chang Xu, Cheng Chi, Jianfei Yang, Shanghang Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2026-09-01 cs.CV 版本更新 57%

A Study of the Design Space of Motion and Disocclusion Control in Video Generation

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J.Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01470 2026-09-01 cond-mat.soft cond-mat.stat-mech physics.comp-ph 版本更新 50%

Colloidal layer deposition with a controllable number of layers and compositional order

具有可控层数和组分有序性的胶体层沉积

Akshaya Kumar Jena, Aashima Aashima, Pritam Kumar Jana, Bortolo Matteo Mognetti

专题命中 可控生成 :diffusion(abstract)

AI总结 本文设计了一种二元悬浮液与表面结合的系统,通过DNA寡聚物调控胶体自组装,实现可控层数和组分有序的胶体聚集。

Comments These last two authors contributed equally to the work. This is the manuscript of an article accepted for publication in The Journal of Physical Chemistry B. The final published version will be available from ACS upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27700 2026-09-01 q-fin.MF 版本更新 50%

Data-Driven Stochastic Optimal Control for Intraday Electricity Trading by Renewable Producers

数据驱动的随机最优控制用于日内电力交易:可再生能源生产者

Chiheb Ben Hammouda, Michael Samet, Raul Tempone

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种数据驱动的连续时间随机最优控制框架,用于可再生能源生产者的日内电力交易,通过随机微分方程和跳跃扩散模型来应对市场波动和不平衡惩罚风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新 50%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03773 2026-09-01 math.OC math.PR 版本更新 50%

Stochastic Control Problems Motivated by Sailboat Trajectory Optimization

由帆船轨迹优化启发的随机控制问题

Carlo Ciccarella, Robert C. Dalang, Laura Vinckenbosch

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出两个随机控制问题,旨在快速到达圆形迎风目标,通过分析帆船在随机风场中的运动模型,探讨了冲击控制与奇异控制的数学特性及解的存在性。

Comments 45 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏