arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-24 至 2026-08-24 共收录 70 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 5 篇

2608.20691 2026-08-24 cs.CV 新提交 70%

Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

连接语言与球面空间:面向全景生成的以对象为中心的控制方法

Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对现有文本到全景生成方法难以对齐对象级方向描述的问题,提出以对象为中心的可控框架PanoCtrl,构建相关数据集并实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20448 2026-08-24 cs.GR cs.CV 新提交 62%

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCube:具有部件级语义与空间控制的组合式三维生成

Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MultiCube是一种组合式三维生成方法,通过两阶段扩散过程与部件布局适配器,实现了对三维对象部件级语义和空间的精确控制,可生成高质量且布局独特的组合式三维对象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06159 2026-08-24 cs.CV 版本更新 57%

Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving

驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征

Xuyang Chen, Conglang Zhang, Chuanheng Fu, Zihao Yang, Kaixuan Zhou, Yizhi Zhang, Yanfeng Zhang, Mingwei Sun, Zhen Dong, Xiaoxiao Long, Zengmao Wang, Liqiu Meng

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center(华为希利伯特研究中心) Huawei Riemann Lab(华为里曼实验室) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 1 篇

2601.18535 2026-08-24 eess.AS cs.SD 版本更新 78%

Audio Inpainting in Time-Frequency Domain with Phase-Aware Prior

时频域中具有相位意识先验的音频修补

Peter Balušík, Pavel Rajmic

专题命中 图像修复 :inpainting(title,abstract)

AI总结 本文提出了一种基于相位意识先验的时频域音频修补方法,通过优化算法提升重建质量并降低计算成本,优于现有深度神经网络和自回归方法。

Comments submitted to IEEE for review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2608.08446 2026-08-24 cs.AI 版本更新 78%

TRACE-Memory: Public-Conditioned Retrieval and Utility-Aware Evidence Admission for Personalized Generation

TRACE-Memory:用于个性化生成的公共条件检索与效用感知证据接纳

Jing Wang, Zhu Wang, Yifan Guo, Yulong Yang, Yunji Liang

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 该研究针对个性化生成系统中记忆使用的效用问题,提出TRACE-Memory两阶段框架,经多阶段训练后在三类数据集的4500个任务上表现优于多种记忆使用方法,支持选择性个性化。

Comments 9 pages, 4 figures, and 6 tables. Submitted to the 41st AAAI Conference on Artificial Intelligence (AAAI 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-08-24 cs.CV 版本更新 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: this https URL (https://xiaomeng-yang.github.io/Prompt2Effect)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05011 2026-08-24 q-fin.PR q-fin.MF q-fin.TR 版本更新 50%

Reaction-boundary variance and adjoint-consistent local-volatility projection

反应边界方差与伴随一致的局部波动率投影

Chris Angstmann, Tim Gebbie

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 推导潜在订单簿反应边界的运行时间方差核,分离日历时间波动率模型中常合并的三个对象,给出确定性活动时钟的局部波动率投影,指出伴随一致性是对运行到日历时间投影的现实约束。

Comments 13 pages, 12 figures, 1 table; expanded reaction-boundary volatility-surface analysis, clarified adjoint-consistency and clock-projection conditions, and minor reference corrections; Code reproducibility see: this https URL (https://github.com/timgebbie/reaction-boundary-vol-surface-reproducibility)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2606.15867 2026-08-24 cs.CV 版本更新 85%

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation

CogCanvas: 用于评估多主体参考图像生成的基准

Long-Bao Nguyen, Quang-Khai Le, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) University of Dayton, Ohio, United States(代顿大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13416 2026-08-24 cs.CV cs.AI 版本更新 57%

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

DF3DV-1K:用于无干扰新视角合成的大规模数据集与基准

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学) University of Sydney(悉尼大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 为弥补无干扰辐射场领域缺乏大规模真实世界数据集的空白,构建了包含1048个场景、每场景提供干净和杂乱图像集的DF3DV-1K数据集,并基于此基准测试了九种最新方法,识别出最鲁棒的方法和最具挑战的场景。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 1 篇

2603.23463 2026-08-24 cs.CV cs.AI 版本更新 91%

InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting

InverFill:一种用于增强少步扩散修复的一步倒置方法

Duc Vu, Kien Nguyen, Trong-Tung Nguyen, Ngan Nguyen, Phong Nguyen, Khoi Nguyen, Cuong Pham, Anh Tran

机构 * Qualcomm AI Research(.qualcomm 高级研究院) Posts & Telecommunications Inst. of Tech., Vietnam(越南邮电技术研究所)

专题命中 效率与蒸馏 :inpainting(title,abstract);diffusion(title,abstract);text-to-image(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出InverFill,通过注入输入遮挡图像的语义信息到初始噪声中,实现高质量少步修复。该方法无需训练修复模型,利用文本到图像模型进行混合采样,提升图像质量和文本一致性。

Comments Accepted to CVPR'26 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏