arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-25 至 2026-08-25 共收录 161 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 12 篇

2608.16153 2026-08-25 cs.RO 版本更新 50%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18699 2026-08-25 cs.CL cs.AI 版本更新 50%

Semantic Substrate Dynamics Theory: An Operator-Theoretic Framework for Geometric Semantic Drift

语义基质理论:几何语义漂移的算子理论框架

Stephen Russell

机构 * Intelligent Systems and Robotics Department(智能系统与机器人系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出语义基质理论,通过算子理论框架分析几何语义漂移,引入桥质量预测未来邻居重排,并提供理论与测试合同。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2606.06158 2026-08-25 cs.CV 版本更新 79%

Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

通过时间冗余掩码和潜在修复的自适应分词

Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das, Gouranga Bala, Rajeshkumar SA, R. Venkatesh Babu

机构 * Phronetic AI IISc Bangalore IIT Bombay

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 提出一种无参数的自适应视频分词机制,利用冻结连续分词器的潜在空间中的时间冗余,通过阈值丢弃冗余位置,并使用轻量级潜在修复变压器重建,实现内容驱动的令牌分配和高效推理。

Comments Accepted at BMVC 2026. Project page: https://apatkuri.github.io/adaptive-tokenisation-bmvc-2026/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24136 2026-08-25 cs.CV eess.IV 版本更新 79%

Bridging Restoration and Generation in One-step Diffusion for Real-World Image Super-Resolution

连接恢复与生成流形的单步扩散在现实世界超分辨率中的应用

Shyang-En Weng, Yi-Cheng Liao, Yu-Syuan Xu, Chia-Hung Yuan, Wei-Chen Chiu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University, Hsinchu, Taiwan MediaTek Inc., Taiwan

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出IDaS-SR框架,通过Manifold Inversion Noise Estimator和CHARIOT机制,解决单步扩散中恢复与生成流形的匹配问题,提升现实世界超分辨率的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2505.17571 2026-08-25 cs.CL 版本更新 71%

Reasoning Meets Personalization: Unleashing the Potential of Large Reasoning Model for Personalized Generation

推理与个性化结合:释放大型推理模型在个性化生成中的潜力

Sichun Luo, Guanzhi Deng, Jian Xu, Zerui Yang, Xiaojie Zhang, Hanxu Hou, Linqi Song

机构 * Dongguan University of Technology(东莞理工大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Guangzhou University(广州大学)

专题命中 个性化与一致性 :personalized generation(title)

AI总结 本研究针对大型推理模型在个性化任务中存在的局限,提出强化推理框架及相关机制,经实验验证其性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14486 2026-08-25 cs.CV 版本更新 57%

Reduce the Artifacts Bias for More Generalizable AI-Generated Image Detection

降低艺术偏差以提高通用性的人工智能生成图像检测

Yiheng Li, Yang Yang, Wenhao Wang, Zichang Tan, Zecheng Lin, Li Gao, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Sangfor Technologies Inc.(Sangfor技术公司) China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2603.15525 2026-08-25 cs.CV cs.HC 版本更新 79%

Clinically Aware Synthetic Image Generation for Concept Coverage in Chest X-ray Models

临床感知的合成图像生成用于胸部X光模型的概念覆盖

Amy Rafferty, Rishi Ramaesh, Ajitha Rajan

机构 * University of Edinburgh(爱丁堡大学) NHS Lothian(洛锡安国家健康服务)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出CARPA框架,通过解剖约束的概念扰动生成合成胸部X光图像,扩展临床概念覆盖,提升模型性能与可靠性。

Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03337 2026-08-25 cs.CV 版本更新 57%

QIRL: Optimized Question-Image Relation Learning for Bias-Robust Visual Question Answering

QIRL:用于实现偏差鲁棒视觉问答的优化问答-图像关系学习

Quanxing Xu, Ling Zhou, Xian Zhong, Feifei Zhang, Rubing Huang

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 该研究针对现有VQA偏差缓解方法的两大局限,提出QIRL框架,通过NIG与ISI模块结合生成驱动自监督学习,在VQA-CPv2和VQA-v2数据集上取得最优性能,可适配各类VQA架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22309 2026-08-25 cs.LG 新提交 50%

StocBench: A Benchmark for Generative Modeling of Stochastic Dynamics

StocBench:随机动力学生成建模基准

Sebastian Pfister, Benjamin Holzschuh, Nils Thuerey

机构 * School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 该研究构建StocBench基准,对比测试多种生成模型与少步方法在随机流体流动概率预测中的性能,明确不同模型在随机与确定性任务、不同推理预算下的表现差异。

Comments Code available at https://github.com/tum-pbs/stocbench

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2512.17730 2026-08-25 cs.CV 版本更新 57%

AdaptPrompt: Parameter-Efficient Adaptation of VLMs for Generalizable Deepfake Detection

AdaptPrompt: 为通用深度伪造检测高效调整视觉语言模型参数

Yichen Jiang, Mohammed Talha Alam, Sohail Ahmed Khan, Duc-Tien Dang-Nguyen, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) University of Bergen(卑尔根大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 AdaptPrompt通过参数高效迁移学习框架,利用CLIP模型提升深度伪造检测的泛化能力,实现跨领域和少量样本下的高准确率识别。

Comments Accepted at DFF ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22281 2026-08-25 cs.CV 版本更新 57%

Collapse of Patches: Ranking Image Patches for Efficient Visual Modeling

补丁的崩溃

Wei Guo, Shunqi Mao, Zhuonan Liang, Xuanhua Yin, Heng Wang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 通过补丁崩溃视角提升图像建模效率,利用补丁依赖关系优化图像生成与分类

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏