arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-27 至 2026-08-27 共收录 67 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 43 篇

2608.26076 2026-08-27 cs.RO 新提交 50%

Fast Generative Grasping via Lie Group-Constrained MeanFlow

基于李群约束MeanFlow的快速生成式抓取

S. Talha Bukhari, Yi Wei, Ruiqi Ni, Zachary Kingston, Aniket Bera

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出基于李群约束MeanFlow的快速生成式抓取方法,可在≤5次网络评估内采样可靠抓取,在ACRONYM数据集上性能与SOTA模型相当,推理延迟达毫秒级,且无需额外训练即可迁移到真实机器人抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25839 2026-08-27 cs.CY 新提交 50%

Non-Great-Power Conflict and AI Risk

非大国冲突与AI风险

Kristina Kempkey, Seán Boddy, Catherine Ge-Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文聚焦非大国冲突(NGPC)与AI风险,评估其作为灾难性风险来源的重要性,发现NGPC对大国冲突、灾难性恐怖主义的影响相关原假设不成立,提出需重点研究信息环境质量等五个中间变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25163 2026-08-27 cs.LG cs.AI 新提交 50%

Bayesian Flow Networks for Offline Trajectory Planning

用于离线轨迹规划的贝叶斯流网络

Ludvig Killingberg, Helge Langseth

机构 * Norwegian University of Science and Technology(挪威科技大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出基于贝叶斯流网络(BFNs)的BFN-RL框架,可在单一概率公式内建模离散与连续轨迹空间,经实验验证其能在两类状态空间生成有效轨迹,为离线轨迹规划提供通用生成基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25048 2026-08-27 cs.SI 新提交 50%

Tabular Foundation Models for Multi-View Information Cascade Popularity Prediction

面向多视图信息级联流行度预测的表格基础模型

Wenting Zhu, Chenghua Gong, Sanchuan Guo, Chaozhuo Li, Yueyue Zhang, Xi Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对信息级联流行度预测的现有局限,提出双分支设计的TFM4POP框架,结合表格基础模型与神经ODE编码器,通过参数高效微调实现多视图建模,在多数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25796 2026-08-27 math.NA 新提交 50%

Block preconditioning for all-at-once variable-coefficient fractional evolution equations via the GLT analysis

基于GLT分析的全变量系数分数阶演化方程的块预处理方法

Muhammad Faisal Khan, Stefano Serra-Capizzano

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对带弱奇异时间核与空间变扩散系数的非局部演化偏微分方程,基于GLT理论开发块下三角预处理策略,结合GMRES求解器可显著提升大规模问题的收敛等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25505 2026-08-27 cs.IT cs.CL 新提交 50%

Conditional Total Correlation and the Serial Depth of Adaptive Parallel Sampling

条件总相关与自适应并行采样的序列深度

Chuling Wen, Weijie Liang, Jian Lu

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对离散向量自适应并行采样,通过推导条件总相关与采样散度的恒等式,明确序列深度的决定因素,并在马尔可夫链等场景验证其特性,为掩码扩散模型解码提供理论支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25333 2026-08-27 math.AP 新提交 50%

Global well-posedness of strong solutions to the initial-boundary value problem for a two-dimensional stress-diffusive Oldroyd-B model in the creeping flow regime

二维蠕动流区域内应力扩散型Oldroyd-B模型初边值问题强解的整体适定性

Yinghui Wang, Shihao Zhang, Zhuo Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文证明了二维蠕动流区域内应力扩散型Oldroyd-B模型的初边值问题,在构形张量非负性条件下,对任意大的H¹初始聚合物应力均存在唯一整体强解,还揭示了零雷诺数区域的速度场正则性特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25094 2026-08-27 math.PR 新提交 50%

Noising-Denoising by Large Temperature Schrödinger Bridges

基于大温度薛定谔桥的加噪-去噪

Garrett Mulcahy

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文建立去噪扩散模型与大温度动态薛定谔桥的联系,证明大温度下薛定谔桥的扩散特性,为 Clerc 等人2023年的梯度流近似提供过程层面刻画。

Comments 27 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25501 2026-08-27 hep-ph 新提交 50%

Particle production in $p$-O collisions at LHC energy

LHC能量下p-O碰撞中的粒子产生

Chuan Li, Georg Wolschin

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究对比p-O碰撞带电强子产生的前期理论预测与ALICE的Run 3初步数据,调整三源模型参数,结合色玻璃凝聚态与相对论扩散模型,预测了周边碰撞中赝快度较大处最大产生振幅的反转。

Comments 7 pages, 3 figures; submitted to EPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25499 2026-08-27 physics.optics cond-mat.mtrl-sci cond-mat.other 新提交 50%

Generalizing Thermal Transport in High-Contrast Metamaterials through Interfacial Fresnel Reflection

通过界面菲涅耳反射推广高对比度超材料中的热输运研究

Seung Hyeon Ham, Yu Min Kim, In Hyeok Choi, Jeong Woo Han

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对生成式AI发展带来的散热需求,该研究推广有效介质近似,引入含菲涅耳反射系数形式的校正系数,将热流的类反射行为纳入几何光学框架,拓展了高对比度热超材料的热输运预测能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25270 2026-08-27 cond-mat.mtrl-sci 新提交 50%

High-throughput Discovery of Magnetic Rare Earth Transition Metal Alloys

磁性稀土-过渡金属合金的高通量发现

Shuo Tao, Osman Goni Ridwan, Liqin Ke, Qiang Zhu

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究结合扩散晶体结构生成与分层筛选的加速材料发现框架,筛选超24万种结构,识别300余种低能磁性候选物,发现4种富铁高饱和磁化强度稳定相,为磁性材料设计提供指导。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25242 2026-08-27 cond-mat.soft cond-mat.stat-mech physics.comp-ph 新提交 50%

Dynamical and conformational behavior of a polymer in a crowded solution

Setarehalsadat Changizrezaei, Colin Denniston

专题命中 扩散模型 :diffusion(abstract)

Comments Accepted for publication in The Journal of Chemical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21636 2026-08-27 cs.LG cs.AI 版本更新 50%

Measuring the Dependency Gap: Diagnosing Inter-Column Fidelity in Tabular Generative Models

测量依赖差距:诊断表格生成模型中的列间保真度

Jie Zhang

机构 * Accenture Japan(埃森哲日本公司)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究表格生成模型列间保真度,引入依赖感知保真度诊断方法,分解XGB-C2ST测试,应用于TabbyFlow/EF-VFM发现标准指标遗漏的依赖差距,探讨差距原因,表明是缺乏直接依赖监督,非容量或结构问题

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31362 2026-08-27 astro-ph.CO gr-qc hep-ph hep-th 版本更新 50%

Running into tension: primordial black holes from ultra-slow-roll inflation, spectral running, and the Hubble tension

陷入紧张:来自超慢滚暴涨的原初黑洞、谱运行和哈勃紧张

Miguel A. Sabogal, Antonio J. Iovino, Sunny Vagnozzi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究超慢滚暴涨模型预测的负谱运行与ACT CMB数据中正运行提示之间的紧张关系,并分析早期暗能量等新物理对谱运行及原初黑洞模型可行性的影响。

Comments 25 pages, 9 sub-figures arranged into 5 figures. v2: additional references added, minor changes to the abstract to better clarify regime of applicability of results, minor changes in the text, added a new Fig. 1 to better clarify the relevant physics. Version accepted for publication in PRD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16382 2026-08-27 quant-ph 版本更新 50%

Temporal-order-controlled Parrondo reversal in a periodically switched quantum walk acting on NEQR image states

量子图像加密中的帕尔伦多悖论

Łukasz Pawela

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于离散时间量子行走的量子图像加密方案,利用帕尔伦多悖论提升加密性能,实现高熵和低相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10194 2026-08-27 math.PR math.AP 版本更新 50%

Kinetic Theory with Fluctuations: Well-Posedness of The Vlasov--Fokker--Planck--Dean--Kawasaki Equations

含涨落的动理学理论:Vlasov-Fokker-Planck-Dean-Kawasaki 系统的强适定性

Zimo Hao, Zhengyan Wu, Johannes Zimmer

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究含相关噪声的 Vlasov-Fokker-Planck-Dean-Kawasaki 方程的强适定性,通过动理学半群估计和重整化动理学解框架,克服了动理学算子复杂性和保守噪声带来的不规则性。

Comments The previous version contained an error in Section 6, which revealed an additional challenge in the whole-space setting. This issue has been addressed in the revised version, and the resulting conclusion differs from that of the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20412 2026-08-27 cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

Active Learning of a Neural Network Potential for Large-Scale Atomistic Simulations of Polymer Electrolyte Membranes

用于聚合物电解质膜大规模原子模拟的神经网络势的主动学习

Yuta Yoshimoto, Naoki Matsumura, Meguru Yamazaki, Yuto Iwasaki, Hiroshi Nakao, Yasufumi Sakai

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究采用主动学习工作流构建深度势模型,实现了含10000-20000个原子的Nafion体系长达31 ns的稳定MD模拟,提升了输运性质预测精度,拓展了水合度适用范围,为大规模原子模拟提供了高效方法。

Comments 53 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 8 篇

2607.00609 2026-08-27 cs.CV 版本更新 79%

Diffusion-Based Multi-Class Normality for OOD Detection: An Application to CDP Authentication

基于扩散的多类正态性用于OOD检测:在CDP认证中的应用

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior

机构 * CNRS(法国国家科学研究中心) INSA Lyon(里昂国立应用科学学院) LIRIS, UMR 5205(LIRIS实验室,UMR 5205)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出扩散多类正态性框架,用单一条件ControlNet训练于多类真实CDP,通过重构误差检测伪造,并引入双模板掩码提升性能。

Comments IEEE International Conference on Advanced Visual And Signal-Based Systems, Aug 2026, Lecce, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20803 2026-08-27 cs.CV 版本更新 79%

ARGenSeg: Image Segmentation with Autoregressive Image Generation Model

ARGenSeg:基于自回归图像生成模型的图像分割

Xiaolong Wang, Lixiang Ru, Ziyuan Huang, Kaixiang Ji, Dandan Zheng, Jingdong Chen, Jun Zhou

机构 * Ant Group(蚂蚁集团)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 该研究提出ARGenSeg框架,将图像生成融入MLLM,通过并行生成视觉令牌实现高效图像分割,在多数据集上性能优于现有方法且推理速度显著提升。

Comments Accepted to NeurIPS 2025, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25862 2026-08-27 cs.CV 新提交 57%

Learning Late, Guiding Early: Timestep-Decoupled Semantic Guidance for Fair Face Generation

晚学习,早引导:用于公平人脸生成的时间步解耦语义引导

Subir Kumar Parida, Rajbabu Velmurugan, Ketan Kotwal, R.S. Sengar, Swati Hiremath

机构 * Bhabha Atomic Research Centre (B.A.R.C.)(巴巴原子研究中心) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出语义边界预测器(SBP),通过时间步解耦实现公平人脸生成,无需重训练或外部数据集,在CelebA-HQ上大幅降低人口统计公平差距且保持图像质量,计算开销小易集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25734 2026-08-27 cs.CV 新提交 57%

InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control

InteractGesture:用于连续流协同语音手势控制的渐进式分块引导

Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen

机构 * Meta University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对现有协同语音手势生成模型缺乏单关节细粒度空间可控性的问题,提出模型无关的推理时方法InteractGesture,通过渐进式分块引导解决分块依赖问题,在BEAT2数据集上实现多关节空间控制提升。

Comments ECCV 2026 Workshop - Interactive Social Avatars

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-27 cs.CV cs.AI 新提交 57%

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25461 2026-08-27 cs.GR 新提交 57%

GLOSS: Geometric Local Self-Similarity Learning for Faithful Reference-Guided Texture Fill

GLOSS:用于忠实参考引导纹理填充的几何局部自相似性学习

Chenyue Cai, Anita Hu, James Lucas, Szymon Rusinkiewicz, Masha Shugrina

专题命中 可控生成 :inpainting(abstract);分类 cs.GR

AI总结 本研究提出GLOSS模型,利用几何局部自相似性,以数据需求低、可控性强的方式实现忠实参考引导的纹理填充,在3D纹理生成任务中表现优于或媲美基线模型,且作为Blender插件获专业人员认可。

Comments 22 pages, 17 figures, project page this https URL (https://chenyuecai.github.io/gloss-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-27 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: this https URL (https://github.com/boschresearch/TASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-08-27 cs.RO 版本更新 50%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Shiqin Dai, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 13 pages, 5 figures, 8 tables. Project page: this https URL (https://advanced-robotics-lab.github.io/SANTS/)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2608.25334 2026-08-27 cs.CV 新提交 57%

GraftSR: Grafting Authentic Textures for Real-World Image Super-Resolution via Identical-Instance Guidance

GraftSR:通过相同实例引导嫁接真实纹理以实现真实世界图像超分辨率

Qifan Yu, Haoran Bai, Zongyao He, Weijie He, Sibin Deng, Honggang Qi, Ying Chen

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散图像超分辨率的纹理幻觉问题,提出GraftSR框架,采用双掩码参考引导机制,构建TexRefSR-141K数据集,在新基准上实现SOTA,LPIPS降低20.2%。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2608.25648 2026-08-27 cs.CV 新提交 74%

MAMA-FLUX.2: Image-to-Image Synthesis of Post-Contrast Breast DCE-MRI for the MAMA-SYNTH Challenge

MAMA-FLUX.2:面向MAMA-SYNTH挑战赛的对比后乳腺动态对比增强MRI图像到图像合成

Kamil Kwarciak, Marek Wodzinski

机构 * AGH University of Krakow(克拉科夫AGH科技大学) Sano Centre for Computational Medicine(萨诺计算医学中心)

专题命中 个性化与一致性 :image synthesis(title);分类 cs.CV

AI总结 本研究针对MAMA-SYNTH挑战赛,提出MAMA-FLUX.2模型,采用LoRA微调及任务感知区域损失,实现对比前至对比后乳腺DCE-MRI的图像合成,在临床相关指标上取得最优平衡。

Comments 9 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2604.11521 2026-08-27 cs.LG cs.CV 版本更新 70%

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 8 篇

2608.25386 2026-08-27 cs.CV 新提交 79%

Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation

带前瞻的高效训练:用于自回归图像生成的多令牌辅助监督

Guo Niu, Xiongfei Yao, Teng Wang, Nannan Zhu

机构 * Foshan University(佛山大学) The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 该研究针对自回归图像生成的缺陷,提出MTAR框架,通过多令牌预测、令牌级对比正则化和语义丢弃提升性能,在ImageNet上实现了生成质量与效率的更优平衡。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25575 2026-08-27 cs.CV cs.AI 新提交 57%

MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations

MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏

Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony Group Corporation(索尼集团公司)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏