arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-26 至 2026-08-26 共收录 44 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2608.24563 2026-08-26 cs.CV cs.RO 新提交 83%

X-MULTI: VLM-based Imaging Factor Disentanglement for Factor-Aware Image Synthesis

X-MULTI:基于VLM的成像因子解耦用于因子感知图像合成

Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch, Maarten Bieshaar, Michael Moeller, Kristof Van Laerhoven, Danda Pani Paudel

机构 * University of Siegen(锡根大学) ETH Zürich(苏黎世联邦理工学院) Bosch Research(博世研究中心) INSAIT(INSAIT(保加利亚的智能与数据科学研究所)) Sofia University “St. Kliment Ohridski”(索非亚大学“圣·克利门特·奥赫里德斯基”)

专题命中 文生图 :image synthesis(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究针对文本到图像生成的成像因子解耦问题,提出基于VLM的X-MULTI方法及改进的I-FAA指标,提升了新颖因子组合的因子对齐效果与评估的稳健性。

Comments Accepted to the MUCG Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24112 2026-08-26 cs.AI 新提交 78%

Scalable Question-Centric Text-to-Image Evaluation: Reliable Ranking, Fine-Grained Diagnosis, and Cost-Aware Routing

可扩展的以问题为中心的文本到图像评估:可靠排名、细粒度诊断与成本感知路由

Shaoan Zhao, Fang Zhao, Xueqiang Guo, Xinpei Su, Huanlin Gao, Qiang Hui, Ting Lu, Fuyuan Shi, Chao Tan, Bikun Yang, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能) China Unicom Group Co.,Ltd(中国联通集团有限公司)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究针对T2I模型评估的问题,提出QC-T2I-Bench框架,结合DSG实现细粒度诊断,评估显示多能力组件联合完成率随能力数增加下降,成本感知路由器可在减少算力的同时达到ERNIE的估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24160 2026-08-26 cs.AI 新提交 50%

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

全能评判者还是全能偏差?通过平衡、解耦的视角诊断多模态评判者

Guangzheng Hu, Ziyue Jiang, Weixu Qiao, Lixin Zhang, Jianye Kang, Yuru Wu, Rong Bao, Niantong Li, Wei Wang, Ziyi Cheng, Xinfa Zhu, HangRui Hu, Ting He, Bing Zhao, Lin Qu, Hu Wei, Jin Xu

专题命中 文生图 :text-to-image(abstract)

AI总结 本研究推出平衡解耦的多模态评判者诊断基准D3-Omni,发现全能评判者存在模态相关维度表现差、漏检失败等系统性盲点,为评估多模态模型提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2608.24119 2026-08-26 cs.CV cs.AI 新提交 74%

TransPhy: Visual In-Context Learning for Physically Grounded Image Editing

TransPhy:面向物理基础图像编辑的视觉上下文学习

Siyi Xie, Xuanke Shi, Jinsheng Quan, Haoran Tang, Zukai Chen, Lei Yang, Quan Wang

机构 * Peking University(北京大学) SenseTime Research(商汤科技研究院) Zhejiang University(浙江大学)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 针对现有视觉上下文学习对物理基础图像变换支持不足的问题,提出TransPhy框架,通过分解为物理规则归纳和过渡对齐渲染,在PhysVICL-74基准上提升了相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 35 篇

2608.24816 2026-08-26 physics.flu-dyn physics.chem-ph 新提交 82%

Effects of pressure on the chemical sooting structure of equi-diffusive counterflow diffusion flames

压力对等扩散对向流扩散火焰中化学 soot 结构的影响

Rajat Sawanni, Ömer L. Gülder

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究结合实验与OpenSMOKE++数值模拟,探究1-6 bar压力对等扩散对向流扩散火焰soot结构的影响,发现soot浓度随压力升高而增加,乙炔为碳传递关键节点,其影响力随压力增大。

Comments accepted for publication in the Proceedings of the Combustion Institute, Vol. 42

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24646 2026-08-26 cs.CV 新提交 79%

On-Policy Self-Distillation in Diffusion Models

扩散模型中的在线策略自蒸馏

Wei Zhou, Xiongwei Zhu, Lingdong Kong, Bo Chen, Lei Zhang, Yongyuan Liang, Xiaoxia Hou, Ye Tian, Xian Sun, Yingshuo Wang, Linfeng Li, Shengqiong Wu, Leigang Qu, Feng Li, Wei Liu, Julian McAuley, Tat-Seng Chua

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffusionOPSD在线策略自蒸馏框架,将图像级奖励指导转为中间监督,在SD 3.5-M等模型上获最佳保留得分,训练GPU小时显著减少,为高效可诊断的扩散模型对齐提供新路径。

Comments Technical Report; Project Page at this https URL (https://diffusionopsd.github.io) GitHub Repo at this https URL (https://github.com/worldbench/DiffusionOPSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24422 2026-08-26 cs.CV 新提交 79%

ZODIAC: Zero-shot Octree-based Diffusion for Anatomical Completion

ZODIAC:基于八叉树的零样本解剖结构补全扩散模型

Miruna-Alexandra Gafencu, Vlad Bratulescu, Yordanka Velikova, Mohammad Farid Azampour, Nassir Navab

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠AI卓越学院(relAI))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对术中超声脊柱补全的不适定问题,提出零样本框架ZODIAC,通过混合补全机制结合扩散先验与部分几何,在HD95指标上较全监督方法提升22%泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24105 2026-08-26 cs.CV 新提交 79%

DRRG: A Discrete Diffusion Framework for Radiology Report Generation

DRRG:用于放射报告生成的离散扩散框架

Shaoyang Zhoua, Yingshu Li, Yunyi Liu, Lijun Pu, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) Department of Radiology, The First Affiliated Hospital of Soochow University(苏州大学附属第一医院放射科) School of Computer Science, The University of Adelaide(阿德莱德大学计算机学院) School of Computing and Information Technology, University of Wollongong(卧龙岗大学计算与信息技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出基于离散扩散大语言模型的DRRG框架,将放射报告生成转化为迭代掩码词去噪,在MIMIC-CXR、CheXpert Plus数据集上的多项指标优于对比方法,为放射报告生成提供了有效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24068 2026-08-26 cs.CV 新提交 79%

Representation Learning in Diffusion and Flow-based Model: An Application Aspect

扩散模型与基于流的模型中的表示学习:应用视角

Yanchen Xu, Sida Huang, Zhenyu Gu, Ruishu Zhu, Yilan Gao, Hongyuan Zhang

机构 * Fudan University(复旦大学) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(西北工业大学光学与电子信息人工智能学院(iOPEN)) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本综述聚焦应用场景,提出三层渐进框架,梳理扩散与基于流的模型中表示学习的双向关系,分类下游任务方法,明确研究挑战并指明未来方向,为相关应用研究提供参考。

Comments Accepted by Vicinagearth

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23864 2026-08-26 cs.CV 新提交 79%

AffineTok: Semantic Affine Consistency for Diffusion-Friendly Visual Tokenizer

AffineTok:面向扩散模型友好型视觉分词器的语义仿射一致性

Junqiu Yu, Pandeng Li, Yikai Wang, Jiaxing Zhao, Yujie Wei, Kaixun Jiang, Quanhao Li, Hongtao Yu, Zhihang Liu, Zhaohe Liao, Junjie Zhou, Yun Zheng, Yu Liu, Yanwei Fu

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AffineTok,通过语义仿射一致性(SAC)引导视觉分词器训练,引入M_SAC作为代理指标,在ImageNet 256上实现了gFID的显著降低,达到无引导1.21、有引导1.10的SOTA性能。

Comments Project page: this https URL (https://michaelyu781.github.io/AffineTok-site/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23664 2026-08-26 cs.CV cs.LG 新提交 79%

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

通过速度匹配扩展扩散模型的强化学习

Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出基于奖励的速度匹配(RVM)方法,用于扩散模型的奖励微调,其训练成本显著降低,性能优于或相当基于轨迹的策略梯度方法,还通过动态跟踪奖励改善了视频生成的运动效果。

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24812 2026-08-26 cs.LG 新提交 78%

MDTE: Minority-Aware Diffusion over Temporal Edge Events for Imbalanced Node Classification

MDTE:面向时序边事件的少数类感知扩散模型用于不平衡节点分类

Zhou Zelong, Zhang Tianming, Yang Zhengyi, Tang Yifu, Hou Chenyu, Cao Bin, Fan Jing

机构 * Zhejiang University of Technology(浙江工业大学) The University of Sydney(悉尼大学) Vecton AI

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对时序图不平衡节点分类中少数类表示被同化、判别证据不足的问题,提出MDTE框架,通过分布感知选择性传播与多视图判别融合,在五个真实数据集上显著提升少数类相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24699 2026-08-26 eess.SY 新提交 78%

DeepONet-LSTM Neural Operator for Output Feedback Control of Reaction Diffusion PDEs

用于反应扩散偏微分方程输出反馈控制的DeepONet-LSTM神经算子

Jing Zhang, Jie Qi, Linglong Jiang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出混合DeepONet-LSTM神经算子,近似反应扩散偏微分方程输出反馈控制的因果边界算子,结合理论分析与改进损失函数,实现系统有效镇定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23807 2026-08-26 cs.AI 新提交 78%

Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

部署掩码扩散大语言模型:基于真实硬件的特性分析与设计原则

Farhana Amin, Sabiha Afroz, Mona Moghadampanah, Dimitrios S. Nikolopoulos

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过真实硬件实验分析LLaDA-8B-Instruct等dLLM的部署特性,发现其请求步数离散、批处理可分摊CPU开销等规律,提出适配dLLM的部署设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23798 2026-08-26 cs.LG 新提交 78%

A Theory of Speciation in Generative Diffusion Models on Compact Riemannian Manifolds

紧致黎曼流形上生成式扩散模型的物种形成理论

Alessio Marta, Paola Causin

机构 * University of Milan(米兰大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究建立紧致黎曼流形上生成式扩散模型的物种形成内蕴理论,刻画其分岔机制,推导相关估计与稳定性结论,经球面实验及神经网络学习方案验证。

Comments 48 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24253 2026-08-26 math.AP 新提交 78%

Critical Three-Species Competition-Diffusion: Traveling-Wave Rigidity and the Fastest-Species Selection

临界三物种竞争扩散系统:行波刚性与最快物种选择

Haozhe Shu, Dongyuan Xiao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对一维临界三物种竞争扩散系统,研究行波刚性与长期物种选择,结合熵方法及相关不等式,在特定条件下可使较慢物种灭绝并收敛至最快物种的平衡点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23734 2026-08-26 math.AP 新提交 78%

Smoothing effect and uniqueness for aggregation diffusion models

聚集扩散模型的光滑效应与唯一性

Stefano Lisini, Edoardo Mainini

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对$\mathbb R^d$($d\geq2$)中含牛顿或贝塞尔势的聚集扩散模型,通过JKO格式分析,建立$L^\infty$光滑效应,证明梯度流解的唯一性,刻画梯度流并得到公平竞争下解的一致消失性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23905 2026-08-26 cond-mat.stat-mech 新提交 78%

Jamming states in random sequential adsorption of diffusion-limited aggregates

扩散限制聚集体随机序列吸附中的阻塞态

Fahad Puthalath, Dipanjan Mandal, Sumanta Kundu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究探究DLA团簇随机序列吸附的阻塞态,通过模拟分析团簇形状多样性对阻塞密度及涨落的影响,发现阻塞密度的幂律标度规律,且模型差异随团簇尺寸增大逐渐消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24558 2026-08-26 eess.AS eess.SP 新提交 71%

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

基于扩散后验采样的阵列无关 Ambisonics 编码

Amit Milstein, Nir Shlezinger, Boaz Rafaely

专题命中 扩散模型 :diffusion(title)

AI总结 针对现有 Ambisonics 编码方案受固定阵列限制的问题,提出生成框架 ADEPS,将物理采集模型嵌入推理过程,可补偿阵列失真并实现任意阵列零样本编码,性能优于传统基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23938 2026-08-26 stat.ML cs.LG math.ST 新提交 71%

Generalization, memorization, and overfitting for diffusion models trained in the lazy high-dimensional regime

在惰性高维 regime 中训练的扩散模型的泛化、记忆与过拟合

Hugo Latourelle-Vigeant, Sinho Chewi, Aram-Alexandre Pooladian, John Sous, Theodor Misiakiewicz

专题命中 扩散模型 :diffusion(title)

AI总结 本研究针对惰性高维 regime 中训练的扩散模型,推导了梯度流训练下的精确风险轨迹,揭示了其泛化、记忆与过拟合的阶段机制,为生成式建模提供了理论分析框架。

Comments 100 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24342 2026-08-26 cs.CV cs.AI 新提交 70%

Metadata-Aware Adaptation of a Generative Foundation Model for Conditional CMR Synthesis

面向条件化CMR合成的生成式基础模型的元数据感知适配

Marc Rodríguez, Grzegorz Skorupko, Nay Aung, Steffen E Petersen, Karim Lekadir, Polyxeni Gkontra

机构 * Facultat de Matemàtiques i Informàtica, Universitat de Barcelona(巴塞罗那大学数学与信息学院) NIHR Barts Biomedical Research Centre(英国国立卫生研究院巴特生物医学研究中心) St Bartholomew’s Hospital(圣巴塞洛缪医院) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究学院)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出整合无元数据CFG等策略的元数据感知适配方法,基于预训练潜在扩散模型实现仅用患者元数据的CMR合成,在UK Biobank数据集上显著提升FID,验证了生成式基础模型用于临床CMR合成的潜力。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23999 2026-08-26 cs.CY 新提交 67%

The urban right to AI: Pluralistic co-design and governance of public space

城市的AI权利:公共空间的多元协同设计与治理

Rashid Mushkani

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 本论文提出公民AI权利与多元对齐方法,以蒙特利尔为实证基础,结合Street Review与LIVS研究,构建市政AI治理框架,解决公共空间AI决策中的多元价值争议问题。

Comments Ph.D. dissertation, Université de Montréal, 231 pages, 59 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24293 2026-08-26 cs.CV 新提交 57%

Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation

保留还是丢弃?用于紧凑视频表示的自适应分词器

Yeonkyeong Lee, Hyunsung Go, Jongmin Kim, Sewoong Lim, Donghoon Lee

机构 * Kakao Corp.(Kakao公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对传统VAE固定压缩率无法适配视频时空内容复杂度的问题,提出基于Transformer的自适应令牌分词器KATok,结合两种位置预测策略缓解空间错位,在先进压缩率下实现出色的视频重构与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23796 2026-08-26 econ.EM cs.LG stat.AP 新提交 50%

Accelerating the Adoption of Residential Solar Power Systems: Policy Analysis using a Dynamic Structural Model

加速居民太阳能发电系统的普及:基于动态结构模型的政策分析

Sebastián Souyris, Jason A. Duan, Anantaram Balakrishnan, Varun Rai

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究构建居民光伏扩散动态结构模型,利用奥斯汀家庭数据估计模型,模拟反事实政策发现有限期回扣等策略可提升光伏采用与减排效果。

Comments 62 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24851 2026-08-26 cs.NE econ.GN 新提交 50%

Learning Whom to Trust: Decision-Generated Credibility in Social Learning

学习信任对象:社会学习中的决策生成可信度

Gabriel Bontemps, Abhishek Banerjee

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出决策生成的社会信息可信度机制,通过强化学习智能体的漂移扩散过程建模,发现中等传播加速纠错、强传播锁定错误共识,为社会学习的错误放大问题提供了可检验的预测框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24049 2026-08-26 cs.LG 新提交 50%

Physics-Integrated Operator Learning via Gaussian Splatting Representations

基于高斯溅射表示的物理集成算子学习

Jihao Zhang, Junyi Guo, Jian-Xun Wang

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出基于前馈高斯溅射(FFGS)表示的物理集成算子学习框架,在多类PDE系统长时序预测中降低相对ℓ₂误差1.5-2.2倍,提升光谱保真度,对部分已知控制方程具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23953 2026-08-26 cs.SE cs.AI cs.CE 新提交 50%

The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses

长期分裂的帝国必须统一:三种大语言模型智能体框架的架构趋同

Dai Jiahong

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过对LangChain deepagents、Earendil pi、DeepSeek dsh三种编码智能体框架的多案例研究,发现它们虽初始理念迥异却趋同于含五个元素的架构,同时指出外部可验证性是未趋同的关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24055 2026-08-26 math.NA 新提交 50%

Quadrilateral and Hexahedral Immersed Finite Element Methods for Elliptic Interface Problems

用于椭圆界面问题的四边形与六面体浸入有限元方法

Fangfang Qin, Haifeng Ji

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对椭圆界面问题,提出四边形与六面体网格的节点等参IFE方法,通过合理选择离散通量施加点解决了现有方法的单值性与角度限制问题,建立最优误差估计并经数值实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23571 2026-08-26 cs.LG physics.chem-ph 新提交 50%

Equivariant Cellular Sheaves for Molecular Electronic Structure: Bridging Sheaf Cohomology and E(3)-Equivariant Hamiltonian Learning

用于分子电子结构的等变胞层:连接层上同调与E(3)等变哈密顿学习

Krishna Harish

机构 * Elkins High School(埃尔金斯高中)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出等变胞层网络,将分子哈密顿量建模为胞层拉普拉斯算子,兼具拓扑性质与E(3)等变性,在共轭分子非键轨道预测等任务上性能更优。

Comments 12 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24875 2026-08-26 physics.flu-dyn 新提交 50%

Ice melting in an oscillatory flow

振荡流中的冰融化

Sofía Angriman, Tobias de Buck, Roberto Verzicco, Sander G. Huisman

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过二维直接数值模拟,分析无浮力条件下振荡流的振幅和频率对冰圆盘融化动力学的影响,识别出慢振荡的强制对流状态与快振荡的扩散极限状态两种机制,揭示了融水积聚对热传递的抑制作用。

详情

展开后加载摘要…

URL PDF HTML 收藏