arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 198 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 198 篇

2606.17040 2026-06-16 cs.RO cs.CV 新提交 57%

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

R2RDreamer: 面向空间泛化的2D操作策略的3D感知数据增强

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) BUPT(北京邮电大学) GigaAI

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出R2RDreamer框架,通过轻量级3D编辑和2D视频补全,从少量真实演示生成几何一致的增强数据,提升2D操作策略的空间泛化能力。

Comments Project page: https://r2rdreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15592 2026-06-16 cs.CV 新提交 57%

DenseControl: Instance-Level Controllable Synthesis of Dense Crowd Image

DenseControl: 密集人群图像的实例级可控合成

Juncheng Wang, Lei Shang, Wang Lu, Baigui Sun, Shujun Wang

机构 * the Hong Kong Polytechnic University(香港理工大学) Tongyi lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 提出DenseControl管道,通过隔离对象嵌入图和隐式尺度嵌入策略,实现密集人群图像中实例位置、大小、背景、风格和属性的精确控制,在合成质量和下游应用中达到最优。

Comments Accepted to IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15341 2026-06-16 cs.CV 新提交 57%

CausalDrive: Real-time Causal World Models for Autonomous Driving

CausalDrive: 用于自动驾驶的实时因果世界模型

Tianyi Yan, Huan Zheng, Dubing Chen, Meizhi Qu, Yingying Shen, Lijun Zhou, Mingfei Tu, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院,科技学院) Xiaomi EV(小米汽车) CASIA(中国科学院自动化研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出CausalDrive,一种可控、实时的驾驶世界渲染器,通过因果预测和Context-Forced DMD架构实现交互式模拟,支持闭环评估、强化学习后训练和人在环仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15072 2026-06-16 cs.CV 新提交 57%

Texture-Shape Bias Balancing for Robust Synthetic-to-Real Semantic Segmentation in Automotive NIR Imagery

纹理-形状偏差平衡用于汽车近红外图像中鲁棒的合成到真实语义分割

Felix Stillger, Ben Hamscher, Lukas Hahn, Annika Mütze, Tobias Meisen, Kira Maag

机构 * University of Wuppertal(伍珀塔尔大学) Aptiv(Aptiv公司) Heinrich Heine University Düsseldorf(海因里希·海涅大学杜塞尔多夫) Osnabrück University(奥斯纳布吕克大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出生成式增强框架,通过目标风格适配和Voronoi风格多样化策略平衡纹理-形状偏差,实现近红外图像合成到真实域适应,将域差距减少高达63.6%。

Comments Accepted at ECML PKDD 2026 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13382 2026-06-12 cs.CV cs.AI 新提交 57%

SmartFont: Dynamic Condition Allocation for Few-Shot Font Generation

SmartFont: 少样本字体生成的动态条件分配

Zian Yang, Zixin Wang

机构 * Fudan University(复旦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SmartFont扩散框架,通过全局内容-风格生成与弱监督局部校正专家结合,并引入去噪状态条件分配模块动态加权全局与局部特征,实现少样本字体生成的全局完整性与局部细节保真度平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 57%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11096 2026-06-10 cs.CV 新提交 57%

IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

IDEAL: 深度对齐实现离散表示自编码器

Yitong Chen, Zijie Diao, Junke Wang, Lingyu Kong, Yixuan Ren, Bo He, Yu-Gang Jiang, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Innovation Institute(上海创新研究院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。

Comments Code is available at https://github.com/Row11n/IDEAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10902 2026-06-10 cs.CV cs.AI 新提交 57%

Pose-ICL: 3D-Aware In-Context Learning for Pose-Controllable Subject Customization

Pose-ICL:面向姿态可控主体定制的3D感知上下文学习

Xuan Han, Yihao Zhao, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University, Shanghai, China(同济大学电子与信息工程学院) State Key Laboratory of Autonomous Intelligent Unmanned Systems, Frontiers Science Center for Intelligent Autonomous Systems, Ministry of Education, Shanghai, China(自主智能无人系统国家重点实验室,智能自主系统前沿科学中心,教育部,上海,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出Pose-ICL框架,通过3D感知上下文学习和表面锚定位置嵌入(SAPE)实现无调优的姿态可控主体定制,显著提升姿态准确性和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10025 2026-06-10 cs.RO cs.CV cs.LG 新提交 57%

GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation

GHOST: 用于泛化机器人操作的层次化子目标策略

Sriram Krishna, Ben Eisner, Haotian Zhan, Ying Yuan, Haoyu Zhen, Chuang Gan, Shubham Tulsiani, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出GHOST框架,通过将控制分解为高层子目标预测和低层目标条件控制器,实现视觉运动操作策略的泛化,并利用人类演示适应新物体和任务变化。

Comments Accepted at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09131 2026-06-09 cs.AI cs.CL cs.CV cs.LG 新提交 57%

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由

Siyuan Liu, Jinyang Wu

机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。

Comments 18 pages, 4 figures. Submitted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07244 2026-06-08 cs.RO cs.AI cs.CV 新提交 57%

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation

超越航点:面向视觉语言导航的轨迹中心航点范式

Haoxiang Shi, Xiang Deng, Haoyu Zhang, Qiaohui Chu, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出轨迹航点范式,通过TSDF引导的扩散策略预测可执行轨迹,解决VLN-CE中航点不可达与规划控制不一致问题,在基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07117 2026-06-08 cs.CV cs.AI 新提交 57%

Native3D: End-to-End 3D Scene Generation via Unified Mesh-Texture Modeling and Semantic Alignment

Native3D: 通过统一网格纹理建模与语义对齐的端到端3D场景生成

Yibo Liu, Ziwei Zhang, Haozhou Pang, Menghao Li, Lanshan He, Gan Qi

机构 * Kuaishou GameMind Lab(快手游戏大脑实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Native3D,首个完全绕过2D中间表示的端到端3D场景生成框架,通过统一网格纹理联合表示和3D表示对齐损失,解决几何结构失真和纹理细节退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06901 2026-06-08 cs.CV 新提交 57%

LUCID: Learning Unified Control for Image Deflaring and Exposure Mastery in Nighttime Photography

LUCID:夜间摄影中图像去眩光与曝光控制的统一学习

Tingyu Yang, Yuan Cheng, Xiaoyun Yuan

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家实验室) AI Institute(人工智能研究所) School of Computer Science(计算机科学学院) School of Biomedical Engineering(生物医学工程学院) School of Artificial Intelligence(人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出LUCID统一框架,通过眩光解缠模块和扩散驱动模块联合处理夜间图像中的眩光和噪声,并引入四模式训练实现可控恢复,支持HDR重建,性能优于现有方法。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19709 2026-08-21 cs.NI 新提交 50%

RFWM: Physics-Guided World Model for Dynamic Wireless Radiance Field Generation

RFWM:用于生成动态无线辐射场的物理引导世界模型

Zijiu Yang, Qianqian Yang

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究针对动态未知环境下RF场建模泛化难的问题,提出物理引导的RF世界模型RFWM,采用两阶段训练策略,在新构建的基准上实现了优于现有最优方法的RF场生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19023 2026-08-20 math.OC cs.NA math.AP math.NA 新提交 50%

Local null controllability of a quasi-linear system and related numerical experiments

一类拟线性系统的局部零能控性及相关数值实验

Enrique Fernández-Cara, Juan Límaco, Yuri Thamsten, Denilson Menezes

专题命中 可控生成 :diffusion(abstract)

AI总结 本文针对扩散系数依赖状态梯度的拟线性抛物系统,通过线性化系统估计与局部逆定理证明其局部零能控性,提出拟牛顿型迭代算法并经数值实验验证。

Comments 31 pages, 16 figures, 9 tables

Journal ref ESAIM: Control, Optimisation and Calculus of Variations 29 (2023) 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18282 2026-08-20 math.OC cs.LG cs.SY eess.SY 新提交 50%

Self-supervised In-context Operator Learning for Stochastic Mean-Field Control

面向随机平均场控制的自监督上下文算子学习

Suyi Gao, Mo Zhou, Rongjie Lai

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究提出首个无网格自监督神经算子NFIST,通过结合概率流ODE与可逆归一化流Transformer解决随机平均场控制问题,可实现未见任务的一次前向求解,在多任务上展现零样本泛化并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18249 2026-08-20 astro-ph.GA astro-ph.EP astro-ph.HE astro-ph.SR 新提交 50%

Accretion of AGN Stars under Influence of Disk Geometry II: The Adiabatic Regime and Runaway Collapse Induced by Self-gravity

吸积盘几何影响下的AGN恒星吸积 II:绝热 regime 与自引力诱导的坍缩

Yi-Xian Chen, Yan-Fei Jiang, Jeremy Goodman

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究通过三维流体动力学模拟,探究AGN盘内恒星吸积的绝热 regime,发现高热质量比下会触发包层强激波,近自引力盘内满足条件时会发生自引力诱导的失控坍缩,可形成~10⁵M_⊙的超大质量恒星。

Comments Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13164 2026-08-14 math-ph math.MP physics.class-ph 新提交 50%

Exact analytical solution for the non-selfadjoint problem of Maxwell--Cattaneo--Vernotte heat conduction with heat-transfer boundary condition

带传热边界条件的麦克斯韦-卡塔内奥-韦尔诺特热传导非自伴问题的精确解析解

Mátyás Szücs, Tamás Fülöp

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究求解带传热边界条件的麦克斯韦-卡塔内奥-韦尔诺特非傅里叶热传导方程,构建双正交系统得到精确解析解,分析谱结构并与数值解对比,为非自伴双曲热传导提供解析基准。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11936 2026-08-13 math.NA cs.NA 新提交 50%

A Positivity-Preserving Expectation Scheme for Hamilton--Jacobi--Bellman Equations with Oblique Robin Boundary Conditions

具有斜Robin边界条件的Hamilton--Jacobi--Bellman方程的保正性期望格式

Haoran Xu, Xingye Yue

专题命中 可控生成 :diffusion(abstract)

AI总结 本文针对带混合导数的各向异性扩散问题,构造了一种保正性的Hamilton--Jacobi--Bellman方程数值格式,该格式无需对角占优条件和CFL关系即可保持正性,且适用于斜Robin边界条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10498 2026-08-12 physics.flu-dyn 新提交 50%

Low-dimensional structure and online tracking of POD subspaces on the Grassmann manifold: application to flow around an airfoil

Grassmann流形上POD子空间的低维结构与在线跟踪:在翼型绕流中的应用

Shintaro Sato, Yoshitsugu Naka, Rei Sasaki, Rion Handa, Naofumi Ohnishi

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究将POD子空间视为流动状态,通过扩散映射和Grassmann秩1更新算法,在翼型绕流实验中验证了可在线跟踪其低维演化,为流动状态估计与控制提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09571 2026-08-11 cs.SD 新提交 50%

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

SonicWeave:用于统一音频场景生成的分块路由混合专家模型

Yunrui Cai, Xu Li, Yucheng Zhou, Jinchao Li, Dingdong Wang, Dongchao Yang, Xixin Wu, Chen Zhang, Zhiyong Wu, Pengfei Wan, Helen Meng

机构 * Kuaishou Technology(快手科技) The Chinese University of Hong Kong(香港中文大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出SonicWeave,一种带CPE-MoE的流匹配模型,可通过单一权重集生成含语音、音乐等的统一音频场景,在多项基准及复杂场景评估中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07840 2026-08-11 cond-mat.quant-gas physics.atom-ph 新提交 50%

Coherent Control of Domain-Wall Transport in an Ultracold Bose Gas

超冷玻色气体中畴壁输运的相干控制

O. Farion, M. Pourzand, J. M. McGuirk

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究在超冷玻色气体中实现了畴壁输运的相干控制,通过调控自旋畴取向改变畴壁轨迹,揭示了两种输运 regime 的交叉,为原子电子学系统的可控畴壁动力学提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06208 2026-08-07 cs.RO 新提交 50%

ErgoSurf: Ergodic Control for the Coverage of Unknown Surfaces

ErgoSurf:用于未知表面覆盖的遍历控制

Stefan Schneyer, Timo Bachmann, Maged Iskandar, Korbinian Nottensteiner, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR)(德国航空航天中心) Technical University of Munich (TUM)(慕尼黑工业大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ErgoSurf框架,结合GPIS模型与触觉传感,实现未知表面的遍历覆盖与几何在线学习,经仿真和真实机器人实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05953 2026-08-07 math.OC 新提交 50%

Stabilizer Design for Policy Iteration in Stochastic Linear Quadratic Control: A Spectrum-Assignment Approach

随机线性二次控制中策略迭代的稳定器设计:一种频谱分配方法

Xinyu Cao, Bing-Chang Wang, Ying Cao

专题命中 可控生成 :diffusion(abstract)

AI总结 针对连续时间不定随机线性二次控制中无模型策略迭代的初始化难题,提出频谱分配方法设计初始稳定器,构建无模型算法实现最优控制,仿真验证了方法有效性。

Comments 14 pages, 9 figures. Extended version with complete proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05251 2026-08-07 cond-mat.stat-mech physics.bio-ph 新提交 50%

Nucleation beyond Equilibrium: Fronts Control Invasion in Bistable Ecosystems

超越平衡的成核:双稳态生态系统中的入侵由前沿控制

Victor Lequin, Giulio Biroli, Camille Scalliet

专题命中 可控生成 :diffusion(abstract)

AI总结 本文针对具有非守恒矢量序参量的反应扩散系统建立了非平衡成核理论,将其应用于双稳态生态的 Lotka-Volterra 模型,揭示了强种间竞争使入侵难度指数级增加的机制。

Comments 34 pages, 20 figures, 2 supplementary videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02569 2026-08-04 cs.AI cs.DC cs.OS 新提交 50%

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies

AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架

Qiushi Lin, Chaojie Zhang, Íñigo Goiri, Aditya Akella, Ricardo Bianchini, Jovan Stojkovic

专题命中 可控生成 :diffusion(abstract)

AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02218 2026-08-04 cs.AI 新提交 50%

PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs

PosterMELD:面向可编辑打印就绪输出的可控设计多样性多智能体论文转海报生成

Haojie Hu, Chenhao Dang, Yaojia Liu, Hengrui Kang, Conghui He, Weijia Li

专题命中 可控生成 :image generation(abstract)

AI总结 PosterMELD是模板条件化多智能体海报生成流水线,可导出可编辑PPTX和PNG,在621篇论文实验中PRR达81.3%,成本仅为Codex+Skill的3.5%,性能优于P2P、PosterGen等方法。

Comments 9 pages, 5 figures, and 4 tables. Code and resources are available at https://github.com/Shannon4Science/PosterMELD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00970 2026-08-04 cs.RO 新提交 50%

FreqNav: Stage-Wise Frequency Routing for Object-Oriented Aerial Vision-Language Navigation

FreqNav:面向面向对象空中视觉语言导航的分阶段频率路由

Yin Tang, Jiawei Ma, Jiahao Li, Hao Zhang, Zhemin Sun, Jianqiao Sun, Deyu Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 针对现有空中VLN方法的感知干扰问题,提出FreqNav框架,通过动态分配视觉令牌实现分阶段频率路由,提升性能并加快推理速度,验证了其实际应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29563 2026-08-03 math.OC cs.SY eess.SY 新提交 50%

Node-Wise Dynamic Optimal Control for Evolutionary Games on General Multilayer Networks

通用多层网络上演化博弈的节点级动态最优控制

Rio Aurachman, Giuliano Punzo

专题命中 可控生成 :diffusion(abstract)

AI总结 针对通用多层网络中演化博弈的最优控制问题,通过求解哈密尔顿-雅可比-贝尔曼方程得到节点级动态最优激励的解析解,经数值验证后与现有文献结果对比,为促进种群合作提供了新方案。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26762 2026-07-30 cs.CL 新提交 50%

Relation Geometry in Semantic Space of Language Models

语言模型语义空间中的关系几何

Zhihan Cao, Hiroaki Yamada, Simone Teufel, Tatsuya Hiraoka, Kentaro Inui, Hitomi Yanaka, Takenobu Tokunaga

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究语言模型语义空间中关系几何的表征情况,通过三类语言模型在6种语义关系上的实验,发现非对称关系的表征更清晰,且不同模型依赖的信息来源存在差异。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏