arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-11 至 2026-02-11 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 59 篇

2508.09268 2026-02-11 astro-ph.SR 50%

Evolution of a Long-Lived Deep-Seated Main-Sequence Magnetic Field During White Dwarf Cooling

恒星主序星期内长寿命深部磁场的演化过程:白矮星冷却期间

Matias Castro-Tapia, Maria Camisassa, Shu Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了白矮星冷却期间主序星遗留磁场的演化机制,表明深部磁场可通过主序星发电机和等分标度解释观测到的磁场强度差异。

Comments Published in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17301 2026-02-11 math.NA cs.NA 50%

Moment-based adaptive time integration for thermal radiation transport

基于动量的自适应时间积分用于热辐射传输

Ben S. Southworth, Steven Walton, Steven B. Roberts, HyeongKae Park

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于动量的自适应时间积分方法,用于多频率热辐射传输,通过高阶低阶表示和误差估计实现高效的时间适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05316 2026-02-11 math.AP 50%

Sharp Decay of the Fisher Information for Degenerate Fokker-Planck Equations

退化福克-普朗克方程的菲舍尔信息的快速衰减

Anton Arnold, Amit Einav, Tobias Wöhrer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究退化福克-普朗克方程在二次菲舍尔信息下的精确收敛率,通过与有限维ODE相关联的传播算子范数来确定该速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14033 2026-02-11 math.AP math-ph math.MP 50%

Generalised Fisher Information in Defective Fokker-Planck Equations

广义Fisher信息在缺陷福克-普朗克方程中

Anton Arnold, Amit Einav, Tobias Wöhrer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种新的广义Fisher信息方法,用于研究福克-普朗克方程的长期行为,通过最小谱信息替代传统谱理论工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2504.10350 2026-02-11 cs.CV 57%

Benchmarking 3D Human Pose Estimation Models under Occlusions

在遮挡下评估3D人体姿态估计模型的基准测试

Filipa Lino, Carlos Santiago, Manuel Marques

机构 * Institute for Systems and Robotics, LARSyS(系统机器人研究所、LARSyS)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文评估了九种3D人体姿态估计模型在遮挡条件下的鲁棒性,发现所有模型在遮挡下性能下降,尤其是扩散模型表现不佳,揭示了当前模型在遮挡处理上的关键限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09425 2026-02-11 cs.CV cs.LG 57%

Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification

弥合道路激光雷达的模态差距:一种无需训练的视觉-语言模型框架用于车辆分类

Yiqiao Li, Bo Shang, Jie Wei

机构 * Department of Civil Engineering, City College of New York(城市学院土木工程系) Department of Computer Science, City College of New York(城市学院计算机科学系)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的视觉-语言模型框架,用于解决道路激光雷达中稀疏点云与密集图像之间的模态差距问题,实现细粒度车辆分类。

Comments 12 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18862 2026-02-11 cs.CV cs.AI 57%

TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models

TAMMs: 卫星图像时间序列中基于时序感知的多模态模型用于变化理解和预测

Zhongbin Guo, Yuhao Wang, Ping Jian, Chengzhi Li, Xinyue Chen, Zhen Yang, Ertai E

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 TAMMs通过时序感知多模态模型统一执行卫星图像时间序列中的变化理解和未来预测,提升长程时间动态建模能力。

Comments Published as a conference paper at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08986 2026-02-11 cs.RO cs.LG 50%

ChicGrasp: Imitation-Learning based Customized Dual-Jaw Gripper Control for Delicate, Irregular Bio-products Manipulation

ChicGrasp:基于模仿学习的定制化双爪夹具控制用于精细、不规则生物产品操作

Amirreza Davar, Zhengtong Xu, Siavash Mahmoudi, Pouya Sohrabipour, Chaitanya Pallerla, Yu She, Wan Shou, Philip Crandall, Dongyi Wang

机构 * University of Arkansas(阿肯色大学) Purdue University(普渡大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 ChicGrasp通过模仿学习实现定制化双爪夹具控制,有效提升对精细、不规则生物产品的操作效率。

Comments Submitted for journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09695 2026-02-11 eess.SY cs.SY 50%

Robust Macroscopic Density Control of Heterogeneous Multi-Agent Systems

异构多智能体系统的鲁棒宏观密度控制

Gian Carlo Maffettone, Davide Salzano, Mario di Bernardo

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种可扩展的宏观密度控制框架,用于异构多智能体系统,在部分未知环境中实现鲁棒的密度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15862 2026-02-11 cond-mat.mes-hall cs.SY eess.SY quant-ph 50%

Integration of Cobalt Ferromagnetic Control Gates for Electrical and Magnetic Manipulation of Semiconductor Quantum Dots

钴铁磁控制门的集成用于半导体量子点的电和磁操控

Fabio Bersano, Michele Aldeghi, Niccolò Martinolli, Victor Boureau, Thibault Aboud, Michele Ghini, Pasquale Scarlino, Gian Salis, Adrian Mihai Ionescu

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种利用钴铁磁控制门集成多栅 FD-SOI 纳米线,实现半导体量子点的电和磁操控,展示了其在量子计算中的应用潜力。

Comments 15 pages, 7 figures

Journal ref Adv. Funct. Mater. 2025, 35, 2419940

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2602.10113 2026-02-11 cs.CV 57%

ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation

ConsID-Gen:视图一致且身份保持的图像到视频生成

Mingyang Wu, Ashirbad Mishra, Soumik Dey, Shuo Xing, Naveen Ravipati, Hansi Wu, Binbin Li, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) eBay Inc.(eBay公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ConsID-Gen通过视图辅助生成框架提升图像到视频生成的视图一致性和身份保持性。

Comments Project page: https://myangwu.github.io/ConsID-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 5 篇

2602.09007 2026-02-11 cs.AI cs.CV 79%

GEBench: Benchmarking Image Generation Models as GUI Environments

GEBench: 图形用户界面生成模型的基准测试

Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun South China University of Technology(南方科技大学) Peking University(北京大学) Tsinghua University(清华大学) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) The University of Chicago(芝加哥大学) Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 GEBench提出一个评估GUI生成模型动态交互和时间一致性的基准测试,通过五维指标揭示模型在多步交互中的瓶颈问题。

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10913 2026-02-11 cs.CV cs.CL 70%

Know "No" Better: A Data-Driven Approach for Enhancing Negation Awareness in CLIP

了解“不”:一种数据驱动的方法用于增强CLIP中的否定意识

Junsung Park, Jungbeom Lee, Jongyoon Song, Sangwon Yu, Dahuin Jung, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Amazon(亚马逊) Samsung Research(三星研究院) School of Computer Science and Engineering, Soongsil University(顺天大学计算机科学与工程学院) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学IPAI、AIIS、ASRI、INMC和ISRC)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出NegationCLIP,通过生成包含否定的数据增强CLIP的否定意识,同时提出NegRefCOCOg基准用于评估多模态模型的否定理解能力。

Comments Accepted to ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 2825-2835

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09891 2026-02-11 cs.SD cs.LG cs.MM 57%

Stemphonic: All-at-once Flexible Multi-stem Music Generation

Stemphonic:一次生成灵活多音部音乐创作

Shih-Lun Wu, Ge Zhu, Juan-Pablo Caceres, Cheng-Zhi Anna Huang, Nicholas J. Bryan

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Adobe Research(Adobe研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.MM

AI总结 Stemphonic通过一次生成灵活多音部音乐创作,提升音乐生成效率和质量。

Comments Accepted for publication at Int. Conf. on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09461 2026-02-11 cs.LG 50%

Scalable and Reliable State-Aware Inference of High-Impact N-k Contingencies

可扩展且可靠的高影响N-k contingencies状态感知推断

Lihao Mai, Chenhan Xiao, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering at Arizona State University(亚利桑那州立大学电气、计算机与能源工程学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出了一种可扩展、状态感知的contingency推断框架,通过条件扩散模型和拓扑感知图神经网络生成高影响的N-k停电场景,提高contingency评估的可靠性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13981 2026-02-11 q-bio.BM cs.LG 50%

Decomposed Direct Preference Optimization for Structure-Based Drug Design

基于结构的分解直接偏好优化用于基于结构的药物设计

Xiwei Cheng, Xiangxin Zhou, Yuwei Yang, Yu Bao, Quanquan Gu

专题命中 图像生成评测 :diffusion(abstract)

AI总结 DecompDPO通过分解优化目标和引入物理信息能量项,提升基于结构的药物设计中分子生成与优化的性能。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2508.21091 2026-02-11 cs.CV 79%

ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion

ERTACache:误差修正与时间步调整以实现高效的扩散模型

Xurui Peng, Chenqian Yan, Hong Liu, Rui Ma, Fangmin Chen, Xing Wang, Zhihua Wu, Songwei Liu, Mingbao Lin

机构 * ByteDance Inc.(字节跳动公司) Rakuten Asia(乐天亚洲)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 ERTACache通过误差修正和时间步调整,实现高效扩散模型的加速,保持视觉质量的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00076 2026-02-11 cond-mat.mtrl-sci 50%

Materials discovery acceleration by using condition generative methodology

通过条件生成方法加速材料发现

Caiyuan Ye, Yuzhi Wang, Xintian Xie, Tiannian Zhu, Jiaxuan Liu, Yuqing He, Lili Zhang, Junwei Zhang, Zhong Fang, Lei Wang, Zhipan Liu, Hongming Weng, Quansheng Wu

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出PODGen框架,通过条件生成方法显著提升拓扑绝缘体的发现效率,生成成功率提高5.3倍,识别出多种可合成的拓扑绝缘体。

Journal ref Nat. Commun. 2025, 16, 1930

详情

展开后加载摘要…

URL PDF HTML 收藏