arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-24 至 2026-02-24 共收录 11 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 11 篇

2602.19348 2026-02-24 cs.CV cs.AI 86%

MultiDiffSense: Diffusion-Based Multi-Modal Visuo-Tactile Image Generation Conditioned on Object Shape and Contact Pose

MultiDiffSense: 基于扩散的多模态视觉-触觉图像生成,基于物体形状和接触姿态

Sirine Bhouri, Lan Wei, Jian-Qing Zheng, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、帝国理工学院伦敦分校) CAMS-Oxford Institute, University of Oxford(CAMS-牛津研究所、牛津大学)

专题命中 可控生成 :diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 MultiDiffSense是一种基于扩散的多模态视觉-触觉图像生成模型,通过双条件化实现可控且物理一致的多模态生成,提升了触觉传感数据集的生成效率和跨模态学习能力。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18903 2026-02-24 cs.CV cs.HC 74%

SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model

Gemini 3 Pro图像的SCHEMA:为Google原生多模态模型的受控AI图像生成的结构化方法

Luca Cazzaniga

机构 * Independent Researcher(独立研究者)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 SCHEMA为Google Gemini 3 Pro图像提供结构化提示工程方法,通过三级系统提升AI图像生成的可控性,实现高合规率和跨领域应用。

Comments 24 pages, 8 tables. Based on SCHEMA Method v1.0 (deposited December 11, 2025). Previously published on Zenodo: doi:10.5281/zenodo.18721380

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17690 2026-02-24 cs.GR cs.AI cs.CV cs.LG cs.MM 67%

DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation

DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度

Ziyuan Liu, Shizhao Sun, Danqing Huang, Yingdong Shi, Meisheng Zhang, Ji Li, Jingsong Yu, Jiang Bian

机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) Microsoft(微软公司) ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20079 2026-02-24 cs.CV 57%

SemanticNVS: Improving Semantic Scene Understanding in Generative Novel View Synthesis

SemanticNVS: 提高生成式新视角合成中的语义场景理解

Xinya Chen, Christopher Wewer, Jiahao Xie, Xinting Hu, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Germany(马克斯·普朗克研究所信息学院,萨尔兰州信息学院,德国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SemanticNVS通过整合预训练语义特征提取器,提高生成式新视角合成中远距离视角下的生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19937 2026-02-24 cs.CV 57%

Learning Positive-Incentive Point Sampling in Neural Implicit Fields for Object Pose Estimation

在神经隐式场中学习正激励点采样用于物体姿态估计

Yifei Shi, Boyan Wan, Xin Xu, Kai Xu

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出结合SO(3)-等价卷积隐式网络和正激励点采样策略的方法,提升物体姿态估计的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19358 2026-02-24 cs.CV 57%

Referring Layer Decomposition

提及层分解

Fangyi Chen, Yaojie Shen, Lu Xu, Ye Yuan, Shu Zhang, Yulei Niu, Longyin Wen

机构 * Intelligent Editing Team, Intelligent Creation, ByteDance(字节跳动智能创作部)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 提及层分解任务通过预测RGBA层实现精确的视觉内容控制,结合大规模数据集和评估协议,提升图像编辑和生成的可控性与质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14720 2026-02-24 cs.CV 57%

ShapeShift: Text-to-Mosaic Synthesis via Semantic Phase-Field Guidance

ShapeShift: 通过语义相场指导实现文本到马赛克合成

Vihaan Misra, Peter Schaldenbrand, Jean Oh

机构 * Carnegie Mellon University USA(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ShapeShift通过语义相场指导实现文本到马赛克合成,结合语义指导与可行性约束解决,提升排列的语义清晰性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18817 2026-02-24 cs.CV 57%

HeRO: Hierarchical 3D Semantic Representation for Pose-aware Object Manipulation

HeRO:用于姿态感知物体操作的分层3D语义表示

Chongyang Xu, Shen Cheng, Haipeng Li, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Dexmal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HeRO通过分层语义场结合几何与语义,提升姿态感知操作的控制策略,实现多个任务的成功率提升。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13851 2026-02-24 cs.LG stat.ML 50%

Inverting Self-Organizing Maps: A Unified Activation-Based Framework

反向自组织映射:一个基于激活的统一框架

Alessandro Londei, Matteo Benati, Denise Lanzieri, Vittorio Loreto

机构 * Sony Computer Science Laboratories - Rome Joint Initiative CREF-SONY, Centro Ricerche Enrico Fermi Via Panisperna 89/A, 00184 Rome, Italy(索尼计算机科学实验室-罗马联合计划 CREF-SONY,埃尼奇费里研究中心,帕纳尔纳街89号A,00184罗马,意大利) Department of Computer, Automatic and Management Engineering Sapienza University, Via Ariosto 25 Rome, Italy(计算机、自动与管理工程系,萨皮恩扎大学,阿里奥斯特路25号,意大利) Physics Department Sapienza University, Piazzale Aldo Moro 1 Rome, Italy(物理系,萨皮恩扎大学,阿尔多·莫罗广场1号,意大利) Complexity Science Hub Josefstädter Strasse 39, A 1080, Vienna, Austria(复杂性科学中心,约瑟夫斯塔德特街39号,奥地利1080)

专题命中 可控生成 :diffusion(abstract)

AI总结 MUSIC通过原型几何实现SOM的反向与控制,无需采样或解码器,产生语义连贯的轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18739 2026-02-24 cs.LG 50%

When World Models Dream Wrong: Physical-Conditioned Adversarial Attacks against World Models

当世界模型做梦错误:针对世界模型的物理条件对抗攻击

Zhixiang Guo, Siyuan Liang, Andras Balogh, Noah Lunberry, Rong-Cheng Tu, Mark Jelasity, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) University of Szeged(塞格德大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出PhysCond-WMA攻击方法,通过扰动物理条件通道诱导世界模型的语义、逻辑或决策层面的扭曲,揭示生成式世界模型的安全性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18699 2026-02-24 cs.CL cs.AI 50%

Semantic Substrate Theory: An Operator-Theoretic Framework for Geometric Semantic Drift

语义基质理论:几何语义漂移的算子理论框架

Stephen Russell

机构 * Intelligent Systems and Robotics Department(智能系统与机器人系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出语义基质理论,通过算子理论框架分析几何语义漂移,引入桥质量预测未来邻居重排,并提供理论与测试合同。

详情

展开后加载摘要…

URL PDF HTML 收藏