arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-03 至 2026-03-03 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 6 篇

2603.01163 2026-03-03 cs.CV 57%

BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling

BeautyGRPO: 通过动态路径引导和细粒度偏好建模实现面部修饰的美观对齐

Jiachen Yang, Xianhui Lin, Yi Dong, Zebiao Zheng, Xing Liu, Hong Gu, Yanmei Fang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学计算机科学与技术学院,深圳校区) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd., China(vivo蓝影实验室,vivo移动通信有限公司)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 BeautyGRPO通过动态路径引导和细粒度偏好建模,解决面部修饰中保真度与审美偏好对齐的难题,实现更高质量的图像编辑效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05606 2026-03-03 cs.CV cs.CL 57%

Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

Uni-cot: 向跨文本和视觉的统一链式推理迈进

Luozheng Qin, Jia Gong, Yuqing Sun, Tianjiao Li, Mengping Yang, Xiaomeng Yang, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。

Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00825 2026-03-03 cs.CV 57%

COMBAT: Conditional World Models for Behavioral Agent Training

COMBAT:基于行为代理训练的条件世界模型

Anmol Agarwal, Pranay Meshram, Sumer Singh, Saurav Suman, Andrew Lapp, Shahbuland Matiana, Louis Castricato, Spencer Frazier

机构 * Overworld AI Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00526 2026-03-03 cs.CV 57%

Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成

Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文元) Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21333 2026-03-03 cs.CV 57%

HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles

HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑

Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang

机构 * NEC Labs America(NEC美国实验室) Stony Brook University(石溪大学) UC San Diego(圣地亚哥大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10980 2026-03-03 cs.CV 57%

TrueSkin: Towards Fair and Accurate Skin Tone Recognition and Generation

TrueSkin: 向公平和准确的皮肤色调识别与生成迈进

Haoming Lu

机构 * Topaz Labs(Topaz实验室)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 TrueSkin通过系统化的皮肤色调数据集,提升模型在公平性和准确性上的表现,验证了其在识别和生成任务中的有效性。

Comments The dataset is available for download at https://drive.google.com/file/d/1_ndw5uyY4h4DLL5iGTL4bVDKdE_g_H4B/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏