arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-25 至 2025-11-25 共收录 127 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 4 篇

2502.17775 2025-11-25 cs.CL 67%

FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks

FoREST: 空间推理任务中的参考框架评估

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

AI总结 FoREST基准通过空间引导提示法提升LLMs在空间推理任务中的参考框架理解能力。

Comments 10 pages, 3 Figures, 4 Tables, EMNLP-2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01982 2025-11-25 cs.LG cs.CV 57%

Fine-Grained GRPO for Precise Preference Alignment in Flow Models

细粒度GRPO用于流模型中的精确偏好对齐

Yujie Zhou, Pengyang Ling, Jiazi Bu, Yibin Wang, Yuhang Zang, Jiaqi Wang, Li Niu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出细粒度GRPO框架,通过细粒度评估和多粒度整合模块提升流模型中偏好对齐的精度与鲁棒性。

Comments Project Page: https://bujiazi.github.io/g2rpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17606 2025-11-25 cs.LG cs.AI 50%

Energy-based Autoregressive Generation for Neural Population Dynamics

基于能量的自回归生成用于神经群体动力学

Ningling Ge, Sicheng Dai, Yu Zhu, Shan Yu

机构 * Ningling Ge 1,2,3(Ge Ningling 机构1, 机构2, 机构3) Sicheng Dai 1,2,3,4(Dai Sicheng 机构1, 机构2, 机构3, 机构4) Yu Zhu 1,2,3,4(Zhu Yu 机构1, 机构2, 机构3, 机构4) Shan Yu 1, 3(Yu Shan 机构1, 机构3)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出基于能量的自回归生成框架,用于高效生成神经群体动态,展示其在生成质量和计算效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01250 2025-11-25 q-bio.NC cs.HC 50%

Perceptogram: Reconstructing Visual Percepts and Presumptive Electrode Preference from EEG

Perceptogram: 从EEG重建视觉知觉及推测电极偏好

Teng Fei, Srinivas Ravishankar, Zhining Chen, Abhinav Uppal, Ian Jackson, Virginia R. de Sa

专题命中 图像生成评测 :diffusion(abstract)

AI总结 Perceptogram通过简单线性解码器和CLIP嵌入实现从EEG到图像的高精度重建,并可视化EEG特征图以揭示视觉属性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与蒸馏 2 篇

2511.18834 2025-11-25 cs.CV cs.AI 76%

FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories

FlowSteer: 通过真实轨迹引导少步图像合成

Lei Ke, Hubery Yin, Gongye Liu, Zhengyao Lv, Jingcai Guo, Chen Li, Wenhan Luo, Yujiu Yang, Jing Lyu

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司微信视觉部门) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与蒸馏 :image synthesis(title,comments);分类 cs.CV

AI总结 FlowSteer通过引导学生沿教师真实生成轨迹提升ReFlow蒸馏效果,解决分布不匹配和优化调度器问题,提升少步图像合成质量。

Comments Few-Step Image Synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17898 2025-11-25 cs.RO 50%

L1 Sample Flow for Efficient Visuomotor Learning

L1样本流用于高效视觉-运动学习

Weixi Song, Zhetao Chen, Tao Xu, Xianchao Zeng, Xinyu Zhou, Lixin Yang, Donglin Wang, Cewu Lu, Yong-Lu Li

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 L1流通过结合去噪模型的多模分布捕捉能力与L1回归的高效性,实现高效的视觉-运动学习。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他图像生成 1 篇

2511.19343 2025-11-25 cs.CV 57%

Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning

Syn-GRPO:面向多模态大语言模型感知推理的自进化数据合成

Qihan Huang, Haofei Zhang, Rong Wei, Yi Wang, Rui Tang, Mingli Song, Jie Song

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 Syn-GRPO通过自进化数据合成提升多模态大语言模型的感知推理能力,采用数据服务器与GRPO工作流协同生成高质量多样化训练数据,实验验证其在视觉感知任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏