Stroke Patches: Customizable Artistic Image Styling Using Regression
笔触补丁:通过回归实现可定制的艺术图像风格化
AI总结 本文提出了一种基于回归的图像风格化方法,通过可扩展的笔触补丁集实现对图像风格的定制化控制。
Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Creative AI Track
期刊&会议
Conference on Neural Information Processing Systems · 会议 · Machine Learning
笔触补丁:通过回归实现可定制的艺术图像风格化
AI总结 本文提出了一种基于回归的图像风格化方法,通过可扩展的笔触补丁集实现对图像风格的定制化控制。
Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Creative AI Track
基于统计等式约束的学习
机构 * University of Stuttgart(斯图加特大学) ; École polytechnique, Institut Polytechnique de Paris(巴黎高等理工学院)
AI总结 本文提出了一种基于等式约束的统计学习方法,通过推导泛化理论并设计实用算法,提升了公平学习、插值分类器和边界值问题的性能。
Comments Published in the 39th Annual Conference on Neural Information Processing Systems
DisCO:通过判别约束优化强化大推理模型
机构 * Texas A&M University(德克萨斯A&M大学)
AI总结 DisCO通过判别约束优化方法,有效解决大推理模型中的难度偏差和熵不稳定性,显著提升数学推理能力。
Comments Accepted to NeurIPS 2025
干预所有路径:统一缓解跨对齐格式的大型视觉-语言模型幻觉
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; ShanghaiTech University(上海科技大学)
AI总结 本文提出一种统一干预框架,通过分析不同路径间的相互作用,有效缓解跨对齐格式的LVLM幻觉问题。
Comments Accepted to NeurIPS 2025, Project Page: https://github.com/SooLab/AllPath
组合蒙特卡洛树扩散用于可扩展规划
机构 * KAIST(韩国科学技术院) ; SAP(SAP公司) ; NYU(纽约大学)
AI总结 C-MCTD通过引入三个互补组件,将规划从单轨迹优化提升到完整计划组合推理,实现更高效和可扩展的规划方法。
Comments 24 pages, 4 figures, NeurIPS 25 Spotlight
组合式离散潜在代码用于高保真、高效的扩散模型
机构 * Mila, Université de Montréal(蒙特利尔大学)
AI总结 本文提出离散潜在代码(DLC)以提升扩散模型的生成保真度,通过组合性实现分布外样本生成,并展示其在图像生成和文本到图像生成中的应用。
Comments Published at NeurIPS, 22 pages, 7 tables, 12 figures, code and models available
MIRAGE:农业专家引导对话中多模态信息检索与推理的基准
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
AI总结 MIRAGE是一个用于农业专家引导对话中多模态信息检索与推理的基准,通过真实用户-专家交互数据,提供高保真的多模态推理评估平台。
Comments Accepted to NeurIPS 2025
顿悟时刻再审视:VLMs在推理时间缩放中真的能自我验证吗?
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Meta
AI总结 本研究发现VLMs在推理时间缩放中自我验证效果有限,生成能力优于验证策略,且视觉信息整合不足。
Comments Neurips 2025 Multimodal Algorithmic Reasoning Workshop Oral. In submission
MMMG:大规模、跨学科、多层级的文本到图像推理生成基准
AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。
Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track
用语言锻造时间序列:一种基于大语言模型的合成数据生成方法
机构 * IBM Research Europe(IBM欧洲研究院)
AI总结 SDForger通过大语言模型生成高质量多变量时间序列,利用文本条件化实现高效合成数据生成及多模态建模。
Journal ref NeurIPS 2025, https://openreview.net/forum?id=A2pmvkqOgp
需要多少张图片?文本到图像模型中模仿阈值的估计
机构 * University of Washington, Seattle(华盛顿大学) ; Bar-Ilan University(巴伊兰大学) ; University of California, Irvine(加州大学伊文斯顿分校) ; Allen Institute of AI(人工智能研究院)
AI总结 研究通过评估文本到图像模型的模仿阈值,探讨其在版权和隐私合规中的应用。
Comments Accepted at TMLR 2025, ATTRIB, RegML, and SafeGenAI workshops at NeurIPS 2024 and NLLP Workshop 2024. https://openreview.net/forum?id=x0qJo7SPhs