Self-sustaining traveling fronts for a model related to bushfires
与丛林大火相关模型的自维持行波前
专题命中 扩散模型 :diffusion(abstract)
AI总结 该研究针对丛林大火蔓延的数学模型,明确大火蔓延或熄灭的条件,发现垂直平移解不存在,而温和或短程核的任意速度行波解始终存在且剖面无界。
Comments 31 pages, 2 figures, accepted version (JDE)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
与丛林大火相关模型的自维持行波前
专题命中 扩散模型 :diffusion(abstract)
AI总结 该研究针对丛林大火蔓延的数学模型,明确大火蔓延或熄灭的条件,发现垂直平移解不存在,而温和或短程核的任意速度行波解始终存在且剖面无界。
Comments 31 pages, 2 figures, accepted version (JDE)
EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。
超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计
机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。
Comments Accepted to ACM MM 2026
生成式可重光照虚拟化身
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。
Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/
LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型
专题命中 可控生成 :diffusion(abstract)
AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。
声子分布函数在光滑晶体界面处的边界条件及界面角动量转移
专题命中 可控生成 :diffusion(abstract)
AI总结 本文提出声子在光滑晶体界面处的边界条件,揭示了界面角动量转移机制,阐明了自旋角动量与轨道角动量在声子传输中的作用。
Comments Revised version. Main text (35 pages, 9 figures, 1 table) + supplementary material (4 pages, 2 figures, no tables). This manuscript provides a detailed analysis of an accompanying Letter (latest version of arXiv:2409.08874)
DinoLizer: 从最佳中学习以实现生成修复的定位
专题命中 图像修复 :inpainting(title,abstract);diffusion(title);分类 cs.CV
AI总结 DinoLizer基于DINOv2改进生成修复中的篡改定位,通过滑动窗口和后处理提升鲁棒性,实现更高的IoU性能。
ZUNA1.1:一种更灵活的用于去噪和超分辨率的脑电图(EEG)基础模型
机构 * Zyphra
专题命中 图像修复 :diffusion(abstract)
AI总结 研究推出3.8亿参数的EEG基础模型ZUNA1.1,其灵活性远超原模型ZUNA1,在EEG去噪与重建任务中性能达标且显著优于MNE包的球形样条插值,已以Apache 2.0许可开源发布。
Bunraku:将单张插图转换为可编辑的Live2D角色
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; SparcAI Inc.(SparcAI公司)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出Bunraku系统,可从单张插图端到端生成可编辑Live2D角色,构建分层扩散与联合位移预测方法,发布首个相关基准Live2D-Bench及8884模型语料库,解决了Live2D模型手动构建效率低的问题。
Comments Project page: https://bunraku-live2d.github.io/
从合成到真实:迈向身份一致的化妆转移的合成与真实数据
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。
ID-Guard:一种通过破坏身份特征来对抗面部操纵的通用框架
专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV
AI总结 本研究针对面部操纵滥用的问题,提出ID-Guard通用框架,通过身份破坏模块生成跨模型可迁移扰动,可防御多种操纵模型并集成到其他任务中。
通用型与专家型大语言模型组成的社交网络中的信念协同演化
机构 * Khoury College of Computer Sciences, Northeastern University(东北大学库尔计算机科学学院) ; Network Science Institute, Northeastern University(东北大学网络科学研究所) ; Santa Fe Institute(圣塔菲研究所)
专题命中 个性化与一致性 :diffusion(abstract)
AI总结 该研究提出CoevolveSim框架,模拟通用型与专家型LLM组成的社交网络中信念扩散,发现专家型LLM可显著提升共识转变幅度,模拟多智能体LLM系统信念扩散需多样化底层LLM。
Comments 33 pages (14 pages of main text), 7 figures, 14 tables
LU-500:用于概念遗忘的标志基准
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 研究文本到图像模型中概念遗忘里公司标志未被充分研究的问题,引入LU-500基准及多粒度协议,通过实验评估多种方法,分析ProLU基线,指出未来标志遗忘或需空间感知控制。
面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) ; School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)
专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV
AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。
用于少步生成的隐核离散流图
专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)
AI总结 提出隐核离散流图(LKF)模型,通过共享隐变量绑定分解组件实现少步生成,在两个文本基准上较似然基线提升困惑度2.1-3.3倍,M=8时优于现有少步采样器
ReGenVC:超低位率下的端到端实时生成式视频编码
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 ReGenVC是首个结合超低位率编码与实时解码的端到端生成式视频编解码器,通过技术优化实现24 fps输出,内存占用显著降低。
Comments 12 pages, 5 figures, 5 tables
EgoGVAE:基于引导变分自编码器的自我身体网格重建
机构 * Konkuk University(建国大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对仅用头部姿态重建全身网格的难题,提出EgoGVAE方法,通过引导变分自编码器实现一步采样,推理速度比扩散方法快50倍以上,在基准数据集上提升了重建性能。
Comments 18 pages, 6 figures, Accepted to ECCV 2026
DexDirect:用于高效灵巧演示采集的直接运动学手臂引导
机构 * UCLA(加利福尼亚大学洛杉矶分校)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 该研究提出DexDirect方法,结合直接运动学手臂引导与视觉手部重定向,采集灵巧操作演示的效率更高、认知负荷更低,训练的扩散策略在立方体抓取任务上达到90%成功率。
Comments 8pages, 6 figures
费米能级介导的氧化物陶瓷快速烧结加速
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 研究探讨氧化物陶瓷快速烧结中原子层面机制,用第一性原理计算,揭示YSZ中缺陷电荷补偿使费米能级上移加速阳离子迁移,如Zr空位电荷转变降低扩散势垒,该机制可推广,对FS技术理论有重要意义。