Spread of Correlations in Strongly Disordered Lattice Systems with Long-Range Coupling
专题命中 扩散模型 :diffusion(abstract)
Journal ref Phys. Rev. B 105, 184204 (2022)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 扩散模型 :diffusion(abstract)
Journal ref Phys. Rev. B 105, 184204 (2022)
EmoScene:用于可控情感图像生成的双空间数据集
机构 * Fudan University(复旦大学) ; East China Normal University(华东师范大学)
专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出EmoScene数据集,通过双空间编码情感维度与感知属性,提升文本到图像模型对场景语义和情感调制的控制能力。
超越边缘图:面向多适配器地图到卫星扩散的小波域条件控制
机构 * Tribhuvan University(特里布文大学) ; Pulchowk Engineering Campus(普尔乔克工程校区)
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 本文针对资源匮乏地区卫星底图缺失问题,提出基于OSM栅格地图和SWT子带的多适配器ControlNet扩散框架,在尼泊尔数据集和Pix2Pix基准上验证了其合成卫星图像的有效性。
Comments 10 pages, 5 figures, 3 tables
ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染
机构 * University of Rochester(罗切斯特大学) ; Pixocial Technology(Pixocial技术)
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。
Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web
在均匀扰动的非光滑区域中具有诺伊曼边界条件的反应扩散方程全局吸引子的一致\(L^{\infty}\)有界性
专题命中 可控生成 :diffusion(title)
AI总结 研究一族在非光滑区域上具诺伊曼边界条件的半线性抛物方程,通过特定条件建立适定性与吸引子存在性,利用多种方法证明吸引子族\(L^\infty\)一致有界,且在区域体积收敛时关于强\(H^1\)拓扑在\(\mu = 0\)处上半连续。
Comments 27 pages
GCDance:基于音乐的风格控制3D全身舞蹈生成
机构 * School of Computer Science and Electronic Engineering, University of Surrey(萨里大学计算机科学与电子工程学院) ; Department of Music and Media, University of Surrey(萨里大学音乐与媒体系) ; Department of Informatics, University of Oslo(奥斯陆大学信息学系) ; Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音与信号处理中心) ; School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出GCDance框架,通过音乐和文本条件生成风格化的3D舞蹈,利用文本控制机制和音乐基础模型提升生成质量,实验验证其优于现有方法。
Journal ref IEEE Transactions on Multimedia, 2026
VARPose:基于视觉自回归建模的灵活2D姿态密集化以提升3D姿态提升性能
机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR(自然资源部粤港澳大湾区自然资源数据协同应用技术创新中心)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 VARPose基于VAR建模,通过GPT分词器和UniSkelar自回归模型实现2D姿态灵活密集化,在3D姿态估计等下游任务上性能优于现有方法且可泛化到新粒度。
Comments ACM MM 2026
代理化身与低秩缓存结合:实时单样本情感可控肖像动画
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究提出结合代理化身与低秩缓存的级联框架,解决音频驱动肖像动画的实时性与情感控制问题,实现了情感表达、身份保留及推理效率的提升。
G-Skin:学习结合生成式视觉先验的3D高斯绑定方法
机构 * City University of Hong Kong(香港城市大学) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究院) ; Central South University(中南大学)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文针对3D高斯资产绑定的难题,提出生成式蒙皮框架G-Skin,利用2D视觉基础模型提炼运动先验构建优化流程,可灵活泛化并优于现有方法。
几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。
Comments 17 pages, 11 figures
大基础模型时代的手物交互:重建、生成与具身迁移
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。
3D场景自适应轨迹可控的人体图像动画与相机运动
机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) ; Ministry of Education(教育部) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; University of Warwick(沃林格大学) ; Zhejiang Yuexiu University(浙江越秀大学) ; University of Surrey(萨里大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。
Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)
AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架
专题命中 可控生成 :diffusion(abstract)
AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。
PosterMELD:面向可编辑打印就绪输出的可控设计多样性多智能体论文转海报生成
专题命中 可控生成 :image generation(abstract)
AI总结 PosterMELD是模板条件化多智能体海报生成流水线,可导出可编辑PPTX和PNG,在621篇论文实验中PRR达81.3%,成本仅为Codex+Skill的3.5%,性能优于P2P、PosterGen等方法。
Comments 9 pages, 5 figures, and 4 tables. Code and resources are available at https://github.com/Shannon4Science/PosterMELD
FreqNav:面向面向对象空中视觉语言导航的分阶段频率路由
专题命中 可控生成 :diffusion(abstract)
AI总结 针对现有空中VLN方法的感知干扰问题,提出FreqNav框架,通过动态分配视觉令牌实现分阶段频率路由,提升性能并加快推理速度,验证了其实际应用潜力。
JADE-GS:3D高斯点云渲染中基于事件引导的联合交替去模糊
机构 * School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) ; Shanghai Baoshan Shangda General Intelligent Robotics Research Institute(上海宝山尚大通用智能机器人研究院) ; School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中 图像修复 :diffusion(abstract);分类 cs.CV
AI总结 研究相机快速移动曝光时模糊问题,提出JADE-GS方法,通过像素自适应路由门融合互补先验,2D恢复器与3D高斯点云渲染双向循环耦合,正则化恢复器,在合成和真实基准测试中获最佳感知质量,训练高效且保留实时渲染。
CopyCat:在数秒内提升主体到图像模型中的细粒度主体一致性
专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 本研究提出轻量级模型精调框架CopyCat,通过附加FCLoRA在数秒内提升主体到图像模型的细粒度主体一致性,经DreamBench等实验验证,可适配多样未见过的主体与提示并取得持续效果。
面向以人为中心场景中AI生成图像检测的视觉证据定位与解释
专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV
AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。
FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; University of Electronic Science and Technology of China(电子科技大学) ; Tianjin University(天津大学)
专题命中 个性化与一致性 :generative vision(abstract);分类 cs.CV
AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。
CAPEval:跨理解与生成的解耦式标题评估
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本研究提出解耦式标题评估基准CAPEval,将标题质量分为覆盖度与精确度,发现二者分别对应理解与生成任务性能,为标题生成器的选择优化提供指导。
Comments 21 pages, 8 figures. Code and dataset will be available at https://liuzhipenggg.github.io/CAPEval/
将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架
机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) ; Shenzhen Technology University(深圳技术大学)
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。
关于一般度量测度空间上多孔介质方程的适定性
专题命中 图像生成评测 :diffusion(abstract)
AI总结 研究一般度量测度空间上带符号多孔介质方程柯西问题的适定性,基于Rothe方法和单调算子理论,仅用狄氏型定义,证明对给定初始数据存在唯一弱解,适用于多种度量测度空间包括非光滑分形。
Comments 39 pages, 2 figures. Have corrected nearly all errors in old versions. Comments are welcome
破解生成困惑度:为何无条件文本评估需要分布度量
机构 * AITHYRA Institute(AITHYRA研究所)
专题命中 图像生成评测 :diffusion(abstract)
AI总结 本文指出生成困惑度(gen-PPL)作为非自回归语言模型评估指标存在缺陷,通过构造零参数朴素采样器在LM1B和OpenWebText上达到SOTA gen-PPL但生成不连贯文本,建议采用直接量化生成文本与参考文本分布差异的评估套件。
Comments Presented at the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM), Seoul, South Korea
CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法
机构 * ShanghaiTech University(上海科技大学) ; Beihang University(北京航空航天大学) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; Zhejiang University(浙江大学) ; BUPT(北京邮电大学)
专题命中 效率与蒸馏 :diffusion(abstract,abstract_cn)
AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。
Comments 11 pages, 6 figures
具有约束屏障函数的可证明安全生成采样
机构 * Mechanical Engineering University of California, Riverside(机械工程 加州大学河滨分校) ; Electrical Engineering and Computer Science University of California, Irvine(电气工程与计算机科学 加州大学伊尔弗分校)
专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract)
AI总结 通过约束屏障函数实现安全生成采样,确保生成样本满足硬约束并保持语义保真度。
Comments 26 pages, 10 figures
用于高效视频生成的 Token 半径注意力机制
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。
TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。
Comments Code: https://github.com/GuoCalix/TurboClear
ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑
专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV
AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器
基于潜在流匹配的混合域后验采样用于逆问题
机构 * College of Computer Science, Sichuan University(四川大学计算机学院)
专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV
AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。
Comments Accepted to ACM Multimedia 2026
万松v1.0技术报告
机构 * Alibaba Group(阿里巴巴集团)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对音乐生成难题,提出万松方法,它是基于扩散的模型,可直接生成高保真多语言长歌曲并输出双声道,通过步长蒸馏加快推理,为微调定制提供途径,助力下游编辑任务。
Comments Wan Team, Alibaba Group