Learned split-spectrum metalens for obstruction-free broadband imaging in the visible
学习型分频光谱金属镜用于可见光波段无遮挡广谱成像
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本研究提出学习型分频光谱金属镜,实现可见光波段无遮挡广谱成像,提升物体检测和分割精度。
Journal ref Nature Communications 2026
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
学习型分频光谱金属镜用于可见光波段无遮挡广谱成像
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本研究提出学习型分频光谱金属镜,实现可见光波段无遮挡广谱成像,提升物体检测和分割精度。
Journal ref Nature Communications 2026
RoboMirror: 在模仿之前理解以实现视频到仿人运动
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。
超临界流体中活塞效应的精确解析解:声学近似后的短时渐近、热穿透深度及与Spacelab D-2实验的比较
专题命中 可控生成 :diffusion(abstract)
AI总结 针对超临界流体中的活塞效应,在线性后声学近似下推导了直角和球坐标中一维问题的精确解析解,分析了短时渐近和热穿透深度,并通过考虑容器热容与Spacelab D-2实验数据良好吻合。
Comments 33 pages, 12 figure
具有隐式定义目标函数的均衡随机控制问题
专题命中 可控生成 :diffusion(abstract)
AI总结 本文针对含隐式目标函数的时间不一致随机控制问题,在受控扩散框架中推导均衡策略的充要条件,并将其应用于两类带约束的动态投资组合选择问题,明确了确定市场系数下的均衡策略形式。
Comments To appear in SCIENTIA SINICA Mathematica
基于运动感知扩散的无人机视频去模糊:通往鲁棒目标检测的路径
机构 * Research Institute for Science & Technology, Tokyo University of Science(东京理科大学科学技术研究所)
专题命中 图像修复 :diffusion(title);分类 cs.CV
AI总结 该研究针对无人机视频运动模糊问题,提出自适应潜在尺度选择器与多帧对齐可学习门控模块,实现高效去模糊,提升无人机目标检测性能,适用于鲁棒航拍视觉任务。
Comments 8 pages, 8 figures. Published in the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)
音频超分辨率和带宽扩展从判别模型到生成模型的综述
机构 * Discovery Partners Institute(发现伙伴研究所)
专题命中 图像修复 :diffusion(abstract)
AI总结 本文综述了音频超分辨率和带宽扩展领域,从判别模型向生成模型的转变,总结了早期判别模型的局限性以及生成模型在表示域、架构、条件机制等方面的改进,探讨了大语言模型和多模态基础模型等新兴方向,并指出了感知评估、相位建模和实际应用泛化等开放挑战。
Comments Under review
基于推理的稀疏数据用户个性化生成
机构 * Vanderbilt University(范德比尔特大学) ; Adobe Research(Adobe研究) ; Yale University(耶鲁大学) ; University of Oregon(俄勒冈大学)
专题命中 个性化与一致性 :personalized generation(title,abstract)
AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。
StyleID:一种用于风格无关面部身份识别的感知感知数据集与指标
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 针对当前身份编码器在风格化下的脆弱性问题,提出StyleID数据集与评估框架,微调语义编码器使其与人类感知对齐,提升了身份识别的相关性与鲁棒性。
Comments SIGGRAPH 2026 / ACM TOG. Project page at https://kwanyun.github.io/StyleID_page/
面向大规模三元数据集的上下文内调色风格迁移
机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ; Nankai International Advanced Research Institute (Shenzhen Futian)(南开国际先进研究院(深圳福田)) ; OPPO AI Center, OPPO Inc.(OPPO AI中心,OPPO公司)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 本文提出ICTone框架,通过上下文内联合条件生成实现调色风格迁移,利用生成模型语义先验提升风格一致性和视觉质量。
Comments ECCV2026, https://dengyuhai.github.io/ICTone_Project/
PickStyle:基于上下文-风格适配器的视频到视频风格迁移
机构 * Pickford AI ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 PickStyle是一种视频到视频风格迁移框架,通过在预训练视频扩散骨干中插入低秩适配器、构建合成训练片段并提出CS-CFG,实现了优于现有基线的视频风格迁移效果。
Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 Workshops
TRACE-Bench:多参考图像生成的分解与诊断
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV
AI总结 研究针对多参考图像生成基准的缺陷,构建TRACE-Bench基准,采用算子分解方法评估9个主流模型,发现解耦与属性绑定是核心瓶颈,最优模型属性保真度仅0.74
Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)
Defake-o3:从推测性理由到可验证证据的可解释AIGI检测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。
Comments Accepted by ACMMM 2026
基于生成对抗网络(GANs)的合成指纹照片生成
机构 * Clarkson University(克拉克森大学) ; UNC Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 该研究针对非接触式指纹数据不足与真实数据安全风险问题,用StyleGAN2-ADA和StyleGAN3生成合成指纹照片并评估其真实性、隐私性与多样性,为后续评估提供定量基准。
RETO:一种增强旋转的Transformer操作符用于汽车气动性能的高保真预测
机构 * Department of Mechanics and Aerospace Engineering, Southern University of Science and Technology(南方科技大学机械与航空航天工程系) ; Shenzhen Key Laboratory of Complex Aerospace Flows, Southern University of Science and Technology(深圳复杂航空航天流动重点实验室) ; Ningbo Key Laboratory of Advanced Manufacturing Simulation, Eastern Institute of Technology(宁波先进制造模拟重点实验室) ; Shenzhen Tenfong Science and Technology Co., Ltd.(深圳天丰科技有限公司)
专题命中 图像生成评测 :diffusion(abstract)
AI总结 本文提出RETO操作符,通过双阶段空间意识机制提升汽车气动预测精度,实验显示其在ShapeNet和DrivAerML数据集上均优于现有方法。
专题命中 图像生成评测 :image generation(abstract)
Comments 23 pages
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 27572-27595
用于图像生成的条件动力系统
专题命中 效率与蒸馏 :image generation(title,abstract)
AI总结 该研究开发了用于图像生成的连续动力系统,引入能量倾斜实现条件生成,在CIFAR-10上取得9.71的干净FID,为非GPU的高效生成任务提供了新方向。
欧几里得格场论的跳扩散随机量化方法
专题命中 效率与蒸馏 :diffusion(title,abstract)
AI总结 该研究提出跳扩散随机量化方法,利用跳扩散过程的非连续路径特性改善遍历性,解决二维U(1)规范理论拓扑冻结的基准问题。
Comments 15 pages, 4 figures
DanceOPD:在策略生成场蒸馏
机构 * ByteDance Seed(字节跳动Seed) ; NUS(新加坡国立大学) ; UMD(马里兰大学) ; HKUST(香港科技大学)
专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 提出DanceOPD框架,通过将每个样本路由到能力场并查询低噪声学生诱导状态,用速度MSE损失训练流匹配模型,实现文本到图像、局部编辑和全局编辑的多能力组合,提升目标能力同时保持生成质量。
Comments Technical Report; 42 pages, 14 figures, 9 tables; Project Page at https://danceopd.github.io/ GitHub Repo at https://github.com/worldbench/DanceOPD
MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件
机构 * The University of Hong Kong(香港大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Tongji University(同济大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。
Comments 12 pages, 6 pages appendix, 13 figures, technical report
SQuad:用于高效视频生成的次二次注意力蒸馏
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。
基于同步感知跨模态稀疏注意力的高效视听生成
机构 * Alibaba Group(阿里巴巴集团) ; Alibaba Cloud Computing(阿里巴巴云计算) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。
EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存
机构 * Peking University(北京大学) ; Taiyuan University of Technology(太原理工大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。
Comments EchoCache is honored to be accepted by ACM MM 2026
IMPLICITSTAINER:基于神经隐式函数的无分辨率依赖数据高效虚拟染色
机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) ; Department of Pathology, University of Utah(犹他大学病理学系)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出IMPLICITSTAINER,通过神经隐式深度学习模型将H&E图像转化为IHC图像,实现无分辨率依赖的高效虚拟染色,提升低数据场景下的鲁棒性与输出确定性。
机构 * Group in Computational Science and HPC(计算科学与高性能计算组) ; DA-IICT ; Dhirubhai Ambani University(迪鲁布希阿尼大学) ; Smart Energy Learning Center(智能能源学习中心) ; DAU
专题命中 效率与蒸馏 :diffusion(abstract)
Journal ref Engineering Applications of Artificial Intelligence, Volume 167, Part 2, 1 March 2026, 113889
Artly:探索数字艺术家对AI生成反馈的看法
专题命中 其他图像生成 :image generation(abstract)
AI总结 本研究开发了结合个性化AI反馈与人类学习资源的Artly系统,通过被试间对比实验发现该系统受艺术家认可,能支持艺术成长,使用图像生成功能的用户创造力感知更强但新想法产出略低。
Journal ref Proceedings of the 14th Nordic Conference on Human-Computer Interaction (NordiCHI '26), October 03-07, 2026, Vaasa, Finland