MegaSR: Mining Customized Semantics and Expressive Guidance for Real-World Image Super-Resolution
MegaSR: 为真实世界图像超分辨率挖掘定制语义和表达引导
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 MegaSR通过定制语义和表达引导提升真实世界图像超分辨率的重建质量与结构一致性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
MegaSR: 为真实世界图像超分辨率挖掘定制语义和表达引导
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 MegaSR通过定制语义和表达引导提升真实世界图像超分辨率的重建质量与结构一致性。
OmniSVG: 一种统一的可扩展矢量图形生成模型
机构 * Fudan University(复旦大学) ; StepFun Project(StepFun项目)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 OmniSVG通过统一框架和预训练视觉-语言模型,实现高效多模态SVG生成,提升复杂结构的表达能力,并引入大规模数据集推动SVG合成发展。
Comments 20 pages; Project Page: https://omnisvg.github.io/
SPIRAL: 基于语义的渐进式LiDAR场景生成与理解
机构 * Technical University of Munich(慕尼黑技术大学) ; Fudan University(复旦大学) ; National University of Singapore(新加坡国立大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 Spiral提出了一种基于范围视图的LiDAR扩散模型,能够同时生成深度、反射图像和语义地图,实现高效的3D场景生成与理解。
Comments NeurIPS 2025; 24 pages, 10 figures, 9 tables; Code at https://github.com/worldbench/SPIRAL
通过隐式触觉校准确保视觉引导的机器人操作中的力安全
机构 * Sun Yat-sen University(中山大学) ; UC San Diego(加州大学圣地亚哥分校) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出SafeDiff框架,通过隐式触觉校准提升机器人操作中的力安全,结合视觉和触觉数据优化状态规划,减少有害力风险。
Comments Website URL: see https://i-am-future.github.io/safediff/
Thought2Text: 使用大型语言模型(LLMs)从EEG信号生成文本
机构 * School of Information University of Texas at Austin(信息学院 德克萨斯大学奥斯汀分校)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 Thought2Text利用大型语言模型从EEG信号生成文本,通过多阶段微调实现脑活动的可理解表达。
Comments Accepted to Findings of NAACL 2025
DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线
机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) ; Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。
Comments 13pages,12 figures
CoordSpeaker: 利用手势描述生成协调的 caption-驱动的语音同步手势生成
机构 * Tsinghua University(清华大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 CoordSpeaker通过引入手势描述框架和条件潜在扩散模型,实现了协调的caption驱动的语音同步手势生成,解决了手势生成中的语义先验间隙和多模态控制难题。
CAPE:通过近端模式扩展实现上下文感知的扩散策略用于避障
机构 * Huawei Technologies Canada(华为加拿大技术有限公司) ; Huawei(华为) ; Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 CAPE通过近端模式扩展实现上下文感知的扩散策略,提升避障任务中轨迹生成的泛化能力与碰撞规避性能。
Comments 4 tables, 9 figures
自回归风格文本图像生成,但使其更可靠
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; Google(谷歌)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出Eruku方法,通过多模态提示条件生成任务和分类器自由引导策略,改进自回归模型以生成更可靠、更忠实于文本提示的风格化文本图像。
Comments Accepted at WACV2026
TRACE: 基于时间可靠性的解剖条件3D CT生成与增强效率
机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系) ; Department of Automation, Tsinghua University(清华大学自动化系) ; College of Computer Science and Engineering, Dalian Minzu University(大连民族大学计算机科学与工程学院) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Jarvis Research Center, Tencent YouTu Lab(腾讯YouTu实验室 Jarvis 研究中心) ; School of Engineering Mathematics and Technology, University of Bristol(布里斯托大学工程数学与技术学院) ; Medical Artificial Intelligence Laboratory, School of Engineering, Westlake University(西湖大学工程学院医学人工智能实验室)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 TRACE通过2D多模态条件扩散方法生成具有时空对齐的3D CT图像,提升生成效率和解剖保真度。
Comments Accepted to MICCAI 2025 (this version is not peer-reviewed; it is the extended version)
3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器
机构 * Zhejiang University(浙江大学) ; Huawei(华为) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.MM
AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。
DELTA: 基于语言扩散的EEG到文本架构
机构 * Sungkyunkwan University(成均馆大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 DELTA通过结合残差向量量化和语言扩散模型,提升了EEG到文本的语义对齐和生成质量。
迈向空间一致的图像生成:将内在场景属性纳入扩散模型
专题命中 多模态生成 :image-text(abstract);分类 cs.CV
AI总结 本文提出一种基于内在场景属性的图像生成方法,通过同时生成图像和其内在属性,提升生成图像的空间一致性和真实感。
通过VLM引导的迭代自优化提升物理导向的视频生成
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。
Comments ICCV 2025 Physics-IQ Challenge Third Place Solution
MovieDreamer:用于生成连贯长视觉序列的分层生成
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。
Comments 30 pages, 22 figures
打破遗忘:通过条件扩散实现无训练的少样本类增量学习
机构 * Northeastern University(东北大学) ; School of Information and Intelligent Science(信息与智能科学学院) ; Whiting School of Engineering(工程学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出无训练的少样本类增量学习方法,通过条件扩散过程替代梯度优化,缓解灾难性遗忘并提升泛化能力。
Motion-R1: 通过分解的链式推理与RL绑定增强运动生成
机构 * GigaAI ; CASIA ; HKUST(香港科技大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 Motion-R1通过结合分解的链式推理与强化学习,提升运动生成的质量和可解释性,实现多项指标的性能提升。
ControlThinker: 通过视觉推理揭示潜在语义以实现可控图像生成
机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) ; Shanghai Collaborative Innovation Center on Intelligent Visual Computing(上海智能视觉计算协同创新中心) ; MiniMax
专题命中 多模态生成 :MLLM(abstract);分类 cs.CV
AI总结 ControlThinker通过视觉推理挖掘潜在语义,提升可控图像生成的语义一致性和视觉质量。
MagicMirror: 视频扩散变换器中的身份保留视频生成
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。
Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/
原生3D编辑与全关注
机构 * Fudan University(复旦大学) ; StepFun, Inc.(StepFun公司) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; VAST
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出一种高效的原生3D编辑框架,通过多模态数据集和3D标记连接方法,提升3D编辑的效率和一致性。
大型语言模型如何塑造虚拟现实的未来
机构 * Technical University of Munich(慕尼黑技术大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文探讨了大型语言模型如何通过增强叙事生成、NPC互动和个性化来塑造虚拟现实的未来,并提出了多模态AI和伦理保障等未来研究方向。
Comments Pre-print
VividFace: 高质量和高效的一步扩散用于视频面部增强
机构 * South China University of Technology(华南理工大学) ; Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) ; University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University of Science and Technology(南京理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态生成 :MLLM(abstract);分类 cs.CV
AI总结 VividFace通过单步扩散框架和联合训练策略,高效提升视频面部增强的高质量与效率。
利用大语言模型生成合成数据:文本与代码领域的进展
机构 * Faculty of Mathematics and Computer Science, Babeş-Bolyai University(巴贝什-博耶亚大学数学与计算机科学系) ; KlusAI Research Lab(KlusAI研究实验室)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL
AI总结 本文探讨了利用大语言模型生成合成数据在文本和代码领域的新进展,分析了其在低资源任务和代码应用中的潜力及挑战。
Comments 24 pages, 6 tables, 1 figure, 64 references
Journal ref IEEE Access 13, 134615-134633 (2025)
动态系统与扩散策略耦合下的理论闭环稳定性边界
机构 * Department of Mechanical Engineering, Universite de Sherbrooke(机械工程系, Sherbrooke 大学) ; Department of Electronic and Computer Engineering, Universite de Sherbrooke(电子与计算机工程系, Sherbrooke 大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文研究了动态系统与扩散策略耦合下的闭环稳定性边界,提出了一种更快的模仿学习框架和基于演示方差的稳定性判断指标。
Comments 5 pages, 3 figures
机构 * University of Michigan-Ann Arbor(密歇根大学安娜堡分校)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
机构 * DIISM University of Siena(DIISM锡耶纳大学) ; CNRS, ISIR Sorbonne University(CNRS,ISIR索邦大学) ; Inria, ARCHES Sorbonne University(Inria,ARCHES索邦大学) ; Valeo.ai Sorbonne University(Valeo.ai索邦大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
Journal ref Proceedings of the 2025 International Joint Conference on Neural Networks (IJCNN 2025)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Comments AAAI2026
机构 * University of Southern California(南加州大学) ; Intel Labs(英特尔实验室)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Comments AAAI2026-Oral. Project Page: https://xinyuanhu66.github.io/SRSplat/
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
Comments Accepted by AAAI 2026 Oral