Unpaired Modality-Agnostic Generative Recommendation
非配对模态无关生成式推荐
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出UnpairGR模型,从多类观测中学习统一语义ID空间,在三类基准数据集上验证其可提升完全与不完全观测下的推荐性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
非配对模态无关生成式推荐
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出UnpairGR模型,从多类观测中学习统一语义ID空间,在三类基准数据集上验证其可提升完全与不完全观测下的推荐性能。
OmniCustom: 通过联合音视频生成模型实现同步音视频定制
机构 * The University of Hong Kong(香港大学) ; Shanda AI Research Tokyo(Shanda AI东京研究所) ; XIntelligence Technology Co., Limited(XIntelligence技术有限公司)
专题命中 多模态生成 :audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。
Comments code: https://github.com/OmniCustom-project/OmniCustom
Mage-Flow:用于图像生成和编辑的高效原生分辨率基础模型
机构 * Microsoft Mage Team(微软Mage团队)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 研究针对大规模视觉生成器成本高的问题,提出Mage-Flow,由Mage-VAE和原生分辨率多模态扩散Transformer组成。通过协同设计实现高效文本到图像生成及编辑,开发完整模型家族,Turbo变体在高分辨率下生成和编辑高效,性能有竞争力。
并发图像理解与生成:自校正耦合马尔可夫跳跃过程
机构 * Stony Brook University(纽约州立大学石溪分校) ; Google DeepMind(谷歌DeepMind)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 研究针对人类认知中理解与生成的耦合循环,引入自校正耦合马尔可夫跳跃过程框架及$\texttt{CO}_\texttt{2}\texttt{Jump}$采样器,解决掩码扩散模型跨模态矛盾问题,创建多模态语料库,该方法在图像相关任务中性能优异,且性能随去噪步骤数提升。
Comments Project page: https://coupled-jump.github.io
层次化合成表格数据生成:一种自上而下与自下而上混合框架
机构 * University of Southern California(南加州大学)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出一种层次化混合自上而下和自下而上(H-TDBU)框架,通过解耦语义结构与随机纹理,结合结构驱动的逻辑约束和轻量级表格生成器,在弱多模态金融基准上提升合成数据的语义一致性和统计保真度。
Comments Accepted as a poster at FMSD @ ICML 2026. 9 pages, 6 figures
面向同步视听重建的语义卫星通信
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出自适应多模态语义传输系统,通过双流生成架构和动态关键帧更新机制,在带宽受限的卫星场景下实现高质量同步视听重建,显著降低带宽消耗并提升鲁棒性。
T2MM:一种支持基于探究建模的LLM架构
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 提出T2MM架构,利用LLM在生态建模软件VERA中生成交互式模型,优于全代码生成基线。
Comments 16 pages, 4 figures
从去噪到决策:面向无线网络的扩散模型赋能深度强化学习综述
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract)
AI总结 本文综述了扩散模型与深度强化学习结合的方法,通过捕捉无线资源管理中的复杂多模态动作结构,提升决策质量,并系统总结了其在移动边缘计算、无人机辅助、车联网、AIGC驱动系统、无线资源分配、物理层安全及机器人/无人机规划等领域的应用。
Comments 22 pages, 7 figures, Author list corrected
CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成
机构 * Pontificia Universidad Católica de Chile(智利天主教大学) ; CENIA ; iHEALTH ; KAUST(科威特皇家科学与技术局)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。
Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289
WISE: 一种基于世界知识的文本到图像生成语义评估方法
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对现有文本到图像生成模型缺乏复杂语义理解和世界知识整合评估的问题,提出WISE基准,包含25个子领域的1000个精心设计的提示,并引入WiScore指标评估知识-图像对齐,实验表明当前模型在整合世界知识方面存在显著局限。
Comments Accepted to ICML 2026. We have also released an updated version of the benchmark, WISE_Verified. Please refer to https://github.com/PKU-YuanGroup/WISE for the latest version
Avatar Forcing:用于自然对话的实时交互式头部化身生成
机构 * KAIST(韩国科学技术院) ; NTU Singapore(新加坡国立大学) ; DeepAuto.ai
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出Avatar Forcing框架,通过扩散强制实现实时交互式头部化身生成,利用直接偏好优化进行无标签学习,在低延迟(约500ms)下生成富有表现力的反应动作。
Comments CVPR 2026. Project page: https://taekyungki.github.io/AvatarForcing/
JanusCoder: 向代码智能的视觉-程序化界面迈进
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出JanusCoder,一种面向代码智能的视觉-程序化界面,通过构建大规模多模态代码数据集和统一模型,实现从文本指令、视觉输入或两者结合生成代码,展示了其在文本和视觉编程任务中的优越性能。
Comments ICLR 2026 Camera Ready Version, with code and data available
ANVIL:为讲师提供类比和视频
机构 * Delft University of Technology(代尔夫特理工大学) ; JetBrains Research(JetBrains研究院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 ANVIL是一种多模态生成系统,可自动生成基于类比的计算机科学教学动画。通过生成文本类比、结构化视觉剧本和可执行代码,提升教学有效性。
空间提示优于语义提示:一种基于网格的方法以提高LLM在图表数据提取上的准确性
机构 * Russian Federation(俄罗斯联邦)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文通过对比空间提示与语义提示,发现基于网格的提示方法能显著降低图表数据提取误差,优于传统语义引导策略。
Comments his is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302248
Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 799-804
Meta-CoT:提升图像编辑的粒度与泛化能力
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Hunyuan, Tencent(腾讯 Hunyuan)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 Meta-CoT通过双重分解提升图像编辑的粒度和泛化能力,通过任务-目标-理解能力三元组分解和五元基本元任务训练策略,显著提高编辑性能。
Comments Accepted by CVPR2026, Project Page: https://shiyi-zh0408.github.io/projectpages/Meta-CoT/
ANCHOR:基于大语言模型的文本到图像合成中的主体条件化
机构 * Optum AI ; The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 ANCHOR通过大规模抽象式标题数据集研究文本到图像合成中多主体理解与上下文推理的缺陷,提出基于大语言模型的主体感知微调方法,提升图像-标题一致性与人类偏好对齐。
Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026
具有对齐检测和局部细化的自纠正文本到视频生成
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; NTU Singapore(新加坡国立大学) ; Allen Institute for AI(人工智能研究院) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。
Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io
在大规模传感器模型时代的人工智能可穿戴技术
专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract)
AI总结 本文探讨了大规模传感器模型在可穿戴AI中的应用,提出通过整合多模态数据提升系统泛化能力,并讨论了无语言能力和有语言能力的两种模型方向。
Comments 18 pages
用于联合音频视频生成的扩散模型
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。
通过条件近端策略优化实现扩散策略
机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学) ; Hong Kong University of Science and Technology, Hongkong, China(香港科技大学) ; Zhejiang University-University of Illinois Urbana-Champaign Institute, Haining, China(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract)
AI总结 本文提出了一种基于条件近端策略优化的高效方法,用于在在线强化学习中训练多模态扩散策略,解决了计算动作对数似然的难题,并在多个基准任务中取得优异性能。
FreeAct: 为LLM量化释放激活
机构 * National University of Singapore(新加坡国立大学) ; Huawei Technology(华为技术有限公司) ; Central South University(中央南大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 FreeAct通过放松静态转换约束,为LLM量化提供动态适应的激活转换方法,实现性能提升5.3%。
Comments 26 pages, 18 figures, 2 tables
EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架
机构 * Alibaba Cloud(阿里云)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。
Comments 10 pages, 8 figures, ACM MM 2025
FlowPortrait:基于强化学习的音频驱动肖像视频生成
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 FlowPortrait通过强化学习框架结合多模态模型和人类对齐评估系统,提升音频驱动肖像视频生成的质量和表现力。
Bob的彩纸:音乐和视频生成中的语音记忆攻击
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of California San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 研究揭示了生成音乐和视频AI系统中语音记忆攻击的漏洞,通过同音替代词绕过版权过滤,展示语音结构对跨模态检索的关键作用。
三模态掩码扩散模型的设计空间
机构 * Apple(苹果公司) ; Google Deepmind(谷歌DeepMind) ; University of Cambridge(剑桥大学) ; MIT(麻省理工学院)
专题命中 多模态生成 :multimodal(abstract);image-text(abstract)
AI总结 本文提出了一种从头开始预训练的三模态掩码扩散模型,通过分析多模态扩展定律和批大小效应,实现了优化的推理采样,并在文本生成、图像生成和语音生成任务中取得了显著成果。
Comments 41 pages, 29 figures, 10 tables
Continual-NExT: 一种统一的理解和生成持续学习框架
机构 * East China Normal University(华东师范大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Xiamen University(厦门大学)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 本文提出Continual-NExT框架,通过MAGE方法提升双到双多模态大语言模型的持续学习能力,实现跨模态知识转移和减少遗忘。
可靠且负责任的基础模型:全面综述
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。
Comments TMLR camera-ready version
基于技能的自主代理用于材料蠕变数据库构建
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)
AI总结 本文提出基于技能的自主代理框架,用于从科学文献中自动提取高保真的材料蠕变数据,实现物理自洽的数据库构建。
GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5 的安全报告
机构 * Fudan University(复旦大学) ; Shanghai Innovation institute(上海创新研究院) ; Deakin University(德克萨斯大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本报告对六个前沿模型进行综合安全性评估,揭示其在安全性和鲁棒性方面的差异,强调需要标准化评估以指导负责任的部署。
Comments 41 pages, 22 figures
基于指令的3D面部表情生成与转换
机构 * Department of Computer Engineering, Sejong University(忠南大学计算机工程系) ; School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出基于指令的3D面部表情生成与转换框架,通过IFED模块和I2FET方法实现面部表情的生成与平滑过渡,实验表明其在多个数据集上优于现有方法。
Journal ref IEEE Transactions on Multimedia, 2025