MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量
机构 * Adobe(Adobe公司) ; Georgia Tech(佐治亚理工学院)
AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。
高校专区
通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量
机构 * Adobe(Adobe公司) ; Georgia Tech(佐治亚理工学院)
AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。
超越现实:利用StickerNet学习表现性创作
机构 * Picsart AI Research(Picsart人工智能研究) ; Picsart Inc(Picsart公司) ; College of Computing(计算学院) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 StickerNet通过学习真实世界编辑模式,实现了表现性图像合成,超越传统真实感追求,提升艺术性和用户意图的表达。
动量多边际施罗德桥匹配
机构 * Georgia Institute of Technology(佐治亚理工学院) ; FAIR at Meta(Meta 的 FAIR)
AI总结 3MSBM通过学习满足多位置约束的随机系统光滑测度值样条,改进了多边际设置中匹配框架的收敛性和可扩展性。
扩散去噪超光谱高斯点云
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出DD-HGS方法,通过引入波长敏感的球谐函数、光谱损失和扩散去噪器,实现超光谱场景的3D显式重建,提升3D高斯点云方法的性能。
Comments Accepted to 3DV 2026
Web-Shepherd: 促进强化网络代理的PRMs
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。
Comments NeurIPS 2025 Spotlight
OuroMamba:一种无需数据的视觉Mamba量化框架
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Intel Labs(英特尔实验室)
AI总结 OuroMamba提出一种无需数据的视觉Mamba量化方法,通过生成语义丰富的合成数据和混合精度量化技术,实现高效的模型压缩与性能提升。
Comments Accepted to ICCV 2025
从文本到多模态:探索大型语言模型在医疗实践中的演变与影响
机构 * Kyoto University(京都大学) ; Georgia Institute of Technology(佐治亚理工学院) ; National Taiwan Normal University(台湾师范大学) ; Indiana University(印第安纳大学) ; Hong Kong University of Science(香港科学大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Cornell University(康奈尔大学) ; University of Liverpool(利物浦大学) ; University of Edinburgh(爱丁堡大学) ; Zhejiang University(浙江大学) ; Purdue University(Purdue 大学) ; Emory University, Atlanta, GA, USA(埃默里大学) ; West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)
AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。
Comments 12 pages, 1 figure
没有被遗漏的请求:通过Medha解决长上下文LLM推理中的异质性
机构 * Microsoft(微软公司) ; Georgia Institute of Technology(佐治亚理工学院) ; UC San Diego(圣地亚哥大学)
AI总结 Medha 通过引入细粒度抢占式调度和新型并行策略,有效解决长上下文LLM推理中的异质性问题,显著提升系统吞吐量和响应效率。
大语言模型与认知科学:对相似性、差异性和挑战的全面综述
机构 * Kyoto University(京都大学) ; Indiana University(印第安纳大学) ; National Taiwan Normal University(台湾师范大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Hong Kong University of Science(香港科学大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Cornell University(康奈尔大学) ; University of Liverpool, UK(利物浦大学) ; University of Edinburgh, UK(爱丁堡大学) ; Zhejiang University(浙江大学) ; Purdue University(普渡大学) ; Emory University(埃默里大学) ; West China Biomedical Big Data Center, West China Hospital, Sichuan University(四川大学西昌生物大数据中心、西昌医院)
AI总结 本文综述了大语言模型与认知科学的相似性、差异性和挑战,探讨了LLMs在认知领域的应用及改进方法。
Comments 10 pages, 1 figure