Adaptive Block-Scaled Data Types
自适应块缩放数据类型
机构 * Massachusetts Institute of Technology(麻省理工学院) ; NVIDIA(英伟达)
AI总结 本文提出自适应块缩放数据类型,通过动态选择整数和浮点表示以减少量化误差,在4位量化中实现更低的训练损失和更高的任务准确性。
Comments 19 pages, 9 figures
大厂专区
自适应块缩放数据类型
机构 * Massachusetts Institute of Technology(麻省理工学院) ; NVIDIA(英伟达)
AI总结 本文提出自适应块缩放数据类型,通过动态选择整数和浮点表示以减少量化误差,在4位量化中实现更低的训练损失和更高的任务准确性。
Comments 19 pages, 9 figures
生成式AI在金属有机框架设计与合成中的崛起
机构 * Deep Principle, Inc.(Deep Principle公司) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Washington University(华盛顿大学) ; Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程研究所) ; Massachusetts Institute of Technology(麻省理工学院) ; Cornell University(康奈尔大学) ; University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所) ; Acceleration Consortium, University of Toronto(多伦多大学加速联盟) ; University of Washington(华盛顿大学) ; University of North Texas(北德克萨斯大学) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Canadian Institute for Advanced Research(加拿大高等研究院) ; NVIDIA(英伟达)
AI总结 生成式AI推动金属有机框架设计方法革新,通过自主提出并合成新型多孔结构,结合高通量计算筛选和自动化实验,形成加速发现闭环流程,提升清洁空气和能源应用材料性能。
Comments 10 pages, 5 figures
Journal ref Matter (2026)
4DSurf:高保真动态场景表面重建
机构 * Australian National University(澳大利亚国立大学) ; NVIDIA(英伟达) ; Amazon(亚马逊)
AI总结 本文提出4DSurf框架,解决动态场景表面重建问题,通过高斯变形和重叠分段策略实现大变形和时间一致性,实验显示在Chamfer距离上优于现有方法。
Comments Accepted to CVPR 2026
AffordMatcher: 从视觉符号中学习3D场景中的 affordance
机构 * University of Liverpool(利物浦大学) ; AIOZ Ltd.(AIOZ有限公司) ; National Tsing Hua University(国立清华大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of Western Australia(西澳大学) ; Indian Institute of Science(印度科学理工学院) ; NVIDIA(英伟达)
AI总结 本文提出AffordMatcher,通过结合点云和图像实例,利用视觉符号实现更精确的affordance区域识别,基于大规模数据集验证了方法有效性。
Comments 14 pages. Accepted to CVPR 2026
基于生成预训练和测试时计算的原子级蛋白质结合物设计扩展
机构 * NVIDIA(英伟达) ; University of Oxford(牛津大学) ; Mila - Québec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; HEC Montréal(蒙特利尔高等商学院) ; CIFAR AI Chair(CIFAR人工智能主席) ; AITHYRA ; School of Biological Sciences, Seoul National University(首尔大学生物科学学院) ; Interdisciplinary Program in Bioinformatics, Seoul National University(首尔大学生物信息学跨学科项目) ; Institute of Molecular Biology and Genetics, Seoul National University(首尔大学分子生物学与遗传学研究所) ; Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)
AI总结 本文提出Proteina-Complexa方法,结合生成模型与结构预测,实现高精度蛋白质结合物设计,优于现有生成和幻觉方法,同时扩展至小分子和酶设计。
Comments ICLR 2026 Oral Presentation. Project page: https://research.nvidia.com/labs/genair/proteina-complexa/
开放语音识别排行榜:迈向可重复和透明的多语言和长文本语音识别评估
机构 * Hugging Face, Inc.(Hugging Face公司) ; NVIDIA(英伟达) ; University of Cambridge(剑桥大学) ; Mistral AI(Mistral AI公司) ; OpenAI(OpenAI公司)
AI总结 本文介绍了开放语音识别排行榜,通过学术和工业社区的贡献,比较了86种开源和专有系统在12个数据集上的表现,标准化WER和RTFx评估,促进模型架构和工具包的准确-效率比较。
Comments Leaderboard: https://huggingface.co/spaces/hf-audio/open_asr_leaderboard ; Code: https://github.com/huggingface/open_asr_leaderboard
基于统一多模态大语言模型的定制化视觉叙事
机构 * National Taiwan University(国立台湾大学) ; NVIDIA(英伟达)
AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。
Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)
可泛化动作生成的探索:数据、模型与评估
机构 * Nanyang Technological University(南洋理工大学) ; SenseTime Research(商汤科技研究院) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; NVIDIA Research(英伟达研究院)
AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。
Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen
基于模式的上下文学习框架
机构 * University of Toronto(多伦多大学) ; Nanyang Technological University(南洋理工大学) ; Acceleration Consortium(加速联盟) ; Vector Institute for Artificial Intelligence(向量人工智能研究所) ; Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院(CIFAR)) ; NVIDIA(英伟达)
AI总结 本文提出基于认知模式的上下文学习框架,通过提取先验示例中的认知构建块,生成抽象模式以增强模型推理能力,实验证明在化学和物理问题上性能提升达36.19%。
LSM-GNN: 基于大规模存储的多GPU GNN训练方法通过优化数据传输方案
机构 * NVIDIA(英伟达) ; NVIDIA/UIUC(英伟达/伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出LSM-GNN框架,通过优化数据传输方案提升多GPU环境下GNN训练效率,实验表明其在单节点双GPU配置下优于双节点四GPU的Dist-DGL基线,实现端到端训练时间的3.75倍加速。
BHCast: 从单张模糊图像解锁黑洞等离子体动力学的长期预测
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NVIDIA(英伟达)
AI总结 BHCast通过单张模糊图像预测黑洞等离子体动力学,结合多尺度金字塔损失实现超分辨率和长期稳定预测,提取时空特征并利用梯度提升树恢复黑洞属性。
Comments CVPR 2026