Trainable Dynamic Mask Sparse Attention
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 26 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 26 pages
机构 * Université de Montréal(蒙特利尔大学) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; Concordia University(康科迪亚大学) ; University of Chicago(芝加哥大学) ; Capital One(Capital One公司)
专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :language model(abstract);instruction tuning(abstract);pretraining(abstract)
Comments Need more refinement
专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract)
Comments We plan to revise the methodology and update the experimental analysis before resubmission
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 pages, 1 figure, 7 tables
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
机构 * Yuan Ze University(元智大学)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by The 38th Conference of Open Innovations Association FRUCT, 2025
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
Comments 9 pages, 4 figures (not including citation and appendix) submitted to ICLR 2026
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; Databricks(Databricks公司) ; Google DeepMind(谷歌DeepMind) ; UC Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * The University of Hong Kong(香港大学) ; ARC Lab, Tencent PCG(腾讯PCG实验室) ; The Chinese University of Hong Kong(香港中文大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICCV 2025. Project page: https://chenyi99.github.io/moto/
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
Comments This paper was originally submitted to ACM MM 2025 on April 12, 2025
专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract)
Comments 9 pages, 6 figures, 3 tables
机构 * Oracle AI
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ACL 2025
Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track) - 2025
机构 * Emory University(埃默里大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 预训练与数据 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to EMNLP 2025 (Main Conference)
机构 * Tencent Hunyuan(腾讯文元) ; University of Macau(澳门大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
Comments To appear at UIST 2025
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) ; MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室) ; The University of Tokyo(东京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; E-surfing Vision Technology Co., Ltd(亿欧视觉科技有限公司)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted by ICCV2025
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; WICT, Peking University(北京大学WICT学院) ; The University of Hong Kong(香港大学)
专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract)
Comments TL;DR: Streaming 4D reconstruction using causal transformer. Project page: https://nirvanalan.github.io/projects/stream3r
机构 * Basic Algorithm Center, PCG, Tencent(腾讯基础算法中心、PCG、腾讯)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)
机构 * Vrije Universiteit Amsterdam, The Netherlands(阿姆斯特丹自由大学,荷兰) ; NYU Abu Dhabi, United Arab Emirates(纽约大学阿布扎克分校,阿联酋)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted for publication @ IEEE AIxSET 2024; 4 pages, 2 Figures
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)
机构 * Shanghai University of Finance and Economics(上海财经大学) ; The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Cardinal Operations ; Columbia University(哥伦比亚大学) ; Duke University(杜克大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments accepted by Operations Research
Journal ref Operations Research (2025), published online ahead of print
机构 * Peking University(北京大学) ; Guangdong University of Technology(广东工业大学) ; The University of Sheffield(谢菲尔德大学) ; University of Science and Technology Beijing(北京科技大学) ; Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Nanjing University(南京大学) ; University of Trento(特伦特大学) ; Queen's University Belfast(贝尔法斯特女王大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract)
Comments Paper was accepted by ACM MM 2025; Code: https://github.com/YihuaJerry/EventVAD