Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
Jinze Li, Yixing Xu, Haiduo Huang, Xuanwu Yin, Dong Li, Edith C. H. Ngai, Emad Barsoum
机构
*
Advanced Micro Devices, Inc., Beijing, China(Advanced Micro Devices公司,北京)
;
Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系)
;
Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所)
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers
Joshua Barron, Devin White
机构
*
Amazon(亚马逊)
专题命中
效率与部署
:large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
CommentsAccepted for oral presentation to Tiny Titans: The next wave of On-Device Learning for Foundational Models Workshop at the 42nd International Conference on Machine Learning
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
Taiye Chen, Zeming Wei, Ang Li, Yisen Wang
机构
*
School of EECS, Peking University(电子工程系,北京大学)
;
School of Mathematical Sciences, Peking University(数学系,北京大学)
;
State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学校,北京大学)
;
Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Evaluating the Correctness of Inference Patterns Used by LLMs for Judgment
Lu Chen, Yuxuan Huang, Yixing Li, Dongrui Liu, Qihan Ren, Shuai Zhao, Kun Kuang, Zilong Zheng, Quanshi Zhang
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Zhejiang University(浙江大学)
;
Beijing Institute for General Artificial Intelligence(北京一般人工智能研究所)
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
From Image to Video, what do we need in multimodal LLMs?
Suyuan Huang, Haoxin Zhang, Linqing Zhong, Honggu Chen, Yan Gao, Yao Hu, Zengchang Qin
机构
*
Intelligent Computing and Machine Learning Lab, School of ASEE, Beihang University(北京航空航天大学自动化学院智能计算与机器学习实验室)
;
Xiaohongshu(小红书)
;
School of Sino-French Engineer, Beihang University(北京航空航天大学中法工程师学院)
;
College of Engineering and Computer Science, VinUniversity(Vin大学工程与计算机科学学院)
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
Semantic Retention and Extreme Compression in LLMs: Can We Have Both?
Stanislas Laborde, Martin Cousseau, Antoun Yaacoub, Lionel Prevost
机构
*
ESIEA Lab(ESIEA实验室)
;
ESIEA
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
CommentsAccepted for publication in the Proceedings of the 2025 International Joint Conference on Neural Networks (IJCNN); this arXiv version includes an appendix with 6 result tables; 10 pages, 15 figures, 7 tables