arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 104 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 104 篇

2602.07375 2026-02-10 cs.CL cs.LG 92%

Efficient Post-Training Pruning of Large Language Models with Statistical Correction

大型语言模型高效后训练剪枝与统计修正

Peiqi Yu, Jinhao Wang, Xinyi Sui, Nam Ling, Wei Wang, Wei Jiang

机构 * Department of Computer Science and Engineering, Santa Clara University, Santa Clara, CA, USA(计算机科学与工程系,圣克拉拉大学) Futurewei Technologies, Inc., USA(未来韦艾技术公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文提出了一种基于模型权重和激活统计性质的轻量级后训练剪枝方法,通过统计修正提升剪枝性能,同时保持计算效率。

Comments 11 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07035 2026-02-10 cs.AI cs.LG 92%

DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents

DLLM-Searcher: 为搜索代理适应扩散大语言模型

Jiahao Zhao, Shaoxuan Xu, Zhongxiang Sun, Fengqi Zhu, Jingyang Ou, Yuling Shi, Chongxuan Li, Xiao Zhang, Jun Xu

机构 * Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 DLLM-Searcher通过优化基于dLLM的搜索代理,解决代理能力不足和延迟挑战,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07596 2026-02-10 cs.LG cs.AI 91%

Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization

Astro: 基于激活引导的结构正则化用于鲁棒性LLM后训练量化

Xi Chen, Ming Li, Junxi Li, Changsheng Li, Peisong Wang, Lizhong Ding, Ye Yuan, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hebei Province Key Laboratory of Big Data Science and Intelligent Technology(河北省大数据科学与智能技术重点实验室)

专题命中 效率与部署 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 Astro通过激活引导的结构正则化方法,在高效且无延迟的情况下提升LLM后训练量化的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05846 2026-02-10 cs.CL 90%

Luth: Efficient French Specialization for Small Language Models and Cross-Lingual Transfer

Luth:小语言模型和跨语言迁移的高效法语专业化

Maxence Lasbordes, Sinoué Gad

机构 * LightOn, Paris Inria Paris(LightOn 巴黎 国家信息与自动化所巴黎)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 Luth通过定向后训练提升法语小语言模型性能,同时保留英语能力,并通过模型合并增强跨语言迁移效果。

Comments Accepted at the EACL 2026 Student Research Workshop (SRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11731 2026-02-10 cs.LG cs.AI cs.CL 90%

Dist2ill: Distributional Distillation for One-Pass Uncertainty Estimation in Large Language Models

Dist2ill: 基于分布的蒸馏用于大语言模型中单次传递的不确定性估计

Yicong Zhao, King Yeung Tsang, Harshil Vejendla, Haizhou Shi, Zhuohang Li, Zhigang Hua, Qi Xu, Tunyu Zhang, Yi Wang, Ligong Han, Bradley A. Malin, Hao Wang

机构 * Rutgers University(罗格斯大学) Vanderbilt University(范德比尔特大学) Meta

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Dist2ill通过在单次推断中生成多个多样化的推理路径,利用轻量级模块近似置信度分数,实现大语言模型中更准确的不确定性估计。

Comments Preprint; work in progress. Update Log: 05/2025 (v1&v2): Introduced Dist2ill (previously named EUD) for efficient uncertainty estimation, focusing on discriminative reasoning tasks. 02/2026 (v3): Extended Dist2ill to a unified framework supporting both discriminative and generative reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07804 2026-02-10 cs.CL cs.AI 90%

Pruning as a Cooperative Game: Surrogate-Assisted Layer Contribution Estimation for Large Language Models

剪枝作为合作博弈:用于大型语言模型的代理辅助层贡献估计

Xuan Ding, Pengyu Tong, Ranjie Duan, Yunjian Zhang, Rui Sun, Yao Zhu

机构 * Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Beijing Normal University(北京师范大学) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于博弈论的层剪枝方法,利用代理网络估计层贡献,实现高效且有效的大型语言模型剪枝。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07642 2026-02-10 cs.AI cs.LG 90%

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

基于多模态大语言模型的高效表格检索与理解

Zhuoyan Xu, Haoyang Fang, Boran Han, Bonan Min, Bernie Wang, Cuixiong Hu, Shuai Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS(亚马逊网络服务)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。

Comments Published at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20997 2026-02-10 cs.LG cs.AI 90%

Toward Efficient Exploration by Large Language Model Agents

迈向高效探索的大型语言模型代理

Dilip Arumugam, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology(心理学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大型语言模型显式实现后验抽样强化学习算法,以提升自然语言任务中的探索效率。

Comments Accepted to the International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05047 2026-02-10 cs.AR cs.AI cs.LG 90%

Challenges and Research Directions for Large Language Model Inference Hardware

大语言模型推理硬件的挑战与研究方向

Xiaoyu Ma, David Patterson

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大语言模型推理硬件面临的挑战,提出了高带宽闪存、内存-逻辑堆叠和低延迟互连等研究方向,以提升内存带宽和通信效率。

Comments Accepted for publication by IEEE Computer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03613 2026-02-10 cs.LG 89%

Understanding Large Language Models in Your Pockets: Performance Study on COTS Mobile Devices

理解口袋中的大型语言模型:对商用移动设备上LLM性能的研究

Jie Xiao, Qianyi Huang, Xu Chen, Chen Tian

机构 * Sun Yat-Sen University(孙中山大学) Nanjing University(南京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究评估了商用移动设备上轻量级LLM的性能,分析了用户体验和开发者关注的指标,以帮助优化移动LLM应用。

Comments Corrected a typographical error on page 12: "4604%" has been corrected to "60%."

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08861 2026-02-10 cs.CV 89%

TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models

TiFRe: 基于文本的视频帧减少用于高效视频多模态大语言模型

Xiangtian Zheng, Zishuo Wang, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 TiFRe通过文本引导的帧采样和帧匹配机制,有效减少视频输入帧数,同时保留关键信息,提升视频多模态大语言模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08024 2026-02-10 cs.CV cs.AI cs.CL cs.LG 89%

FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging

FlashVID: 通过无训练树状时空标记合并实现高效的视频大语言模型

Ziyang Fan, Keyu Chen, Ruilong Xing, Yulin Li, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FlashVID通过无训练的树状时空标记合并技术,在保留99.1%性能的情况下将视频帧输入提升10倍,实现高效视频大语言模型加速。

Comments Accepted by ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12932 2026-02-10 cs.LG cs.AI cs.CE 88%

Investigating Data Pruning for Pretraining Biological Foundation Models at Scale

大规模预训练生物基础模型的数据剪枝研究

Yifan Wu, Jiyue Jiang, Xichen Ye, Yiqi Wang, Chang Zhou, Yitao Xu, Jiayang Chen, He Hu, Weizhong Zhang, Cheng Jin, Jiao Yuan, Yu Li

专题命中 效率与部署 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种影响引导的数据剪枝方法,用于大规模预训练生物基础模型,通过有效减少计算成本和数据冗余,提升生物信息学任务的可重复性和可访问性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07909 2026-02-10 cs.CL cs.LG 88%

SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization

SparseEval: 通过稀疏优化高效评估大语言模型

Taolin Zhang, Hang Guo, Wang Lu, Tao Dai, Shu-Tao Xia, Jindong Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 SparseEval通过稀疏优化方法高效评估大语言模型,利用梯度下降和迭代细化策略提升基准测试效率,展现高鲁棒性和实用性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04019 2026-02-10 cs.LG cs.AI 88%

Understanding and Guiding Layer Placement in Parameter-Efficient Fine-Tuning of Large Language Models

理解并指导大语言模型参数高效微调中的层放置

Yichen Xu, Yuyang Liang, Shan Dai, Tianyang Hu, Tsz Nam Chan, Chenhao Ma

机构 * University of California, Berkeley(加州大学伯克利分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen University(深圳大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Layer Card工具,通过分析层的残差信号强度、计算成本和性能,指导大语言模型参数高效微调中的层选择,以实现性能与成本的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19595 2026-02-10 cs.CL cs.AI 88%

Efficient Attention Mechanisms for Large Language Models: A Survey

大型语言模型中的高效注意力机制:综述

Yutao Sun, Zhenyu Li, Yike Zhang, Tengyu Pan, Bowen Dong, Yuyi Guo, Jianyong Wang

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中高效注意力机制的发展,包括线性注意力和稀疏注意力方法,并分析了其在大规模预训练模型中的应用与设计。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13333 2026-02-10 cs.AI cs.NE math.OC 88%

HiFo-Prompt: Prompting with Hindsight and Foresight for LLM-based Automatic Heuristic Design

HiFo-Prompt: 基于前瞻性与回顾性的提示方法用于基于大语言模型的自动启发式设计

Chentong Chen, Mengyuan Zhong, Ye Fan, Jialong Shi, Jianyong Sun

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University, Xi’an, China(西安交通大学数学与统计学院) School of Electronics and Information, Northwest Polytechnical University, Xi’an, China(西北工业大学电子与信息学院)

专题命中 效率与部署 :LLM(title,abstract);prompting(title,abstract);分类 cs.AI

AI总结 HiFo-Prompt通过前瞻性与回顾性提示策略,提升基于大语言模型的自动启发式设计效率与质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15973 2026-02-10 cs.LG cs.CL 87%

Dynamic Rank Reinforcement Learning for Adaptive Low-Rank Multi-Head Self Attention in Large Language Models

动态秩强化学习用于自适应低秩多头自注意力机制在大语言模型中

Caner Erden

机构 * Faculty of Technology, Department of Computer Engineering, Sakarya University of Applied Sciences(技术学院,计算机工程系,萨克萨大学应用科学)

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 本文提出动态秩强化学习方法,通过强化学习优化注意力机制,实现低秩多头自注意力在大语言模型中的自适应调整,显著降低计算成本并保持模型性能。

Journal ref International Journal of Complexity in Applied Science and Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07547 2026-02-10 q-bio.NC cs.AI cs.CL cs.LG 87%

Linguistic properties and model scale in brain encoding: from small to compressed language models

语言属性与模型规模在脑编码中的作用:从小型到压缩语言模型

Subba Reddy Oota, Vijay Rowtula, Satya Sai Srinath Namburi, Khushbu Pahwa, Anant Khandelwal, Manish Gupta, Tanmoy Chakraborty, Bapi S. Raju

机构 * TU Berlin(柏林技术大学) IIIT-Hyderabad(海得拉巴理工学院) GE HealthCare(通用电气医疗) AWS AI Labs, Amazon(亚马逊AI实验室) Microsoft Research, Bangalore, India(微软研究院,班加罗尔,印度) Microsoft, Hyderabad, India(微软,海得拉巴,印度) IIT Delhi(德里理工学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现小型语言模型在脑一致性上可与大模型媲美,压缩不影响脑可预测性,挑战了神经扩展的常见假设。

Comments 40 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17668 2026-02-10 cs.LG cs.CL 86%

Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction

快速KVzip:基于门控的KV缓存淘汰实现高效且准确的LLM推理

Jang-Hyun Kim, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 基于门控的KV缓存淘汰方法实现高效且准确的LLM推理,通过轻量级门控模块和任务无关的重建目标,实现高压缩比和低计算开销。

Comments Source code: https://github.com/Janghyun1230/FastKVzip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07164 2026-02-10 cs.CL cs.AI 86%

Your Language Model Secretly Contains Personality Subnetworks

你的语言模型秘密包含个性子网络

Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(图兰大学) Northwestern University(西北大学) University of Arizona(亚利桑那大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型内部已嵌入身份子网络,无需外部知识即可实现身份切换和行为调整。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17307 2026-02-10 cs.LG cs.AI cs.CL 86%

R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning

R-Stitch:动态轨迹拼接以实现高效的推理

Zhuokun Chen, Zeren Chen, Jiahao He, Lu Sheng, Mingkui Tan, Jianfei Cai, Bohan Zhuang

机构 * Monash University, Australia(墨尔本大学,澳大利亚) School of Software, Beihang University, China(北航软件学院,中国) South China University of Technology, China(华南理工大学,中国) ZIP Lab, Zhejiang University, China(浙江大学ZIP实验室,中国)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 R-Stitch通过熵引导的混合解码框架,实现高效推理,减少计算成本并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08062 2026-02-10 cs.LG cs.CR 85%

Efficient and Adaptable Detection of Malicious LLM Prompts via Bootstrap Aggregation

通过Bootstrap聚合实现高效且适应性强的恶意LLM提示检测

Shayan Ali Hassan, Tao Ni, Zafar Ayyub Qazi, Marco Canini

机构 * KAUST(卡塔尔人工智能研究所在线中心)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BAGEL通过Bootstrap聚合和专家混合方法,实现高效且适应性强的恶意LLM提示检测,以高F1得分超越现有大参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07878 2026-02-10 cs.CR cs.AI 85%

Rethinking Latency Denial-of-Service: Attacking the LLM Serving Framework, Not the Model

重新审视延迟拒绝服务:攻击LLM服务框架,而非模型

Tianyi Wang, Huawei Fan, Yuanchao Shu, Peng Cheng, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Fill和Squeeze攻击策略,通过影响调度器状态转换,攻击LLM服务框架而非模型,降低攻击成本并造成显著延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18849 2026-02-10 cs.SE cs.AI cs.HC 85%

Pre-Filtering Code Suggestions using Developer Behavioral Telemetry to Optimize LLM-Assisted Programming

利用开发者行为 telemetry 预过滤代码建议以优化 LLM 协助编程

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova

机构 * ITMO University(ITMO大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过开发者行为 telemetry 预过滤代码建议,提升 LLM 协助编程的接受率和效率

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

Journal ref In Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering Workshops (ASEW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18842 2026-02-10 cs.SE cs.AI cs.HC 85%

Optimizing LLM Code Suggestions: Feedback-Driven Timing with Lightweight State Bounds

优化大语言模型代码建议:基于反馈的轻量级状态边界定时机制

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova

机构 * ITMO University(ITMO大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于反馈的轻量级定时机制,通过动态调整延迟来优化大语言模型代码建议的接受率,显著提升了效率并减少了浪费的推理调用。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

Journal ref In Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering Workshops (ASEW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22009 2026-02-10 cs.AI 85%

OpenPhone: Mobile Agentic Foundation Models

OpenPhone: 移动代理基础模型

Yangqin Jiang, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 效率与部署 :foundation model(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 OpenPhone通过设备-云协作提升移动GUI代理性能,结合设备端高效模型与云端强大能力,实现成本降低与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09580 2026-02-10 cs.SE cs.AI 85%

Software Performance Engineering for Foundation Model-Powered Software

面向基础模型驱动软件的软件性能工程

Haoxiang Zhang, Shi Chang, Arthur Leung, Kishanthan Thangarajah, Boyuan Chen, Hanan Lutfiyya, Ahmed E. Hassan

机构 * Centre for Software Excellence at Huawei(华为卓越软件中心) Western University(西方大学) Queen's University(皇后大学)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出面向基础模型驱动软件的性能工程重要性,探讨了认知架构设计、通信协议、调优与部署等四个关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05413 2026-02-10 cs.OS 85%

Flare: Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale

Flare:用于千级规模GPU集群中发散式LLM训练的异常诊断

Weihao Cui, Ji Zhang, Han Zhao, Chao Liu, Jian Sha, Bingsheng He, Minyi Guo, Quan Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Flare是一种用于千级规模GPU集群中大规模分布式LLM训练的异常诊断框架,通过轻量级跟踪守护进程和自动诊断引擎提升异常检测与性能退化分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07899 2026-02-10 cs.CV 85%

Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models

重新思考视觉-语言模型的实用且高效的量化校准

Zhenhao Shang, Haizhao Jing, Guoting Wei, Haokui Zhang, Rong Xiao, Jianqing Gao, Peng Wang

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) Nanjing University of Science and Technology, Nanjing, China(南京理工大学,南京,中国)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 TLQ通过标记级重要性整合和多GPU层级校准,提升视觉-语言模型的量化稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏