arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2405.15374 2026-03-05 cs.IR cs.AI cs.CL 90%

Leveraging Large Language Models for Semantic Query Processing in a Scholarly Knowledge Graph

利用大语言模型在学术知识图谱中进行语义查询处理

Runsong Jia, Bowen Zhang, Sergio J. Rodríguez Méndez, Pouya G. Omran

机构 * Australian National University(澳大利亚国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型与学术知识图谱结合,提升语义查询处理的准确性和效率,以改进学术研究中的知识管理与发现。

Comments for the associated repository, see http://w3id.org/kgcp/KGQP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03310 2026-03-05 cs.CL cs.LG 90%

Entropic-Time Inference: Self-Organizing Large Language Model Decoding Beyond Attention

熵-时间推断:超越注意力的自组织大语言模型解码

Andrew Kiruluta

机构 * School of Information(信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出熵-时间推断方法,通过自组织架构实现基于熵的解码优化,提升大语言模型推理效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18671 2026-03-04 cs.AI cs.CL 90%

Spilled Energy in Large Language Models

大语言模型中的能量溢出

Adrian Robert Minut, Hazem Dewidar, Iacopo Masi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出了一种无需训练的基于能量的模型方法,用于检测大语言模型中的幻觉和错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03215 2026-03-04 cs.CL cs.LG 90%

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

缓存到缓存:大型语言模型之间的直接语义通信

Tianyu Fu, Zihan Min, Hanling Zhang, Jichao Yan, Guohao Dai, Wanli Ouyang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence AI The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) SLAI Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 缓存到缓存通过直接语义通信提升大型语言模型的性能和效率,实现比文本通信更高的准确率和更低的延迟。

Comments Published in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05612 2026-03-04 cs.LG cs.AI 90%

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

Shuffle-R1: 通过数据导向的动态洗牌提升多模态大语言模型的强化学习框架

Linghao Zhu, Yiran Guan, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Bin Qin, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Shuffle-R1通过动态洗牌和轨迹采样提升多模态大语言模型的强化学习效率,实现更高效的训练效果。

Comments This paper has been accepted by ICLR 2026. Conference link: https://iclr.cc/virtual/2026/poster/10007559 OpenReview link: https://openreview.net/forum?id=mYP33u1QBK Project page at: https://xenozlh.github.io/Shuffle-R1/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00196 2026-03-03 cs.CR cs.AI cs.CL 90%

Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models

您的推理请求将变成一个黑箱:面向云上大型语言模型的保密推理

Chung-ju Huang, Huiqiang Zhao, Yuanpeng He, Lijian Li, Wenpin Jiao, Zhi Jin, Peixuan Chen, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education, China(高可信软件技术重点实验室(北京大学)) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院) Tencent, Shenzhen, China(腾讯(深圳)) Macau university, China(澳门大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 Talaria通过在客户端控制的CVM中执行敏感操作并使用ReMO协议保护隐私,实现云上LLM的保密推理,同时保持性能和效率。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13352 2026-03-02 cs.LG cs.CL cs.CR 90%

On the Effectiveness of Membership Inference in Targeted Data Extraction from Large Language Models

针对大型语言模型中成员推断在目标数据提取中的有效性研究

Ali Al Sahili, Ali Chehab, Razane Tajeddine

机构 * American University of Beirut(贝鲁特美国大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过整合多种成员推断技术评估其在大型语言模型目标数据提取中的有效性,并与传统基准测试进行比较以评估实际应用价值。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03801 2026-02-27 cs.LG cs.AI 90%

Large Language Model Compression with Global Rank and Sparsity Optimization

大型语言模型压缩与全局秩和稀疏性优化

Changhai Zhou, Qian Qiao, Yuhua Zhou, Yuxin Wu, Shichao Weng, Weizhong Zhang, Cheng Jin

机构 * Fudan University(复旦大学) Soul AILab, OpenWPLab(Soul AILab,OpenWPLab) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种两阶段LLM压缩方法,通过全局资源分配优化秩和稀疏性,有效提升模型压缩性能。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17694 2026-02-23 cs.LG cs.AI 90%

AsynDBT: Asynchronous Distributed Bilevel Tuning for efficient In-Context Learning with Large Language Models

AsynDBT:异步分布式双层调优用于高效上下文学习与大语言模型

Hui Ma, Shaoyu Dou, Ya Liu, Fei Xing, Li Feng, Feng Pi

机构 * Xinjiang Key Laboratory of Intelligent Computing and Smart Applications, School of Software, Xinjiang University(新疆智能计算与智能应用重点实验室,软件学院,新疆大学) Department of Computer Science and Technology, Tongji University(计算机科学与技术系,同济大学) School of Information Science and Engineering, Zaozhuang University(信息科学与工程学院,枣庄大学) Xinjiang University, College of Geography and Remote Sensing Sciences(新疆大学,地理与遥感科学学院) Hochschule Bielefeld-University of Applied Sciences and Arts(比勒菲尔德应用科学与艺术大学) Xinjiang General Station of Exit and Entry Frontier Inspection(新疆出入境边防检查总站)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 AsynDBT通过异步分布式双层调优优化上下文学习样本和提示片段,提升大语言模型在隐私保护和异构环境下的下游任务性能。

Comments Accepted in Scientific Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19427 2026-02-19 cs.LG cs.AI 90%

WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference

WINA:基于权重的神经元激活以加速大语言模型推理

Sihan Chen, Dan Zhao, Jongwoo Ko, Colby Banbury, Huiping Zhuang, Luming Liang, Pashmina Cameron, Tianyi Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 WINA提出一种无需训练的稀疏激活框架,通过结合隐藏状态大小和权重矩阵列向量ℓ2范数,提升大语言模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15395 2026-02-19 cs.HC cs.AI cs.CL cs.SY eess.SP eess.SY 90%

ChatBCI: A P300 Speller BCI Leveraging Large Language Models for Improved Sentence Composition in Realistic Scenarios

ChatBCI: 一种利用大语言模型改进真实场景中句子组成的P300拼写BCI

Jiazhen Hong, Weinan Wang, Laleh Najafizadeh

机构 * Integrated Systems and NeuroImaging Laboratory(集成系统与神经成像实验室) Department of Electrical and Computer Engineering, Rutgers University(电气与计算机工程系,罗格斯大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ChatBCI利用大语言模型提升真实场景中句子组成的效率和效果。

Journal ref Scientific Reports, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10481 2026-02-17 cs.LG cs.AI cs.CR 90%

Model-based Large Language Model Customization as Service

基于模型的大型语言模型定制服务

Zhaomin Wu, Jizhou Guo, Junyi Hou, Bingsheng He, Lixin Fan, Qiang Yang

机构 * National University of Singapore(新加坡国立大学) WeBank The Hong Kong University of Science and Technology(香港理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 Llamdex 提出了一种基于模型的 LLM 定制服务框架,通过客户端上传预训练的领域模型并结合差分隐私保护,提升领域特定任务的准确率并保持推理效率。

Comments Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10746 2026-02-17 cs.DC cs.AI cs.LG cs.NI 90%

Resource-Efficient Personal Large Language Models Fine-Tuning with Collaborative Edge Computing

基于协作边缘计算的资源高效个性化大语言模型微调

Shengyuan Ye, Bei Ouyang, Tianyi Qian, Liekang Zeng, Jingyi Li, Jiangsu Du, Xiaowen Chu, Guoliang Xing, Xu Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Shenzhen Institute of Artificial Intelligence and Robotics for Society(社会人工智能与机器人研究所(深圳))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC框架,通过算法与系统协同设计,实现高效资源利用的个性化大语言模型微调,提升边缘计算性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12618 2026-02-16 cs.CV cs.AI cs.CL 90%

Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models

通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率

Omer Faruk Deniz, Ruiyu Mao, Ruochen Li, Yapeng Tian, Latifur Khan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。

Comments 2025 IEEE International Conference on Big Data (BigData)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09109 2026-02-11 cs.LG cs.AI cs.CV cs.DC 90%

Distributed Hybrid Parallelism for Large Language Models: Comparative Study and System Design Guide

大规模语言模型的分布式混合并行:比较研究与系统设计指南

Hossam Amer, Rezaul Karim, Ali Pourranjbar, Weiwei Zhang, Walid Ahmed, Boxing Chen

机构 * Huawei Canada(华为加拿大)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究大规模语言模型的分布式混合并行方法,通过比较分析和系统设计指南,探讨优化并行策略以提升训练和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07804 2026-02-10 cs.CL cs.AI 90%

Pruning as a Cooperative Game: Surrogate-Assisted Layer Contribution Estimation for Large Language Models

剪枝作为合作博弈:用于大型语言模型的代理辅助层贡献估计

Xuan Ding, Pengyu Tong, Ranjie Duan, Yunjian Zhang, Rui Sun, Yao Zhu

机构 * Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Beijing Normal University(北京师范大学) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于博弈论的层剪枝方法,利用代理网络估计层贡献,实现高效且有效的大型语言模型剪枝。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07642 2026-02-10 cs.AI cs.LG 90%

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

基于多模态大语言模型的高效表格检索与理解

Zhuoyan Xu, Haoyang Fang, Boran Han, Bonan Min, Bernie Wang, Cuixiong Hu, Shuai Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS(亚马逊网络服务)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。

Comments Published at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20997 2026-02-10 cs.LG cs.AI 90%

Toward Efficient Exploration by Large Language Model Agents

迈向高效探索的大型语言模型代理

Dilip Arumugam, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology(心理学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大型语言模型显式实现后验抽样强化学习算法,以提升自然语言任务中的探索效率。

Comments Accepted to the International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05047 2026-02-10 cs.AR cs.AI cs.LG 90%

Challenges and Research Directions for Large Language Model Inference Hardware

大语言模型推理硬件的挑战与研究方向

Xiaoyu Ma, David Patterson

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大语言模型推理硬件面临的挑战,提出了高带宽闪存、内存-逻辑堆叠和低延迟互连等研究方向,以提升内存带宽和通信效率。

Comments Accepted for publication by IEEE Computer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18220 2026-02-09 eess.SP cs.AI cs.LG 90%

R-MTLLMF: Resilient Multi-Task Large Language Model Fusion at the Wireless Edge

R-MTLLMF: 在无线边缘实现具有鲁棒性的多任务大语言模型融合

Aladin Djuhera, Vlad C. Andrei, Mohsen Pourghasemian, Haris Gacanin, Holger Boche, Walid Saad

机构 * Technical University of Munich(慕尼黑技术大学) RWTH Aachen University(亚琛工业大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出R-MTLLMF,通过鲁棒的模型融合技术在无线边缘环境下提升多任务大语言模型的抗干扰能力。

Journal ref IEEE International Conference on Communications (ICC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02047 2026-02-03 cs.LG cs.CL 90%

Dissecting Outlier Dynamics in LLM NVFP4 Pretraining

解构LLM NVFP4预训练中的异常动态

Peijie Dong, Ruibo Fan, Yuechen Tao, Di Mou, Wenhu Hu, Zhenheng Tang, Yinghao Yu, Jiamang Wang, Wenbo Su, Guodong Yang, Liping Zhang, Xiaowen Chu, Baochun Li, Bo Li

机构 * The Hong Kong University of Science(香港科学与技术大学) Alibaba Group(阿里巴巴集团) University of Toronto(多伦多大学)

专题命中 效率与部署 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究通过分析NVFP4预训练中的异常动态,提出HCP机制和CHON训练配方,有效缩小了与BF16的损失差距。

Comments 39 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01956 2026-02-03 cs.LG cs.AI 90%

Efficient Epistemic Uncertainty Estimation for Large Language Models via Knowledge Distillation

通过知识蒸馏实现大型语言模型的高效信念不确定性估计

Seonghyeon Park, Jewon Yeom, Jaewon Sok, Jeongjae Park, Heejun Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Rural Systems Engineering, Seoul National University(首尔国立大学农村系统工程系) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Department of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology(全州科学科技研究院电子工程与计算机科学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 通过知识蒸馏高效估计大型语言模型的信念不确定性,减少估计误差并提升幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01711 2026-02-03 cs.AI cs.LG 90%

Optimizing Prompts for Large Language Models: A Causal Approach

为大型语言模型优化提示:一种因果方法

Wei Chen, Yanbin Fang, Shuran Fu, Fasheng Xu, Xuan Wei

机构 * School of Business, University of Connecticut(康涅狄格大学商学院) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 CPO通过因果推断方法优化提示设计,提升企业LLM在复杂查询中的鲁棒性,并降低提示优化的经济成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07684 2026-02-03 cs.CL cs.AI cs.SI 90%

When Large Language Models Do Not Work: Online Incivility Prediction through Graph Neural Networks

当大语言模型失效时:通过图神经网络进行在线不文明行为预测

Zihan Chen, Lanyu Yu

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于图神经网络的框架,用于检测在线不文明行为,优于现有大语言模型并降低推理成本。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22692 2026-02-02 cs.CL cs.AI cs.CR 90%

FNF: Functional Network Fingerprint for Large Language Models

FNF:大型语言模型的功能网络指纹

Yiheng Liu, Junhao Ning, Sichen Xia, Haiyang Sun, Yang Yang, Hanyang Chi, Xiaohui Gao, Ning Qiang, Bao Ge, Junwei Han, Xintao Hu

机构 * School of Automation, Northwestern Polytechnical University, Xi'an, China(自动化学院,西北工业大学,西安,中国) School of Physics and Information Technology, Shaanxi Normal University, Xi'an, China(物理与信息技术学院,陕西师范大学,西安,中国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 FNF通过功能网络活动一致性检测LLM来源,提供非侵入性的知识产权保护方法。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22438 2026-02-02 cs.DC cs.CL cs.LG 90%

Towards Resiliency in Large Language Model Serving with KevlarFlow

面向大语言模型服务的韧性提升:KevlarFlow

Shangshu Qian, Kipling Liu, P. C. Sruthi, Lin Tan, Yongle Zhang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Department of Computer Science, Purdue University, West Lafayette, IN, United States(计算机科学系,普渡大学,西拉法叶,印第安纳,美国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 KevlarFlow通过解耦模型并行初始化、动态流量重路由和背景KV缓存复制,显著提升了大语言模型服务的容错性和恢复效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19672 2026-01-29 cs.LG cs.AI cs.SE 90%

ProToken: Token-Level Attribution for Federated Large Language Models

ProToken: 联邦大语言模型中的令牌级归因

Waris Gill, Ahmad Humayun, Ali Anwar, Muhammad Ali Gulzar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 ProToken通过令牌级归因方法,解决联邦大语言模型中客户端贡献识别问题,提升隐私保护下的模型调试与信任验证能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11300 2026-01-29 cs.CL cs.AI 90%

Beyond Random Sampling: Efficient Language Model Pretraining via Curriculum Learning

超越随机采样:通过课程学习实现高效的语言模型预训练

Yang Zhang, Amr Mohamed, Hadi Abdine, Guokan Shang, Michalis Vazirgiannis

专题命中 效率与部署 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过课程学习优化语言模型预训练,发现压缩比、词汇多样性和可读性是关键难度指标,显著提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14523 2026-01-22 cs.AI cs.LG 90%

Large Language Model-Powered Evolutionary Code Optimization on a Phylogenetic Tree

基于进化树的大型语言模型驱动的代码优化

Leyi Zhao, Weijie Huang, Yitong Guo, Jiang Bian, Chenghong Wang, Xuhong Zhang

机构 * Department of Computer Science(计算机科学系) Luddy School of Informatics(信息学院) Indiana University(印第安纳大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 PhyloEvolve利用大型语言模型和进化算法优化GPU科学计算算法,通过进化树结构提升优化效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11579 2026-01-21 cs.CL cs.AI 90%

Bielik 11B v3: Multilingual Large Language Model for European Languages

Bielik 11B v3:面向欧洲语言的多语言大语言模型

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

专题命中 效率与部署 :language model(title,abstract);large language model(title);SFT(abstract);preference optimization(abstract)

AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏