arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-05 至 2026-01-05 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 28 篇

2509.16989 2026-01-05 cs.LG cs.AI 92%

PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models

PTQTP: 预训练量化到三平面用于大语言模型

He Xiao, Runming Yang, Qingyao Yang, Wendong Xu, Zhen Li, Yupeng Su, Zhengwu Liu, Hongxia Yang, Ngai Wong

机构 * The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 PTQTP通过分解权重矩阵为三平面实现高效大语言模型量化,提升推理速度并减少资源消耗。

Comments Ternary Quantization, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00694 2026-01-05 cs.AI 90%

A Vision-and-Knowledge Enhanced Large Language Model for Generalizable Pedestrian Crossing Behavior Inference

一种融合视觉与知识的大型语言模型用于可推广的行人过街行为推断

Qingwen Pu, Kun Xie, Hong Yang, Guocong Zhai

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 本研究提出PedX-LLM,融合视觉与知识的大型语言模型,用于可推广的行人过街行为推断,通过整合视觉特征和领域知识提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11518 2026-01-05 cs.CL 90%

W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search

W2S-AlignTree: 通过蒙特卡洛树搜索实现大语言模型的弱到强推理时对齐

Zhenyu Ding, Yuhao Wang, Tengyue Xiao, Haoying Wang, Caigui Jiang, Ning Ding

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 W2S-AlignTree通过结合MCTS与弱到强泛化范式,实现大语言模型在推理时的高效对齐,提升摘要任务性能15.9%。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10032 2026-01-05 cs.LG 89%

LeanQuant: Accurate and Scalable Large Language Model Quantization with Loss-error-aware Grid

LeanQuant: 一种准确且可扩展的大型语言模型量化方法,具有损失误差感知的网格

Tianyi Zhang, Anshumali Shrivastava

机构 * Dept. of Computer Science, Rice University(计算机科学系, Rice大学) ThirdAI Corp.(ThirdAI公司) Ken Kennedy Institute(肯尼迪研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 LeanQuant通过学习损失误差感知的网格,实现了准确且可扩展的大型语言模型量化,适用于多种量化类型并兼容更多框架。

Comments Published in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00282 2026-01-05 cs.CL cs.AI cs.LG 89%

Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations

大语言模型还能自我解释吗?探讨量化对自我解释的影响

Qianli Wang, Nils Feldhus, Pepa Atanasova, Fedor Splitt, Simon Ostermann, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) University of Copenhagen(哥本哈根大学) Saarland Informatics Campus(萨尔州信息学校园) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨量化对大语言模型自我解释质量及可信度的影响,发现量化会导致中等程度的下降,但不影响其作为压缩技术的有效性。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00202 2026-01-05 cs.CL 88%

Knowledge Distillation for Temporal Knowledge Graph Reasoning with Large Language Models

基于大语言模型的时序知识图谱推理知识蒸馏

Wang Xing, Wei Song, Siyu Lin, Chen Wu, Zhesi Li, Man Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Information Engineering, Chang’an University(长安大学信息工程学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出基于大语言模型的时序知识图谱推理蒸馏框架,通过有效转移结构和时间推理能力,提升学生模型的时效建模能力,实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00227 2026-01-05 cs.AI 85%

FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems

FlashInfer-Bench: 构建 AI 驱动的 LLM 系统的良性循环

Shanli Xing, Yiyan Zhai, Alexander Jiang, Yixin Dong, Yong Wu, Zihao Ye, Charlie Ruan, Yingyi Huang, Yineng Zhang, Liangsheng Yin, Aksara Bayyapu, Luis Ceze, Tianqi Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FlashInfer-Bench 提出了一种闭环框架,用于评估和部署 AI 生成的 GPU 内核,以提升大规模语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11651 2026-01-05 cs.LG cs.DC 85%

70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float (DFloat11)

Tianyi Zhang, Mohsen Hariri, Shaochen Zhong, Vipin Chaudhary, Yang Sui, Xia Hu, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06364 2026-01-05 cs.LG 85%

Sketch to Adapt: Fine-Tunable Sketches for Efficient LLM Adaptation

草图以适应:用于高效大语言模型适应的可调节草图

Tianyi Zhang, Junda Su, Aditya Desai, Oscar Wu, Zhaozhuo Xu, Anshumali Shrivastava

机构 * Rice University, Houston, TX(里士满大学) University of California, Berkeley, Berkeley, CA(加州大学伯克利分校) Stevens Institute of Technology, Hoboken, NJ(史蒂文斯理工学院) ThirdAI Corp.(ThirdAI公司) Ken Kennedy Institute(肯尼迪研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SketchTune通过压缩和适应一体化的方法,实现更高效的大语言模型适应,优于现有PEFT方法。

Comments Published in ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15683 2026-01-05 cs.CL cs.AI cs.DC 85%

FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models

FedSEA-LLaMA: 一种安全、高效且适应性的联邦分割框架用于大语言模型

Zishuai Zhang, Hainan zhang, Weihua Li, Qinnan zhang, jin Dong, Yongxin Tong, Zhiming Zheng

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 FedSEA-LLaMA通过注入噪声、压缩注意力掩码和动态调整分割点,实现安全高效的联邦分割学习,提升大语言模型的训练和推断速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16037 2026-01-05 cs.AI cs.CL cs.LG math.OC stat.ML 85%

Causal LLM Routing: End-to-End Regret Minimization from Observational Data

因果大语言模型路由:从观测数据实现端到端的遗憾最小化

Asterios Tsiourvas, Wei Sun, Georgia Perakis

机构 * MIT(麻省理工学院) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于因果推理的端到端框架,通过最小化决策遗憾从观测数据中学习大语言模型路由策略,实现高效优化和异质成本偏好的处理,实验显示优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04677 2026-01-05 cs.DS 85%

LLM Query Scheduling with Prefix Reuse and Latency Constraints

基于前缀重用和延迟约束的LLM查询调度

Gregory Dexter, Shao Tang, Ata Fatahi Baarzi, Qingquan Song, Tejas Dharamsi, Aman Gupta

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出k-LPM算法,通过平衡前缀重用与公平性,改进LLM查询调度的TTFT性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15298 2026-01-05 cs.NE cs.CL cs.LG 84%

Sorbet: A Neuromorphic Hardware-Compatible Transformer-Based Spiking Language Model

Sorbet:一种兼容神经形态硬件的基于Transformer的脉冲语言模型

Kaiwen Tang, Zhanglu Yan, Weng-Fai Wong

机构 * School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 效率与部署 :language model(title,abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 Sorbet是一种基于Transformer的脉冲语言模型,通过PTsoftmax和BSPN替代高能耗操作,实现高效能的神经形态硬件兼容性。

Comments Accepted by ICML 2025. Camera-ready version

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00644 2026-01-05 cs.DC 82%

FlexSpec: Frozen Drafts Meet Evolving Targets in Edge-Cloud Collaborative LLM Speculative Decoding

FlexSpec: 冻结草稿与演进目标在边缘-云协作大语言模型推测解码中的结合

Yuchen Li, Rui Kong, Zhonghao Lyu, Qiyang Li, Xinran Chen, Hengyi Cai, Lingyong Yan, Shuaiqiang Wang, Jiashu Zhao, Guangxu Zhu, Linghe Kong, Guihai Chen, Haoyi Xiong, Dawei Yin

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 FlexSpec通过共享骨干架构和通道感知机制,提升边缘-云协作大语言模型推测解码的效率与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00454 2026-01-05 cs.CL cs.AI 79%

Defensive M2S: Training Guardrail Models on Compressed Multi-turn Conversations

防御性M2S:在压缩的多轮对话上训练防护模型

Hyunjun Kim

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Defensive M2S通过压缩多轮对话训练防护模型,显著降低训练和推理成本,提升攻击检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00612 2026-01-05 eess.SP 78%

WiFo-MUD: Wireless Foundation Model for Heterogeneous Multi-User Demodulator

WiFo-MUD:面向异构多用户解调的无线基础模型

Zonghui Yang, Shijian Gao, Xuesong Cai, Xiang Cheng, Liuqing Yang

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 WiFo-MUD是一种基于扩散模型的多用户解调基础模型,通过定制化主干网络和动态用户分组策略提升解调性能,在异构环境中实现高效推理和强泛化能力。

Comments 13 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17002 2026-01-05 cs.CV 78%

Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models

语义锚点传输:面向视觉-语言模型的鲁棒性测试时间适应

Shambhavi Mishra, Julio Silva-Rodriguez, Ismail Ben Ayed, Marco Pedersoli, Jose Dolz

机构 * LIVIA, ÉTS Montréal, Canada(LIVIA,蒙特利尔ÉTS,加拿大) International Laboratory on Learning Systems (ILLS), McGILL - ETS - MILA - CNRS - Université Paris-Saclay - CentraleSupélec, Canada(学习系统国际实验室(ILLS),麦吉尔大学-ÉTS-MILA-CNRS-巴黎-萨克雷大学-中央超导大学,加拿大)

专题命中 效率与部署 :language model(title,abstract)

AI总结 语义锚点传输通过生成伪标签和多模板蒸馏方法,提升视觉-语言模型在分布偏移下的鲁棒性与计算效率。

Comments Added additional figures to communicate the algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00543 2026-01-05 cs.CL cs.AI 76%

ECR: Manifold-Guided Semantic Cues for Compact Language Models

ECR: 用于紧凑语言模型的流形引导语义线索

Chung-Wei Victor Yuan

机构 * YVIC Research Lab(YVIC研究实验室)

专题命中 效率与部署 :language model(title);分类 cs.CL、cs.AI

AI总结 ECR通过流形引导语义线索提升紧凑语言模型的结构稳定性与任务适应性

Comments Preprint 13pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00274 2026-01-05 cs.CR 75%

Making Theft Useless: Adulteration-Based Protection of Proprietary Knowledge Graphs in GraphRAG Systems

让盗窃变得无用:基于掺假的专有知识图谱在GraphRAG系统中的保护

Weijie Wang, Peizhuo Lv, Yan Wang, Rujie Dai, Guokun Xu, Qiujian Lv, Hangcheng Liu, Weiqing Huang, Wei Dong, Jiaheng Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AURA通过在知识图谱中注入虚假掺假物,使盗窃的知识图谱对攻击者无用,同时保持授权用户查询的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00770 2026-01-05 cs.CE cs.AI econ.GN q-fin.EC 74%

LLM Agents for Combinatorial Efficient Frontiers: Investment Portfolio Optimization

基于LLM代理的组合效率前沿:投资组合优化

Simon Paquette-Greenbaum, Jiangbo Yu

机构 * Department of Civil Engineering, McGill University(土木工程系,麦吉尔大学)

专题命中 效率与部署 :LLM(title);分类 cs.AI

AI总结 本文提出了一种基于LLM代理的新型框架,用于解决组合效率前沿的投资组合优化问题,通过改进的算法开发和流程自动化,实现了更高效的投资组合解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00397 2026-01-05 cs.DC cs.LG 74%

Revati: Transparent GPU-Free Time-Warp Emulation for LLM Serving

Revati:面向LLM服务的透明GPU-free时间扭曲仿真

Amey Agrawal, Mayank Yadav, Sukrit Kumar, Anirudha Agrawal, Garv Ghai, Souradeep Bera, Elton Pinto, Sirish Gambhira, Mohammad Adain, Kasra Sohrab, Chus Antonanzas, Alexey Tumanov

专题命中 效率与部署 :LLM(title);分类 cs.LG

AI总结 Revati通过时间跳跃技术实现GPU-free的LLM服务性能仿真,比实际GPU执行快5-17倍,预测误差低于5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00504 2026-01-05 cs.CV cs.AI cs.GR 70%

MotionPhysics: Learnable Motion Distillation for Text-Guided Simulation

MotionPhysics: 通过自然语言引导的模拟学习可学习的运动蒸馏

Miaowei Wang, Jakub Zadrożny, Oisin Mac Aodha, Amir Vaxman

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MotionPhysics通过自然语言引导模拟,利用可学习的运动蒸馏损失实现对3D物体物理参数的自动学习,提升动态模拟的逼真度和效率。

Comments AAAI2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14746 2026-01-05 cs.CL cs.LG 62%

Scaling Efficient LLMs

扩展高效大语言模型

B. N. Kausik

机构 * Independent(独立研究者)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出递归变换器,通过结合变换器和递归网络的优势,实现了高效的大语言模型,解决了参数规模与数据规模之间的非线性关系问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15870 2026-01-05 eess.IV cs.CV cs.LG 57%

CIC: Circular Image Compression

循环图像压缩:CIC

Honggui Li, Sinan Chen, Dingtai Li, Zhengyang Zhang, Nahid Md Lokman Hossain, Xinfeng Xu, Yinlu Qin, Ruobing Wang, Maria Trocan, Dimitri Galayko, Amara Amara, Mohamad Sawan

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 本文提出循环图像压缩(CIC)方法,通过闭环架构提升LIC的动态和静态性能,实验表明其在重建能力和样本外测试图像处理方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00783 2026-01-05 cs.CR 50%

Improving Router Security using BERT

使用BERT改进路由器安全

John Carter, Spiros Mancoridis, Pavlos Protopapas, Brian Mitchell, Benji Lilley

专题命中 效率与部署 :language model(abstract)

AI总结 本研究通过改进的eBPF系统调用传感器和对比增强学习,提升路由器安全检测性能,并在物联网环境中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00613 2026-01-05 q-bio.OT 50%

Personalized Forecasting of Glycemic Control in Type 1 and 2 Diabetes Using Foundational AI and Machine Learning Models

使用基础AI和机器学习模型进行1型和2型糖尿病血糖控制的个性化预测

Simon Lebech Cichosz, Stine Hangaard, Thomas Kronborg, Peter Vestergaard, Morten Hasselstrøm Jensen

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文研究利用基础AI和机器学习模型,针对1型和2型糖尿病患者预测周提前的血糖控制指标,通过比较不同模型的性能,发现AutoGluon和tabPFN在部分指标上表现更优,但计算成本较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00160 2026-01-05 cs.SD eess.AS 50%

IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition

IKFST: IOO和KOO算法用于加速和精确的基于WFST的端到端自动语音识别

Zhuoran Zhuang, Ye Chen, Chao Luo, Tian-Hao Zhang, Xuewei Zhang, Jian Ma, Jiatong Shi, Wei Zhang

机构 * Fliggy Alibaba(阿里巴巴飞猪) University of Science and Technology Beijing(北京科技大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(abstract)

AI总结 IKFST通过IOO和KOO算法优化WFST解码,提升端到端语音识别的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15465 2026-01-05 cs.CV 50%

FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers

FP4DiT: 向有效浮点量化扩散变换器迈进

Ruichen Chen, Keith G. Mills, Di Niu

机构 * Department of Electrical and Computer Engineering, Faculty of Engineering University of Alberta(电气与计算机工程系,工程学院,阿尔伯塔大学) Division of Computer Science and Engineering, College of Engineering Louisiana State University(计算机科学与工程系,工程学院,路易斯安那州立大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 FP4DiT通过浮点量化技术实现更高效的扩散变换器量化,提升图像生成性能。

Comments The code is available at https://github.com/cccrrrccc/FP4DiT

详情

展开后加载摘要…

URL PDF HTML 收藏