arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 29 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 29 篇

2601.02232 2026-01-08 cs.LG 89%

ELLA: Efficient Lifelong Learning for Adapters in Large Language Models

ELLA:为大语言模型适配器实现高效的终身学习

Shristi Das Biswas, Yue Zhang, Anwesan Pal, Radhika Bhargava, Kaushik Roy

机构 * Purdue University(普渡大学) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 ELLA通过选择性子空间去相关原理,实现高效终身学习,无需数据重放或架构扩展,显著提升连续学习性能和零样本泛化能力。

Comments Accepted at EACL (Main Conference) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03274 2026-01-08 cs.CL cs.AI 86%

LLM_annotate: A Python package for annotating and analyzing fiction characters

LLM_annotate: 一个用于标注和分析小说人物的Python包

Hannes Rosenbusch

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM_annotate是一个基于大语言模型的Python工具,用于高效、可重复地分析小说人物性格,支持多种LLM并提供交互式GUI验证

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04170 2026-01-08 cs.AI 85%

Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions

智能体漂移:多智能体大语言模型系统在长时间交互中的行为退化量化

Abhishek Rath

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出智能体漂移概念,通过理论框架和量化指标,探讨多智能体系统在长时间交互中的行为退化问题,并提出缓解策略以提升系统稳定性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03874 2026-01-08 cs.CL 85%

Evaluating Small Decoder-Only Language Models for Grammar Correction and Text Simplification

评估小型解码器-only语言模型在语法纠正和文本简化中的表现

Anthony Lamelas

机构 * New York University(纽约大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文评估了小型解码器-only语言模型在语法纠正和文本简化任务中的性能,发现其在效率上有优势,但性能仍低于现有大型语言模型,需进一步改进以缩小差距。

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03281 2026-01-08 eess.SY cs.AI cs.SY 85%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15755 2026-01-08 cs.AI cs.SE 85%

Multi-Agent LLM Orchestration Achieves Deterministic, High-Quality Decision Support for Incident Response

多智能体大语言模型协调实现确定性、高质量的事件响应决策支持

Philip Drammeh

机构 * Philip Drammeh, M.Eng(菲利普·德拉梅, 工程硕士)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 多智能体大语言模型协调显著提升事件响应的确定性和质量,实现100%可操作建议率,为生产环境提供可靠决策支持。

Comments 10 pages, 4 tables. v2: Expanded limitations, added threats to validity, clarified agent definition, added reproducibility notes, updated Phase 2 timeline with current models (GPT-5.2, Claude Sonnet 4.5, Llama 3.3 70B). No changes to experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02006 2026-01-08 cs.DC cs.LG 85%

MorphServe: Efficient and Workload-Aware LLM Serving via Runtime Quantized Layer Swapping and KV Cache Resizing

MorphServe: 通过运行时量化层交换和KV缓存调整实现高效且负载感知的LLM服务

Zhaoyuan Su, Zeyu Zhang, Tingfeng Lan, Zirui Wang, Haiying Shen, Juncheng Yang, Yue Cheng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MorphServe通过运行时量化层交换和KV缓存调整,有效提升动态负载下的LLM服务效率和稳定性。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03482 2026-01-08 cs.AI cs.LG stat.AP 82%

Personalization of Large Foundation Models for Health Interventions

为健康干预个性化设计大型基础模型

Stefan Konigorski, Johannes E. Vedder, Babajide Alamu Owoyele, İbrahim Özkan

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合框架,结合LFMs和N-of-1试验,以实现个性化医疗中的因果推断与责任AI整合。

Comments Accepted to the AAAI 2026 Workshop on Personalization in the Era of Large Foundation Models (PerFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03606 2026-01-08 cs.LG cs.AI 81%

Policy-Guided Search on Tree-of-Thoughts for Efficient Problem Solving with Bounded Language Model Queries

基于树状思维的策略引导搜索以实现高效的有限语言模型查询问题解决

Sumedh Pendurkar, Guni Sharon

机构 * Texas A&M University(德克萨斯大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LTS算法,通过语言模型的启发式概率引导树状思维搜索,以在有限计算预算下提升问题解决效率。

Comments Published in Transactions on Machine Learning Research (TMLR), 2025. Available at https://openreview.net/forum?id=Rlk1bWe2ii

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18795 2026-01-08 cs.CV 78%

ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder

通过基于大语言模型的嵌入器实现渐进式视觉-语言对齐的ProCLIP

Xiaoxing Hu, Kaicheng Yang, Ziyang Gong, Qi Ming, Zonghao Guo, Yu Tian, Xiang An, Ziyong Feng, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) DeepGlint(深图科技) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,abstract)

AI总结 ProCLIP通过课程学习逐步对齐CLIP图像编码器与基于大语言模型的嵌入器,提升长文本处理和多语言理解能力。

Comments 17 pages, 5 fiugres

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01306 2026-01-08 cs.LG math.OC 77%

Towards a Principled Muon under $μ\mathsf{P}$: Ensuring Spectral Conditions throughout Training

迈向基于μP的原理性muon:确保训练过程中光谱条件

John Zhao

机构 * John Zhao(约翰·赵)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Muon++优化器,通过在优化器更新层面维持光谱控制,确保μP条件在整个训练过程中有效,提升长horizon LLM训练的实用性。

Comments 21 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03324 2026-01-08 cs.CL cs.AI cs.AR cs.LG 75%

Bare-Metal Tensor Virtualization: Overcoming the Memory Wall in Edge-AI Inference on ARM64

裸金属张量虚拟化:克服边缘AI推理在ARM64上的内存墙

Bugra Kilictas, Faruk Alpay

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出一种基于ARM64的软件虚拟张量核心架构,通过直接内存映射和NEON SIMD内核实现高效边缘AI推理,达到60 tokens/秒的吞吐量,满足心理语言学延迟要求。

Comments 14 pages, 2 figures. Code and data available at https://github.com/farukalpay/stories100m

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03258 2026-01-08 cs.IR 75%

Enhancing Retrieval-Augmented Generation with Two-Stage Retrieval: FlashRank Reranking and Query Expansion

通过双阶段检索增强检索增强生成:FlashRank重排序与查询扩展

Sherine George

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出双阶段检索框架,结合查询扩展和FlashRank重排序,提升检索增强生成的准确性和效率。

Comments 3 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03743 2026-01-08 cs.CL cs.AI 73%

O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL

O-Researcher: 通过多智能体蒸馏和智能体强化学习构建开放式深度研究模型

Yi Yao, He Zhu, Piaohong Wang, Jincheng Ren, Xinlong Yang, Qianben Chen, Xiaowan Li, Dingfeng Shi, Jiaxian Li, Qiexiang Wang, Sinuo Wang, Xinpeng Liu, Jiaqi Wu, Minghao Liu, Wangchunshu Zhou

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 O-Researcher通过多智能体蒸馏和智能体强化学习,构建开放式深度研究模型,实现开源模型在多个基准上的性能提升。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03700 2026-01-08 cs.CL cs.AI 73%

ADEPT: Adaptive Dynamic Early-Exit Process for Transformers

ADEPT: 用于Transformer的自适应动态早退出过程

Sangmin Yoo, Srikanth Malla, Chiho Choi, Wei D. Lu, Joon Hee Choi

机构 * University of Michigan Ann Arbor(密歇根大学安阿伯分校) Samsung Semiconductor(三星半导体)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ADEPT通过自适应动态早退出机制提升Transformer模型的推理效率,实现生成和预填充阶段的高效计算优化。

Comments 11 figures, 8 tables, 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14211 2026-01-08 cs.CL cs.AI 73%

LiteStage: Latency-aware Layer Skipping for Multi-stage Reasoning

LiteStage: 低延迟层跳过用于多阶段推理

Beomseok Kang, Jiwon Song, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 LiteStage通过低延迟层跳过框架提升多阶段推理效率,有效解决阶段间跳过敏感性和冗余输出问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03577 2026-01-08 cs.LG 70%

Variational Inference, Entropy, and Orthogonality: A Unified Theory of Mixture-of-Experts

变分推断、熵与正交性:混合专家模型的统一理论

Ye Su, Yong Liu

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文从贝叶斯和信息论视角构建混合专家模型的统一理论框架,推导路由机制为最优稀疏后验近似,并证明正交性可缩小全局最优与贪心近似间的差距。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03479 2026-01-08 cs.IR cs.AI 70%

Efficient Sequential Recommendation for Long Term User Interest Via Personalization

通过个性化实现长期用户兴趣的高效顺序推荐

Qiang Zhang, Hanchao Yu, Ivan Ji, Chen Yuan, Yi Zhang, Chihuang Liu, Xiaolong Wang, Christopher E. Lambert, Ren Chen, Chen Kovacs, Xinzhu Bei, Renqin Cai, Rui Li, Lizhu Zhang, Xiangjun Fan, Qunshu Zhang, Benyu Zhang

机构 * Meta Recommendation Systems (MRS)(Meta 推荐系统)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过个性化技术压缩用户历史交互,提升顺序推荐的效率和准确性,适用于多种推荐模型。

Comments ICDM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04301 2026-01-08 cs.LG cs.AR 70%

The Cost of Dynamic Reasoning: Demystifying AI Agents and Test-Time Scaling from an AI Infrastructure Perspective

动态推理的成本:从AI基础设施视角解密AI代理与测试时扩展

Jiin Kim, Byeongjun Shin, Jinha Chung, Minsoo Rhu

专题命中 效率与部署 :LLM(abstract);prompting(abstract);分类 cs.LG

AI总结 本文从AI基础设施视角解密AI代理与测试时扩展,揭示动态推理带来的高成本与可持续性问题,呼吁转向计算高效的代理设计。

Comments Accepted for publication at the 32nd IEEE International Symposium on High-Performance Computer Architecture (HPCA-32), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22156 2026-01-08 cs.CL 70%

InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing

InComeS: 将压缩与选择机制整合到LLMs中以实现高效的模型编辑

Shuaiyi Li, Zhisong Zhang, Yang Deng, Chenlong Deng, Tianqing Fang, Hongming Zhang, Haitao Mi, Dong Yu, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯AI实验室) Singapore Management University(新加坡管理学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 InComeS通过整合压缩和选择机制,提升LLMs处理多编辑任务的效率和性能。

Comments 18 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03713 2026-01-08 cs.CV 67%

BREATH-VL: Vision-Language-Guided 6-DoF Bronchoscopy Localization via Semantic-Geometric Fusion

BREATH-VL:基于视觉-语言引导的6自由度支气管镜定位:通过语义-几何融合

Qingyao Tian, Bingyu Yang, Huai Liao, Xinyan Huang, Junyong Li, Dong Yi, Hongbin Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Pulmonary and Critical Care Medicine, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院呼吸与危重症医学科) Centre of AI and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(香港科学院人工智能与机器人中心) School of Biomedical Engineering and Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 效率与部署 :language model(abstract);pretraining(abstract)

AI总结 BREATH-VL通过融合语义和几何信息,实现高精度的6自由度支气管镜定位,减少定位误差并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10180 2026-01-08 cs.HC 67%

ChartOptimiser: Task-driven Optimisation of Chart Designs

ChartOptimiser: 任务驱动的图表设计优化

Yao Wang, Jiarong Pan, Danqing Shi, Zhiming Hu, Antti Oulasvirta, Andreas Bulling

专题命中 效率与部署 :LLM(abstract);language model(abstract)

AI总结 ChartOptimiser通过贝叶斯优化提升图表设计的保真度、效率和有效性,为非专家用户生成优于LLM的高质量图表。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03928 2026-01-08 cs.CV cs.AI cs.CL cs.HC 62%

FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection

FocusUI: 通过位置保持的视觉标记选择实现高效的UI接地

Mingyu Ouyang, Kevin Qinghong Lin, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 FocusUI通过位置保持的视觉标记选择实现高效UI接地,有效减少冗余标记并保持位置连续性,提升推理效率和性能。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01513 2026-01-08 cs.CV cs.AI 57%

FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation

FastV-RAG: 向快速且细粒度的视频问答迈进:基于检索增强生成的框架

Gen Li, Peiyu Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of International Business and Economics(国际商务经济大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 FastV-RAG通过引入推测解码和基于相似性的过滤策略,提升视频问答任务的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07344 2026-01-08 cs.DC cs.AI 57%

Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding

Venus: 一种高效的边缘内存与检索系统用于基于VLM的在线视频理解

Shengyuan Ye, Bei Ouyang, Tianyi Qian, Liekang Zeng, Mu Yuan, Xiaowen Chu, Weijie Hong, Xu Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(计算机科学与工程学院,中山大学,广州,中国) Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(信息工程系,香港中文大学,香港特别行政区,中国) Shenzhen Smart City Communications Co., Ltd., China(深圳智慧城市通信有限公司,中国)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 Venus提出了一种高效的边缘内存与检索系统,通过边缘-云解耦架构实现快速的在线视频理解,显著降低系统开销并提升响应速度。

Comments Accepted by IEEE International Conference on Computer Communications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03460 2026-01-08 cs.CV cs.AI 57%

FROST-Drive: Scalable and Efficient End-to-End Driving with a Frozen Vision Encoder

FROST-Drive: 可扩展且高效的端到端驾驶方法,采用冻结的视觉编码器

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(Sunrise技术公司)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 FROST-Drive通过冻结预训练视觉编码器,结合适配器和解码器,实现高效端到端驾驶,优于全微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14435 2026-01-08 cs.CV cs.LG 57%

MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models

MoTE:混合三元专家用于内存高效的大型多模态模型

Hongyu Wang, Jiayu Xu, Ruiping Wang, Yan Feng, Yitao Zhai, Peng Pei, Xunliang Cai, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 MoTE通过训练更多低精度三元专家,实现内存高效的大规模多模态模型训练,提升端任务性能并降低内存需求。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05726 2026-01-08 cs.CV cs.CR cs.LG eess.IV 57%

Region of Interest Loss for Anonymizing Learned Image Compression

感兴趣区域损失用于匿名化学习图像压缩

Christoph Liebender, Ranulfo Bezerra, Kazunori Ohno, Satoshi Tadokoro

机构 * Graduate School of Information Sciences, Tohoku University(东京大学信息科学研究生院) Julius Maximilian University Würzburg(维尔堡大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出通过定制损失函数在感兴趣区域实现学习图像压缩的匿名化,使人脸不可识别但保持人物可检测,同时减少敏感数据传输。

Comments Accepted to IEEE CASE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17025 2026-01-08 physics.optics physics.atom-ph quant-ph 50%

High-fidelity holographic beam shaping with optimal transport and phase diversity

高保真全息光束成形与最优传输及相位多样性

Hunter Swan, Andrii Torchylo, Michael J. Van de Graaff, Jan Rudolph, Jason M. Hogan

专题命中 效率与部署 :SLM(abstract)

AI总结 本文提出利用最优传输和相位多样性技术实现高保真光束成形,提升SLM相位计算的准确性和效率。

Comments 14 pages, 5 figures, plus supplement

Journal ref Opt. Express 33, 6290-6303 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏