arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-16 至 2026-01-16 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 38 篇

2601.09772 2026-01-16 cs.AI cs.CL cs.CY econ.GN q-fin.EC 90%

Antisocial behavior towards large language model users: experimental evidence

针对大型语言模型用户的反社会行为:实验证据

Paweł Niszczota, Cassandra Grützner

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,用户对依赖大型语言模型的人施加惩罚,表明LLM的效率提升可能引发社会制裁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20923 2026-01-16 cs.NE cs.AI 89%

Pareto-Grid-Guided Large Language Models for Fast and High-Quality Heuristics Design in Multi-Objective Combinatorial Optimization

基于帕累托网格的大型语言模型在多目标组合优化中快速高质量启发式设计

Minh Hieu Ha, Hung Phan, Tung Duy Doan, Tung Dao, Dao Tran, Huynh Thi Thanh Binh

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 基于帕累托网格的LLM改进方法,用于多目标组合优化中高效高质量启发式设计。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14669 2026-01-16 cs.LG 88%

Quartet: Native FP4 Training Can Be Optimal for Large Language Models

Quartet:原生FP4训练可用于大型语言模型

Roberto L. Castro, Andrei Panferov, Soroush Tabesh, Oliver Sieberling, Jiale Chen, Mahdi Nikdan, Saleh Ashkboos, Dan Alistarh

机构 * ISTA Red Hat AI(红帽人工智能) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 Quartet通过原生FP4训练实现大型语言模型的高效训练,提供与FP16和FP8同等的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10410 2026-01-16 cs.CL 87%

TF3-RO-50M: Training Compact Romanian Language Models from Scratch on Synthetic Moral Microfiction

TF3-RO-50M: 从合成道德微型小说中从头开始训练紧凑型罗曼尼亚语言模型

Mihai Dan Nadas, Laura Diosan, Andreea Tomescu, Andrei Piscoran

机构 * Babes-Bolyai University(巴纳特-博耶伊大学) KlusAI Labs(KlusAI实验室)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);pretraining(abstract);prompting(abstract)

AI总结 TF3-RO-50M通过从头开始训练,生成罗曼尼亚语紧凑型语言模型及大规模合成叙事语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10274 2026-01-16 cs.LG cs.AI cs.IT cs.NI math.IT math.OC 86%

Queueing-Aware Optimization of Reasoning Tokens for Accuracy-Latency Trade-offs in LLM Servers

面向队列的推理令牌优化:在LLM服务器中准确率与延迟的权衡

Emre Ozbas, Melih Bastopcu

机构 * Department of Electrical and Electronics Engineering(电气与电子工程系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种面向队列的推理令牌优化方法,通过优化LLM服务器中准确率与延迟的权衡,提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09865 2026-01-16 cs.LG cs.AI 86%

Advancing Model Refinement: Muon-Optimized Distillation and Quantization for LLM Deployment

推进模型精炼:用于LLM部署的μ子优化蒸馏与量化

Jacob Sander, Brian Jalaian, Venkat R. Dasari

机构 * Intelligent Systems and Robotics (ISR) University of West Florida(智能系统与机器人(ISR)大学西部佛罗里达大学) DEVCOM Army Research Laboratory (ARL)(陆军研究实验室(ARL))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合量化、LoRA和数据蒸馏的框架,通过μ子优化器实现模型压缩与性能提升,适用于LLM部署。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07115 2026-01-16 cs.LG cs.AI math.OC 86%

Online Scheduling for LLM Inference with KV Cache Constraints

在线调度用于具有KV缓存约束的LLM推理

Patrick Jaillet, Jiashuo Jiang, Konstantina Mellou, Marco Molinaro, Chara Podimata, Zijie Zhou

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) HKUST(香港科技大学) Microsoft Research(微软研究院) Sloan School of Management, Massachusetts Institute of Technology(斯隆管理学院,麻省理工学院) Operations Research Center, Massachusetts Institute of Technology(运营研究中心,麻省理工学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种在线调度算法,通过理论建模和实证验证,在管理KV缓存内存的同时最小化LLM推理延迟,显著优于现有基准算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10004 2026-01-16 cs.CR cs.LG 85%

SoK: Privacy-aware LLM in Healthcare: Threat Model, Privacy Techniques, Challenges and Recommendations

SoK:面向医疗的隐私保护大语言模型:威胁模型、隐私技术、挑战与建议

Mohoshin Ara Tahera, Karamveer Singh Sidhu, Shuvalaxmi Dass, Sajal Saha

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Northern British Columbia, Canada(北部BC大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文系统分析了医疗领域大语言模型的隐私保护问题,探讨了威胁模型、隐私技术及挑战,并提出针对不同阶段的防护建议和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19670 2026-01-16 cs.CL 85%

CoSense-LLM: Semantics at the Edge with Cost- and Uncertainty-Aware Cloud-Edge Cooperation

CoSense-LLM:在成本和不确定性意识下实现边缘语义的云边协作

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CoSense-LLM通过边缘优先设计,在成本和不确定性意识下实现云边协作,以提供紧凑的语义标记和隐私保护。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03296 2026-01-16 cs.DC 85%

APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs

APEX:异步并行CPU-GPU执行用于受限GPU上的在线LLM推理

Jiakun Fan, Yanglin Zhang, Xiangchen Li, Dimitrios S. Nikolopoulos

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 APEX通过动态调度策略提升受限GPU上的LLM推理效率,提高吞吐量并保持延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD 83%

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17077 2026-01-16 cs.DC 82%

Taming the Memory Footprint Crisis: System Design for Production Diffusion LLM Serving

缓解内存占用危机:面向生产扩散大语言模型服务的系统设计

Jiakun Fan, Yanglin Zhang, Xiangchen Li, Dimitrios S. Nikolopoulos

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 dLLM-Serve通过优化内存占用、计算调度和生成质量,解决了扩散大语言模型在生产中的内存占用危机,实现了更高的吞吐量和更低的延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25626 2026-01-16 cs.CL cs.AI cs.LG cs.LO 82%

Are Language Models Efficient Reasoners? A Perspective from Logic Programming

语言模型是高效的推理者吗?从逻辑编程的角度看

Andreas Opedal, Yanick Zengaffinen, Haruki Shirakami, Clemente Pasti, Mrinmaya Sachan, Abulhair Saparov, Ryan Cotterell, Bernhard Schölkopf

机构 * ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems, Tübingen(智能系统马克斯·普朗克研究所) EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构) Purdue University(普渡大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从逻辑编程角度评估语言模型的推理效率,发现其在存在无关信息时推理能力下降,生成证明常包含不必要的推理步骤。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10114 2026-01-16 cs.AI 81%

Following the Teacher's Footsteps: Scheduled Checkpoint Distillation for Domain-Specific LLMs

循师之步:面向领域特定LLM的调度检查点蒸馏

Cheng Feng, Chaoliang Zhong, Jun Sun, Yusuke Oishi

机构 * Fujitsu R&D Center(富士通研发中心) Fujitsu Research(富士通研究)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出调度检查点蒸馏方法,通过减少教师偏好的子领域劣势并保留学生在学生偏好的子领域的优势,使学生模型在特定领域任务中超越教师。

Comments 15 pages, submitted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15729 2026-01-16 eess.SP cs.AI cs.HC cs.LG 81%

TinyMyo: a Tiny Foundation Model for Flexible EMG Signal Processing at the Edge

TinyMyo:一种用于边缘端灵活EMG信号处理的轻量级基础模型

Matteo Fasulo, Giusy Spacone, Thorir Mar Ingolfsson, Yawei Li, Luca Benini, Andrea Cossettini

机构 * Integrated Systems Laboratory of ETH Zürich(苏黎世联邦理工学院集成系统实验室) University of Bologna(博洛尼亚大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 TinyMyo是一种轻量级EMG基础模型,通过自监督预训练实现多任务泛化,适用于低功耗边缘设备的高效信号处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15372 2026-01-16 cs.IR cs.AI cs.CV cs.LG cs.MM 81%

Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models

面向高效视觉-语言模型的图像复杂度感知自适应检索

Mikel Williams-Lekuona, Georgina Cosma

机构 * Computer Science, Loughborough University, Loughborough, UK(计算机科学,洛桑大学,洛桑,英国)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ICAR通过自适应计算方法提升视觉-语言模型效率,实现高效图像-文本匹配与复杂度评估。

Comments Camera-ready version for ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10707 2026-01-16 cs.CV cs.LG cs.RO 79%

See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection

见少,驾驶更佳:通过基础模型随机补丁选择实现通用端到端自动驾驶

Amir Mallak, Erfan Aasi, Shiva Sreeram, Tsun-Hsuan Wang, Daniela Rus, Alaa Maalouf

机构 * University of Haifa(海法大学) CSAIL, MIT(MIT计算机科学与人工智能实验室)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 通过随机补丁选择提升自动驾驶策略的鲁棒性和泛化能力,实现更高效且更稳健的端到端自动驾驶

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10567 2026-01-16 cs.AI cs.CY cs.HC cs.LG cs.MA 79%

Generative AI collective behavior needs an interactionist paradigm

生成式AI的集体行为需要一种互动主义范式

Laura Ferrarotti, Gian Maria Campedelli, Roberto Dessì, Andrea Baronchelli, Giovanni Iacca, Kathleen M. Carley, Alex Pentland, Joel Z. Leibo, James Evans, Bruno Lepri

机构 * Fondazione Bruno Kessler(布雷诺·克塞尔基金会) University of Trento(特伦托大学) Not Diamond City St. George’s University of London(伦敦圣乔治大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) University of Chicago(芝加哥大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出生成式AI的集体行为研究需采用互动主义范式,以系统分析知识与社会情境的交互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10088 2026-01-16 cs.AI 77%

State of AI: An Empirical 100 Trillion Token Study with OpenRouter

AI 状态:一项具有 OpenRouter 的 100 万亿 token 实证研究

Malika Aubakirova, Alex Atallah, Chris Clark, Justin Summerville, Anjney Midha

机构 * OpenRouter

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过分析 100 万亿 token 的真实世界 LLM 交互,揭示了 LLM 在实际应用中的复杂使用模式,包括开放式权重模型的普及、创意角色扮演的流行以及代理推理的兴起。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13111 2026-01-16 cs.LG 77%

Why Knowledge Distillation Works in Generative Models: A Minimal Working Explanation

为何知识蒸馏在生成模型中有效:一个最小可行解释

Sungmin Cha, Kyunghyun Cho

机构 * New York University(纽约大学) Genentech(基因泰克)

专题命中 效率与部署 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.LG

AI总结 本文通过模拟和实验揭示了知识蒸馏在生成模型中通过精度与召回权衡提升生成质量的机制。

Comments NeurIPS 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02024 2026-01-16 cs.DC 75%

NestedFP: High-Performance, Memory-Efficient Dual-Precision Floating Point Support for LLMs

NestedFP: 高性能、内存高效的双精度浮点数支持用于大语言模型

Haeun Lee, Omin Kwon, Yeonhong Park, Jae W. Lee

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 NestedFP通过内存高效的方式支持FP16和FP8双精度浮点数,实现大语言模型服务的高性能与高质量平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09928 2026-01-16 cs.HC cs.IR 75%

In-Browser Agents for Search Assistance

浏览器中的搜索助手代理

Saber Zerhoudi, Michael Granitzer

专题命中 效率与部署 :language model(abstract);small language model(abstract);SLM(abstract)

AI总结 本文提出了一种浏览器内隐私保护的搜索助手代理,结合自适应概率模型与小语言模型,提升搜索效率同时保障用户隐私。

Journal ref Proceedings of the 2026 ACM SIGIR Conference on Human Information Interaction and Retrieval (CHIIR '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09985 2026-01-16 cs.LG cs.AR cs.IR 74%

FaTRQ: Tiered Residual Quantization for LLM Vector Search in Far-Memory-Aware ANNS Systems

FaTRQ:面向远内存感知的ANNS系统中的分层残差量化

Tianqi Zhang, Flavio Ponzina, Tajana Rosing

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 效率与部署 :LLM(title);分类 cs.LG

AI总结 FaTRQ通过分层残差量化和自定义加速器,提升ANNS系统的存储效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10155 2026-01-16 cs.LG cs.AI 73%

LOOKAT: Lookup-Optimized Key-Attention for Memory-Efficient Transformers

LOOKAT: 用于内存高效变换器的查找优化键注意力

Aryan Karmore

机构 * Indian Institute of Information Technology, Nagpur(印度信息技术学院,那格浦尔)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LOOKAT通过查找优化键注意力,实现内存高效变换器的压缩,保持高保真度的同时提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10412 2026-01-16 eess.IV 71%

An effective interactive brain cytoarchitectonic parcellation framework using pretrained foundation model

一种利用预训练基础模型的有效交互式脑皮层分区框架

Shiqi Zhang, Fang Xu, Pengcheng Zhou

专题命中 效率与部署 :foundation model(title)

AI总结 本文提出一种利用预训练基础模型的交互式脑皮层分区框架,通过多层特征融合和轻量级解码器实现高效分割,提升大规模数据集的分割精度。

Comments 10 pages, 5 figures, Accepted at IMIP2026 Code: https://github.com/Confetti22/cytoarch_brain_parcellation_dino

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10673 2026-01-16 cs.LG 70%

Single-Stage Huffman Encoder for ML Compression

单阶段Huffman编码器用于机器学习压缩

Aditya Agrawal, Albert Magyar, Hiteshwar Eswaraiah, Patrick Sheridan, Pradeep Janedula, Ravi Krishnan Venkatesan, Krishna Nair, Ravi Iyer

机构 * Google LLC(谷歌公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种单阶段Huffman编码器,通过使用固定代码表实现高效实时压缩,减少计算和延迟开销,适用于芯片间通信等低延迟场景。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10355 2026-01-16 cs.CL 70%

Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text

解锁隐含经验:从文本合成工具使用轨迹

Zhihao Xu, Rumei Li, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xunliang Cai, Xiting Wang

机构 * Renmin University of China(中国人民大学) Meituan(美团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出GEM方法,通过文本数据生成多轮工具使用轨迹,提升LLM在多轮交互中的工具使用能力,实验显示其在基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10307 2026-01-16 cs.CL 70%

The Straight and Narrow: Do LLMs Possess an Internal Moral Path?

直行与狭窄:大型语言模型是否具有内在的道德路径?

Luoming Hu, Jingjie Zeng, Liang Yang, Hongfei Lin

机构 * School of Future Technology, Dalian University of Technology, China(大连理工大学未来技术学院) School of Computer Science and Technology, Dalian University of Technology, China(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence, Ministry of Education, China(教育部社会计算与认知智能重点实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过道德基础理论探索LLMs的道德表示,提出自适应道德融合方法,以增强模型的道德对齐性并减少安全与有用性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09027 2026-01-16 cond-mat.mtrl-sci 67%

Agentic AI and Machine Learning for Accelerated Materials Discovery and Applications

代理AI与机器学习在加速材料发现与应用中的作用

Jihua Chen, Panagiotis Christakopoulos, Karuna D. Chen, Ilia N. Ivanov, Rigoberto Advincula

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文探讨了代理AI和机器学习在加速材料发现中的应用,重点介绍了高效发现方法、核心概念及大型语言模型,并展示了其在流化学、生物传感器和电池等领域的应用。

Comments 36 pages, 4 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06743 2026-01-16 cs.MM cs.IR 67%

The State-of-the-Art in Lifelog Retrieval: A Review of Progress at the ACM Lifelog Search Challenge Workshop 2022-24

生命周期检索的最新进展:ACM生命周期检索挑战工作坊2022-24年进展综述

Allie Tran, Werner Bailer, Duc-Tien Dang-Nguyen, Graham Healy, Steve Hodges, Björn Þór Jónsson, Luca Rossetto, Klaus Schoeffmann, Minh-Triet Tran, Lucia Vadicamo, Cathal Gurrin

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文综述了ACM生命周期检索挑战工作坊2022-24年在交互式生命周期检索领域的最新进展,重点分析了嵌入式检索方法、大语言模型整合及多模态界面的创新,并探讨了系统性能与用户界面设计的平衡问题。

Journal ref 2025 IEEE Access, 13. pp. 216340-216363. ISSN 2169-3536

详情

展开后加载摘要…

URL PDF HTML 收藏