arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22456 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22456 篇

2605.22411 2026-05-22 cs.CL cs.AI cs.LG 83%

DeferMem: Query-Time Evidence Distillation via Reinforcement Learning for Long-Term Memory QA

DeferMem: 通过强化学习进行长时记忆问答的查询时证据蒸馏

Jianing Yin, Tan Tang

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DeferMem,一种长时记忆框架,通过分离问题为高召回候选检索和查询条件证据蒸馏,以提升长时记忆问答的准确性和效率。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19950 2026-05-19 cs.LG cs.AI cs.CL 83%

LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation

LogQuant: 一种基于对数分布的2位KV缓存量化技术,具有更优异的精度保持性能

Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

机构 * Paradigm(4Paradigm)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LogQuant通过基于对数的过滤机制实现KV缓存的2位量化,减少内存占用的同时保持高性能,实验表明其在吞吐量、批处理大小和准确性上均优于现有方法。

Comments Accepted by ICLR 2025 Workshop on Sparsity in LLMs (SLLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14236 2026-05-18 cs.LG cs.AI cs.CL 83%

Active Learners as Efficient PRP Rerankers

主动学习者作为高效的PRP重排序器

Jeremías Figueiredo Paschmann, Juan Kaplan, Francisco Nattero, Santiago Barron, Juan Wisznia, Luciano del Corro

机构 * ELIAS Lab, Departamento de Ingeniería, Universidad de San Andrés(ELIAS实验室,工程系,圣安德烈大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);prompting(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将PRP重排序问题重新定义为从噪声成对比较中进行主动学习,证明主动排序器在受限调用下能提升NDCG@10性能,并引入随机方向oracle以降低计算成本。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04816 2026-05-18 cs.HC 83%

Building AI Companions that Prioritise Learning over Performance

构建以学习优先于性能的人工智能伴侣

Hassan Khosravi, Dragan Gasevic, Shazia Sadiq, Lixiang Yan, Jason Lodge, Jason Tangen, Paul Denny, Kristen DiCerbo, Simon Buckingham Shum, Ryan S. Baker

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨如何设计人工智能以支持学习而非仅提升即时输出,提出AI学习伴侣的概念,通过五个案例研究展示其潜力与局限,主张转向以教学为基础、适应性学习和促进深层理解的人工智能设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14217 2026-05-15 cs.LG cs.AI cs.CL cs.SY eess.SY 83%

PreFT: Prefill-only finetuning for efficient inference

PreFT:仅前缀微调用于高效的推理

Andrew Lanpouthakoun, Aryaman Arora, Zhengxuan Wu, Dhruv Pai, Ben Keigwin, Dan Jurafsky, Christopher Potts

机构 * Stanford University(斯坦福大学) Tilde Research(Tilde研究)

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreFT,通过仅在前缀阶段应用适配器以提高多适配器服务的吞吐量,实验显示其在不同任务中均优于传统PEFT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 83%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02971 2026-05-11 cs.LG cs.AI cs.CL 83%

Multilingual Safety Alignment via Self-Distillation

通过自蒸馏实现多语言安全对齐

Ruiyang Qin, Qingzhuo Wang, Dongrui Liu, Qiang Li, Zhihua Wei, Wen Shen

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多语言自蒸馏框架,通过将高资源语言的安全能力迁移到低资源语言,解决多语言安全对齐问题,无需特定语言响应数据,实验表明方法在多语言安全性能上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10013 2026-05-08 cs.DC 83%

Training LLMs on HPC Systems: Best Practices from the OpenGPT-X Project

在HPC系统上训练LLMs:来自OpenGPT-X项目的最佳实践

Carolin Penke, Chelsea Maria John, Jan Ebert, Stefan Kesselheim, Andreas Herten

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文介绍了OpenGPT-X项目在HPC系统上训练多语言LLM的最佳实践,重点包括Teuken-7B模型的训练过程、系统架构、软件选择及性能优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22681 2026-04-28 cs.CR 83%

CacheTrap: Unveiling a Stealthier Gray-Box Trojan against LLMs

CacheTrap: 揭示一种更隐蔽的灰盒后门攻击 against LLMs

Mohaiminul Al Nahian, Abeer Matar A. Almalky, Gamana Aragonda, Ranyang Zhou, Sabbir Ahmed, Dmitry Ponomarev, Li Yang, Shaahin Angizi, Adnan Siraj Rakin

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CacheTrap,一种针对LLM键值缓存的灰盒后门攻击,通过单比特翻转触发目标行为,无需修改输入或模型权重,实验显示100%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19859 2026-04-23 cs.LG cs.AI cs.CL cs.IR 83%

DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data

DR-Venus:面向前沿边缘端大规模深度研究代理的仅10K开放数据方法

Venus Team, Sunhao Dai, Yong Deng, Jinzhen Lin, Yusheng Song, Guoqing Wang, Xiaofeng Wu, Yuqi Zhou, Shuo Yang, Zhenzhe Ying, Zhanwei Zhang, Changhua Meng, Weiqiang Wang

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DR-Venus,通过提升数据质量和利用效率,在有限开放数据下训练出强大的小规模深度研究代理,实现边缘端部署,并在多个基准测试中超越先前模型。

Comments Technical Report of DR-Venus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05687 2026-04-23 cs.CV 83%

3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models

由多模态大语言模型视觉先验引导的3D烟雾场景重建

Xinye Zheng, Fei Wang, Yiqi Nie, Kun Li, Junjie Chen, Jiaqi Zhao, Yanyan Wei, Zhiliang Wu

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(title);language model(title)

AI总结 本文提出整合视觉先验与高效3D场景建模的框架,通过增强烟雾退化图像和开发Smoke-GS框架,提升烟雾场景重建与视图合成的鲁棒性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12967 2026-04-23 cs.DC 83%

Sutradhara: An Intelligent Orchestrator-Engine Co-design for Tool-based Agentic Inference

Sutradhara: 一种智能编排-引擎协同设计用于基于工具的代理推理

Anish Biswas, Kanishk Goel, Srivarshinee S, Jayashree Mohan, Alind Khare, Anjaly Parayil, Ramachandran Ramjee, Chetan Bansal

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract)

AI总结 Sutradhara通过整合编排与LLM服务,优化工具执行与LLM预填充的重叠,提升代理推理系统的吞吐量与延迟平衡,减少端到端延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19664 2026-04-22 cs.IR 83%

ECLASS-Augmented Semantic Product Search for Electronic Components

基于ECLASS的语义产品搜索增强

Nico Baumgart, Markus Lange-Hegermann, Jan Henze

专题命中 效率与部署 :LLM(summary_cn,abstract);foundation model(abstract)

AI总结 本文提出利用LLM密集检索和ECLASS层次语义提升电子元件语义搜索效果,实验显示其在准确率和效率上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18232 2026-04-21 cs.LG cs.AI cs.CL 83%

Two-Stage Regularization-Based Structured Pruning for LLMs

基于两阶段正则化的结构剪枝用于大语言模型

Mingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang, Hongjian Fang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TRSP方法,通过两阶段正则化提升大语言模型结构剪枝效果,减少知识损失并无需重新训练,实验显示其优于现有方法,实现高效部署。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21569 2026-04-20 cs.LG cs.AI cs.CL 83%

ChemAmp: Amplified Chemistry Tools via Composable Agents

ChemAmp:通过可组合代理增强化学工具

Zhucong Li, Powei Chang, Jin Xiao, Zhijian Zhou, Qianyu He, Jiaqing Liang, Fenglei Cao, Xu Yinghui, Yuan Qi

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) School of Data Science, Fudan University(复旦大学数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Department of Information and Intelligence Development, Zhongshan Hospital, Fudan University(复旦大学中山医院信息与智能发展部)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ChemAmp通过优化动态协调提升化学工具能力,以有限数据构建任务专用超代理,在分子设计等任务中优于专用模型和通用LLM。

Comments Accepted to ACL 2026 Findings ; Code available at https://github.com/Chang-pw/ChemAmp

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12247 2026-04-15 cs.CL cs.AI cs.LG 83%

SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration

SpecBound: 带层间置信度校准的自适应有界自我猜测

Zhuofan Wen, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新型自适应自我猜测框架,通过层间温度退火抑制虚假置信,根据token解码难度动态限制猜测长度,提升大语言模型的自回归推理效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07173 2026-04-09 cs.DC 83%

InfiniLoRA: Disaggregated Multi-LoRA Serving for Large Language Models

InfiniLoRA:解耦的多LoRA服务用于大语言模型

Hongyu Chen, Letian Ruan, Zilin Xu, Yuchen Li, Xinyu Chen, Jingwen Leng, Bingsheng He, Minyi Guo, Shixuan Sun

专题命中 效率与部署 :large language model(title);language model(title)

AI总结 InfiniLoRA通过解耦LoRA执行与基础模型推理,提升多租户和多任务服务的效率与可扩展性,实验显示在严格延迟SLO下服务请求速率提升3.05倍,LoRA适配器满足SLO的百分比提高54.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02776 2026-04-06 cs.SE 83%

Evaluating the Environmental Impact of using SLMs and Prompt Engineering for Code Generation

评估使用SLMs和提示工程进行代码生成的环境影响

Md Afif Al Mamun, Sayan Nath, Gias Uddin, Novarun Deb

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 本文研究了基于SLMs的代码生成中不同提示策略对准确性和可持续性的影响,发现可持续性与准确性脱钩,提示工程可实现环保与性能的平衡。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23954 2026-03-26 cs.SE 83%

Towards Energy-aware Requirements Dependency Classification: Knowledge-Graph vs. Vector-Retrieval Augmented Inference with SLMs

面向能源意识的需求依赖分类:知识图谱与向量检索增强推理的SLM

Shreyas Patil, Pragati Kumari, Novarun Deb, Gouri Ginde

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 本文研究了在SLM中通过知识图谱与向量检索增强推理以提高需求冲突检测的效率和可持续性,评估了不同方法在能耗、延迟和碳排放方面的表现。

Comments 11 pages, Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23075 2026-03-25 cs.HC 83%

Good for the Planet, Bad for Me? Intended and Unintended Consequences of AI Energy Consumption Disclosure

对地球有利,对我却有害?人工智能能耗披露的预期与非预期后果

Michael Klesel, Uwe Messer

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 研究探讨了人工智能能耗披露对用户选择节能小模型的影响,发现其能有效引导环保选择,但未显著改变后续行为,却导致感知偏差和满意度下降。

Comments CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05974 2026-03-10 cs.SE 83%

Balancing Latency and Accuracy of Code Completion via Local-Cloud Model Cascading

通过本地-云模型级联平衡代码补全的延迟与准确性

Hanzhen Lu, Lishui Fan, Jiachi Chen, Qiuyuan Chen, Zhao Wei, Zhongxin Liu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 MCCom通过本地-云模型级联平衡代码补全的延迟与准确性,提升性能并降低成本

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02708 2026-02-04 cs.LG cs.AI cs.CL 83%

BinaryPPO: Efficient Policy Optimization for Binary Classification

BinaryPPO:用于二分类任务的高效策略优化

Punya Syon Pandey, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 BinaryPPO通过置信度加权奖励机制提升二分类任务的准确率,优于传统监督微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22101 2026-01-30 cs.CL cs.AI cs.LG 83%

ECO: Quantized Training without Full-Precision Master Weights

ECO:无需全精度主权重的量化训练

Mahdi Nikdan, Amir Zandieh, Dan Alistarh, Vahab Mirrokni

机构 * Google Research(谷歌研究) ISTA

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 ECO通过直接在量化参数上应用更新,消除了主权重带来的内存开销,实现了在保持精度的同时提升内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21298 2026-01-30 cs.SE 83%

Detecting Multiple Semantic Concerns in Tangled Code Commits

检测 tangled commits 中的多个语义关注点

Beomsu Koh, Neil Walkinshaw, Donghwan Shin

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出利用 SLMs 检测 tangled 提交中的多关注点,通过实验证明提交信息显著提升检测准确率。

Comments 28 pages, 12 figures. Submitted to Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD 83%

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11678 2025-11-18 cs.DC cs.AI cs.CL cs.LG 83%

A Structure-Agnostic Co-Tuning Framework for LLMs and SLMs in Cloud-Edge Systems

Yuze Liu, Yunhan Wang, Tiehua Zhang, Zhishu Shen, Cheng Peng, Libing Wu, Feng Xia, Jiong Jin

机构 * Swinburne University of Technology(斯威本理工大学) Tongji University(同济大学) Wuhan University of Technology(武汉理工大学) INFLY TECH (Shanghai) Co., Ltd.(INFLY TECH(上海)有限公司) Wuhan University(武汉大学) RMIT University(皇家墨尔本理工大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03654 2025-10-09 cs.CL cs.AI cs.LG 83%

Improving Neutral Point-of-View Generation with Data- and Parameter-Efficient RL

Jessica Hoffmann, Christiane Ahlheim, Zac Yu, Aria Walfrand, Jarvis Jin, Marie Tano, Ahmad Beirami, Erin van Liemt, Nithum Thain, Hakim Sidahmed, Lucas Dixon

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06308 2025-10-09 cs.CV 83%

Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding

Yi Xin, Qi Qin, Siqi Luo, Kaiwen Zhu, Juncheng Yan, Yan Tai, Jiayi Lei, Yuewen Cao, Keqi Wang, Yibin Wang, Jinbin Bai, Qian Yu, Dengyang Jiang, Yuandong Pu, Haoxing Chen, Le Zhuo, Junjun He, Gen Luo, Tianbin Li, Ming Hu, Jin Ye, Shenglong Ye, Bo Zhang, Chang Xu, Wenhai Wang, Hongsheng Li, Guangtao Zhai, Tianfan Xue, Bin Fu, Xiaohong Liu, Yu Qiao, Yihao Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) The University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :large language model(title);language model(title)

Comments 33 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00515 2025-10-02 cs.CV 83%

Efficient Multi-modal Large Language Models via Progressive Consistency Distillation

Zichen Wen, Shaobo Wang, Yufa Zhou, Junyuan Zhang, Qintong Zhang, Yifeng Gao, Zhaorun Chen, Bin Wang, Weijia Li, Conghui He, Linfeng Zhang

专题命中 效率与部署 :large language model(title);language model(title)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25267 2025-10-01 cs.LG cs.AI cs.CL 83%

Dynamic Policy Induction for Adaptive Prompt Optimization: Bridging the Efficiency-Accuracy Gap via Lightweight Reinforcement Learning

Jiexi Xu

机构 * University of California, Irvine School of Information & Computer Science(加州大学尔湾分校信息与计算机科学学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 13 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏