arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 38 篇

2512.16855 2025-12-19 cs.AI cs.LO 89%

TOGGLE: Temporal Logic-Guided Large Language Model Compression for Edge

TOGGLE: 基于时序逻辑的大型语言模型压缩用于边缘

Khurram Khalil, Khaza Anuarul Hoque

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 TOGGLE通过结合时序逻辑与贝叶斯优化,实现了在不重新训练的情况下,对大型语言模型进行高效压缩,同时保持语言属性的正式保证。

Comments Published in the IEEE ICCAD 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16236 2025-12-19 cs.IR cs.AI 89%

The Evolution of Reranking Models in Information Retrieval: From Heuristic Methods to Large Language Models

信息检索中重排序模型的演变:从启发式方法到大语言模型

Tejul Pandit, Sakshi Mahendru, Meet Raval, Dhvani Upadhyay

机构 * Palo Alto Networks, USA(帕洛阿尔托网络公司,美国) University of Southern California, USA(南加州大学,美国) Dhirubhai Ambani University, India(迪鲁布希·阿姆巴尼大学,印度)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文综述了信息检索中重排序模型的发展历程,从传统方法到大语言模型的应用,探讨了不同模型的优缺点及效率提升方法。

Comments 15 pages, 1 figure, Accepted in CLNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16650 2025-12-19 cs.AI cs.CR 88%

Prefix Probing: Lightweight Harmful Content Detection for Large Language Models

前缀探查:用于大型语言模型的轻量有害内容检测

Jirui Yang, Hengqi Guo, Zhihui Lu, Yi Zhao, Yuansen Zhang, Shijing Hu, Qiang Duan, Yinggui Wang, Tao Wei

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Prefix Probing通过高效前缀探查实现轻量有害内容检测,在保持检测效果的同时大幅降低计算成本和部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14925 2025-12-19 cs.CL 88%

Multiscale Aggregated Hierarchical Attention (MAHA): A Game Theoretic and Optimization Driven Approach to Efficient Contextual Modeling in Large Language Models

多尺度聚合层次注意力(MAHA):一种基于博弈论和优化驱动的高效上下文建模方法,用于大型语言模型

Caner Erden

机构 * Sakarya University of Applied Sciences(萨卡里亚应用科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MAHA通过层次化分解和数学优化方法,提升大型语言模型在长上下文任务中的计算效率与上下文建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15766 2025-12-19 cs.PL cs.AI cs.DC cs.PF 88%

LOOPRAG: Enhancing Loop Transformation Optimization with Retrieval-Augmented Large Language Models

LOOPRAG:通过检索增强的大语言模型增强循环变换优化

Yijie Zhi, Yayu Cao, Jianhua Dai, Xiaoyang Han, Jingwen Pu, Qingran Wu, Sheng Cheng, Ming Cai

机构 * Zhejiang University(浙江大学) Zhejiang Institute of Administration(浙江行政研究院) Beijing ShenZhou Aerospace Software Technology Ltd.(北京神舟航天软件技术有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 LOOPRAG通过检索增强大语言模型提升循环变换优化效率,实现代码生成的准确性和性能提升。

Comments Accepted to ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16083 2025-12-19 cs.DB cs.AI cs.HC cs.LG 88%

Scaling Text2SQL via LLM-efficient Schema Filtering with Functional Dependency Graph Rerankers

通过LLM高效模式过滤实现Text2SQL扩展

Thanh Dat Hoang, Thanh Tam Nguyen, Thanh Trung Huynh, Hongzhi Yin, Quoc Viet Hung Nguyen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过LLM高效模式过滤框架提升Text2SQL系统在大规模模式下的性能与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20322 2025-12-19 cs.CV 88%

HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models

HyperET: 在超几何空间中为多模态大语言模型实现高效训练

Zelin Peng, Zhengqin Xu, Qingyang Liu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, SJTU(摩埃人工智能重点实验室、人工智能学院、计算机科学学院、上海交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 HyperET通过在双曲空间中动态调整半径,实现多模态大语言模型的高效训练,提升跨模态对齐性能。

Comments Accepted by NeurIPS2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12769 2025-12-19 cs.SD cs.AI 86%

Adaptive Edge-Cloud Inference for Speech-to-Action Systems Using ASR and Large Language Models

基于ASR和大语言模型的自适应边缘-云推断用于语音到动作系统

Mohammad Jalili Torkamani, Israt Zarin

机构 * School of Computing, University of Nebraska--Lincoln(计算机学院,内布拉斯加大学林肯分校)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出ASTA系统,通过自适应边缘-云推断平衡性能与资源利用,实现语音到动作的可靠控制。

Comments preprint, 6 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04133 2025-12-19 cs.AI 85%

TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems

TRiSM 用于代理 AI:对基于 LLM 的代理多代理系统中信任、风险和安全管理的综述

Shaina Raza, Ranjan Sapkota, Manoj Karkee, Christos Emmanouilidis

机构 * Vector Institute, Toronto, Canada(向量研究所) Cornell University, USA(康奈尔大学) University of Groningen, Netherlands(格罗宁根大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了基于 LLM 的代理多代理系统中信任、风险和安全管理的框架与方法,提出新的评估指标并探讨了安全与隐私增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16317 2025-12-19 cs.AI 85%

Design and Evaluation of Cost-Aware PoQ for Decentralized LLM Inference

去中心化大语言模型推理的成本感知PoQ设计与评估

Arther Tian, Alex Ding, Frank Chen, Alan Wu, Aaron Chan, Bruce Zhang

机构 * DGrid AI

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种成本感知的PoQ框架,通过整合效率测量和统一评估流程,提升去中心化LLM推理的经济可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16134 2025-12-19 cs.DC cs.LG 85%

Staggered Batch Scheduling: Co-optimizing Time-to-First-Token and Throughput for High-Efficiency LLM Inference

交错批次调度:协同优化时间到第一个令牌和吞吐量以实现高效的大语言模型推理

Jian Tian, Shuailong Li, Yang Cao, Wenbo Cui, Minghan Zhu, Wenkang Wu, Jianming Zhang, Yanpeng Wang, Zhiwen Xiao, Zhenyu Hou, Dou Shen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出交错批次调度方法,通过缓冲请求优化执行批次,降低TTFT并提升吞吐量,应用于高效大语言模型推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16391 2025-12-19 cs.LG cs.AI cs.DC 81%

Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference

Kascade:一种适用于长上下文LLM推理的实用稀疏注意力方法

Dhruv Deshmukh, Saurabh Goyal, Nipun Kwatra, Ramachandran Ramjee

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 Kascade是一种无需训练的稀疏注意力方法,通过锚定层计算Top-k索引并重用,实现长上下文LLM推理中的高效注意力处理。

Comments 11 pages, 8 figures, 3 tables and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16112 2025-12-19 cs.AR cs.AI cs.CL cs.DC 81%

HPU: High-Bandwidth Processing Unit for Scalable, Cost-effective LLM Inference via GPU Co-processing

HPU:通过GPU协同处理实现可扩展且经济高效的LLM推理的高带宽处理单元

Myunghyun Rhee, Joonseop Sim, Taeyoung Ahn, Seungyong Lee, Daegun Yoon, Euiseok Kim, Kyoung Park, Youngpyo Joo, Hoshik Kim

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HPU,通过GPU协同处理实现大规模LLM推理的高带宽处理单元,提升性能和能效

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16822 2025-12-19 cs.LG 79%

MEPIC: Memory Efficient Position Independent Caching for LLM Serving

MEPIC:内存高效的无位置依赖缓存用于大语言模型服务

Qian Wang, Zahra Yousefijamarani, Morgan Lindsay Heisler, Rongzhi Gu, Bai Xiaolong, Shan Yizhou, Wei Zhang, Wang Lan, Ying Xiong, Yong Zhang, Zhenan Fan

机构 * Huawei Technologies Canada Co., Ltd.(华为技术加拿大有限公司) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 MEPIC通过内存高效的无位置依赖缓存技术,实现跨请求和批次的片段KV重用,显著减少HBM使用量,提升大语言模型服务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15834 2025-12-19 cs.PL cs.AI cs.DC cs.PF cs.SE 79%

Optimizing Agentic Language Model Inference via Speculative Tool Calls

通过推测性工具调用优化代理语言模型推理

Daniel Nichols, Prajwal Singhania, Charles Jekel, Abhinav Bhatele, Harshitha Menon

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文通过推测性工具调用优化代理语言模型推理,提升推理吞吐量并提供理论分析与工具缓存API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00878 2025-12-19 cs.CL cs.AI 79%

Less is More: Resource-Efficient Low-Rank Adaptation

少即是多:资源高效的低秩适应

Chunlin Tian, Xuyang Wei, Huanrong Liu, Zhijiang Guo, Li Li

机构 * University of Macau(澳门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 EffiLoRA通过统一A矩阵和动态B矩阵更新,在多种模型中实现更高效且鲁棒的低秩适应。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15959 2025-12-19 cs.CL cs.AI 79%

BRAID: Bounded Reasoning for Autonomous Inference and Decisions

BRAID:自主推理与决策的有界推理

Armağan Amcalar, Eyup Cinar

机构 * OpenServ Labs(OpenServ实验室) Computer Engineering Department(计算机工程系) Eskisehir Osmangazi University(埃斯基谢普大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 BRAID通过结构化提示提升自主代理推理效率和成本效益

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15784 2025-12-19 cs.AI cs.LG 79%

Beyond Training: Enabling Self-Evolution of Agents with MOBIMEM

超越训练:通过MOBIMEM实现智能体的自我进化

Zibin Liu, Cheng Zhang, Xi Zhao, Yunfei Feng, Bingyu Bai, Dahu Feng, Erhu Feng, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOBIMEM通过引入内存原语和操作系统启发的服务,实现了无需模型重训练的智能体自我进化,显著提升了任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16724 2025-12-19 cs.RO cs.CV 78%

VERM: Leveraging Foundation Models to Create a Virtual Eye for Efficient 3D Robotic Manipulation

VERM:利用基础模型创建虚拟眼睛以实现高效的3D机器人操作

Yixiang Chen, Yan Huang, Keji He, Peiyan Li, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新技术实验室,多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges Shandong University(山东大学)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 VERM通过利用基础模型创建虚拟视图,提升3D机器人操作的效率和准确性,实现训练和推理速度的显著提升。

Comments Accepted at RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13324 2025-12-19 cs.AI cs.MA 77%

Towards Pervasive Distributed Agentic Generative AI -- A State of The Art

迈向普及型分布式代理生成AI——综述

Gianni Molinari, Fabio Ciravegna

机构 * University of Turin(都灵大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了智能代理和大语言模型在普及计算中的最新发展,探讨了代理部署策略、挑战及提出的‘代理作为工具’框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16019 2025-12-19 cs.RO cs.AI 77%

Few-Shot Inference of Human Perceptions of Robot Performance in Social Navigation Scenarios

少样本推理人类对机器人社交导航表现的感知

Qiping Zhang, Nathan Tsoi, Mofeed Nagib, Hao-Tien Lewis Chiang, Marynel Vázquez

机构 * Yale University(耶鲁大学) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的少样本学习能力,通过社交导航任务实验,提升机器人预测用户对其表现感知的准确性,验证了方法的可扩展性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06489 2025-12-19 cs.CL 77%

On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks

大语言模型在对抗攻击下的语言自信度鲁棒性研究

Stephen Obadinma, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Ingenuity Labs Research Institute(创新实验室研究所) Queen’s University(皇后大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在对抗攻击下的语言自信度鲁棒性,发现现有防御技术效果有限,需设计更稳健的自信表达机制。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03226 2025-12-19 cs.AI 77%

Towards Practical GraphRAG: Efficient Knowledge Graph Construction and Hybrid Retrieval at Scale

迈向实用的GraphRAG:高效的图知识库构建与大规模混合检索

Congmin Min, Sahil Bansal, Joyce Pan, Abbas Keshavarzi, Rhea Mathew, Amar Viswanathan Kannan

机构 * SAP

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种高效构建图知识库和混合检索策略的框架,通过降低成本和提升可扩展性,实现大规模检索增强生成在企业环境中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16911 2025-12-19 cs.LG cs.AI cs.RO 76%

Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning

后验行为克隆:为高效强化学习微调预训练BC策略

Andrew Wagenmaker, Perry Dong, Raymond Tsao, Chelsea Finn, Sergey Levine

机构 * UC Berkeley(伯克利大学) Stanford(斯坦福大学)

专题命中 效率与部署 :pretraining(title);分类 cs.AI、cs.LG

AI总结 本文提出后验行为克隆策略,通过建模示范者行为的后验分布来提升强化学习微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16293 2025-12-19 cs.HC 75%

Ein Typenrad auf der Überholspur: Die Kult-Schreibmaschine "Erika" trifft KI

在超车路上的打字机类型:经典打字机'Erika'遭遇AI

Karola Köpferl, Albrecht Kurze

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 通过将经典打字机与AI聊天机器人结合,探索AI的可能性与限制,揭示用户对AI的认知与担忧。

Comments in German language. 18. Internationales Symposium für Informationswissenschaft (ISI 2025), Chemnitz, Deutschland, 18-20.03.2025, S. 399-404

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12781 2025-12-19 cs.CL cs.AI 73%

A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone

一个标记值超过1000个标记:通过低秩克隆实现高效的知识蒸馏

Jitai Hao, Qiang Huang, Hao Liu, Xinyan Xiao, Zhaochun Ren, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学智能科学与工程学院) Baidu Inc.(百度公司) Leiden University(莱顿大学) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出低秩克隆方法,通过高效预训练实现小语言模型在训练效率和性能上的突破。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15787 2025-12-19 cs.CY cs.AI 70%

Toward Agentic Environments: GenAI and the Convergence of AI, Sustainability, and Human-Centric Spaces

迈向代理环境:生成式AI与AI、可持续性及以人为本空间的融合

Przemek Pospieszny, Dominika P. Brodowicz

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出代理环境概念,通过生成式AI、多代理系统和边缘计算减少技术环境影响,促进可持续发展与数据隐私。

Comments Preprint, Paper submitted for publication in Sustainable Development (Wiley)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11233 2025-12-19 cs.NI 67%

AutoRAN: Automated and Zero-Touch Open RAN Systems

AutoRAN:自动化和零触开放无线接入网络系统

Stefano Maxenti, Ravis Shirkhani, Maxime Elkael, Leonardo Bonati, Salvatore D'Oro, Tommaso Melodia, Michele Polese

专题命中 效率与部署 :LLM(abstract);language model(abstract)

AI总结 AutoRAN通过LLM驱动的意图翻译和自动化工作流,实现多供应商开放无线接入网络的零触部署与高效配置。

Comments 18 pages, 18 figures, 6 listings, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16473 2025-12-19 cs.DC 67%

Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems

高效CPU-GPU协同推理用于内存受限系统的MoE大语言模型

En-Ming Huang, Li-Shang Lin, Chun-Yi Lee

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出一种CPU-GPU协同推理框架,通过专家缓存机制减少数据传输并提升推理效率,适用于内存受限系统的MoE大语言模型。

Comments 7 pages, 6 figures, to be published in ASP-DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16814 2025-12-19 cs.CL cs.AI 62%

Grammar-Forced Translation of Natural Language to Temporal Logic using LLMs

基于语言模型的自然语言到时序逻辑的语法强制翻译

William English, Dominic Simon, Sumit Kumar Jha, Rickard Ewetz

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, Florida(电子与计算机工程系,佛罗里达大学,盖恩斯维尔,佛罗里达) Knight Foundation School of Computing and Information Sciences, Florida International University, Miami, Florida(骑士基金会计算与信息科学学院,佛罗里达国际大学,迈阿密,佛罗里达)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraFT框架,通过限制输出标记集提升自然语言到时序逻辑的翻译准确率和领域外翻译能力。

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:15370-15383, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏