arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 195 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 38 篇

2506.04133 2025-12-19 cs.AI 85%

TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems

TRiSM 用于代理 AI:对基于 LLM 的代理多代理系统中信任、风险和安全管理的综述

Shaina Raza, Ranjan Sapkota, Manoj Karkee, Christos Emmanouilidis

机构 * Vector Institute, Toronto, Canada(向量研究所) Cornell University, USA(康奈尔大学) University of Groningen, Netherlands(格罗宁根大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了基于 LLM 的代理多代理系统中信任、风险和安全管理的框架与方法,提出新的评估指标并探讨了安全与隐私增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16317 2025-12-19 cs.AI 85%

Design and Evaluation of Cost-Aware PoQ for Decentralized LLM Inference

去中心化大语言模型推理的成本感知PoQ设计与评估

Arther Tian, Alex Ding, Frank Chen, Alan Wu, Aaron Chan, Bruce Zhang

机构 * DGrid AI

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种成本感知的PoQ框架,通过整合效率测量和统一评估流程,提升去中心化LLM推理的经济可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16134 2025-12-19 cs.DC cs.LG 85%

Staggered Batch Scheduling: Co-optimizing Time-to-First-Token and Throughput for High-Efficiency LLM Inference

交错批次调度:协同优化时间到第一个令牌和吞吐量以实现高效的大语言模型推理

Jian Tian, Shuailong Li, Yang Cao, Wenbo Cui, Minghan Zhu, Wenkang Wu, Jianming Zhang, Yanpeng Wang, Zhiwen Xiao, Zhenyu Hou, Dou Shen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出交错批次调度方法,通过缓冲请求优化执行批次,降低TTFT并提升吞吐量,应用于高效大语言模型推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16391 2025-12-19 cs.LG cs.AI cs.DC 81%

Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference

Kascade:一种适用于长上下文LLM推理的实用稀疏注意力方法

Dhruv Deshmukh, Saurabh Goyal, Nipun Kwatra, Ramachandran Ramjee

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 Kascade是一种无需训练的稀疏注意力方法,通过锚定层计算Top-k索引并重用,实现长上下文LLM推理中的高效注意力处理。

Comments 11 pages, 8 figures, 3 tables and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16112 2025-12-19 cs.AR cs.AI cs.CL cs.DC 81%

HPU: High-Bandwidth Processing Unit for Scalable, Cost-effective LLM Inference via GPU Co-processing

HPU:通过GPU协同处理实现可扩展且经济高效的LLM推理的高带宽处理单元

Myunghyun Rhee, Joonseop Sim, Taeyoung Ahn, Seungyong Lee, Daegun Yoon, Euiseok Kim, Kyoung Park, Youngpyo Joo, Hoshik Kim

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HPU,通过GPU协同处理实现大规模LLM推理的高带宽处理单元,提升性能和能效

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16822 2025-12-19 cs.LG 79%

MEPIC: Memory Efficient Position Independent Caching for LLM Serving

MEPIC:内存高效的无位置依赖缓存用于大语言模型服务

Qian Wang, Zahra Yousefijamarani, Morgan Lindsay Heisler, Rongzhi Gu, Bai Xiaolong, Shan Yizhou, Wei Zhang, Wang Lan, Ying Xiong, Yong Zhang, Zhenan Fan

机构 * Huawei Technologies Canada Co., Ltd.(华为技术加拿大有限公司) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 MEPIC通过内存高效的无位置依赖缓存技术,实现跨请求和批次的片段KV重用,显著减少HBM使用量,提升大语言模型服务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15834 2025-12-19 cs.PL cs.AI cs.DC cs.PF cs.SE 79%

Optimizing Agentic Language Model Inference via Speculative Tool Calls

通过推测性工具调用优化代理语言模型推理

Daniel Nichols, Prajwal Singhania, Charles Jekel, Abhinav Bhatele, Harshitha Menon

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文通过推测性工具调用优化代理语言模型推理,提升推理吞吐量并提供理论分析与工具缓存API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00878 2025-12-19 cs.CL cs.AI 79%

Less is More: Resource-Efficient Low-Rank Adaptation

少即是多:资源高效的低秩适应

Chunlin Tian, Xuyang Wei, Huanrong Liu, Zhijiang Guo, Li Li

机构 * University of Macau(澳门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 EffiLoRA通过统一A矩阵和动态B矩阵更新,在多种模型中实现更高效且鲁棒的低秩适应。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15959 2025-12-19 cs.CL cs.AI 79%

BRAID: Bounded Reasoning for Autonomous Inference and Decisions

BRAID:自主推理与决策的有界推理

Armağan Amcalar, Eyup Cinar

机构 * OpenServ Labs(OpenServ实验室) Computer Engineering Department(计算机工程系) Eskisehir Osmangazi University(埃斯基谢普大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 BRAID通过结构化提示提升自主代理推理效率和成本效益

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15784 2025-12-19 cs.AI cs.LG 79%

Beyond Training: Enabling Self-Evolution of Agents with MOBIMEM

超越训练:通过MOBIMEM实现智能体的自我进化

Zibin Liu, Cheng Zhang, Xi Zhao, Yunfei Feng, Bingyu Bai, Dahu Feng, Erhu Feng, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOBIMEM通过引入内存原语和操作系统启发的服务,实现了无需模型重训练的智能体自我进化,显著提升了任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16724 2025-12-19 cs.RO cs.CV 78%

VERM: Leveraging Foundation Models to Create a Virtual Eye for Efficient 3D Robotic Manipulation

VERM:利用基础模型创建虚拟眼睛以实现高效的3D机器人操作

Yixiang Chen, Yan Huang, Keji He, Peiyan Li, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新技术实验室,多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges Shandong University(山东大学)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 VERM通过利用基础模型创建虚拟视图,提升3D机器人操作的效率和准确性,实现训练和推理速度的显著提升。

Comments Accepted at RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13324 2025-12-19 cs.AI cs.MA 77%

Towards Pervasive Distributed Agentic Generative AI -- A State of The Art

迈向普及型分布式代理生成AI——综述

Gianni Molinari, Fabio Ciravegna

机构 * University of Turin(都灵大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了智能代理和大语言模型在普及计算中的最新发展,探讨了代理部署策略、挑战及提出的‘代理作为工具’框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16019 2025-12-19 cs.RO cs.AI 77%

Few-Shot Inference of Human Perceptions of Robot Performance in Social Navigation Scenarios

少样本推理人类对机器人社交导航表现的感知

Qiping Zhang, Nathan Tsoi, Mofeed Nagib, Hao-Tien Lewis Chiang, Marynel Vázquez

机构 * Yale University(耶鲁大学) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的少样本学习能力,通过社交导航任务实验,提升机器人预测用户对其表现感知的准确性,验证了方法的可扩展性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06489 2025-12-19 cs.CL 77%

On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks

大语言模型在对抗攻击下的语言自信度鲁棒性研究

Stephen Obadinma, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Ingenuity Labs Research Institute(创新实验室研究所) Queen’s University(皇后大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在对抗攻击下的语言自信度鲁棒性,发现现有防御技术效果有限,需设计更稳健的自信表达机制。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03226 2025-12-19 cs.AI 77%

Towards Practical GraphRAG: Efficient Knowledge Graph Construction and Hybrid Retrieval at Scale

迈向实用的GraphRAG:高效的图知识库构建与大规模混合检索

Congmin Min, Sahil Bansal, Joyce Pan, Abbas Keshavarzi, Rhea Mathew, Amar Viswanathan Kannan

机构 * SAP

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种高效构建图知识库和混合检索策略的框架,通过降低成本和提升可扩展性,实现大规模检索增强生成在企业环境中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16911 2025-12-19 cs.LG cs.AI cs.RO 76%

Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning

后验行为克隆:为高效强化学习微调预训练BC策略

Andrew Wagenmaker, Perry Dong, Raymond Tsao, Chelsea Finn, Sergey Levine

机构 * UC Berkeley(伯克利大学) Stanford(斯坦福大学)

专题命中 效率与部署 :pretraining(title);分类 cs.AI、cs.LG

AI总结 本文提出后验行为克隆策略,通过建模示范者行为的后验分布来提升强化学习微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16293 2025-12-19 cs.HC 75%

Ein Typenrad auf der Überholspur: Die Kult-Schreibmaschine "Erika" trifft KI

在超车路上的打字机类型:经典打字机'Erika'遭遇AI

Karola Köpferl, Albrecht Kurze

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 通过将经典打字机与AI聊天机器人结合,探索AI的可能性与限制,揭示用户对AI的认知与担忧。

Comments in German language. 18. Internationales Symposium für Informationswissenschaft (ISI 2025), Chemnitz, Deutschland, 18-20.03.2025, S. 399-404

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12781 2025-12-19 cs.CL cs.AI 73%

A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone

一个标记值超过1000个标记:通过低秩克隆实现高效的知识蒸馏

Jitai Hao, Qiang Huang, Hao Liu, Xinyan Xiao, Zhaochun Ren, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学智能科学与工程学院) Baidu Inc.(百度公司) Leiden University(莱顿大学) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出低秩克隆方法,通过高效预训练实现小语言模型在训练效率和性能上的突破。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15787 2025-12-19 cs.CY cs.AI 70%

Toward Agentic Environments: GenAI and the Convergence of AI, Sustainability, and Human-Centric Spaces

迈向代理环境:生成式AI与AI、可持续性及以人为本空间的融合

Przemek Pospieszny, Dominika P. Brodowicz

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出代理环境概念,通过生成式AI、多代理系统和边缘计算减少技术环境影响,促进可持续发展与数据隐私。

Comments Preprint, Paper submitted for publication in Sustainable Development (Wiley)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11233 2025-12-19 cs.NI 67%

AutoRAN: Automated and Zero-Touch Open RAN Systems

AutoRAN:自动化和零触开放无线接入网络系统

Stefano Maxenti, Ravis Shirkhani, Maxime Elkael, Leonardo Bonati, Salvatore D'Oro, Tommaso Melodia, Michele Polese

专题命中 效率与部署 :LLM(abstract);language model(abstract)

AI总结 AutoRAN通过LLM驱动的意图翻译和自动化工作流,实现多供应商开放无线接入网络的零触部署与高效配置。

Comments 18 pages, 18 figures, 6 listings, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16473 2025-12-19 cs.DC 67%

Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems

高效CPU-GPU协同推理用于内存受限系统的MoE大语言模型

En-Ming Huang, Li-Shang Lin, Chun-Yi Lee

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出一种CPU-GPU协同推理框架,通过专家缓存机制减少数据传输并提升推理效率,适用于内存受限系统的MoE大语言模型。

Comments 7 pages, 6 figures, to be published in ASP-DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16814 2025-12-19 cs.CL cs.AI 62%

Grammar-Forced Translation of Natural Language to Temporal Logic using LLMs

基于语言模型的自然语言到时序逻辑的语法强制翻译

William English, Dominic Simon, Sumit Kumar Jha, Rickard Ewetz

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, Florida(电子与计算机工程系,佛罗里达大学,盖恩斯维尔,佛罗里达) Knight Foundation School of Computing and Information Sciences, Florida International University, Miami, Florida(骑士基金会计算与信息科学学院,佛罗里达国际大学,迈阿密,佛罗里达)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraFT框架,通过限制输出标记集提升自然语言到时序逻辑的翻译准确率和领域外翻译能力。

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:15370-15383, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16824 2025-12-19 cs.LG math.DS 57%

Tiny Recursive Control: Iterative Reasoning for Efficient Optimal Control

Tiny Recursive Control: 迭代推理用于高效的最优控制

Amit Jain, Richard Linares

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 TRC通过递归推理实现高效最优控制,在非线性控制问题中达到接近最优性能,且内存和计算需求显著低于语言模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16700 2025-12-19 cs.LG 57%

CLARiTy: A Vision Transformer for Multi-Label Classification and Weakly-Supervised Localization of Chest X-ray Pathologies

CLARiTy:用于多标签分类和胸片病理弱监督定位的视觉变换器

John M. Statheros, Hairong Wang, Richard Klein

机构 * School of Computer Science and Applied Mathematics, University of the Witwatersrand(计算机科学与应用数学系,沃尔特·斯通大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 CLARiTy是一种基于视觉变换器的模型,用于胸片多标签分类和弱监督定位,通过类特定标记和SegmentCAM模块实现高精度和效率。

Comments 23 pages, 11 figures, submitted to Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07503 2025-12-19 cs.CR cs.AI 57%

Biologically-Informed Hybrid Membership Inference Attacks on Generative Genomic Models

生物启发的混合成员推理攻击用于生成基因组模型

Asia Belfiore, Jonathan Passerat-Palmbach, Dmitrii Usynin

机构 * Asia Belfiore(第1机构) Dmitrii Usynin(第2机构)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种结合生物信息学指标的混合成员推理攻击方法,用于评估生成式基因组模型的隐私保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15980 2025-12-19 cs.SE cs.AI 57%

Embedding Software Intent: Lightweight Java Module Recovery

嵌入软件意图:轻量级Java模块恢复

Yirui He, Yuqi Huai, Xingyu Chen, Joshua Garcia

机构 * Department of Informatics, University of California, Irvine(信息学院,加州大学伊文斯顿分校)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文提出ClassLAR方法,通过类和语言模型恢复Java模块,提升架构恢复效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16905 2025-12-19 cs.CV 50%

Alchemist: Unlocking Efficiency in Text-to-Image Model Training via Meta-Gradient Data Selection

Alchemist: 通过元梯度数据选择提升文本到图像模型训练效率

Kaixin Ding, Yang Zhou, Xi Chen, Miao Yang, Jiarong Ou, Rui Chen, Xin Tao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 效率与部署 :LLM(abstract)

AI总结 Alchemist通过元梯度数据选择提升文本到图像模型训练效率,实现高效的数据筛选和模型性能提升。

Comments project page: https://kxding.github.io/project/Alchemist/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00498 2025-12-19 cond-mat.mtrl-sci 50%

"One defect, one potential" strategy for accurate machine learning prediction of defect phonons

每个缺陷一个潜力

Junjie Zhou, Xinpeng Li, Menglin Huang, Shiyou Chen

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出“每个缺陷一个潜力”策略,通过训练有限超胞的MLIP模型,实现高精度缺陷声子计算,显著降低计算成本。

Journal ref Phys. Rev. B 112, 235205 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16077 2025-12-19 cs.CV 50%

Auto-Vocabulary 3D Object Detection

自动词汇3D目标检测

Haomeng Zhang, Kuan-Chuan Peng, Suhas Lohit, Raymond A. Yeh

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 效率与部署 :language model(abstract)

AI总结 AV3DOD通过自动生成类别名称,实现了无需用户输入的开放词汇3D目标检测,取得SOTA性能。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15971 2025-12-19 cs.CV 50%

From Words to Wavelengths: VLMs for Few-Shot Multispectral Object Detection

从词语到波长:用于少样本多光谱目标检测的视觉语言模型

Manuel Nkegoum, Minh-Tan Pham, Élisa Fromont, Bruno Avignon, Sébastien Lefèvre

机构 * Univ Bretagne Sud, IRISA, UMR 6074(布列塔尼大学,IRISA,UMR 6074) Univ Rennes, IRISA, UMR 6074(里尔大学,IRISA,UMR 6074) ATERMES UiT The Arctic University of Norway(北欧大学)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出利用视觉语言模型进行少样本多光谱目标检测,通过整合文本、视觉和热模态,在数据稀缺情况下实现高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏