arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-10 至 2025-12-10 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4 篇

2510.16809 2025-12-10 cs.SE cs.AI cs.CL cs.PL 90%

When Many-Shot Prompting Fails: An Empirical Study of LLM Code Translation

当多示例提示失效:对LLM代码翻译的实证研究

Amirkia Rafiei Oskooei, Kaan Baturalp Cosdan, Husamettin Isiktas, Mehmet S. Aktas

机构 * Yildiz Technical University, Department of Computer Engineering(Yildiz技术大学计算机工程系)

专题命中 长上下文与记忆 :prompting(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究发现代码翻译中少量精心挑选的示例比大量示例更有效,挑战了ICL中'更多更好'的普遍假设。

Comments Accepted to ICSE 2026 (RECODE workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08242 2025-12-10 cs.DC cs.AR 85%

Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency

Chopper:一个多级GPU特性工具及对LLM训练低效性的衍生见解

Marco Kurzynski, Shaizeen Aga, Di Wu

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Chopper通过多级GPU特性分析揭示LLM训练低效原因,发现频率开销是性能差距的主要因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07850 2025-12-10 cs.LG cs.AI 81%

SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents

SABER: 小动作,大误差 -- 保护LLM代理中的突变步骤

Alejandro Cuadron, Pengfei Yu, Yang Liu, Arpit Gupta

机构 * Amazon AGI Foundations(亚马逊人工智能基础研究)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 SABER通过分析LLM代理中的突变步骤,提出针对性保护措施,提升长周期任务的稳定性。

Comments submitted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08143 2025-12-10 cs.CL cs.AI 79%

Compactor: Calibrated Query-Agnostic KV Cache Compression with Approximate Leverage Scores

Compactor: 基于近似杠杆分数的校准查询无关KV缓存压缩

Vivek Chari, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Compactor通过近似杠杆分数实现查询无关的KV缓存压缩,减少内存占用并提升性能,适用于多种语言模型部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏