arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1088 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1088 篇

2605.16336 2026-08-10 cs.CR cs.AI cs.CY 版本更新 92%

On Seeding Watermarks to Detect Verbatim LLM Copy-Paste Responses

检测作业中的直接LLM复制粘贴

Aizierjiang Aiersilan, Artin Yousefi, Robert Pless

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SteganoPrompt工具,通过在作业提示中嵌入隐形指令,使LLM在响应时生成特征签名,帮助教师检测学生直接复制粘贴模型回复的行为。

Comments We are pleased to announce that this paper has been accepted by the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026). We appreciate the valuable feedback from the reviewers and look forward to sharing our findings with the community

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07396 2026-08-06 cs.AR cs.LG 版本更新 92%

SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs

SHIELD:一种用于边缘NPUs上高效LLM推断的分段分层内存架构

Jintao Zhang, Xuanyao Fong

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SHIELD通过分段eDRAM架构优化边缘NPUs上LLM推断的能效,减少eDRAM刷新能耗35%同时保持准确性。

Comments Accepted to 2026 IEEE 8th International Conference on Artificial Intelligence Circuits and Systems (AICAS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24162 2026-07-31 cs.CR cs.AI 版本更新 92%

Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation

解除触发器:通过尾风险内在几何平滑实现的插件式防御方法用于后门LLM

Kaisheng Fan, Yishu Gao, Xunzhu Tang, Tegawendé F. Bissyandé, Weizhe Zhang

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) University of Luxembourg(卢森堡大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TIGS方法,通过在推理时进行内容感知的尾风险筛查和内在几何平滑,有效抑制后门攻击,同时保持推理稳定性和语义一致性,适用于多种架构的LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07246 2026-07-30 cs.CL 版本更新 92%

Ensembling LLM-Induced Decision Trees for Explainable and Robust Error Detection

集成LLM诱导决策树用于可解释和鲁棒的错误检测

Mengqi Wang, Jianwei Wang, Qing Liu, Xiwei Xu, Zhenchang Xing, Liming Zhu, Michael Bain, Wenjie Zhang

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Data61, CSIRO(Data61, 澳大利亚联邦科学与工业研究组织)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出集成LLM诱导决策树的方法,用于可解释和鲁棒的错误检测,通过多棵树集成提升检测准确性与鲁棒性。

Comments 15 pages, 7 figures. Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19387 2026-07-15 cs.SE cs.AI 版本更新 92%

Interpretable and Verifiable Hardware Generation with LLM-Driven Stepwise Refinement

可解释且可验证的硬件生成:基于LLM驱动的逐步细化

You Li, Samuel Mandell, David Z. Pan

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) USA(美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出结合LLM创造力与形式化方法可解释性的硬件生成框架,通过迭代应用变换规则将设计规范转换为正确性有保证的RTL程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07066 2026-07-14 cs.AI 版本更新 92%

2.5-D Decomposition for LLM-Based Spatial Construction

基于2.5-D分解的LLM空间构建

Paul Whitten, Li-Jen Chen, Sharath Baddam

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01143 2026-07-14 cs.AI 版本更新 92%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17267 2026-07-13 cs.AI stat.AP 版本更新 92%

Rectification Difficulty and Optimal Sample Allocation in LLM-Augmented Surveys

LLM增强调查中的校正难度与最优样本分配

Zikun Ye, Hema Yoganarasimhan

机构 * Michael G. Foster School of Business, University of Washington(华盛顿大学Michael G. Foster商学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究在LLM预测可用时如何分配人类样本以提高估计效率,提出校正难度分析、最优分配规则及元学习方法,通过实验证明其在不同领域和LLM上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29251 2026-07-09 cs.AI q-fin.CP 版本更新 92%

When Summaries Distort Decisions: Information Fidelity in LLM-Compressed Financial Analysis

当摘要扭曲决策:LLM压缩财务分析中的信息保真度

Hoyoung Lee, Suhwan Park, Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, CheolWon Na, Zhangyang Wang, Zach Golkhou, Minkyu Kim, Sotirios Sabanis, Alejandro Lopez-Lira, Dhagash Mehta, Soonyoung Lee, Chanyeol Choi, Wonbin Ahn, Yongjae Lee

机构 * UNIST(全纳科学技术大学) LG AI Research(LG人工智能研究) Sungkyunkwan University(成均馆大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) J.P. Morgan Chase(摩根大通) State Street(州立银行) University of Edinburgh(爱丁堡大学) University of Florida(佛罗里达大学) BlackRock(黑石) LinqAlpha

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM压缩财务信息时因丢失决策相关上下文导致投资判断改变的问题,提出通过生成多个候选压缩并审计分歧的代理上下文压缩方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11021 2026-07-08 cs.LG 版本更新 92%

Leech Lattice Vector Quantization for Efficient LLM Compression

Leech晶格向量量化用于高效的LLM压缩

Tycho F. A. van der Ouderaa, Mart van Baalen, Paul Whatmough, Markus Nagel

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Leech晶格向量量化方法,通过高维晶格结构实现高效LLM压缩,优于现有量化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09046 2026-07-03 cs.CR cs.LG cs.OS 版本更新 92%

FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

FlexServe: 一种适用于移动设备的高效且安全的LLM服务系统,具有灵活的资源隔离

Yinpeng Wu, Yitong Chen, Lixiang Wang, Jinyu Gu, Zhichao Hua, Yubin Xia

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FlexServe,一种适用于移动设备的高效且安全的LLM服务系统,通过灵活的资源隔离机制提升推理速度和安全性,采用多模型调度器优化多模型工作流,实验显示在TTFT和多模型工作流中均取得显著加速效果。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10540 2026-07-02 cs.LG 版本更新 92%

FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data

FusionFactory: 融合多LLM日志数据中的大语言模型能力

Tao Feng, Haozhen Zhang, Zijie Lei, Pengrui Han, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Meta Monetization AI(Meta 变现人工智能) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出FusionFactory框架,通过查询级、思维级和模型级融合策略,利用多LLM日志数据提升模型性能,在14个基准测试中均优于最佳单模型。

Journal ref TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08187 2026-07-01 cs.AI 版本更新 92%

Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression

利用同质性感知的结构和语义文本属性图压缩提升LLM推理能力

Zijun Di, Bin Lu, Huquan Kang, Luoyi Fu, Jiaxin Ding, Xiaoying Gan, Lei Zhou, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出HS2C框架,通过结构熵最小化进行全局层次划分以识别同质社区,并利用检测到的结构同质性指导LLM进行差异化语义聚合,在10个节点级和7个图级基准上同时提升压缩率和推理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17188 2026-07-01 cs.NI cs.AI cs.CR 版本更新 92%

LLM-Aided Joint Secrecy Precoding and Trajectory for RSMA-Based Heterogeneous UAV Networks

基于RSMA的异构无人机网络中LLM辅助的联合保密预编码与轨迹设计

Lijie Zheng, Ji He, Shih Yu Chang, Yulong Shen

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Department of Applied Data Science, San Jose State University(圣何塞州立大学应用数据科学系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对RSMA异构无人机网络中的安全通信问题,提出分层优化框架:内层用SDR-S2DC算法求解固定位置下的保密预编码,外层用LLM引导的多智能体强化学习优化轨迹,实现保密速率与能效的权衡。

Comments Submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23132 2026-06-25 cs.CR cs.AI 版本更新 92%

Verifiable Manifest Signing and Transparency Enforcement for Secure MCP-Based LLM Pipelines

可验证的清单签名与透明度强制:面向基于MCP的安全LLM流水线

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Foutse Khomh, Mohammad Hamdaqa

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院) SæT Laboratory, Polytechnique Montréal(SæT实验室,蒙特利尔理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对MCP协议缺乏工具清单认证的问题,提出清单级强制层,通过策略验证、新鲜度检查、数字签名、执行前验证和Merkle透明度日志,实现低开销、可追溯的LLM工具调用安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26557 2026-06-18 cs.CL 版本更新 92%

MemBoost: A Memory-Boosted Framework for Cost-Aware LLM Inference

MemBoost:一种面向成本感知的LLM推理的内存增强框架

Joris Köster, Zixuan Liu, Siavash Khajavi, Zizhan Zheng

机构 * University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MemBoost框架,通过轻量模型重用历史答案和检索支持信息,并选择性将困难查询路由到强模型,以降低LLM推理成本,同时保持回答质量。

Comments ICML MemFM 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02721 2026-06-17 cs.SE cs.AI cs.PL 版本更新 92%

Blueprint First, Model Second: A Framework for Deterministic LLM Workflow

蓝图优先,模型其次:确定性LLM工作流框架

Libin Qiu, Yuhang Ye, Zhirong Gao, Xide Zou, Junfu Chen, Ziming Gui, Weizhi Huang, Xiaobo Xue, Wenkai Qiu, Kun Zhao

机构 * Alibaba(阿里巴巴)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出“蓝图优先,模型其次”框架,通过将工作流逻辑解耦为源代码蓝图并由确定性引擎执行,LLM仅处理子任务,在TravelPlanner上最终通过率提升97.6%,约束违反减少96.0%。

Comments 12 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04945 2026-06-09 cs.LG 版本更新 92%

STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models

STaR-Quant:扩散大语言模型的状态-时间一致训练后量化

Xin Yan, Aqiang Wang, Zhenglin Wan, Xingrui Yu, Ivor Tsang

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局前沿人工智能研究中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 针对扩散大语言模型低比特量化中的状态相关激活差异和时间误差累积问题,提出STaR-Quant框架,通过状态引导激活变换和时间注意力补偿实现高效量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30836 2026-06-09 cs.LG math.DG 版本更新 92%

Cross-Layer Subspace Coupling for LLM Compression: A Unifying Framework and Its Empirical Limits

跨层子空间耦合用于LLM压缩:一个统一框架及其经验极限

Snigdha Chandan Khilar

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个统一框架将SVD LLM和Basis Sharing等基于SVD的压缩方法纳入同一优化问题,但实验发现跨层耦合在实用任务中失败,原因是残差流在正向传播中解耦了相邻层,因此逐层优化优于联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24189 2026-06-09 cs.CL 版本更新 92%

SPECTRA: Revealing the Full Spectrum of User Preferences via Distributional LLM Inference

SPECTRA:通过分布化LLM推理揭示用户偏好的全频谱

Luyang Zhang, Jialu Wang, Shichao Zhu, Beibei Li, Zhongcun Wang, Guangmou Pan, Yang Song

机构 * Carnegie Mellon University(卡内基梅隆大学) TikTok Inc.(TikTok公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SPECTRA方法,将微调后的LLM视为隐式概率模型,通过探测softmax层推断用户偏好的概率分布,有效恢复长尾偏好并提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07472 2026-06-08 cs.LG cs.NI 版本更新 92%

Scalable Joint Resource Allocation for SLO-Constrained LLM Inference in Heterogeneous GPU Clouds

异构GPU云中SLO约束的LLM推理的可扩展联合资源分配

Jiaming Cheng, Duong Tung Nguyen

机构 * Ira A. Fulton Schools of Engineering, Arizona State University(亚利桑那州立大学工程学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对异构GPU云中LLM推理的SLO约束,提出可扩展框架,通过约束感知启发式算法(GH和AGH)实现联合资源分配,在秒级内生成可行解并接近最优,显著降低成本和SLO违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18741 2026-08-18 cs.DC 版本更新 91%

ReMP: Low-Downtime Runtime Model-Parallelism Reconfiguration for LLM Serving

ReMP:面向LLM服务的低停机时间运行时模型并行重配置

Haipeng Yuan, Kaining Zheng, Yongshu Bai, Yuchen Zhang, Yunquan Zhang, Baodong Wu, Xiang Gao, Daning Cheng

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出ReMP框架,通过解耦拓扑与运行时状态、二维KV缓存迁移等技术,实现LLM推理服务中模型并行拓扑的在线动态调整,将重配置停机时间从分钟级降至1-7秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19606 2026-08-18 cs.PF cs.DC 版本更新 91%

RAPID-LLM: Resilience-Aware Performance analysis of Infrastructure for Distributed LLM Training and Inference

RAPID-LLM:面向分布式大语言模型训练和推理的容错性能分析框架

George Karfakis, Lime Yao, Binglu Chen, Faraz Tahmasebi, Saptarshi Mitra, Tianyue Pan, Hyoukjun Kwon, Puneet Gupta

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 RAPID-LLM通过统一性能建模框架,实现对分布式大语言模型训练和推理的容错性能分析,准确预测延迟和训练时间,并评估GPU设计变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29395 2026-08-14 cs.CV 版本更新 91%

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

NaLA: 一种用于高质量3D场景生成的原生3D LLM布局代理

Cheng Wan, Yongsen Mao, Wenzheng Wu, Yuxuan Xie, Chucheng Xiang, Runze Wang, Xiang Zhang, Zhongyuan Liu, Rushi Dai, Yuan Liu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出NaLA,一种原生3D LLM布局代理,通过直接编码3D边界和资产到LLM中,采用粗到细预测机制,解决文本-3D模态差距导致的布局不合理问题,在生成质量和推理效率上优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://adamcwan.github.io/NaLA/. Code: https://github.com/adamcwan/NaLA-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05639 2026-08-13 cs.AR 版本更新 91%

TokenStack: A Heterogeneous HBM-PIM Architecture and Runtime for Efficient LLM Inference

TokenStack:一种异构HBM-PIM架构和运行时,用于高效的LLM推理

Zhuoran Li, Zhuohang Bian, Zihao Huang, Yibo Zhao, Xueqi Li, Guangyu Sun, Youwei Zhuo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 TokenStack通过异构HBM-PIM架构优化KV缓存,提升LLM推理效率,实现1.62倍吞吐量和1.70倍服务能力提升,同时降低能耗30-47%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09321 2026-08-13 cs.CR 版本更新 91%

SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails

SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'

Zhiyi Mou, Jingyuan Yang, Zeheng Qian, Wangze Ni, Tianfang Xiao, Ning Liu, Chen Zhang, Zhan Qin, Kui Ren

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02329 2026-08-12 cs.DC 版本更新 91%

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference

驯服请求不平衡:面向解聚LLM推理的SLO感知调度

Qipeng Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对解聚LLM推理中请求长度长尾分布导致的预填阶段队头阻塞和解码阶段拖尾者利用率低的问题,提出SLO感知调度系统Kairos,通过预填侧的紧迫性优先级调度和解码侧的松弛引导自适应批处理,显著提升SLO达成率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09695 2026-07-30 cs.SE 版本更新 91%

How well LLM-based test generation techniques perform with newer LLM versions?

基于新版本LLM的测试生成技术表现如何?

Michael Konstantinou, Renzo Degiovanni, Mike Papadakis

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了基于新版本LLM的测试生成技术表现,发现纯LLM方法在覆盖率和变异评分上优于现有方法,且成本相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14516 2026-07-22 cs.DC 版本更新 91%

Efficient Multi-round LLM Inference over Disaggregated Serving

高效多轮LLM推理的解耦服务

Wenhao He, Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12198 2026-07-16 cs.IR 版本更新 91%

LLM-Based User Personas for Recommendations at Scale

基于LLM的用户画像用于大规模推荐

Haoting Wang, Haokai Lu, Zheyun Feng, Jenny Huang, Yifat Amir, Gregory Hinkson, Ben Most, Zelong Zhao, Yixin Kelly Cui, Rein Zhang, Fabio Soldo, Yu Xia, Nihar Bhupalam, Minmin Chen, Konstantina Christakopoulou, Lichan Hong, Ed H. Chi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出实时生成LLM用户兴趣画像的框架,通过知识蒸馏、异步推理和语义聚类优化,平衡利用-探索权衡,提升大规模视频推荐效果。

Comments Accepted by 2026 RecSys Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏