arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1111 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1111 篇

2605.26872 2026-06-29 cs.LG cs.AI cs.CL 版本更新 75%

The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16886 2026-06-29 cs.CL cs.AI cs.LG 版本更新 75%

ReFreeKV: Towards Threshold-Free KV Cache Compression

ReFreeKV: 迈向无阈值的KV缓存压缩

Xuanfan Ni, Liyan Xu, Chenyang Lyu, Longyue Wang, Mo Yu, Lemao Liu, Fandong Meng, Jie Zhou, Piji Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对KV缓存压缩中阈值依赖导致性能不稳定的问题,提出无阈值方法ReFreeKV,自适应调整预算分配,在13个数据集上保持全缓存性能。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17917 2026-06-25 cs.LG cs.AI cs.CL cs.CV 版本更新 75%

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding

Streaming-dLLM: 通过后缀剪枝和动态解码加速扩散大语言模型

Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo, Yong Luo, Jia Liu, Jie Xu, Han Hu

机构 * School of information(信息学院) Electronics, Beijing Institute of Technology, Beijing(电子学院,北京理工大学,北京) Department of Computer Science, City University of Hong Kong, Hong Kong(计算机科学系,香港城市大学,香港) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学,武汉) School of Economics(经济学院) Management, Communication University of China, Beijing(管理学院,中国传媒大学,北京) School of Science(科学学院) Engineering, The Chinese University of Hong Kong (Shenzhen), Shenzhen(工程学院,香港中文大学(深圳),深圳)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Streaming-dLLM,通过空间上的注意力引导后缀建模剪枝冗余掩码令牌和时间上的动态置信度感知早停策略,实现无需训练的扩散大语言模型推理加速,最高达68.2倍加速且保持生成质量。

Comments Tech report. Code is available at https://github.com/xiaoshideta/Streaming-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06952 2026-06-19 cs.CV 版本更新 75%

LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer

LaTtE-Flow: 基于层间时间步专家流的Transformer

Ying Shen, Zhiyang Xu, Jiuhai Chen, Shizhe Diao, Jiaxin Zhang, Yuguang Yao, Joy Rimchala, Ismini Lourentzou, Lifu Huang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland(马里兰大学) Nvidia(英伟达) Salesforce AI Research(Salesforce AI研究) Intuit AI Research(Intuit AI研究)

专题命中 效率与部署 :language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 提出LaTtE-Flow,一种基于预训练视觉语言模型的高效统一架构,通过层间时间步专家流和条件残差注意力机制,实现图像理解与生成,生成速度提升约6倍。

Comments Unified multimodal model, Flow-matching

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15201 2026-06-11 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems

Pass@K 策略优化:解决更困难的强化学习问题

Christian Walder, Deep Karkhanis

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 Pass-at-k 策略优化 (PKPO),通过变换奖励直接优化 pass@k 性能,利用低方差无偏估计器,在训练中退火 k 可同时提升 pass@1 和 pass@k,解决更难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06042 2026-06-08 cs.CV 版本更新 75%

LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing

LoomVideo: 统一多模态输入到视频生成与编辑

Jianzong Wu, Hao Lian, Jiongfan Yang, Dachao Hao, Ye Tian, Yunhai Tong, Jingyuan Zhu, Biaolong Chen, Qiaosong Qi, Aixi Zhang, Wanggui He, Mushui Liu, Jinlong Liu, Pipei Huang, Hao Jiang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13710 2026-08-21 cs.LG 版本更新 74%

HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models

HBVLA: 推动面向视觉-语言-动作模型的1位后训练量化

Xin Yan, Zhenglin Wan, Feiyang Ye, Xingrui Yu, Hangyu Du, Yang You, Ivor Tsang

专题命中 效率与部署 :post-training(title);分类 cs.LG

AI总结 HBVLA通过改进的二值化框架,实现对视觉-语言-动作模型的高效1位量化,保留了高精度性能,适用于资源受限的机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13756 2026-08-19 cs.LG 版本更新 74%

The Integer Alibi: Localizing Cross-Kernel Divergence in INT8-Quantized LLM Inference

整数不在场证明:定位INT8量化大语言模型推理中的跨内核差异

Teng-Ruei Chen

机构 * Krixvon(克里克斯冯公司)

专题命中 效率与部署 :LLM(title);分类 cs.LG

AI总结 该研究验证了vLLM中INT8线性内核(CUTLASS与Triton)的可互换性,定位到差异源于累加器后的缩放应用与输出舍入,提出的干预措施可恢复端到端逐位一致,还揭示了FP8 GEMM差异的不同特征并发布相关一致性检查流程。

Comments 10 pages (IEEEtran two-column), 3 figures, 4 tables. Pre-registered protocol with append-only amendments. Companion to arXiv:2608.11693. v2: corrects the product-bound attribution (weight side, not activation side; 16256 is exact) and distinguishes the layer-level uniform pow2 regime from the per-channel probe; no result changes. Figure count corrected from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13911 2026-08-14 cs.CV cs.LG 版本更新 74%

Continual Distillation Learning for Rehearsal-Free Class-Incremental Learning via Decoupled Prompting

通过解耦提示学习实现无重放类增量学习的连续蒸馏学习

Qifan Zhang, Yunhui Guo, Yu Xiang

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系 德州大学达拉斯分校)

专题命中 效率与部署 :prompting(title);分类 cs.LG

AI总结 该研究针对无重放类增量学习,提出解耦连续蒸馏学习(D-CDL),通过解耦提示与蒸馏提升跨模型知识迁移能力,在多数据集实验中优于现有蒸馏基线。

Comments Accepted at CoLLAs 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23893 2026-08-04 cs.IR cs.CL cs.CY 版本更新 74%

Who Gets Named: Citation Type Predicts Individual Naming by Grounded Language Models, and a Roster Instrument Captures 0.5% of It

谁会被提及:引用类型可预测基础语言模型的个体提及情况,而一份名册工具仅捕捉到其中的0.5%

Dmitrij Żatuchin

专题命中 效率与部署 :language model(title);分类 cs.CL

AI总结 研究在买家选人的类别中,通过API调用研究语言模型提及个体情况,发现类别主导、模型有差异,引用类型可预测提及,引用量不能,还通过名册测量个体AI可见性,发现其只覆盖模型行为的一小部分且不具代表性。

Comments 28 pages, 5 figures. Data: https://doi.org/10.5281/zenodo.21612690

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25062 2026-08-04 cs.LG 版本更新 74%

SIGMA: Semantic Identifier Grouping for Molecular Autoregression

SIGMA: 通过自回归对比学习实现的结构不变生成分子对齐用于化学语言模型

Xinyu Wang, Fei Dou, Jinbo Bi, Minghu Song

机构 * School of Computing, University of Connecticut(康涅狄格大学计算学院) Institute for Artificial Intelligence, University of Georgia(佐治亚大学人工智能研究所) Institute of Hydrobiology, Chinese Academy of Sciences(中国科学院水生生物研究所)

专题命中 效率与部署 :language model(title);分类 cs.LG

AI总结 本文提出SIGMA方法,通过自回归对比学习解决分子序列生成中的结构不一致问题,提升生成效率与结构多样性。

Comments 9 pages, 2 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05313 2026-07-14 cs.LG 版本更新 74%

Controllably Efficient Language Models

可控高效语言模型

Jatin Prakash, Aahlad Puli, Rajesh Ranganath

机构 * New York University(纽约大学)

专题命中 效率与部署 :language model(title);分类 cs.LG

AI总结 研究提出可控高效语言模型CAT,通过关注压缩序列块解码,能在训练时控制推理成本与质量的权衡,测试时无需重新训练,使用密集注意力作混合器可匹配多种高效模型,在长上下文理解任务中表现出色且吞吐量高。

Comments Preprint v2; Added more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19635 2026-07-07 cs.SD cs.AI 版本更新 74%

StarTSE: Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

面向流式目标说话人提取的分块交织拼接自回归语言模型

Shuhai Peng, Hui Lu, Jinjiang Liu, Liyang Chen, Guiping Zhong, Jiakui Li, Huimeng Wang, Haiyun Li, Liang Cao, Shiyin Kang, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

专题命中 效率与部署 :language model(title);分类 cs.AI

AI总结 本文提出一种分块交织拼接方法,用于提升流式目标说话人提取的效率与稳定性,实验表明其在低延迟下保持高性能且优于离线基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15136 2026-06-23 stat.ML cs.LG 版本更新 74%

Universal priors: solving empirical Bayes via Bayesian inference and pretraining

通用先验:通过贝叶斯推断和预训练解决经验贝叶斯问题

Nick Cannella, Anzo Teh, Yanjun Han, Yury Polyanskiy

机构 * Courant Institute of Mathematical Sciences, NYU(纽约大学Courant数学科学研究所) Center for Data Science, NYU(纽约大学数据科学中心) Department of EECS, MIT(麻省理工学院电子工程与计算机科学系)

专题命中 效率与部署 :pretraining(title);分类 cs.LG

AI总结 本文从理论上证明,在合成数据上预训练的Transformer能通过后验收缩自适应未知测试分布,实现经验贝叶斯问题的近最优遗憾界。

Comments To appear at COLT 2026. 43 pages, 5 figures. Code release at https://github.com/Anzoteh96/eb-transformers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28378 2026-06-17 cs.SD cs.AI 版本更新 74%

Membership Inference Attacks against Large Audio Language Models

针对大型音频语言的成员推断攻击

Jia-Kai Dong, Yu-Xiang Lin, Hung-Yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能卓越研究中心)

专题命中 效率与部署 :language model(title);分类 cs.AI

AI总结 首次系统评估大型音频语言模型的成员推断攻击,提出盲基线协议控制分布偏移,发现跨模态记忆仅源于说话人声纹与文本绑定。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10046 2026-06-11 cs.SD cs.AI 版本更新 74%

Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models

潜流内部:音频分离基础模型中注意力动力学的因果解读

Yuxuan Chen, Haoyuan Yu, Peize He

机构 * Jilin University(吉林大学) Hunan University(湖南大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 效率与部署 :foundation model(title);分类 cs.AI

AI总结 本文通过因果干预协议揭示流匹配Transformer在音频分离中的双路径注意力机制,并提出无训练加速方法LSAC,在保持质量的同时减少约25%自注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02530 2026-08-24 cs.AI cs.CL 版本更新 73%

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04786 2026-08-24 cs.LG cs.AI 版本更新 73%

AgentOCR: Reimagining Agent History via Optical Self-Compression

AgentOCR: 通过光学自压缩重新想象代理历史

Lang Feng, Fuchao Yang, Feng Chen, Xin Cheng, Haiyang Xu, Zhenglin Wan, Ming Yan, Bo An

机构 * NTU(国立科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AgentOCR通过光学自压缩技术,将代理历史转换为紧凑图像,从而在保持性能的同时显著减少token消耗和内存使用。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00894 2026-08-24 cs.LG cs.CL 版本更新 73%

When to Ponder: Adaptive Compute Allocation for Code Generation via Test-Time Training

何时思考:通过测试时间训练实现的自适应计算分配

Gihyeon Sim

机构 * Dongpae High School, Paju, Gyeonggi-do, Republic of Korea(京畿道帕久郡东垈高中)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过测试时间训练实现自适应计算分配,利用自监督重建损失选择性更新,提升代码语言建模性能

Comments 14 pages, 1 figure, 14 tables, code available at this https URL (https://github.com/deveworld/ponderTTT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18521 2026-08-21 cs.AI cs.LG 版本更新 73%

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔

Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoying Tang

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-20 cs.LG cs.AI cs.HC 版本更新 73%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-08-19 cs.SE cs.AI cs.CR cs.IR cs.LG 版本更新 73%

From Adoption to Deployment: A Qualitative Study on AI Integration in Software Development Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12276 2026-08-18 cs.AI cs.CL 版本更新 73%

Agentic Test-Time Scaling for WebAgents

代理测试时缩放 for WebAgents

Nicholas Lee, Lutfi Eren Erdogan, Chris Joseph John, Surya Krishnapillai, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 CATTS 通过动态分配计算资源提升代理在 WebArena-Lite 和 GoBrowse 的性能,比 React 提高 9.1%,且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06564 2026-08-14 cs.LG cs.CL 版本更新 73%

Which Decisions Low-Bit Quantization Breaks, and How to Predict Them

量化损伤是乘法性的,而非加法性的

Zekun Wu, Swati Dhiman, Adriano Koshiyama

机构 * Holistic AI(霍利斯提克人工智能公司) University College London(伦敦大学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现大型语言模型的量化损伤是乘法性的,而非加法性的,提出边际收缩概念,拟合关系可准确预测决策翻转率,增加1位是修复损伤最廉价的方式。

Comments 18 pages, 9 figures, 8 tables. Under review at the Third Workshop on Uncertainty-Aware NLP (UncertaiNLP), EMNLP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27431 2026-08-14 cs.LG cs.AI 版本更新 73%

SE(3)-MeanFlow: Few-Step Protein Backbone Generation on Lie Groups

SE(3)-MeanFlow:李群上的少步蛋白质主链生成

Yikun Bai, Binghang Lu, Yikai Liu, Elaheh Akbari, Soheil Kolouri, Linxuan Wang, Ping He, Shuchan Wang, Ruqi Zhang, Guang Lin

机构 * Purdue University(普渡大学) Vanderbilt University(范德堡大学) Freie Universität Berlin(柏林自由大学)

专题命中 效率与部署 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 SE(3)-MeanFlow将MeanFlow扩展到李群几何,通过新训练目标实现少步蛋白质主链生成,性能优于多倍采样的流匹配基线,适配高通量设计需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05678 2026-08-14 cs.CL cs.AI 版本更新 73%

Gradual Code-Switching as Inference-Time Cross-Lingual Representational Alignment for LLMs

渐进式代码切换作为大语言模型推理时的跨语言表征对齐

Haneul Yoo, Jiho Jin, Kyunghyun Cho, Alice Oh

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型跨语言性能不均衡问题,提出推理时的代码切换上下文学习机制,经多模型、多语言、多数据集验证,可显著提升目标及未见语言任务性能,尤其在低资源场景表现突出。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20244 2026-08-11 cs.CL cs.AI 版本更新 73%

Hybrid Policy Distillation for LLMs

混合策略蒸馏用于大语言模型

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

机构 * Department of Computer Science(计算机科学系) Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05164 2026-08-11 cs.LG cs.AI 版本更新 73%

Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents

并非所有转折都同样困难:为高效多轮推理的自适应思维预算

Neharika Jali, Anupam Nayak, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01900 2026-08-11 cs.CL cs.LG 版本更新 73%

High-Layer Attention Pruning with Rescaling

高层注意力剪枝与重缩放

Songtao Liu, Peng Liu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种高层注意力剪枝与重缩放方法,通过自适应重缩放参数优化表示尺度,提升LLMs在生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19366 2026-08-11 cs.CL cs.LG 版本更新 73%

MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs

MoE-Prism:通过模型-系统协同设计解耦整体式专家以实现弹性MoE服务

Xinfeng Xia, Xiaofeng Hou, Jiacheng Liu, Wenfeng Wang, Mingxuan Zhang, Peng Tang, Chao Li, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MoE-Prism通过模型-系统协同设计将MoE的整体专家分解为细粒度子专家,实现请求级计算弹性,扩展路由工作点数量,提升吞吐量并降低首包时间,验证了实用弹性MoE服务的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏