arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 151 篇

2606.01756 2026-06-02 cs.CV 78%

EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models

EvoCut:面向高效大型视觉语言模型的多层演化感知视觉标记压缩

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Pengfei Zhang, Yao Hu, Jiawei Li, Shikai Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Xiaohongshu(小红书) Fudan University(复旦大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 提出一种无需训练和注意力的视觉标记压缩方法EvoCut,通过分析多层演化偏差估计标记重要性,在LLaVA-1.5-7B上仅保留11.1%的视觉标记即可保持94.4%的平均性能。

Comments Preprint. 12 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01850 2026-06-02 cs.AI 77%

Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction

压缩是否保留不确定性?基于共形预测的量化和稀疏大语言模型统一基准

Yujia Tong, Yuxi Wang, Yunyang Wan, Tian Zhang, Junhao Dong, Jingling Yuan

机构 * Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过共形预测方法,在五个NLP任务上对12种不同压缩配置的大语言模型进行基准测试,发现压缩经常解耦准确率与不确定性,大模型更能吸收压缩引起的不确定性,且不确定性膨胀常呈阈值状而非渐进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00971 2026-06-02 cs.CL 77%

HypothesisMed: Inference-Time Answer Fusion and Structured Hypothesis-Space Reporting for Biomedical Question Answering

HypothesisMed:生物医学问答中的推理时答案融合与结构化假设空间报告

Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系雷士打理工学院) Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系雷士打理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出HypothesisMed推理时可靠性流水线,通过答案融合和SPACE标签(有效/不完整/矛盾)提升生物医学多项选择问答的准确率、可解析性和结构化可靠性报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00535 2026-06-02 cs.LG 77%

DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation

DREAM-S: 基于可搜索草稿与目标感知精炼的推测解码用于多模态生成

Zining Liu, Yunhai Hu, Tianhua Xia, Bo Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang

机构 * New York University(纽约大学) Cerebras Systems Inc.(Cerebras Systems公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出DREAM-S框架,通过神经架构搜索和目标感知超网训练自动优化草稿模型架构与交互策略,结合注意力熵引导的自适应中间特征蒸馏,实现视觉语言模型的高效推测解码,加速比达3.85倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00320 2026-06-02 cs.LG 77%

Adversarially Robust Control of Conditional Value-at-Risk via Rockafellar-Uryasev Conformal Inference

通过Rockafellar-Uryasev共形推断的条件风险价值对抗鲁棒控制

Catherine Chen, Jingyan Shen, Zhun Deng, Lihua Lei

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种在线无分布框架,通过结合共形尾风险控制、在线学习和CVaR的变分表示,在非平稳和对抗环境下实现对条件风险价值(CVaR)的鲁棒控制,并提供渐近保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00138 2026-06-02 cs.AI 77%

A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems

面向固体力学问题的端到端有限元分析的多AI智能体框架

Titu Ranjan Sarker, Muhammed Jawaad Zulqernine, Ling Yue, Shaowu Pan, Chenxi Wang, Shiyao Lin

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) Institute for Predictive Performance Methodologies(预测性能方法研究所) Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于大语言模型的多智能体框架AbaqusAgent,将自然语言指令转化为Abaqus有限元分析及结果可视化,在50个固体力学问题上实现86%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10688 2026-06-02 cs.LG cs.AI cs.CL 75%

SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting

SCOPE: 信号校准的在线策略蒸馏增强与双路径自适应加权

Binbin Zheng, Xing Ma, Yiheng Liang, Jingqing Ruan, Xiaoliang Fu, Kepeng Lin, Benchang Zhu, Ke Zeng, Xunliang Cai

机构 * University of Science and Technology of China(中国科学技术大学) Meituan LongCat Interaction Team(美团 LongCat 交互团队) Nanjing University(南京大学) Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对在线策略强化学习中奖励稀疏导致的信用分配难题,提出SCOPE框架,通过双路径自适应加权机制分别处理正确与错误轨迹,实现信号校准的蒸馏增强,在六个推理基准上平均提升11.42%的Avg@32和7.30%的Pass@32。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18016 2026-06-02 cs.CL cs.AI cs.DC cs.LG 75%

MineDraft: A Framework for Batch Parallel Speculative Decoding

MineDraft: 批量并行推测解码框架

Zhenwei Tang, Arun Verma, Zijian Zhou, Zhaoxuan Wu, Alok Prakash, Daniela Rus, Bryan Kian Hsiang Low

机构 * Massachusetts Institute of Technology(麻省理工学院) Toyota Research Institute(丰田研究院) Toyota Motor Corporation(丰田公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MineDraft框架,通过批量并行设计将草稿生成与验证阶段重叠,显著提升推测解码的吞吐量和端到端延迟。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02211 2026-06-02 cs.CL cs.AI 73%

Consistency Training while Mitigating Obfuscation via Rate Matching

通过速率匹配缓解混淆的一致性训练

Sohaib Imran, Prakhar Gupta, Jannes Elstner, David Demitri Africa

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出速率匹配一致性训练(RMCT),通过匹配目标行为率而非约束表达方式,在减少模型受无关特征影响的同时避免混淆,提升可监控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01666 2026-06-02 cs.LG cs.AI 73%

DOT-MoE: Differentiable Optimal Transport for MoEfication

DOT-MoE:用于MoE化的可微最优传输

Udbhav Bamba, Arnav Chavan, Aryamaan Thakur, Steve Teig, Deepak Gupta

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DOT-MoE框架,通过可微最优传输将密集层分解为专家,联合学习神经元分配和路由策略,在减少50%活跃参数的同时保留90%原始性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00755 2026-06-02 cs.CL cs.LG 73%

Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning

内化温度:面向强化学习的同策略自蒸馏作为策略加热器

Xuewei Yang, Jiachen Yu, Jie Wu, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出温度缩放同策略自蒸馏(TS-OPSD),通过将温度探索效应内化到模型参数中,缓解强化学习中的熵崩溃问题,无需外部教师或额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00189 2026-06-02 cs.LG cs.AI 73%

Learning to Construct Practical Agentic Systems

学习构建实用的智能体系统

Aditya Kumar, Zhihan Lei, Jerry Yan, Joshua W. Momo, Lauhitya Reddy, Rafael Enrique Cabrera Jimenez, Cassandra A. Cohen, Arthur Kajiyama, William W. Cohen

机构 * Carnegie Mellon University(卡内基梅隆大学) Dept. of Computer Science(计算机科学系) Emory University(埃默里大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种基于伪工具和固定工作流的智能体框架,通过模块化设计和多目标优化方法,在保证成本可控和结果质量的前提下,实现实用智能体系统的自动构建与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26684 2026-06-02 cs.LG cs.AI 73%

Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning

超越轨迹级归因:基于图的智能体强化学习信用分配

Xin Cheng, Shuo He, Lang Feng, HaiYang Xu, Ming Yan, Lei Feng, Bo An

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出GraphGPO方法,通过构建状态转移图并利用全局信息估计各状态到任务目标的距离,实现步骤级信用分配,提升训练效率和性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17109 2026-06-02 cs.LG cs.AI 73%

DynMuon: A Dynamic Spectral Shaping View of Muon

DynMuon: 缪子的动态谱整形视角

Fangzhou Wu, Rikhav Shah, Sandeep Silwal, Qiuyi Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT(麻省理工学院) Elorian AI

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DynMuon方法,通过动态调整谱整形参数p(从正到负),在训练过程中平衡高曲率与低曲率方向,从而加速收敛并降低验证损失。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12652 2026-06-02 cs.LG cs.AI 73%

Multi-Rollout On-Policy Distillation via Peer Successes and Failures

基于同伴成功与失败的多轨迹在线策略蒸馏

Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu, Ruowang Zhang, Haixin Wang, Yinyi Luo, Chen Henry Wu, Gaurav Mittal, Matt Fredrikson, Yu Hu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Purdue University(普渡大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出多轨迹在线策略蒸馏(MOPD),利用学生模型的本地轨迹组构造更丰富的教师信号,通过同伴成功与失败条件化提升蒸馏效果。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06065 2026-06-02 stat.ML cond-mat.dis-nn cs.CL cs.LG 73%

Deep networks learn to parse uniform-depth context-free languages from local statistics

深度网络从局部统计中学习解析均匀深度的上下文无关语言

Jack T. Parley, Francesco Cagnetta, Matthieu Wyart

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过引入可调类概率上下文无关文法并设计基于深度卷积网络的推理算法,揭示了语言结构从局部统计中涌现的机制,并验证了深度卷积和Transformer架构的预测。

Comments Accepted as regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05387 2026-06-02 cs.CL cs.AI 73%

Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs

推进解码策略:局部典型采样在大型语言模型中的增强

Jaydip Sen, Saptarshi Sengupta, Subhasis Dasgupta

机构 * Praxis Business School(普拉克斯商业学校) San Jose State University(旧金山州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出自适应语义感知典型性采样(ASTS)改进局部典型采样算法,通过动态熵阈值、多目标评分和奖惩调整,在保持计算效率的同时提升文本生成的流畅性、多样性和连贯性。

Comments This is the accepted but pre-reviewed version of the chapter that has been accepted for publication in the Springer volume 'Decision-Making in Computational Intelligence-Based Systems,' edited by Witold Pedrycz, Gilberto Rivera, Rose Ma Rodriguez, and Salvador Ibarra Martinez. The chapter is 39 pages long, and it contains 2 figures and 6 tables. This is NOT the final camera-ready version

Journal ref Recent Advances in Artificial Neural Networks. Intelligent Systems Reference Library, vol 283. Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02375 2026-06-02 cs.CL cs.CY cs.HC 70%

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

WAXAL-NET: 针对19种非洲语言的微调边缘ASR

Victor Tolulope Olufemi, Oreoluwa Babatunde, Ramsey Njema, Bolarinwa Gbotemi, Wanchi Lucia Yen, John Uzodinma, Sunday Ajayi, Oluwademilade Williams, Kausar Moshood, Innocent Elendu Anyaele, Akebert Arefaine, Candace Hunzwi, Wongel Dawit Daniel, Emmilly Namuganga, Cleophas Kadima, Athanase Bahizire, Onitsiky Ranaivoson, Emmanuel Aaron, Nicholaus Ladislaus, Idris Muhammed, Jonathan Enoch Simenya, Martin Koome, Matewos Tegete Endaylalu, Peter Ifeoluwa Adeyemo, Hondi Prisca Birindwa, Ukachi Agnes Eze-Mbey, Yacoba Oduro-Yeboah, Pericles Adjovi, Mikel K. Ngueajio, Toluwani Aremu, Prasenjit Mitra

机构 * CMU Africa(CMU非洲中心) LyngualLabs MBZUAI

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究评估了紧凑型领域专用ASR模型在WAXAL语料库的19种非洲语言会话语音上是否优于大规模多语言基础模型,通过微调边缘模型实现了宏平均WER从64.9%降至38.0%,模型大小缩小3-40倍,证实领域专业化主导规模效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02204 2026-06-02 cs.CL 70%

Cross-Environment Neural Reranking for Sample-Efficient Action Selection in Text-Based Agents

跨环境神经重排序用于文本智能体中样本高效的动作选择

Kan Shao

机构 * Jinglue Technology Development (Nanjing) Co., Ltd.(江苏 Jinglue 技术发展(南京)有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过联合训练轻量级神经重排序器(DeBERTa-v3)在多个文本环境(ALFWorld、WebShop、ScienceWorld)中实现样本高效的动作选择,发现重平衡联合训练显著提升性能,跨环境适应仅需9.2%目标域数据即可恢复93%全数据性能,数据多样性是主要驱动力。

Comments 11 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01839 2026-06-02 cs.DC cs.AR cs.LG 70%

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

观察而非预测:面向智能体服务的对话级解耦调度

Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出将调度单元从单轮提升至整个对话,利用对话中首轮计算密集与后续内存密集的两阶段可观察特性,实现无需预测的解耦调度,显著降低延迟并提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01282 2026-06-02 cs.CV cs.CY cs.LG 70%

KG-FairDiff: Knowledge Graph-Guided Prompt Refinement for Demographically Fair Text-to-Image Generation

KG-FairDiff: 知识图谱引导的提示词精炼用于人口统计公平的文本到图像生成

Farbod Davoodi, Seyed Reza Tavakoli Shiyadeh, Pooria Safaei, Sana Harighi, Parsa Gholami, Amirali Amini, Kimia Vanaei, Emad Firoozi, Parham Abed Azad, Babak Khalaj, Siavash Ahmadi, Amir Hossein Payberah, Mohammad Hossein Rohban, Soheil Kolouri, Ali Diba

机构 * University of Science and Technology of China(中国科学技术大学) Sharif University of Technology(谢赫·伊斯兰大学) Iran University of Science and Technology(伊朗科学技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出KG-FairDiff框架,通过知识图谱引导的提示词精炼,在推理时优化公平性损失,减少文本到图像生成中的性别、种族、年龄等人口统计偏差,同时保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00746 2026-06-02 cs.CV cs.LG 70%

Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

将并行序列模型扩展到基础规模的视觉编码器

Yitong Jiang, Hongjun Wang, Collin McCarthy, Hanrong Ye, David Wehr, Xinhao Li, Qi Dou, Tianfan Xue, Ka Chun Cheung, Simon See, Wonmin Byeon, Ke Chen, Kai Han, Jinwei Gu, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出C-GSPN,一种基于2D空间传播的基础规模视觉编码器,通过快速CUDA内核、压缩潜在空间传播块和两阶段交叉算子蒸馏,在减少参数的同时提升性能并实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00739 2026-06-02 cs.LG 70%

Score $\times$ Decoder: A Unified View of Unsupervised Inference-Time Scaling for Hallucination Mitigation

Score × Decoder:无监督推理时缩放缓解幻觉的统一视角

Yun-Chen Cheng, Che-Yu Lin, Cheng-Lin Yang

机构 * CyCraft AI Lab, Taiwan(CyCraft人工智能实验室,台湾)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Score×Decoder框架,通过配对四种内在分数(困惑度、对比度、幂分布似然、自验证)与三种解码族(优化、采样、共识),在无监督条件下选择最佳组合以缓解大语言模型幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00735 2026-06-02 cs.DC cs.LG 70%

ViBE: Co-Optimizing Workload Skew and Hardware Variability for MoE Serving

ViBE: 针对MoE服务的工作负载偏斜与硬件变异性协同优化

Seokjin Go, Marko Scrbak, Ephrem Wu, Srilatha Manne, Divya Mahajan

机构 * Georgia Institute of Technology(佐治亚理工学院) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出ViBE框架,通过感知硬件的专家放置方法,结合GPU性能建模与专家激活分析,最小化分布式MoE推理中的执行时间不平衡,显著提升SLO达标率并降低P90 TTFT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00611 2026-06-02 cs.AI 70%

TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety

TRACE: 面向长程智能体安全的轨迹风险感知压缩

Zhepei Hong, Lin Wang, Liting Li, Haokai Ma, Junfeng Fang, Fei Shen, Dan Zhang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) South China Normal University(华南师范大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出轨迹风险感知压缩方法TRACE,通过压缩器-阅读器架构将长轨迹压缩为潜在证据状态,以聚合稀疏风险信号并提升长程安全检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00442 2026-06-02 cs.LG math.OC stat.ML 70%

Exploiting weight-space symmetries for approximating curvature

利用权重空间对称性近似曲率

Artem Artemev, Rui Xia, Benjamin M. Boyd, Youjing Yu, Felix Dangel, Guillaume Hennequin, Alberto Bernacchia

机构 * DeepMind, London, UK(伦敦DeepMind)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文通过解析平均化保持损失不变的群作用,从单个梯度构建结构化的Hessian近似,从而利用权重空间对称性来近似损失函数的曲率。

Comments Published at ICML 2026. 35 pages, 11 figures. Code: https://github.com/mtkresearch/symm_opt

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00432 2026-06-02 cs.LG 70%

Grounded Decoding: Retrieval-Anchored Probability Fusion for Faithful RAG

Grounded Decoding: 面向忠实RAG的检索锚定概率融合

Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系) Department of Computer Science, Kalinga Institute of Industrial Technology(卡林加工业技术学院计算机科学系) Department of Civil, Construction & Environmental Engineering, Iowa State University(爱荷华州立大学土木、建设与环境工程系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Grounded Decoding,一种无需训练的推理时解码框架,通过KL-重心目标融合全RAG分布和仅检索分布,并引入冲突感知自适应加权,以提升RAG的事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00062 2026-06-02 cs.CL 70%

Graph-Augmented Retrieval for Cross-Entity Financial Sentiment Analysis: A Comparative Study

跨实体金融情感分析的图增强检索:一项比较研究

Rajan Bastakoti, Sagar Bhetwal, Nirajan Acharya, Gaurav Kumar Gupta

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种两跳图增强检索架构(Graph-RAG),通过构建情感加权知识图谱并融合密度检索与图遍历,相比标准向量检索在跨实体金融情感分析中显著提升实体召回率和复杂查询答案相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26444 2026-06-02 cs.CL 70%

NanoSpec: Accelerating Speculative Decoding using Minimalist In-Context Vocabularies

NanoSpec: 利用极简上下文词汇表加速推测解码

Zhiyang Chen, Daliang Xu, Yinyuan Zhang, Chenghua Wang, Mengwei Xu, Yun Ma

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院) Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(教育部高可信软件技术重点实验室) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院) State Key Laboratory of Networking(网络与交换技术国家重点实验室) School of Computer Science, Beijing University of Posts(北京邮电大学计算机学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出NanoSpec,一种无需训练的方法,通过动态构建极简上下文感知词汇表(平均<3k tokens),结合系统-算法协同设计,将推测解码的草稿生成时间平均减少51.6%,实现端到端加速1.17-1.29倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28768 2026-06-02 cs.DC cs.LG 70%

CRAFT: Fine-Grained Cost-Aware Expert Replication For Efficient Mixture-of-Experts Serving

CRAFT:面向高效混合专家服务的细粒度成本感知专家复制

Adrian Zhao, Zhenkun Cai, Zhenyu Song, Lingfan Yu, Haozheng Fan, Jun Wu, Yida Wang, Nandita Vijaykumar

机构 * NVIDIA Corporation(英伟达公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出CRAFT框架,通过基于估计收益的细粒度逐层复制,在给定内存预算下最大化负载均衡,无需额外训练即可提升大规模MoE服务吞吐量。

Comments 22 pages, 15 figures

Journal ref Proceedings of the Ninth Conference on Machine Learning and Systems (MLSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏