arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 408 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 91 篇

2601.04879 2026-08-27 cs.CL 版本更新 70%

Mind2Report: Expert-Level Commercial Report Synthesis via Cognitive Deep Research Agent

Mind2Report: 一种用于专家级商业报告综合的认知深度研究代理

Mingyue Cheng, Daoyu Wang, Qi Liu, Shuo Yu, Xiaoyu Tao, Yuqian Wang, Chengzhong Chu, Yu Duan, Mingkang Long, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Engineering Institute, iFLYTEK Co., Ltd(人工智能工程院,iFLYTEK公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Mind2Report是一种通过动态内存增强大语言模型,实现专家级商业报告综合的认知深度研究代理,优于现有基线模型。

Comments Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026), Rome, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-08-27 cs.AI 版本更新 70%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26103 2026-08-27 cs.RO cs.CV 新提交 67%

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAM:基于人类视频的上下文世界-动作建模用于开放式任务泛化

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Zero-WAM是基于人类视频的因果视频-动作模型,通过提出自动流水线构建HumanGen数据集、引入IFP目标,在RoboTwin 2.0仿真7个未见任务上平均成功率达47.0%,实现机器人操作零样本跨任务泛化。

Comments https://robbyant-research.github.io/Zero-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25815 2026-08-27 cs.CY q-bio.NC 新提交 67%

GenAIT: Development and Validation of an Objective Generative AI Literacy Test for High School Students

GenAIT:面向高中生的客观生成式AI素养测试的开发与验证

Brett Puppart, Kristjan-Julius Laak, Jaan Aru

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究开发并验证了面向高中生的GenAIT测试,其18道题覆盖GenAI多领域知识,经大样本验证适用于群体研究,且发现AI使用频率与概念理解负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04938 2026-08-27 cs.LG cs.AI cs.CL 版本更新 67%

ONNX-Net: Towards Universal Representations and Instant Performance Prediction for Neural Architectures

ONNX-Net:面向神经网络架构的通用表示与即时性能预测

Shiwen Qin, Alexander Auras, Shay B. Cohen, Elliot J. Crowley, Michael Moeller, Linus Ericsson, Jovita Lukasik

机构 * University of Edinburgh(爱丁堡大学) University of Siegen(锡根大学) University of Glasgow(格拉斯哥大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出ONNX-Net及基于ONNX的基准ONNX-Bench,通过文本编码实现通用神经网络架构表示,可即时预测任意架构性能,突破了传统NAS方法依赖特定搜索空间的局限。

Comments Accepted at AutoML 26,Our code is available at: https://github.com/shiwenqin/ONNX-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25539 2026-08-27 cs.CV cs.LG 新提交 57%

CropCop: An Auditable 120-Class Plant-Health Model from Benchmark Reconstruction to a Quantised Runtime Artifact

CropCop:从基准重建到量化运行时构件的可审计120类植物健康模型

Rana Muhammad Ahmed, Sabahat Abbas

机构 * Bahria University(巴里亚大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 CropCop构建了120类植物健康的可审计闭集识别系统,经基准重建与量化后,其ExecuTorch/XNNPACK构件在内部测试中达到高准确率与宏F1值,具备运行时保真度。

Comments 25 pages, 6 figures, and 15 tables. Includes benchmark-audit, model-retention, runtime-fidelity, and reproducibility appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25452 2026-08-27 cs.CV cs.AI 新提交 57%

VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality

VGA-BenchV2:用于评估视频美学与生成质量的扩展统一基准及多模型框架

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出扩展的视频评估基准VGA-BenchV2,构建混合评估器架构,并将其作为奖励模型优化视频生成器,实现从基准到模型优化的闭环,提升视频的美学质量与人类偏好对齐性。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25425 2026-08-27 cs.SE cs.AI 新提交 57%

RotDroid: Cross-Orientation State Equivalence Testing for Detecting GUI Rotation Bugs in Android Apps

RotDroid:用于检测Android应用GUI旋转漏洞的跨方向状态等价测试

Mengdi Qin, Bo Jiang

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 RotDroid是一款检测Android应用GUI旋转漏洞的测试框架,通过生成SPS、构建RotBench数据集及开发RotVL模型,在相同预算下比现有技术检测到更多旋转故障,还发现94个未知漏洞且47个被确认修复。

Comments Accepted to ISSRE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25343 2026-08-27 cs.CL 新提交 57%

GUIDE: Generative Unsupervised Chinese Query Correction via Phonetic and Visual Shared-ID Encoding

GUIDE:基于语音与视觉共享ID编码的生成式无监督中文查询纠错方法

Lei Yang, Binbin Huang, Jiwei Tan, Xuhui Sui, Chang Tu, Yi Wang, Han Li

机构 * Kuaishou Technology(快手科技) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文针对中文查询纠错中监督方法维护成本高、无监督方法易意图偏移的问题,提出基于语音与视觉共享ID编码的生成式无监督框架GUIDE,在公开与真实数据集上均优于基线,线上测试也验证了其有效性。

Comments Accepted to EMNLP 2026 Industry Track; 7 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25286 2026-08-27 cs.AI q-bio.QM 新提交 57%

BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks

BixBench3:面向研究级计算生物学任务的AI智能体基准测试

Zane Koch, Asmamaw T. Wassie, Javier Valdes-Aleman, Jason Lee, Michaela M. Hinks, Samuel G. Rodriques, Andrew D. White, Jon M. Laurent

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 研究人员推出BixBench3基准测试,评估AI智能体完成研究级计算生物学任务的能力,发现前沿模型表现差异大,且智能体在大数据集、多步骤任务中性能更差,高分智能体更高效。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13940 2026-08-27 cs.AI 版本更新 57%

AI Research Preference Models

AI研究偏好模型

Thomas Simon Foster, Bassel Al Omari, Tingchen Fu, Thomas Mann, Carl Domond, Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily McMilin, Jakob Nicolaus Foerster

机构 * FAIR at Meta University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对AI研究智能体的候选方案评估成本过高问题,提出AI研究偏好模型,将其集成到AIRA-dojo智能体后提升了基准任务性能,且达到目标性能的时间更短、预算更少。

Comments 34 pages, 17 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15971 2026-08-27 cs.CL 版本更新 57%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG: 查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, Xingcheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 提出SAG架构,通过SQL查询动态构建局部超边索引,避免全局图维护,在多跳推理基准上达到最优召回率,支持亿级数据生产部署。

Comments v2: revised version, with the earlier copy of this revision inadvertently posted as a separate submission (arXiv:2608.12129, now withdrawn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25866 2026-08-27 cs.CV 新提交 50%

LUTSeg: A Longitudinal Multi-Expert Dataset for Ulcer Tissue Segmentation

LUTSeg:用于溃疡组织分割的纵向多专家数据集

Karen Sanchez, Carlos Hinojosa, Albert A. Ávila, Andrea C. Riano-Rojas, Diego H. Romero, Jenny C. Páez, Martina Llinás, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Subred Norte E.S.E, Hospital Simón Bolívar(北红区E.S.E西蒙·玻利瓦尔医院) Universidad del Rosario(罗萨里奥大学)

专题命中 评测与基准 :language model(abstract)

AI总结 研究针对慢性溃疡组织分割数据稀缺问题,构建LUTSeg数据集,并提出半监督框架TiSage,在低标注设置下优于基线方法。

Comments Published at ISIC in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25674 2026-08-27 cs.RO 新提交 50%

Opportunities of Self Supervised Learning for GNSS: Evaluation of a Deep Learning-Enhanced PVT Algorithm

自监督学习在GNSS中的应用机会:深度学习增强型PVT算法的评估

Thomas Barbero, Bertrand Ekambi

机构 * Abbia GNSS Technologies(Abbia GNSS技术公司)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本研究提出深度学习增强型PVT算法,结合监督目标与JEPA自监督预训练,在多驾驶场景评估中显著提升GNSS的PVT精度,尤其适用于恶劣城区,凸显未标注GNSS数据的泛化潜力。

Comments European Navigation Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25434 2026-08-27 cs.IR 新提交 50%

DocPC: Document-Level Visual Retrieval via Representative Page Composition

DocPC:基于代表性页面组合的文档级视觉检索

Chengsong You, Junwei Zhou, Nan Du

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有视觉文档检索以页面为中心的问题,提出DocPC框架,通过组合代表性页面实现文档级索引,在DocViRe基准上性能优于最强页面级基线且存储成本大幅降低。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00307 2026-08-27 cs.RO 版本更新 50%

ScaRF-SLAM: Scale-Consistent Reconstruction with Feed-Forward Models and Classical Visual SLAM

ScaRF-SLAM: 基于前馈模型与经典视觉SLAM的尺度一致重建

Yuhao Zhang, Yifu Tao, Frank Dellaert, Maurice Fallon

机构 * Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出一种解耦框架,将经典特征SLAM用于鲁棒跟踪,几何基础模型仅用于建图,通过尺度优化和子图融合实现高质量一致密集重建,在建筑级数据集上重建精度提升10%-20%。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 78 篇

2608.25543 2026-08-27 eess.SY cs.AI cs.SY 新提交 92%

Goodput Maximization for Large Language Model Edge Inference: A Two-Phase Maskable PPO Approach

面向大型语言模型边缘推理的有效吞吐量最大化:一种两阶段可屏蔽近端策略优化方法

Xiaojing Chen, Qi Zhang, Wei Ni, Shunqing Zhang, Yanzan Sun

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对无线边缘网络中LLM推理服务的有效吞吐量最大化问题,提出两阶段可屏蔽近端策略优化算法,仿真显示其系统奖励提升33.3%至87.5%且有效吞吐量最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02559 2026-08-27 cs.CL cs.AI 版本更新 92%

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

从层到子模块:重新思考基于替换的LLM压缩中的粒度

Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

机构 * University of Trento(特伦托大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出子模块级别的非连续替换压缩方法SubFit,通过为注意力和前馈子模块分别设计轻量残差旁路,在多种LLM上实现更好的困惑度-准确率权衡。

Comments Accepted at EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01120 2026-08-27 cs.AI math.CO 版本更新 92%

New Bounds for Zarankiewicz Numbers via Reinforced LLM Evolutionary Search

通过强化LLM进化搜索获得Zarankiewicz数的新界

Jay Bhan, Nicole Nobili, Patrick Langer

机构 * Massachusetts Institute of Technology(麻省理工学院) ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次确定三个Zarankiewicz数的精确值,并通过强化LLM进化搜索方法为41个数建立下界,展示了LLM引导的进化搜索在数学研究中的潜力。

Comments *Jay Bhan and Nicole Nobili contributed equally to this work as first authors, and their order was determined via coin flip

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23022 2026-08-27 cs.LG 版本更新 92%

Scorpio: Serving Right Requests at the Right Time for Heterogeneous SLOs in LLM Inference

Scorpio:针对LLM推理中异构SLO的适时正确请求服务

Yinghao Tang, Tingfeng Lan, Bo Pan, Xiuqi Huang, Hui Lu, Wei Chen

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) University of Virginia(弗吉尼亚大学) The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Scorpio是一款面向SLO的LLM服务系统,通过异构SLO自适应调度及双防护模块设计,在高负载下可将系统有效吞吐量提升最高14.4倍、SLO合规性提升最高46.5%

Comments Accepted at WISE 2026 (27th International Conference on Web Information Systems Engineering), Special Track on Innovative Web Technologies. 15 pages. This version has been accepted for publication after peer review but is not the Version of Record; the Version of Record will appear in the Springer LNCS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25096 2026-08-27 cs.LG cs.AI 新提交 91%

Understanding the Energy Scaling of Large Language Model Inference Across Context Lengths and Attention Architectures

探究大语言模型推理在上下文长度与注意力架构上的能量缩放规律

Molka Chkir, Syed Muhammad Danish, Jos Höll, Arghavan Asad

机构 * Algoma University(阿尔戈马大学) Reutlingen University(罗伊特林根大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证研究,明确注意力架构是影响LLM解码能耗随上下文长度缩放的核心因素,发现GQA及带SWA的GQA能效更优,批处理可降低能耗与延迟,为LLM配置提供实用指导。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22788 2026-08-27 cs.AI cs.LG 版本更新 91%

TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts

TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由

Tianqi Xu, Lu Lv, Haoyang Huang, Wenjie Huang, Zhanming Shen, Yuhao Shen, Baolin Zhang, Xinyi Hu, Shuang Ge, Jun Dai, Tianyu Liu, Suorong Yang, Zhikai Li, Ye Bai, Jun Zhang, Lei Chen, Yue Li, Mingchen Wan

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25697 2026-08-27 cs.CR 新提交 90%

LMSM: LLM Security Framework Inspired by Linux Security Modules

LMSM:受Linux安全模块启发的大语言模型安全框架

XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

专题命中 效率与部署 :LLM(title,summary_cn);language model(abstract,abstract_cn);large language model(abstract)

AI总结 该研究提出受Linux安全模块启发的LMSM框架,通过分离调解与策略实现LLM安全,在Qwen3-4B上可降低攻击成功率,同时保持较高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24945 2026-08-27 cs.LG cs.AI cs.DC 新提交 90%

FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

FAMPWQ:基于费舍尔信息的自适应混合精度权重量化方法,用于高效的大语言模型推理

Gongwei Lee, Ji Liu, Juncheng Jia, Ji Wu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Hithink Research(海思睿研究中心) Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM部署的资源瓶颈,该研究提出FAMPWQ方法,通过费舍尔信息度量层敏感度结合强化学习分配位宽,在7个模型和5个基准上优于7种基线方法,提升了量化性能。

Comments 21 pages, to appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24892 2026-08-27 cs.AI cs.CL 新提交 90%

Natural Language Input, Semantic Track Representation, and LLM Inference: Making the Maritime Information Exchange Model Tractable

自然语言输入、语义航迹表示与大语言模型推理:使海上信息交换模型可处理

Frederick Roth

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出基于LLM的架构,通过自然语言输入自动生成SARs,实现MIEM与富语义航迹模型的可处理与快速部署,适用于国防执法等场景。

Comments 11 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25523 2026-08-27 cs.CL 新提交 90%

TOPAS: Workflow-Aware Prefix-State Scheduling for Multi-Agent LLM Serving

TOPAS:面向多智能体大语言模型服务的工作流感知前缀状态调度器

Hongqiu Ni, Han Tian, Chi Zhang, Guopeng Li, Haisheng Tan

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对多智能体LLM服务的前缀缓存权衡问题,提出TOPAS调度器,在SGLang框架中实现,经实验可显著降低合成及MetaGPT工作负载下的作业完成时间。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25321 2026-08-27 cs.CR cs.AI 新提交 90%

LLMscope: Extracting LLM Assets from Edge AI Chips via Optical Probing

LLMscope:通过光学探测从边缘AI芯片中提取大语言模型(LLM)资产

Dev Mehta, Lily Dukette, William Folan, Olivia Kochol, Noah Solomon, Shahin Tajik, Fatemeh Ganji

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出LLMscope方法,通过激光电压成像攻击基于FPGA的LLM加速器,可从边缘AI芯片提取LLM资产,建立了资产恢复方法及成像工作量与资产维度的下界

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25053 2026-08-27 cs.AR cs.AI cs.DC cs.PF 新提交 90%

Hydra: Phase-Aware Workload Characterization of LLM Inference across Edge SoC Generations, Backends, and Quantization Levels

Hydra:面向边缘SoC代际、后端及量化级别的LLM推理的阶段感知工作负载表征

Amir Taherin, Sana Taghipour Anvari, Charles Amante, Yixiao Chen, Ruben Noroian, Zlatan Feric, Nicolas Bohm Agostini, Pu Zhao, José Cano, Bin Ren, Yanzhi Wang, David Kaeli

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 Hydra是面向边缘SoC的LLM推理阶段感知工作负载表征框架,可评估多代SoC、多种LLM及执行格式,揭示延迟、量化、SoC代际对性能的影响,相关成果开源发布。

Comments Accepted at the IEEE International Symposium on Workload Characterization (IISWC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24650 2026-08-27 cs.AR cs.AI 版本更新 90%

Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems

Simthesizer:面向LLM服务系统的智能体驱动仿真框架

Wonung Kim, Hyunmin Choi, Minsu Kim, Jaehong Cho, Yeongwook Kim, Jongse Park

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Borg框架,通过智能体驱动仿真器开发缩小LLM服务系统与仿真器的差距,其构建的扩展吞吐量误差更低,仿真速度显著优于现有仿真器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06346 2026-08-27 cs.LG cs.AI 版本更新 90%

Ban&Pick: Enhancing Performance and Efficiency of MoE-LLMs via Smarter Routing

Ban&Pick:通过更智能的路由提升MoE-LLM的性能与效率

Yuanteng Chen, Peisong Wang, Yuantian Shao, Nanxin Zeng, Chang Xu, Jian Cheng

机构 * Nanjing University of Science and Technology(南京理工大学) C 2 \text{C}^{2} DL, Institute of Automation, Chinese Academy of Sciences(C2 DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science, University of Sydney(悉尼大学计算机学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究针对MoE-LLM预训练路由的问题,提出即插即用的Ban&Pick策略,通过Pick强化关键专家、Ban修剪冗余专家,在不重新训练或改架构的情况下提升MoE-LLM性能并加速推理。

Comments 26 pages, 13 figures

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏