arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 706 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 177 篇

2509.22225 2026-08-25 cs.CV cs.AI 版本更新 57%

ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

ExtrinSplat:解耦几何与语义以实现3D高斯散射中的开放词汇理解

Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Guangdong Bohua UHD Innovation Center Co., Ltd.(广东博华超高清创新中心有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 ExtrinSplat通过解耦几何与语义,利用视觉语言模型生成轻量文本假设,提升3D高斯散射中开放词汇物体选择和语义分割的性能和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新 57%

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23302 2026-08-25 cs.CV 新提交 50%

Grounding Free-Form Instructions for Fashion Complementary Image Generation

基于自由形式指令的时尚互补图像生成的接地

Matteo Attimonelli, Claudio Pomo, Alessandro De Bellis, Danilo Danese, Dietmar Jannach, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学) Sapienza University of Rome(罗马大学) University of Klagenfurt(克拉根福大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有时尚互补图像生成基准的缺陷,该研究提出基于自由形式指令的新设置,用StyleFlow模型实现该任务,其生成的服装符合指令且风格连贯,同时降低了架构复杂度和推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23189 2026-08-25 cs.CV 新提交 50%

EchoWM: Open and Enterable Omnimodal World Models

EchoWM:开放且可进入的全模态世界模型

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan

机构 * HKUST(香港科技大学) PKU(北京大学) Joy Future Academy, JD(京东探索研究院) HKU(香港大学) THU(清华大学) USTC(中国科学技术大学) FDU(复旦大学) Beihang University(北京航空航天大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :post-training(abstract)

AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。

Comments 42 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22888 2026-08-25 cs.CV 新提交 50%

NemoSplat: Feed-Forward 4D Gaussian Splatting for Media-Aware Underwater Reconstruction

NemoSplat:面向介质感知水下重建的前馈式4D高斯溅射方法

Xiaopeng Guo, Wai Chung Tse, Yipeng Zhu, Hanwen Zhang, Huajian Huang, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对水下环境光散射与动态物体导致的重建难题,提出首个介质感知前馈4D高斯溅射框架NemoSplat,设计可提示动态解缠器与介质感知高斯预测器,构建大规模水下数据集,实现了最优跟踪精度与高保真渲染。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22637 2026-08-25 cs.CV 新提交 50%

OmniCAD: A Large-Scale Benchmark for 3D Spatial Reasoning in Robotics Assemblies

OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集

Mingjia Wang, Taiting Lu, Ziwei Dong, Sisong Bei, Jingying Zeng, Runze Liu, Kaiyuan Lin, Hongxing Pan, Kai Zhang, Yizheng Hou, Yangshoudu Zheng, Chenchen Guo, Weiyuan Meng, Shubin Lyu, Zhijun Zheng, Dexu Wang, Xinyu Bai, Shurui Qian, Zhangzixin, Mengyu Pan, Guoliang Shi, Ling Ma, Yifan Yang, Qi He, Yi-Chao Chen, Yincheng Jin, Sung-Liang Chen, Mahanth Gowda

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22366 2026-08-25 cs.CV 新提交 50%

When Do VLMs Help Arabic Manuscript OCR? A Cross-Dataset Study

视觉语言模型(VLMs)何时助力阿拉伯手稿光学字符识别(OCR)?一项跨数据集研究

Moshiur Farazi, Firoj Alam, Abderrahmane Maaradji, Zakaria Maamar, Hamdy Mubarak, Wajdi Zaghouani

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Northwestern University in Qatar(卡塔尔西北大学) University of Doha for Science Technology(多哈科技大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文通过跨8类阿拉伯语文本数据集的实验,探究VLMs对阿拉伯手稿OCR的助力场景,提出OCR先验可恢复性原则,支持构建自适应OCR-VLM工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11269 2026-08-25 cs.CV cs.HC 版本更新 50%

Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment

特质更深:面向人格评估的特质特异性非对称融合

Jia Li, Qian Chen, Wei Wang, Xinyu Li, Zhenzhen Hu, Dongsheng Shao, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) Jianghuai Advanced Technology Center(江淮前沿技术中心) Anhui Provincial Industry Innovation Center of Humanoid Robots(安徽省人形机器人产业创新中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出Traits Run Deeper框架,通过多模态基础表示、特质特异性非对称融合和分布校准回归模块,解决人格评估中模态偏好差异和标签偏差问题,在AVI Challenge 2026上MSE降低约25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05522 2026-08-25 eess.IV cs.CV 版本更新 50%

Tumor-aware augmentation with task-guided attention analysis improves rectal cancer segmentation from magnetic resonance images

肿瘤感知增强与任务引导注意力分析提高磁共振图像直肠癌分割

Aneesh Rangnekar, Joao Miranda, Natally Horvat, Stephanie Chahwan, Samir Alrayess, Aditya Apte, Aditi Iyer, Eve LoCastro, Revathi Ravella, Marc J Gollub, Iva Petkovska, Jesse Joshua Smith, Paul Romesser, Julio Garcia-Aguilar, Harini Veeraraghavan, Joseph O Deasy

机构 * Department of Medical Physics, Memorial Sloan Kettering Cancer Center(医学物理系,纪念斯隆凯特琳癌症中心) Department of Radiology, Memorial Sloan Kettering Cancer Center(放射学系,纪念斯隆凯特琳癌症中心) Department of Radiation Oncology, Memorial Sloan Kettering Cancer Center(放射肿瘤学系,纪念斯隆凯特琳癌症中心) Department of Surgery, Memorial Sloan Kettering Cancer Center(外科系,纪念斯隆凯特琳癌症中心) Department of Medicine, Memorial Sloan Kettering Cancer Center(医学系,纪念斯隆凯特琳癌症中心)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文通过肿瘤感知增强和任务引导注意力分析,改进CT到MRI的直肠癌分割,验证了预训练模型在跨模态转移中的局限性,并提出了缓解策略以提升鲁棒性。

Comments Accepted to Biomedical Signal Processing & Control 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09305 2026-08-25 cs.CV 版本更新 50%

VAGNet: Vision-based Accident Anticipation with Global Features

VAGNet:基于视觉的事故预测与全局特征

Vipooshan Vipulananthan, Charith D. Chitraranjan

机构 * Department of Computer Science and Engineering, University of Moratuwa(moratuwa大学计算机科学与工程系)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出VAGNet,通过全局特征预测事故,提升实时性与效率,实验显示在四个数据集上精度和响应时间均优于现有方法。

Comments Published in IEEE Open Journal of Vehicular Technology (OJVT)

Journal ref IEEE Open Journal of Vehicular Technology, vol. 7, pp. 1873-1883, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11421 2026-08-25 cs.CV 版本更新 50%

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)

专题命中 评测与基准 :language model(abstract)

AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。

Comments SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05150 2026-08-25 cs.CR 版本更新 50%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 评测与基准 :prompting(abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 102 篇

2608.22762 2026-08-25 cs.AI 新提交 92%

Compositional Chain-of-Relations for Faithful Knowledge Graph Question Answering with Large Language Models

面向大型语言模型的忠实知识图谱问答的组合式关系链

Chenhui Liu, Jianpeng Zhou, Jiahai Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文针对现有基于LLM的KGQA方法存在的实体剪枝不可靠、约束处理无基础的局限,提出组合式关系链(CCoR)框架,以关系为中心探索实现更忠实的多跳KGQA,在多个基准上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20923 2026-08-25 cs.NE cs.AI 92%

Pareto-Grid-Guided Large Language Models for Fast and High-Quality Heuristics Design in Multi-Objective Combinatorial Optimization

基于帕累托网格的大型语言模型在多目标组合优化中快速高质量启发式设计

Minh Hieu Ha, Hung Phan, Tung Duy Doan, Tung Dao, Dao Tran, Huynh Thi Thanh Binh

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 基于帕累托网格的LLM改进方法,用于多目标组合优化中高效高质量启发式设计。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-08-25 cs.MA cs.AI cs.CL 版本更新 92%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24747 2026-08-25 cs.AI cs.CE 版本更新 92%

Scaling Laws for Task-Specific LLM Distillation

任务特定LLM蒸馏的缩放定律

Lavinia Ghita, Dhruv Desai, Ioana Boier

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文推导了领域特定LLM压缩的经验缩放定律,通过定量金融领域的实验,比较了基于logit和LoRA的蒸馏方法,并引入混合思维链监督损失,揭示了监督格式对领域知识与通用知识权衡的关键作用。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03770 2026-08-25 cs.DC cs.AI 版本更新 92%

E2LLM: Towards Efficient LLM Serving in Heterogeneous Edge/Fog Environments

E2LLM:异构边缘/雾环境中高效LLM服务

Truong-Thanh Le, Amir Taherkordi, Hoang-Loc La, Frank Eliassen, Phuong Hoai Ha, Peiyuan Guan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出E2LLM框架,通过复制模型到多设备组并采用模型并行,结合遗传算法聚类和动态规划分区,在资源受限的异构边缘/雾环境中实现高效LLM部署,相比Splitwise基线在高需求下平均等待时间降低50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22788 2026-08-25 cs.AI cs.LG 新提交 91%

TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts

TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由

Tianqi Xu, Lu Lv, Haoyang Huang, Wenjie Huang, Zhanming Shen, Yuhao Shen, Baolin Zhang, Xinyi Hu, Shuang Ge, Jun Dai, Tianyu Liu, Suorong Yang, Zhikai Li, Ye Bai, Jun Zhang, Lei Chen, Yue Li, Mingchen Wan

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23353 2026-08-25 cs.CL cs.NE 新提交 90%

FormuEvo: LLM-Guided Evolution for Discovering Solver-Efficient Mixed-Integer Programming Formulations

FormuEvo:大语言模型引导的进化算法用于发现求解器高效的混合整数规划模型

Haofeng Yuan, Jianing Peng, Jieyi Bi, Ni Zhang, Shiji Song, Zhiguang Cao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FormuEvo是LLM引导的进化框架,将MIP模型设计转化为符号空间的进化优化,结合求解器感知诊断与结构化内存,发现的MIP模型性能远超专家设计及现有LLM方法,求解加速最高达5.5倍且知识可跨场景迁移。

Comments 27 pages, 6 figures, and 9 tables. To appear in the Proceedings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20280 2026-08-25 cs.DB cs.LG 版本更新 90%

Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders

大语言模型(LLM)缓存应采用哪种驱逐策略?跨工作负载、容量和编码器的系统研究

Yash Kulkarni, Shubham Harkare, Arvind Yogesh Suresh Babu

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本研究使用CLEVER工具在多场景下对比多种LLM缓存驱逐策略,发现LFU性能最优,且当前操作点的答案可替换性低、阈值难跨模型迁移,建议部署时先验证答案有效性再测试次级策略差异。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-08-25 cs.AI cs.LG 版本更新 90%

CacheSpec: Finding the Sweet Spot for Small Models in Large Language Models

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jie Feng, Jinghua Piao, Shaogang Hu, Yong Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments Accepted by EMNLP 2026, codes via https://github.com/chenjqQAQ/CacheSpec

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19803 2026-08-25 cs.LG cs.AI cs.CL 版本更新 89%

MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

MileGPO:面向长 horizon LLM 智能体的基于图策略优化的里程碑推理

Bo Qian, Yuting Wu, Shuang Zeng, Huaiyu Wan, Dalin Zhang, Jiqiang Liu

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的信用分配难题,提出 MileGPO 方法,通过里程碑发现、RCS、PCC 三项设计提升性能,在 ALFWorld 和 WebShop 上达 SOTA 且分布差距小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10186 2026-08-25 cs.AR 版本更新 89%

FlashAccel: Leveraging High-Bandwidth Flash (HBF) for High-Throughput LLM Inference

FlashAccel:利用高带宽闪存实现高吞吐量语言模型推理

Xinyu Wang, Yalong Xue, Xiaotian Sun, Xiaoyu Zhang, Xinjiang Zhang, Chunmeng Dou, Xueqi Li, Xiaoming Chen

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理受HBM容量限制问题,提出FlashAccel系统,将HBF集成到基于HBM的GPU中,通过架构支持、特殊数据布局及引入新管理层和编程模型,在100ms延迟约束下,提升了每GPU吞吐量和能源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25098 2026-08-25 cs.AI cs.CL cs.LG 版本更新 89%

Revisiting the Effectiveness of LLM Pruning for Test-Time Scaling

重新审视LLM剪枝对测试时缩放的有效性

Ocean Monjur, Shahriar Kabir Nahin, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究非结构化剪枝对推理型大语言模型测试时缩放性能的影响,发现其优于结构化剪枝甚至有时超过未剪枝模型,并探讨了层间稀疏分配策略的作用。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21362 2026-08-25 cs.AI cs.DC 新提交 89%

KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference

KVBoost:用于高效大语言模型推理的、基于偏差引导重计算的分块级键值缓存复用方案

Srihari Unnikrishnan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 KVBoost是适用于HuggingFace兼容解码器模型的分块级KV缓存复用系统,通过双哈希键方案与两类重计算策略等,在不损失准确率的前提下,将Qwen2.5-3B的首token生成时间缩短4.49倍,性能优于前缀缓存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22613 2026-08-25 cs.AR 新提交 88%

NOVA: Technology-Architecture Co-Design of Near-Memory Processing for Attention-SSM-MoE Hybrid LLM Inference

NOVA:面向注意力-状态空间模型-混合专家混合大语言模型推理的近内存处理技术-架构协同设计

In-Jun Jung, Jaeha Min, Joo-Young Kim

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 NOVA是面向注意力-SSM-MoE混合LLM推理的近内存处理技术-架构协同设计方案,通过4F² VCT DRAM与两层NMP架构,在低面积开销下实现远超GPU的推理性能与能效。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05545 2026-08-25 stat.ME econ.EM 版本更新 88%

Can Language Models Boost the Power of Randomized Experiments Without Statistical Bias?

语言模型能否在无统计偏见的情况下提升随机实验的效力?

Xinrui Ruan, Xinwei Ma, Yingfei Wang, Waverly Wei, Jingshen Wang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 CALM通过整合语言模型生成的洞察与因果估计器,提升随机实验的精度和有效性,减少偏见并提高稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22761 2026-08-25 cs.CL cs.AI cs.LG 新提交 88%

Don't Repeat Yourself: Stopping Verbatim Loops at Sampling Time

不要重复你自己:在采样时停止逐字循环

Philipp Emanuel Weidmann, Allen Roush, Judah Goldfeder, Sanjay Basu, Ravid Shwartz-Ziv

机构 * Thoughtworks Columbia University(哥伦比亚大学) Oracle(甲骨文公司) New York University(纽约大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型的逐字循环问题,提出采样时的DRY对数几率调整方法,在多模型和研究中有效降低循环率并保持性能,已被开源LLM推理框架采用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22898 2026-08-25 cs.CL 新提交 87%

SelFusion: Self-distillation for Diffusion Language Models

SelFusion:面向扩散语言模型的自蒸馏方法

Hyeongsoo Lim, Jinyoung Kim, Eunseo Seo, Minho Jang, Jiwon Yoon

机构 * Chung-Ang University(中央大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文针对扩散语言模型(DLM)生成质量差的问题,提出无需外部教师模型的自蒸馏框架SelFusion,通过双向蒸馏两种掩码模式实现性能提升,在指令跟随任务中效果优于传统知识蒸馏方法。

Comments Published as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15592 2026-08-25 cs.AI 版本更新 87%

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

当熵不够用时:在大语言模型输出长度预测中恢复丢失的语义

Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对 LLM 服务中序列填充导致的算力浪费问题,提出 ESTP 框架结合熵与语义重要性预测输出长度,在 ForeLen 基准及端到端测试中均表现更优,可提升吞吐量并降低填充率。

详情

展开后加载摘要…

URL PDF HTML 收藏