arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2605.12898 2026-05-14 cs.SI cs.CL cs.CY 88%

When Do LLMs Generate Realistic Social Networks? A Multi-Dimensional Study of Culture, Language, Scale, and Method

当大型语言模型生成真实的社会网络时?文化、语言、规模和方法的多维研究

Sai Hemanth Kilaru, Sriram Theerdh Manikyala, Raghav Upadhyay, Sri Sai Kumar Ramavath, Srivika Nunavathu, Dalal Alharthi

机构 * University of Arizona(亚利桑那大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过多维度研究探讨LLM生成社会网络的可靠性,发现文化框架、提示语言和模型规模等因素显著影响网络结构,揭示提示设计对社会学假设的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12935 2026-05-14 cs.AI 88%

AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions

大语言模型的安全性景观:分类、现状与未来方向

Chen Chen, Xueluan Gong, Ziyao Liu, Weifeng Jiang, Si Qi Goh, Kwok-Yan Lam

机构 * College of Computing and Data Science(计算与数据科学学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出新型框架,从可信AI、负责任AI和安全AI三个视角审视AI安全,综述当前研究进展,通过大语言模型等实例展示创新方法,旨在推动AI安全研究并提升数字转型信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12056 2026-05-13 cs.AI 88%

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率

Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11803 2026-05-13 cs.CV cs.AI 88%

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

OTT-Vid: 基于最优传输的视频大语言模型时间令牌压缩

Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

机构 * Yonsei University(延世大学) LG Electronics(LG电子) KIST(韩国科学技术院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 OTT-Vid通过结合空间修剪和最优传输,有效压缩视频令牌,保持高性能,实验显示在保留10%令牌的情况下,VQA和VTG性能分别达到95.8%和73.9%。

Comments 22pages, 9 figures. Code available at https://github.com/minseokii/OTT-Vid

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23928 2026-05-12 cs.CL 88%

The Astonishing Ability of Large Language Models to Parse Jabberwockified Language

大型语言模型解析jabberwockified语言的惊人能力

Gary Lupyan, Senyi Yang

机构 * Department of Psychology, University of Wisconsin-Madison(威斯康星大学麦迪逊分校心理学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究展示大型语言模型能从严重退化的英文文本中恢复意义,通过替换内容词为无意义字符串的文本,模型能生成接近原文的常规英文,揭示了语法结构对词汇意义的强约束作用。

Comments Submitted to the 2026 Annual Meeting of the Cognitive Science Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09515 2026-05-12 cs.AI 88%

A Game Theoretic Free Energy Analysis of Higher Order Synergy in Attention Heads of Large Language Models

基于博弈自由能分析的大型语言模型注意力头中高阶协同效应

Djamel Bouchaffra

机构 * DAVID Lab, University of Paris-Saclay, UVSQ Campus, 78035 Versailles, France(巴黎萨克雷大学DAVID实验室,UVSQ校区,法国Versailles)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过博弈自由能原理分析大型语言模型注意力头中的高阶协同效应,揭示了高阶冗余性,并展示了通过剪枝降低计算成本的方法。

Comments this manuscript has been submitted to Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03829 2026-05-12 cs.CL cs.CR 88%

Majority Bit-Aware Watermarking For Large Language Models

多数位感知水印技术用于大语言模型

Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

机构 * University of Nevada, Reno(内华达大学里诺分校) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出多数位感知编码方法,通过放松绿色列表大小对水印信号强度的限制,提升大语言模型生成文本的解码准确性和文本质量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07883 2026-05-11 cs.CL 88%

Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement

超越'我无法完成此请求':通过标签增强缓解LLM中的刚性拒绝

Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

机构 * Southeast University, Nanjing, China(东南大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LANCE方法,通过标签增强实现安全且灵活的响应,减少LLM中的刚性拒绝问题,提升交互自然性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17942 2026-05-11 cs.AI cs.DB 88%

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

基于大型语言模型的SQL生成:提示、自我完善与自适应加权多数投票

Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

机构 * Institute of Information Management(信息管理研究所) National Yang Ming Chiao Tung University(阳明交通大学) R. B. Annis School of Engineering(R. B. Annis工程学院) University of Indianapolis(印第安纳大学)

专题命中 效率与部署 :LLM(title);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文提出SSEV管道,通过自我完善与加权多数投票提升SQL生成准确性,在多个基准测试中取得良好成绩,并进一步提出ReCAPAgent-SQL框架以应对企业数据库复杂性,提升实际应用效果。

Comments 29 pages, 22 figures

Journal ref 2026 International Conference on Information Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06206 2026-05-08 cs.LG 88%

Federation of Experts: Communication Efficient Distributed Inference for Large Language Models

专家联邦:用于大型语言模型的通信高效的分布式推理

Muhammad Shahir Abdurrahman, Chun Deng, Azalia Mirhoseini, Philip Levis

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出FedEx架构,通过将MoE块分为多个集群,减少专家间通信开销,提升单节点和多节点下的推理吞吐量和延迟,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21623 2026-05-08 cs.LG cs.NA math.NA 88%

LAMP: Look-Ahead Mixed-Precision Inference of Large Language Models

LAMP:大型语言模型的前瞻性混合精度推理

Stanislav Budzinskiy, Marian Gloser, Tolunay Yilmaz, Ying Hong Tham, Yuanyi Lin, Wenyi Fang, Fan Wu, Philipp Petersen

机构 * Faculty of Mathematics University of Vienna(维也纳大学数学系) Huawei Technologies(华为技术)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种前瞻性混合精度推理方法,通过选择性提高部分组件的计算精度,提升Transformer推理的准确性,实验证明在GPT-2模型上精度提升达两个数量级。

Comments Major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01255 2026-05-05 cs.LG 88%

Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

LLMs中的激活压缩:理论分析与高效算法

Wen-Da Wei, Han-Bin Fang, Yang-Di Liu, Jiang-Xin Shi, James Kwok, Yu-Feng Li

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Hong Kong University of Science and Technology(香港科学大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种激活-梯度联合压缩方法,通过低秩因子压缩线性层梯度,无需额外计算,提升LLM训练效率与压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27115 2026-05-01 cs.CL 88%

Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models

探索剪枝的极限:任务特定神经元、模型崩溃与任务特定大语言模型中的恢复

M. K. Khalidi Siam, Md. Tausif-Ul-Islam, Md. Reshad Romim Khan, Mohammed Ali Hossain, Mushfiqul Amin, Labib Hasan Khan, Niloy Farhan, Farig Sadeque

机构 * BRAC University(布拉格大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究通过系统剪枝实验揭示任务特定语言模型中神经元的专有性,发现任务特定神经元对性能至关重要,剪枝策略影响模型鲁棒性和恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06635 2026-04-30 cs.LG 88%

Graph Property Inference in Small Language Models: Effects of Representation and Reasoning Strategy

在小型语言模型中进行图属性推断:表示与推理策略的影响

Michal Podstawski

机构 * NASK National Research Institute, Warsaw, Poland(波兰华沙国家研究 institute)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 研究探讨了小型指令微调语言模型在图属性推断中的表现,发现输入表示和推理策略显著影响结果,未经过微调的模型在估计图属性时存在系统性误差,但通过改进表示和推理设计可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23838 2026-04-28 cs.LG 88%

JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training

JigsawRL:构建高效的LLM后训练强化学习流水线

Zhengding Hu, Hehua Ouyang, Chang Chen, Zaifeng Pan, Yue Guan, Zhongkai Yu, Zhen Wang, Steven Swanson, Yufei Ding

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(title,title_cn);post-training(title);分类 cs.LG

AI总结 JigsawRL通过动态资源分配和图调度策略,提升强化学习流水线效率,实现异步和同步任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22768 2026-04-28 cs.CY cs.CL 88%

Secure On-Premise Deployment of Open-Weights Large Language Models in Radiology: An Isolation-First Architecture with Prospective Pilot Evaluation

面向放射学的开放权重大语言模型本地部署安全方案:一种优先隔离的架构及其前瞻性试点评估

Sebastian Nowak, Jann-Frederick Laß, Narine Mesropyan, Babak Salam, Nico Piel, Mohammed Bahaaeldin, Wolfgang Block, Alois Martin Sprinkart, Julian Alexander Luetkens, Benjamin Wulff, Alexander Isaak

机构 * Department of Diagnostic and Interventional Radiology, University Hospital Bonn(诊断与介入放射科,波恩大学医院) Department of Research-IT, University Hospital Bonn(研究-IT部门,波恩大学医院)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种优先隔离的架构,用于在放射学领域安全部署开放权重大语言模型,通过严格的网络隔离和权限控制,验证了其在临床实用性和技术可行性上的表现。

Comments 39 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01897 2026-04-28 cs.LG cs.IT math.IT math.OC 88%

MLorc: Momentum Low-rank Compression for Memory Efficient Large Language Model Adaptation

MLorc: 动量低秩压缩用于内存高效的大型语言模型适应

Wei Shen, Zhang Yaxiang, Minhui Huang, Mengfan Xu, Jiawei Zhang, Cong Shen

机构 * University of Virginia(弗吉尼亚大学) National University of Singapore(新加坡国立大学) Meta University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出MLorc方法,通过压缩和重建矩阵参数动量以降低内存消耗,相比LoRA和GaLore在内存效率和训练动态保留方面更优,理论和实验均验证其有效性。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21197 2026-04-24 cs.LG 88%

Toward Efficient Membership Inference Attacks against Federated Large Language Models: A Projection Residual Approach

迈向高效成员推断攻击对抗联邦大语言模型:一种投影残差方法

Guilin Deng, Silong Chen, Yuchuan Luo, Yi Liu, Songlei Wang, Zhiping Cai, Lin Liu, Xiaohua Jia, Shaojing Fu

机构 * Colleague of Computer Science and Technology, National University of Defense Technology, Changsha, China(计算机科学与技术系,国防科技大学,中国长沙) City University of Hong Kong, Hong Kong, China(香港城市大学,中国香港) Shenzhen University, Shenzhen, China(深圳大学,中国深圳)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出ProjRes方法,通过分析隐藏嵌入向量在梯度子空间中的投影残差,有效识别联邦大语言模型中的成员推断攻击,实现近100%的准确率,优于现有方法75.75%。

Comments This is the full version (including complete appendices and supplementary materials) of the paper accepted for publication at the 2026 IEEE Symposium on Security and Privacy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18610 2026-04-22 cs.NE cs.AI 88%

SpikeMLLM: Spike-based Multimodal Large Language Models via Modality-Specific Temporal Scales and Temporal Compression

基于脉冲的多模态大语言模型:通过模态特定的时间尺度和时间压缩

Han Xu, Zhiyong Qin, Di Shang, Jiahong Zhang, Xuerui Qiu, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 University of Chinese Academy of Sciences 3 Beijing Academy of Artificial Intelligence 4 Zhongguancun Academy 5 Peking University 6 Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology 7 Spiking Intelligence Lab, Tianqiao \& Chrissy Chen Institute [0.5em] Equal contribution Corresponding authors

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出SpikeMLLM,首个基于脉冲的多模态大语言模型框架,通过模态特定时间尺度和时间压缩技术,在减少时间步数的同时保持高性能,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18092 2026-04-21 cs.LG 88%

Generalization Boundaries of Fine-Tuned Small Language Models for Graph Structural Inference

微调小语言模型在图结构推断中的泛化边界

Michal Podstawski

机构 * NASK National Research Institute(NASK国家研究院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 研究微调小语言模型在图结构推断中的泛化能力,通过图大小和图族分布两个维度评估其在超出训练条件时的表现,揭示模型在不同架构下的退化特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10154 2026-04-21 cs.CR cs.AI cs.MM 88%

PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models

PRISM-XR: 通过多模态大语言模型赋能隐私感知的扩展现实协作

Jiangong Chen, Mingyu Zhu, Bin Li

机构 * Department of Electrical Engineering, The Pennsylvania State University, University Park, PA 16802, USA(电气工程系,宾夕法尼亚州立大学,University Park,PA 16802,USA)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出PRISM-XR框架,通过边缘服务器智能预处理过滤敏感数据,实现隐私保护的多用户XR协作,实验表明其在准确性和隐私保护方面表现优异。

Comments Accepted to the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR)

Journal ref 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17087 2026-04-21 cs.CV cs.LG 88%

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

EvoComp: 通过语义引导的进化标注学习多模态大语言模型的视觉令牌压缩

Jiafei Song, Fengwei Zhou, Jin Qu, Wenjin Jason Li, Tong Wu, Gengjian Xue, Zhikang Zhao, Daomin Wei, Yichao Lu, Bailin Na

机构 * OPPO CTG

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出EvoComp框架,通过语义引导的进化标注策略,有效压缩视觉令牌数量,同时保持任务精度,实验显示在3倍压缩下保持99.3%的准确率,并在移动设备上提升1.6倍速度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20503 2026-04-20 cs.CL 88%

Protecting multimodal large language models against misleading visualizations

保护多模态大语言模型免受误导性可视化的影响

Jonathan Tonglet, Tinne Tuytelaars, Marie-Francine Moens, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系,德累斯顿技术大学及应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电气工程系,鲁文大学) Department of Computer Science, KU Leuven(计算机科学系,鲁文大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究发现多模态大语言模型在面对误导性可视化时回答准确性显著下降,提出两种有效方法提升其处理能力,同时保持非误导性可视化下的准确性。

Comments Preprint. Code and data available at https://github.com/UKPLab/arxiv2025-misleading-visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12767 2026-04-15 cs.CV cs.AI 88%

CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models

CLASP:面向多模态大语言模型的类适应层融合与双阶段剪枝

Yunkai Dang, Yizhu Jiang, Yifan Jiang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology(人工智能科学与技术学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 CLASP通过类适应层融合和双阶段剪枝,实现多模态大语言模型中视觉token的高效减少,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08964 2026-04-13 cs.CL 88%

Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models

打破块边界:基于锚点的历史稳定解码用于扩散大语言模型

Shun Zou, Yong Wang, Zehui Chen, Lin Chen, Chongyang Tao, Feng Zhao, Xiangxiang Chu

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学教育部多模态认知与智能系统重点实验室) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出AHD解码策略,通过动态锚点实时监控token稳定性,实现跨块高效解码,提升性能与推理效率。

Comments Accepted for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05887 2026-04-08 cs.AI 88%

HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference

HybridKV: 为高效多模态大语言模型推理设计的混合KV缓存压缩

Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出HybridKV框架,通过分层预算分配和不同压缩策略,有效减少KV缓存内存占用并提升解码速度,实验表明在11个多模态基准上内存减少达7.9倍,解码速度提升1.52倍,性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05502 2026-04-08 cs.CR cs.LG 88%

AttnDiff: Attention-based Differential Fingerprinting for Large Language Models

AttnDiff:基于注意力的差分指纹法用于大语言模型

Haobo Zhang, Zhenhua Xu, Junxian Li, Shangfeng Sheng, Dezhang Kong, Meng Han

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出AttnDiff,一种高效白盒框架,通过内在信息路由行为提取模型指纹,用于验证大语言模型的衍生关系,实现高相似度区分相关衍生模型与无关模型家族。

Comments Accepted at ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09438 2026-04-08 cs.CL 88%

GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models

GrACE:一种生成方法,用于改进置信度 elicitation 和大语言模型在测试时的高效扩展

Zhaohan Zhang, Ziquan Liu, Ioannis Patras

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出GrACE,一种生成方法,用于改进大语言模型的置信度 elicitation 和测试时的高效扩展,通过实时计算隐藏状态与特殊标记嵌入的相似性,实现可靠且可扩展的置信度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04482 2026-04-07 cs.AI 88%

Scalable and Explainable Learner-Video Interaction Prediction using Multimodal Large Language Models

基于多模态大语言模型的可扩展且可解释的学习者-视频交互预测

Dominik Glandorf, Fares Fawzi, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出利用多模态大语言模型预测学习者观看、暂停、跳过和回放行为,以评估视频内容的认知负荷,通过7700万次视频控制事件验证了模型的可扩展性和解释性。

Comments Accepted as long paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02556 2026-04-06 cs.LG cs.AR cs.PF 88%

Fast NF4 Dequantization Kernels for Large Language Model Inference

快速的NF4去量化内核用于大语言模型推理

Xiangbo Qi, Chaoyi Jiang, Murali Annavaram

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种轻量级共享内存优化方法,通过利用内存层次结构提升性能,实现大语言模型推理的加速,展示了在不同模型上的显著速度提升。

Comments 7 pages, 4 figures, EMC2 Workshop at ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏