arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 766 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 164 篇

2606.21351 2026-06-23 q-bio.PE 新提交 50%

Surveying the adaptive landscapes of 10,000 antibodies

调查10000种抗体的适应度景观

Daniel PGH Wong, Aleksandra M. Walczak, Thierry Mora

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出无参数群体遗传框架,通过分析公共克隆型中趋同亲和成熟信号,识别超过10000种抗体的有益突变位点及其适应度效应,揭示突变流行度与适应度效应间的权衡,并用于基准测试抗体语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22890 2026-06-23 cs.CV 新提交 50%

PHOEBI: An Open-World Benchmark for Bacterial Identification in Phase-Contrast Microscopy

PHOEBI:用于相差显微镜细菌识别的开放世界基准

Aaditya Baranwal, Md Jahid Hasan, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出PHOEBI数据集(12万张相差显微镜图像,6种杆状菌的40种组合),通过留出组合评估协议模拟开放世界场景,发现聚合器存在系统性开放世界识别失败,并设计基于锚点的轻量化解码器在未见组合上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22766 2026-06-23 cs.CV 新提交 50%

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

READ:超越所见——基于强化学习的准确连贯音频描述生成

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Tsinghua University(清华大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22487 2026-06-23 cs.CV 新提交 50%

FetSelect: Task-Specific Architectures and Self-Supervised Learning for Automated Fetal Ultrasound Frame Selection

FetSelect: 面向自动化胎儿超声帧选择的任务特定架构与自监督学习

Mahmood Alzubaidi, Raden Muaz, Uzair Shah, Mohammed Ammar, Khalid Alyafei, Mowafa Househ, Marco Agus

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·哈利法大学科学与工程学院) LIST Laboratory Department of Electrical Systems Engineering, University of Boumerdes(布迈德斯大学电气系统工程系LIST实验室) Sidra Medicine(锡德拉医学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出FetSelect框架,结合冻结视觉基础骨干与混合多头设计(任务门控分类头+检测派生质量头),通过BYOL自监督预训练,在四个胎儿测量目标上实现高AUROC与质量相关性。

Comments Accepted in 30th Conference on Medical Image Understanding and Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22476 2026-06-23 cs.CV 新提交 50%

CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

CVSBench:跨视角空间推理与想象的全面基准

Ruixun Liu, Lingyu Zhang, Lanxuan Xue, Kaiyu Li, Bowen Fu, Xiangyong Cao

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 提出CVSBench基准,通过卫星-街景对评估视觉语言模型的跨视角空间推理能力,发现模型在视角剧变下难以保持物体与布局一致性,引入3D场景想象管道可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22339 2026-06-23 cs.CV 新提交 50%

T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

T-IMPACT:面向上下文图像-文本操纵的严重性感知基准

Gagandeep Singh, Aaditya Yadav, Priyanka Singh

机构 * The University of Queensland(昆士兰大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出T-IMPACT基准,包含98,786个图像-文本对,涵盖原始、仅图像、仅文本和联合操纵,通过校准的连续严重性分数和粗粒度标签评估操纵对上下文理解的影响,实验表明现有模型在严重性预测上仍远弱于人类判断。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22211 2026-06-23 cs.HC 新提交 50%

Open AI in the Wild: Adoption and Adaptation of Open Models on r/LocalLLaMA

野生的开放AI:r/LocalLLaMA社区中开放模型的采纳与适应

Woohyeuk Lee, James Howison, Min Kyung Lee, Hanlin Li

专题命中 评测与基准 :foundation model(abstract)

AI总结 通过对r/LocalLLaMA社区的实证研究,揭示用户对开放模型的实用主义理解,包括可靠性、本地控制、隐私和适应能力,并分析采纳动机与障碍,以及共享资源如何支撑开放AI生态。

Comments Accepted at FAccT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 50%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 评测与基准 :language model(abstract)

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21108 2026-06-23 cs.CV 新提交 50%

SARIF: Segment Anything for Robust Image Forensics

SARIF: 用于鲁棒图像鉴别的 Segment Anything

Dong-Hyun Moon, Ju-Hyeon Nam, Sang-Chul Lee

机构 * Department of Electrical and Computer Engineering, Inha University(仁荷大学电气与计算机工程系)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出SARIF框架,利用Segment Anything Model的提示架构和泛化能力,通过反馈引导掩码解码器和双编码器设计提取伪造痕迹,实现自动伪造定位,在跨数据集和图像退化下表现鲁棒。

Comments Accepted to ECCV 2026. Equal contribution: Dong-Hyun Moon and Ju-Hyeon Nam. Corresponding author: Sang-Chul Lee. Code: https://github.com/Inha-CVAI/SARIF_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20736 2026-06-23 cs.CV 新提交 50%

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

REKEY: 基于元数据的视觉键再生方法用于抗污染的VQA评估

Tengjie Lin, Yutao Sun, Jingwei Ni, Shuhan Ge, Hao-Xuan Ma, Yanting Miao, Wangyue Lu, Mingshuai Chen, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) University of Waterloo(滑铁卢大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出ReKey协议,通过随机再生图像中的视觉键来防止VQA基准测试泄露,实验显示原始项目得分比再生变体高9.5-18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20697 2026-06-23 cs.CV 新提交 50%

AEF-Econ: Toward Plug-and-Play Socioeconomic Foundation Embeddings from AlphaEarth for Urban Remote Sensing

AEF-Econ:面向城市遥感的即插即用社会经济基础嵌入

Shuyang Hou, Ziqi Liu, Haoyue Jiao, Lutong Xie, Yaxian Qing, Xiaopu Zhang, Qingyang Xu, Zhangyan Xu, Xuefeng Guan, Huayi Wu

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping, and Remote Sensing(测绘遥感信息工程国家重点实验室)

专题命中 评测与基准 :pretraining(abstract)

AI总结 针对AlphaEarth基础模型在社会经济任务中即插即用受限的问题,提出容量自适应重构方法,通过多流解码器缓解高维流对低维流的抑制,在跨区域和跨层级评估中R²分别提升至0.848和0.693。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 50%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23729 2026-06-23 cs.CV 版本更新 50%

DynProto: Dynamic Prototype Evolution for Out-of-Distribution Detection

DynProto: 动态原型进化用于分布外检测

Yanqi Wu, Xinhua Lu, Runhe Lai, Qichao Chen, Jia-Xin Zhuang, Wei-Shi Zheng, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(诺丁汉马来西亚大学) Hong Kong University of Science and Technology(香港科学与技术大学) Key Laboratory of Machine Intelligence and Advanced Computing(智能与先进计算关键实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 DynProto通过动态学习分布内信息生成原型,提升分布外检测性能,减少FPR95并提升AUROC。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16809 2026-06-23 cs.DC cs.PF 50%

PICO: Performance Insights for Collective Operations

PICO:集体操作的性能洞察

Saverio Pasqualoni, Tommaso Bonato, Lorenzo Piarulli, Torsten Hoefler, Marco Canini, Daniele De Sensi

专题命中 评测与基准 :LLM(abstract)

AI总结 PICO框架通过解耦实验设置与平台执行,提供跨MPI和NCCL的参数选择接口,记录系统配置以实现可重复比较,并通过诊断证据揭示拓扑敏感的算法选择,优化集体操作性能,减少训练时间达44%。

Journal ref ISC High Performance 2026 Research Paper Proceedings (41st International Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19925 2026-06-23 eess.IV cs.CV 版本更新 50%

ReconMIL: Synergizing Latent Space Reconstruction with Bi-Stream Mamba for Whole Slide Image Analysis

ReconMIL: 协同潜在空间重建与双流Mamba的全切片图像分析

Lubin Gan, Jing Zhang, Heng Zhang, Xin Di, Zhifeng Wang, Wenke Huang, Xiaoyan Sun

机构 * USTC(中国科学技术大学) NUDT(南京理工大学) SCNU(华南师范大学) NTU(南洋理工大学) Anhui Province Key Laboratory of Biomedical Imaging and Intelligent Processing(安徽省生物医学成像与智能处理重点实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出ReconMIL框架,通过潜在空间重建模块适配任务特定特征,并设计双流架构(Mamba全局流+CNN局部流)平衡全局与局部特征,有效抑制背景噪声并定位细粒度诊断区域,在多个基准上超越现有方法。

Comments This paper has been withdrawn by the authors due to identified issues in the evaluation protocol in Section Exp. , which may affect the interpretation of the experimental results. The authors are preparing a substantially revised version addressing these issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04205 2026-06-23 cs.CV 版本更新 50%

Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild

Real5-OmniDocBench:面向野外鲁棒文档解析的全尺度物理重建基准

Changda Zhou, Ziyue Gao, Xueqing Wang, Tingquan Gao, Cheng Cui, Jing Tang, Yi Liu

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :language model(abstract)

AI总结 提出首个对OmniDocBench v1.5进行全尺度一对一物理重建的基准Real5-OmniDocBench,覆盖扫描、弯曲、屏幕摄影、光照和倾斜五种真实场景,通过完整真值映射实现性能退化的因子级归因,揭示文档解析中的“现实鸿沟”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15651 2026-06-23 q-bio.QM cond-mat.dis-nn 版本更新 50%

From Scarce Functional Labels to Label-Aware Generation in Homologous Protein Families

从同源蛋白家族中的稀缺功能标签到标签感知生成

Lorenzo Rosset, Martin Weigt, Francesco Zamponi

专题命中 评测与基准 :language model(abstract)

AI总结 研究两阶段轻监督策略,比较不同序列表示在有限监督下预测功能标签,并利用推断标签训练标签感知RBM进行条件生成,揭示稀缺标签在准确传播下可支持标签感知设计。

Comments 13 pages, 4 figures + SI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 131 篇

2606.23136 2026-06-23 cs.NI cs.AI cs.LG 新提交 92%

LLM-Aided A* Search in Non-Geometric Network Graphs

LLM辅助的非几何网络图中的A*搜索

Nouf Alabbasi, Esraa Ghourab, Omar Alhussein

机构 * KU 6G Research Centre, Department of Computer Science, Khalifa University, Abu Dhabi, UAE(KU 6G研究中心,计算机科学系,哈利法大学,阿布扎赫德,阿联酋)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对非几何网络图最短路径问题,提出LLM辅助A*算法,利用LLM生成中间路标点引导搜索,结合路标距离作为启发式,减少约50%扩展节点,路径成本略有增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23003 2026-06-23 cs.CR 新提交 92%

VCT: A Verifiable Transcript System for LLM Conversations

VCT: 一种用于LLM对话的可验证转录系统

Ruilin Xing, Feihong Li, Jiayue Liu, Jiali Zheng, Wei Liu, Wanzhi Xie

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对LLM对话非线性演化(如重提示、回复再生、会话删除等)导致传统日志无法保证完整性的问题,提出VCT系统,通过三层密码学数据结构(分支级哈希链、会话级Merkle树、账户级Merkle根)和带删除屏障的状态转换协议,实现账户级对话记录的完整性、一致性、可验证共享和不可否认性。

Comments 58 pages, 14 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23030 2026-06-23 cs.CL 新提交 92%

Have You Ever Seen Them? Entity-level Membership Inference through Interrogating Large Language Models

你见过它们吗?通过审问大型语言模型进行实体级成员推断

Yiran Zhu, Ziqi Yang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出实体级成员推断任务,通过语义特征分析从LLM生成文本中判断实体信息是否用于训练,形式化约束并设计五种审问策略,在人物实体上AUC达0.97。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19725 2026-06-23 cs.SE cs.AI cs.MA 新提交 92%

Library-Aware Doubles and Iterative Repair for Large Language Model-Generated Unit Tests in OpenSIL Firmware

面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复

Ma Toan Bach, Yuchi Zheng, Haingo Razafindranto, Tanvir Alam, Aric Leather, Ranveer Sandhu, Jitesh Arora

机构 * School of Software Design and Data Science(软件设计与数据科学学院) Seneca Polytechnic(森纳学院) Advanced Micro Devices Canada(加拿大先进微器件公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。

Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21316 2026-06-23 hep-ph 新提交 92%

Large Language Model-Assisted Framework for BSM Model Building

大型语言模型辅助的BSM模型构建框架

Shaikh Saad

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 提出bsm_agent框架,结合确定性物理后端与LLM聊天接口,通过自然语言指定新场量子数,自动构建可重整拉氏量、检查规范反常、导出对称性破缺条件与质量矩阵,确保结果可重复。

Comments 49 pages. Includes a Python package for BSM model building via LLM chat from user-specified particle quantum numbers. Code: https://github.com/saad-hep/bsm_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13007 2026-06-23 cs.LG cs.AI 新提交 92%

scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing

scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序

Ping Xu, Pengjiang Li, Tian Du, Zaitian Wang, Jiawei Gu, Zhiyuan Ning, Ziyue Qiao, Pengfei Wang, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16312 2026-06-23 cs.AI cs.CL 版本更新 92%

EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning

EquivPruner:通过动作剪枝提升基于LLM的搜索效率与质量

Jiawei Liu, Qisi Chen, Jianshu Zhang, Quan Liu, Defu Lian

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) iFLYTEK Research(iFLYTEK研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM搜索中语义等价步骤导致的大量冗余消耗,提出EquivPruner方法,通过剪枝等价动作提升效率,并创建数学等价数据集MathEquiv训练轻量检测器,在多种任务中显著减少token消耗并提高准确性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22179 2026-06-23 cs.CL 新提交 92%

The Score Granularity Gap in Black-Box LLM Classification: A Comparative Study of Confidence Constructions

黑盒LLM分类中的分数粒度差距:置信度构建的比较研究

Ao Sun, Tian Sun, Jiaxing Geng

机构 * institutetext: 1 1(机构1) institutetext: 2 2(机构2) institutetext: 3 3(机构3)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究黑盒LLM分类中置信度分数的粒度差距,比较七种构建方法,发现单次口头置信度排名良好但取值有限,多查询聚合可帮助弱模型但可能降低强模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23345 2026-06-23 cs.AI 新提交 91%

Abstract representational geometry supports inference in large language models

抽象表征几何支持大型语言模型中的推理

Yunan Zeng, Yuwang Wang

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究通过文本版情境反转学习范式,比较人类与LLM的行为和表征,发现LLM内部状态在推理时形成类似海马体的抽象几何结构,且该结构分层组织,高层次表征与推理相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23419 2026-06-23 cs.LG cs.AI 新提交 91%

GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

GRINQH:基于分级输入的量化层次结构用于高效LLM生成

Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann, Emre Neftci

机构 * Fakultät für Informatik, RWTH Aachen(亚琛工业大学计算机科学系) Fakultät für Elektrotechnik und Informationstechnik, RWTH Aachen(亚琛工业大学电气工程与信息技术系) Peter Grünberg Institut, Forschungszentrum Jülich GmbH(于利希研究中心彼得·格林贝格研究所)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出GRINQH框架,利用激活幅度动态分配权重通道精度,统一量化与稀疏化,加速LLM解码阶段,在Llama3和Qwen3上优于现有方法,实现2位生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21023 2026-06-23 cs.LG 新提交 91%

Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

揭秘LLM推理中的数值不稳定性:使用HEAL实现关键任务的可复现推理

Zhenting Zhu, Lucas Thai, Shan Yu, Yicheng Liu, Yifan Qiao, Chenxi Wang, Harry Xu, Junyi Shu

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM在关键任务中因16位精度导致输出不一致的问题,提出HEAL方法,通过INT16量化和代数误差补偿,在保持FP32精度的同时减少性能开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23568 2026-06-23 cs.LG cs.CL 新提交 91%

SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression

SVD-Surgeon:面向大语言模型压缩的最优奇异值手术

Mahmoud Safari, Frank Hutter

机构 * University of Freiburg(弗莱堡大学) Prior Labs ELLIS Institute Tübingen(蒂宾根ELLIS研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出SVD-Surgeon,一种无需训练的方法,将最优脑外科医生框架引入奇异值基,通过闭式更新保留的奇异值补偿截断损失,并基于显著性选择修剪值,可叠加于现有SVD压缩器上,改善困惑度-压缩权衡。

Comments 8 pages, 3 figures, 5 tables; appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22153 2026-06-23 cs.CR cs.AI cs.CL 新提交 91%

$π$-RAG: Oblivious Retrieval via Semantic Quantization and Transcendental Addressing for Large Language Models

$\pi$-RAG:通过语义量化和超越寻址实现的大语言模型遗忘检索

Aniket Wattamwar, Mrunal Kakirwar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出$\pi$-RAG架构,利用$\pi$的数字作为超越熵源,通过语义量化层将用户输入映射到规范意图质心,生成$\pi$-key实现遗忘检索,保障数据隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏