arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 454 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 103 篇

2502.09667 2026-02-10 cs.CL cs.LG stat.ML 62%

Summaries as Centroids for Interpretable and Scalable Text Clustering

摘要作为可解释且可扩展的文本聚类的中心

Jairo Diaz-Rodriguez

机构 * York University(约克大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出k-NLPmeans和k-LLMmeans,通过摘要作为中心实现可解释且可扩展的文本聚类,优于传统方法并接近LLM聚类性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04093 2026-02-10 cs.CL 61%

SearchAttack: Red-Teaming LLMs against Knowledge-to-Action Threats under Online Web Search

SearchAttack: 对知识到行动威胁下对LLM进行红队攻击

Yu Yan, Sheng Sun, Mingfeng Li, Zheming Yang, Chiwei Zhu, Fei Ma, Benfeng Xu, Min Liu, Qi Li

机构 * Institute of Computing Technology, CAS(计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) People's Public Security University of China(中国人民公安大学) University of Science and Technology of China(中国科学技术大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东人工智能与数字经济实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,comments);分类 cs.CL

AI总结 SearchAttack通过重新表述有害语义和测试奖励追逐偏差,揭示LLM在搜索增强任务中的安全漏洞。

Comments Misusing LLM-driven search for harmful information-seeking poses serious risks. We characterize its usability and impact through a comprehensive red-teaming and evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08849 2026-02-10 stat.ML cond-mat.mtrl-sci cs.LG physics.chem-ph 57%

Cutting Through the Noise: On-the-fly Outlier Detection for Robust Training of Machine Learning Interatomic Potentials

在噪声中穿行:面向机器学习互原子势稳健训练的实时异常检测

Terry C. W. Lam, Niamh O'Neill, Christoph Schran, Lars L. Schaaf

机构 * Cavendish Laboratory, Department of Physics, University of Cambridge(卡文迪许实验室,物理系,剑桥大学) Lennard-Jones Centre, University of Cambridge(兰纳德-琼斯中心,剑桥大学) Yusuf Hamied Department of Chemistry, University of Cambridge(尤苏夫·哈米德化学系,剑桥大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出了一种实时异常检测方法,通过自动降低噪声样本权重,提升机器学习互原子势在不完美数据集上的训练鲁棒性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08765 2026-02-10 cs.SE cs.AI 57%

Taming Scylla: Understanding the multi-headed agentic daemon of the coding seas

驯服斯基拉:理解编码海洋中的多头代理守护程序

Micah Villmow

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出Scylla框架,用于评估代理编码工具,通过结构化消融研究量化复杂性和效率的权衡,表明架构复杂性不总是提升质量。

Comments 32 Pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01655 2026-02-10 cs.AI cs.SE 57%

ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development

ProjDevBench: 从端到端项目开发角度评估AI编程代理

Pengrui Lu, Shiqi Zhang, Yunzhong Hou, Lyumanshan Ye, Chaoyi Huang, Zixi Chen, Ji Zeng, Hantao Jiang, Pengfei Liu, Yiwei Wang, Ming-Hsuan Yang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Beijing Institute of Technology, Beijing, China(北京理工大学) University of California, Merced, CA, USA(加州大学默塞德分校) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 ProjDevBench从端到端项目开发角度评估AI编程代理,通过系统架构设计、功能正确性和迭代优化三个维度,评估六种基于不同LLM的代理,发现其在复杂系统设计和资源管理方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19171 2026-02-10 cs.HC cs.AI 57%

Bridging Gulfs in UI Generation through Semantic Guidance

通过语义引导弥合UI生成中的沟壑

Seokhyeon Park, Soohyun Lee, Eugene Choi, Hyunwoo Kim, Minkyu Kweon, Yumin Song, Jinwook Seo

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 通过语义引导弥合UI生成中的执行与评估沟壑,提升用户对设计意图和结果的控制与理解。

Comments In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26098 2026-02-10 cs.AI 57%

GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks

GUI知识基准:揭示VLMs在GUI任务中的知识差距

Chenrui Shi, Zedong Yu, Zhi Gao, Ruining Feng, Enqi Liu, Yuwei Wu, Yunde Jia, Liuyu Xiang, Zhaofeng He, Qing Li

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室) Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 GUI知识基准揭示VLMs在GUI任务中的知识差距,通过提炼三个维度的GUI知识,评估现有模型的不足并指导更高效的任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13786 2026-02-10 cs.SD cs.AI 57%

DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer

DegDiT:基于动态事件图引导的扩散变换器的可控音频生成

Yisu Liu, Chenxing Li, Wanqian Zhang, Wenfu Wang, Meng Yu, Ruibo Fu, Zheng Lin, Weiping Wang, Dong Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tencent, AI Lab(腾讯AI实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.AI

AI总结 DegDiT通过动态事件图引导的扩散变换器框架,实现了开放式词汇可控音频生成,提升了生成音频的准确性和多样性。

Journal ref IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19385 2026-02-10 cs.AI 57%

CID-GraphRAG: Enhancing Multi-Turn Dialogue Systems through Dual-Pathway Retrieval of Conversation Flow and Context Semantics

CID-GraphRAG:通过对话流程和上下文语义的双路径检索增强多轮对话系统

Ziqi Zhu, Tao Hu, Honglong Zhang, Dan Yang, Hangeng Chen, Mengran Zhang, Xilun Chen

机构 * Amazon Web Services(亚马逊网络服务) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 CID-GraphRAG通过结合意图转换结构与语义检索,提升多轮对话系统的响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08031 2026-02-10 cs.CL 57%

Beyond Raw Detection Scores: Markov-Informed Calibration for Boosting Machine-Generated Text Detection

超越原始检测分数:基于马尔可夫的校准以提升机器生成文本检测

Chenwang Wu, Yiu-ming Cheung, Shuhai Zhang, Bo Han, Defu Lian

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种基于马尔可夫随机场的校准策略,用于提升机器生成文本检测的准确性,通过减少token级检测分数的偏差,提高检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07735 2026-02-10 cs.LG q-bio.BM 57%

TerraBind: Fast and Accurate Binding Affinity Prediction through Coarse Structural Representations

TerraBind: 通过粗粒结构性表示实现快速且准确的结合亲和力预测

Matteo Rossi, Ryan Pederson, Miles Wang-Henderson, Ben Kaufman, Edward C. Williams, Carl Underkoffler, Owen Lewis Howell, Adrian Layer, Stephan Thaler, Narbe Mardirossian, John Anthony Parkhill

机构 * Terray Therapeutics, Inc.(Terray Therapeutics公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 TerraBind通过粗粒结构性表示实现了快速且准确的结合亲和力预测,其推理速度比现有方法快26倍,同时在亲和力预测准确性上提升了约20%。

Comments 31 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07645 2026-02-10 cs.CV cs.AI 57%

From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding

从死像素到可编辑幻灯片:通过视觉-语言区域理解将信息图转换为原生Google幻灯片

Leonardo Gonzalez

机构 * Trilogy AI Center of Excellence(Trilogy AI卓越中心)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 通过视觉-语言区域理解,将信息图转换为可编辑的Google幻灯片,实现元素恢复和布局保真度的高精度转换。

Comments Accepted for publication in the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26), April 13-17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07550 2026-02-10 cs.CV cs.AI 57%

Revealing the Semantic Selection Gap in DINOv3 through Training-Free Few-Shot Segmentation

通过无训练少样本分割揭示DINOv3中的语义选择差距

Hussni Mohd Zakir, Eric Tatt Wei Ho

机构 * Department of Electrical & Electronics Engineering(电子与电气工程系) Universiti Teknologi PETRONAS(技术大学PETRONAS)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本研究通过无训练方法揭示DINOv3中存在语义选择差距,指出最后一层特征虽表现优异,但无法可靠识别高保真语义特征。

Comments 10 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07243 2026-02-10 cs.RO cs.AI cs.GR 57%

Realistic Synthetic Household Data Generation at Scale

大规模生成逼真合成家庭数据

Siddharth Singh, Ifrah Idrees, Abraham Dauhajre

机构 * Siddharth Singh(1 西雅图)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种大规模生成逼真合成家庭数据的方法,通过松耦合生成人机交互与环境数据,实现双向影响建模,提升家庭智能设备的开发与测试能力。

Comments Accepted at Agentic AI Benchmarks and Applications for Enterprise Tasks workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22978 2026-02-10 cs.CL 57%

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp: LLMs 是否真的准备好为您的购物车服务?

Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

机构 * ByteDance(字节跳动)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14271 2026-02-10 cs.CL 57%

FAID: Fine-Grained AI-Generated Text Detection Using Multi-Task Auxiliary and Multi-Level Contrastive Learning

FAID:利用多任务辅助和多级对比学习进行细粒度AI生成文本检测

Minh Ngoc Ta, Dong Cao Van, Duc-Anh Hoang, Minh Le-Anh, Truong Nguyen, My Anh Tran Nguyen, Yuxia Wang, Preslav Nakov, Sang Dinh

机构 * BKAI Research Center, Hanoi University of Science and Technology(河内科学技术大学BKAI研究中心) MBZUAI INSAIT, Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·奥赫里德斯"INSAIT)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 FAID通过多任务辅助和多级对比学习,实现对AI生成文本的细粒度分类与识别,提升AI辅助写作的透明度和可问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07041 2026-02-10 cs.CV cs.LG 57%

OMNI-Dent: Towards an Accessible and Explainable AI Framework for Automated Dental Diagnosis

OMNI-Dent:迈向一个可及且可解释的AI框架,用于自动化牙科诊断

Leeje Jang, Yao-Yi Chiang, Angela M. Hastings, Patimaporn Pungchanchaikul, Martha B. Lucas, Emily C. Schultz, Jeffrey P. Louie, Mohamed Estai, Wen-Chen Wang, Ryan H. L. Ip, Boyen Huang

机构 * University of Minnesota(明尼苏达大学) Khon Kaen University(科恩卡恩大学) Minnesota State University(明尼苏达州立大学) The University of Western Australia(西澳大学) Kaohsiung Medical University(高雄医学院) Auckland University of Technology(奥克兰理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 OMNI-Dent通过结合临床推理原则和视觉语言模型,提供一个数据高效且可解释的牙科诊断框架,帮助用户识别异常并判断是否需要专业评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07034 2026-02-10 cs.AI 57%

ST-Raptor: An Agentic System for Semi-Structured Table QA

ST-Raptor:一个用于半结构化表格问答的智能系统

Jinxiu Qu, Zirui Tang, Hongzhang Huang, Boyu Niu, Wei Zhou, Jiannan Wang, Yitong Song, Guoliang Li, Xuanhe Zhou, Fan Wu

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 ST-Raptor通过结合视觉编辑、树形结构建模和代理驱动查询解决,提升半结构化表格问答的准确性和易用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07014 2026-02-10 cs.CV cs.AI 57%

Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation

Vectra: 一种新的度量标准、数据集和模型用于电子商务图像中的图像翻译视觉质量评估

Qingyu Wu, Yuxuan Han, Haijun Li, Zhao Xu, Jianshan Zhao, Xu Jin, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 评测与基准 :instruction tuning(abstract);分类 cs.AI

AI总结 Vectra提出了一种无参考、基于大语言模型的视觉质量评估框架,通过多维度量系统、数据集和模型提升电子商务图像翻译的视觉质量评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08977 2026-02-10 eess.SY cs.SY 50%

Contraction Metric Based Safe Reinforcement Learning Force Control for a Hydraulic Actuator with Real-World Training

基于收缩度量的液压执行器安全强化学习力控制(真实世界训练)

Lucca Maitan, Lucas Toschi, Cícero Zanette, Elisa G. Vergamini, Leonardo F. Santos, Thiago Boaventura

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出基于收缩度量的液压执行器安全强化学习方法,通过真实硬件训练提升力控制性能并抑制不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13261 2026-02-10 cs.CV 50%

Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges

构建第一人称程序化AI助手:方法、基准和挑战

Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang

机构 * Department of EEE(电子工程系) The Hong Kong Polytechnic University(香港理工大学) RayNeo Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出第一人称程序化AI助手,探讨其核心任务、赋能维度及挑战,通过实验评估现有方法并指明未来研究方向。

Comments Under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19184 2026-02-10 cs.CV 50%

A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches

对类无关计数的综述:从基于参考到开放世界文本引导方法的进展

Luca Ciampi, Ali Azmoudeh, Elif Ecem Akbaba, Erdi Sarıtaş, Ziya Ata Yazıcı, Hazım Kemal Ekenel, Giuseppe Amato, Fabrizio Falchi

机构 * CNR-ISTI Istanbul Technical University(伊斯坦布尔技术大学) Division of Engineering, NYU Abu Dhabi(NYU阿布扎比分校工程系)

专题命中 评测与基准 :language model(abstract)

AI总结 本文综述了类无关计数方法,提出三种范式并评估了30种架构,探讨了其性能、挑战及未来方向。

Comments Preprint version of an article accepted ad Elsevier's CVIU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07931 2026-02-10 cs.CV 50%

Which private attributes do VLMs agree on and predict well?

VLMs在哪些隐私属性上达成一致并预测良好?

Olena Hrynenko, Darya Baranouskaya, Alina Elena Baia, Andrea Cavallaro

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构)

专题命中 评测与基准 :language model(abstract)

AI总结 本文研究了VLMs在隐私属性识别上的表现,发现其在某些属性上与人类标注一致且预测准确,可辅助大规模图像数据集的隐私标注。

Comments This work has been accepted to the ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05218 2026-02-10 cs.CV 50%

MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm

MonkeyOCR: 一种基于结构-识别-关系三元组范式的文档解析方法

Zhang Li, Yuliang Liu, Qiang Liu, Zhiyin Ma, Ziyang Zhang, Shuo Zhang, Biao Yang, Zidun Guo, Jiarui Zhang, Xinyu Wang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公)

专题命中 评测与基准 :foundation model(abstract)

AI总结 MonkeyOCR通过结构-识别-关系三元组范式实现文档解析,提出MonkeyDoc数据集并训练30亿参数基础模型,提升性能并优化部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 104 篇

2602.07375 2026-02-10 cs.CL cs.LG 92%

Efficient Post-Training Pruning of Large Language Models with Statistical Correction

大型语言模型高效后训练剪枝与统计修正

Peiqi Yu, Jinhao Wang, Xinyi Sui, Nam Ling, Wei Wang, Wei Jiang

机构 * Department of Computer Science and Engineering, Santa Clara University, Santa Clara, CA, USA(计算机科学与工程系,圣克拉拉大学) Futurewei Technologies, Inc., USA(未来韦艾技术公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文提出了一种基于模型权重和激活统计性质的轻量级后训练剪枝方法,通过统计修正提升剪枝性能,同时保持计算效率。

Comments 11 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07035 2026-02-10 cs.AI cs.LG 92%

DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents

DLLM-Searcher: 为搜索代理适应扩散大语言模型

Jiahao Zhao, Shaoxuan Xu, Zhongxiang Sun, Fengqi Zhu, Jingyang Ou, Yuling Shi, Chongxuan Li, Xiao Zhang, Jun Xu

机构 * Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 DLLM-Searcher通过优化基于dLLM的搜索代理,解决代理能力不足和延迟挑战,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07596 2026-02-10 cs.LG cs.AI 91%

Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization

Astro: 基于激活引导的结构正则化用于鲁棒性LLM后训练量化

Xi Chen, Ming Li, Junxi Li, Changsheng Li, Peisong Wang, Lizhong Ding, Ye Yuan, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hebei Province Key Laboratory of Big Data Science and Intelligent Technology(河北省大数据科学与智能技术重点实验室)

专题命中 效率与部署 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 Astro通过激活引导的结构正则化方法,在高效且无延迟的情况下提升LLM后训练量化的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05846 2026-02-10 cs.CL 90%

Luth: Efficient French Specialization for Small Language Models and Cross-Lingual Transfer

Luth:小语言模型和跨语言迁移的高效法语专业化

Maxence Lasbordes, Sinoué Gad

机构 * LightOn, Paris Inria Paris(LightOn 巴黎 国家信息与自动化所巴黎)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 Luth通过定向后训练提升法语小语言模型性能,同时保留英语能力,并通过模型合并增强跨语言迁移效果。

Comments Accepted at the EACL 2026 Student Research Workshop (SRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11731 2026-02-10 cs.LG cs.AI cs.CL 90%

Dist2ill: Distributional Distillation for One-Pass Uncertainty Estimation in Large Language Models

Dist2ill: 基于分布的蒸馏用于大语言模型中单次传递的不确定性估计

Yicong Zhao, King Yeung Tsang, Harshil Vejendla, Haizhou Shi, Zhuohang Li, Zhigang Hua, Qi Xu, Tunyu Zhang, Yi Wang, Ligong Han, Bradley A. Malin, Hao Wang

机构 * Rutgers University(罗格斯大学) Vanderbilt University(范德比尔特大学) Meta

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Dist2ill通过在单次推断中生成多个多样化的推理路径,利用轻量级模块近似置信度分数,实现大语言模型中更准确的不确定性估计。

Comments Preprint; work in progress. Update Log: 05/2025 (v1&v2): Introduced Dist2ill (previously named EUD) for efficient uncertainty estimation, focusing on discriminative reasoning tasks. 02/2026 (v3): Extended Dist2ill to a unified framework supporting both discriminative and generative reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07804 2026-02-10 cs.CL cs.AI 90%

Pruning as a Cooperative Game: Surrogate-Assisted Layer Contribution Estimation for Large Language Models

剪枝作为合作博弈:用于大型语言模型的代理辅助层贡献估计

Xuan Ding, Pengyu Tong, Ranjie Duan, Yunjian Zhang, Rui Sun, Yao Zhu

机构 * Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Beijing Normal University(北京师范大学) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于博弈论的层剪枝方法,利用代理网络估计层贡献,实现高效且有效的大型语言模型剪枝。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏