arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-30 至 2025-12-30 共收录 244 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 36 篇

2510.21118 2025-12-30 cs.CL cs.AI 79%

The Gray Zone of Faithfulness: Taming Ambiguity in Unfaithfulness Detection

信仰的灰色地带:在不忠检测中消除歧义

Qiang Ding, Lvzhou Luo, Yixuan Cao, Ping Luo

机构 * Key Lab of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院信息处理重点实验室) State Key Lab of Al Safety(人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的忠实性注释框架和VeriGray基准,用于解决摘要任务中因外部知识边界不明确导致的注释歧义问题,并展示了其对现有方法的挑战。

Comments Update the evaluation results due to the annotation updates; revise the citation to Seo et al., 2025; add the acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22899 2025-12-30 cs.AI cs.CV 77%

HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery

HiSciBench: 一个分层多学科基准,用于从阅读到发现的科学智能

Yaping Zhang, Qixuan Zhang, Xingquan Zhang, Zhiyuan Chen, Wenwen Zhuang, Yupu Liang, Lu Xiang, Yang Zhao, Jiajun Zhang, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 HiSciBench是一个分层多学科基准,用于评估从阅读到发现的科学智能,涵盖五个层次,揭示了模型在不同科学推理阶段的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23701 2025-12-30 cs.CL cs.LG 73%

Eliciting Behaviors in Multi-Turn Conversations

多轮对话中的行为引导

Jing Huang, Shujian Zhang, Lun Wang, Andrew Hard, Rajiv Mathews, John Lambert

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出了一种多轮对话中的行为引导方法,通过分析不同方法的效率,展示了在线方法在多任务中的高成功率,强调了动态基准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22741 2025-12-30 cs.CL 70%

Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis

基于解释和时序对齐的文本引导稀疏专家混合模型用于多模态情感分析

Dongning Rao, Yunbiao Zeng, Zhihua Jiang, Jujian Lv

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于解释和时序对齐的文本引导稀疏专家混合模型,用于提升多模态情感分析的性能。

Comments 9 pages, 9 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22628 2025-12-30 cs.CL 70%

M2G-Eval: Enhancing and Evaluating Multi-granularity Multilingual Code Generation

M2G-Eval: 提升和评估多粒度多语言代码生成

Fanglin Xu, Wei Zhang, Jian Yang, Guo Chen, Aishan Liu, Zhoujun Li, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Hunan University(湖南大学) Ubiquant

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 M2G-Eval通过多粒度多语言框架评估代码生成能力,揭示了不同粒度任务的难度差异和跨语言学习的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22496 2025-12-30 cs.MA cs.AI 70%

Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring

层级教学监督:一种多智能体对抗框架用于可靠的AI辅导

Saisab Sadhu, Ashim Dhor

机构 * AAAI 2026 EGSAI Community Activity(AAAI 2026 EGSAI 社区活动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出层级教学监督框架,通过多智能体对抗机制提升AI辅导的可靠性与效率,实验结果显示其在资源受限环境下表现优异。

Comments Accepted for presentation at the AAAI 2026 EGSAI Community Activity (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23691 2025-12-30 astro-ph.IM astro-ph.GA 67%

Galaxy Zoo Evo: 1 million human-annotated images of galaxies

Galaxy Zoo Evo: 100万张人类标注的星系图像

Mike Walmsley, Steven Bamford, Hugh Dickinson, Tobias Géron, Alexander J. Gordon, Annette M. N. Ferguson, Lucy Fortson, Sandor Kruk, Natalie Lines, Chris J. Lintott, Karen L. Masters, Robert G. Mann, James Pearson, Hayley Roberts, Anna M. M. Scaife, Stefan Schuldt, Brooke Simmons, Rebecca Smethurst, Josh Speagle, Kyle Willett

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 Galaxy Zoo Evo提供100万张人类标注的星系图像,用于构建和评估天文基础模型,支持领域适应和不确定性学习,助力未来天文研究。

Comments Submitted to NeurIPS Datasets and Benchmarks 2025. Positive reviews but rejected by AC; see OpenReview

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 67%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22721 2025-12-30 cs.NI cs.GT 67%

Cyber Resilience in Next-Generation Networks: Threat Landscape, Theoretical Foundations, and Design Paradigms

下一代网络中的网络韧性:威胁图景、理论基础与设计范式

Junaid Farooq, Quanyan Zhu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本书探讨下一代网络中网络韧性的重新概念化与工程化,通过零信任架构、博弈论威胁建模和AI技术,应对复杂威胁挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22680 2025-12-30 eess.SY cs.SY 67%

From Electrochemical Energy Storage to Next-Generation Intelligent Battery Technologies for Electric Vehicles: A Survey

从电化学储能到下一代智能电池技术:电动汽车的综述

Abderaouf Bahi, Amel Ourici, Chaima Lagraa, Siham Lameche, Soundess Halimi, Inoussa Mouiche, Ylias Sabri, Waseem Haider, Mohamed Trari

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了电化学储能技术的最新进展,探讨了智能电池管理系统中机器学习和AI的应用,旨在为电动汽车领域提供下一代电池技术的全面理解。

Comments This work was supervised by leading professor in the field (Pr. Mohamed Trari, Pr. Waseem Haider, Pr. Ylias Sabri)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05948 2025-12-30 cs.LG cs.CL 62%

DE$^3$-BERT: Distance-Enhanced Early Exiting for BERT based on Prototypical Networks

DE$^3$-BERT: 基于原型网络的距离增强型BERT早期退出

Jianing He, Qi Zhang, Weiping Ding, Duoqian Miao, Jun Zhao, Liang Hu, Longbing Cao

机构 * School of Information Engineering, Tianjin University of Commerce(天津商业大学信息工程学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) National Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) DataX Research Centre, School of Computing, Macquarie University(麦考瑞大学计算学院DataX研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 DE$^3$-BERT通过结合局部和全局信息提升BERT的早期退出效果,实验表明其在不同加速比例下性能更优。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23686 2025-12-30 cs.CL cs.SD 57%

PROFASR-BENCH: A Benchmark for Context-Conditioned ASR in High-Stakes Professional Speech

PROFASR-BENCH:面向高风险专业演讲的上下文条件ASR基准

Deepak Babu Piskala

机构 * Seattle, USA(美国西雅图)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 ProfASR-Bench 是一个针对高风险专业演讲的ASR基准测试,通过上下文条件识别评估,揭示了当前系统在利用上下文信息方面的不足。

Comments Benchmark dataset and evaluation suite. Data and code available at: https://huggingface.co/datasets/prdeepakbabu/ProfASR-Bench https://github.com/prdeepakbabu/ProfASR-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20491 2025-12-30 cs.CL 57%

Step-DeepResearch Technical Report

Step-DeepResearch 技术报告

Chen Hu, Haikuo Du, Heng Wang, Lin Lin, Mingrui Chen, Peng Liu, Ruihang Miao, Tianchi Yue, Wang You, Wei Ji, Wei Yuan, Wenjin Deng, Xiaojian Yuan, Xiaoyun Zhang, Xiangyu Liu, Xikai Liu, Yanming Xu, Yicheng Cao, Yifei Zhang, Yongyao Wang, Yubo Shu, Yurong Zhang, Yuxiang Zhang, Zheng Gong, Zhichao Chang, Binyan Li, Dan Ma, Furong Jia, Hongyuan Wang, Jiayu Liu, Jing Bai, Junlan Liu, Manjiao Liu, Na Wang, Qiuping Wu, Qinxin Du, Shiwei Li, Wen Sun, Yifeng Gong, Yonglin Chen, Yuling Zhao, Yuxuan Lin, Ziqi Ren, Zixuan Wang, Aihu Zhang, Brian Li, Buyun Ma, Kang An, Li Xie, Mingliang Li, Pan Li, Shidong Yang, Xi Chen, Xiaojia Liu, Yuchu Luo, Yuan Song, YuanHao Ding, Yuanwei Liang, Zexi Li, Zhaoning Zhang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Jiansheng Chen, Jing Li, Xiangyu Zhang, Yibo Zhu

机构 * Step-DeepResearch

专题命中 评测与基准 :SFT(abstract);分类 cs.CL

AI总结 Step-DeepResearch通过原子能力数据合成策略和渐进式训练路径,实现低成本高效率的深度研究代理,实验表明其在Scale AI Research Rubrics和ADR-Bench上的表现优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22629 2025-12-30 cs.AI cs.IR 57%

DICE: Discrete Interpretable Comparative Evaluation with Probabilistic Scoring for Retrieval-Augmented Generation

DICE:基于概率评分的离散可解释比较评估用于检索增强生成

Shiyan Liu, Jian Ma, Rui Qu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 DICE提出一种基于概率评分的两阶段框架,提升RAG评估的可解释性和稳健性,通过透明判断和系统性错误诊断,实现高效且可信的评估。

Comments Accepted at ResponsibleFM @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22457 2025-12-30 cs.IR 50%

A Real-Time System to Populate FRA Form 57 from News

一种实时系统用于从新闻中填写FRA表单57

Chansong Lim, Haz Sameen Shahgir, Yue Dong, Jia Chen, Evangelos E. Papalexakis

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种实时系统,通过从新闻中提取信息来自动填写FRA表单57,解决了表单复杂性和新闻噪声问题。

Comments to be published in WSDM 2026 Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22452 2025-12-30 cs.CV 50%

SAM 3D for 3D Object Reconstruction from Remote Sensing Images

SAM 3D用于从遥感图像中进行3D物体重建

Junsheng Yao, Lichao Mou, Qingyu Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) MedAI Technology(MedAI技术)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出SAM 3D模型用于遥感图像的3D建筑重建,通过实验验证其在生成几何和边界上的优势,并扩展至城市场景重建,探讨其在城市建模中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22404 2025-12-30 cs.HC cs.SE 50%

Mining the Gold: Student-AI Chat Logs as Rich Sources for Automated Knowledge Gap Detection

挖掘黄金:学生与AI聊天记录作为自动识别知识缺口的丰富来源

Quanzhi Fu, Qiyu Wu, Dan Williams

专题命中 评测与基准 :LLM(abstract)

AI总结 QueryQuilt通过分析学生与AI的聊天记录,自动检测大规模讲座中的知识缺口,提升教学效率。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22310 2025-12-30 cs.CV 50%

MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation

MoFu: 多主体视频生成的尺度感知调制与傅里叶融合

Run Ling, Ke Cao, Jian Lu, Ao Ma, Haowei Liu, Runze He, Changwei Wang, Rongtao Xu, Yihua Shao, Zhanjie Zhang, Peng Wu, Guibing Guo, Wei Feng, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Xingwei Wang

专题命中 评测与基准 :LLM(abstract)

AI总结 MoFu通过尺度感知调制和傅里叶融合解决多主体视频生成中的尺度不一致和排列敏感性问题,提升生成质量。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22218 2025-12-30 cs.CV cs.MM 50%

Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark

面向路牌的视觉问答:ViSignVQA数据集、方法与基准

Hieu Minh Nguyen, Tam Le-Thanh Dang, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University(越南国家大学)

专题命中 评测与基准 :language model(abstract)

AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。

Comments Dataset paper; code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17750 2025-12-30 cs.CV 50%

SPIDER: Spatial Image CorresponDence Estimator for Robust Calibration

SPIDER:用于鲁棒校准的图像对应估计器

Zhimin Shao, Abhay Yadav, Rama Chellappa, Cheng Peng

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 SPIDER是一种通用的图像匹配框架,通过整合共享特征提取主干和两个专用网络头,有效提升在不同场景下的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 43 篇

2508.03332 2025-12-30 cs.LG cs.AI 92%

Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models

探索分层信息有效性以实现小语言模型的后训练量化

He Xiao, Qingyao Yang, Dirui Xie, Wendong Xu, Zunhai Su, Runming yang, Wenyong Zhou, Haobo Liu, Zhengwu Liu, Ngai Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);post-training(title,abstract);large language model(abstract)

AI总结 LieQ通过分层信息有效性量化方法,在亚8B模型中实现高效低比特压缩,减少精度损失并提升边缘设备部署可行性。

Comments low-bit quantization

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07185 2025-12-30 cs.CL cs.AI cs.LG 90%

DySK-Attn: A Framework for Efficient, Real-Time Knowledge Updating in Large Language Models via Dynamic Sparse Knowledge Attention

DySK-Attn:通过动态稀疏知识注意力实现大语言模型高效实时知识更新的框架

Kabir Khan, Priya Sharma, Arjun Mehta, Neha Gupta, Ravi Narayanan

机构 * Department of Computer Science, San Francisco State University, San Francisco, CA 94132, India(计算机科学系,圣何塞州立大学) Department of Computer Science and Engineering, Indian Institute of Technology Bombay, Mumbai 400076, India(印度班加罗尔理工学院计算机科学与工程系) Department of Computer Science and Engineering, Indian Institute of Technology Delhi, New Delhi 110016, India(印度德里理工学院计算机科学与工程系) Department of Computer Science and Automation, Indian Institute of Science, Bengaluru 560012, India(印度班加罗尔科学研究所计算机科学与自动化系) Machine Learning Lab, International Institute of Information Technology Hyderabad (IIIT-H), Hyderabad 500032, India(国际信息科技研究所海得拉巴分所机器学习实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DySK-Attn通过动态稀疏知识注意力机制,实现大语言模型高效实时知识更新,提升事实准确性和计算效率。

Comments Preprint; 7 figures, 3 tables, 1 algorithm; v1. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19486 2025-12-30 cs.LG cs.AI 90%

Efficient Inference Using Large Language Models with Limited Human Data: Fine-Tuning then Rectification

利用有限人类数据高效推理:微调后再校正

Lei Wang, Zikun Ye, Jinglong Zhao

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院) Questrom School of Business, Boston University(波士顿大学questrom商学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段框架,结合微调与校正,并优化有限标记样本的分配,以提高估计和推理性能,实现成本节约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21884 2025-12-30 cs.DC cs.AI cs.NI 89%

Optimizing Resource Allocation for Geographically-Distributed Inference by Large Language Models

通过大语言模型进行地理分布式推断的资源分配优化

Tingyang Sun, Ting He, Bo Ji, Parimal Parag

机构 * Department of Computer Science and Engineering, Pennsylvania State University, University Park, PA, USA(计算机科学与工程系,宾夕法尼亚州立大学,大学公园,PA,USA) Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(计算机科学系,弗吉尼亚理工大学,布莱克堡,VA,USA) Department of Electrical Communication Engineering, Indian Institute of Science, Bangalore, India(电子通信工程系,印度科学研究院,班加罗尔,印度)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出了一种系统研究分布式LLM推断中的资源分配问题,通过块放置和请求路由的优化,显著减少推断时间并开发了轻量级CPU模拟器。

Journal ref Performance Evaluation, Vol. 170, pp. 102527, November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10426 2025-12-30 cs.CL 89%

Computational Economics in Large Language Models: Exploring Model Behavior and Incentive Design under Resource Constraints

在大型语言模型中进行计算经济学:在资源限制下探索模型行为和激励设计

Sandeep Reddy, Kabir Khan, Rohit Patil, Ananya Chakraborty, Faizan A. Khan, Swati Kulkarni, Arjun Verma, Neha Singh

机构 * Department of Computer Science and Engineering, Jorhat Engineering College(计算机科学与工程系,贾尔哈特工程学院) School of Computer Science, KLE Technological University(计算机科学学院,KLE技术大学) Department of Computer Applications, Bundelkhand University(计算机应用系,邦德尔坎德大学) Department of Computer Science, Sant Gadge Baba Amravati University(计算机科学系,桑塔·加德·巴瓦·阿姆拉瓦蒂大学) San Francisco State University(旧金山州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出了一种基于计算经济学的LLM训练方法,通过引入计算成本项促进高效激活,实现更高效的模型和更可解释的注意力模式。

Comments Preprint; 7 figures, 4 tables, 1 algorithm. Experiments on GLUE (MNLI, STS-B, CoLA) and WikiText-103 with BERT-base; evaluation includes FLOPS, latency, Gini and entropy metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22402 2025-12-30 cs.DC cs.AI 89%

Efficient Multi-Model Orchestration for Self-Hosted Large Language Models

高效多模型编排用于自托管大型语言模型

Bhanu Prakash Vangala, Tanu Malik

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Pick和Spin框架通过混合路由模块和自适应自动化,提升自托管LLM的效率和经济性,实现更高的成功率、更低的延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14937 2025-12-30 cs.CL cs.CR 89%

Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)

为大规模语言模型(LLMs)的红队测试构建威胁模型

Apurv Verma, Satyapriya Krishna, Sebastian Gehrmann, Madhavan Seshadri, Anu Pradhan, Tom Ault, Leslie Barrett, David Rabinowitz, John Doucette, NhatHai Phan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出了一种针对大规模语言模型的威胁模型,并系统化地总结了红队攻击的分类、防御方法及实践策略,以提升LLM系统的安全性和鲁棒性。

Comments Transactions of Machine Learning Research (TMLR)

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22682 2025-12-30 cs.CL cs.AI 88%

Conformal Prediction Sets for Next-Token Prediction in Large Language Models: Balancing Coverage Guarantees with Set Efficiency

针对大语言模型的下一个标记预测的符合预测集:在覆盖保证与集合效率之间平衡

Yoshith Roy Kotla, Varshith Roy Kotla

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出VACP框架,通过语义掩码和温度调整评分,在保证覆盖的前提下显著提升预测集效率,实验证明其在大语言模型下一个标记预测中的有效性。

Comments 10 pages, 5 tables and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23014 2025-12-30 cs.CL 87%

Improving Generalization in LLM Structured Pruning via Function-Aware Neuron Grouping

通过函数感知神经元分组提升LLM结构剪枝的泛化能力

Tao Yu, Yongqi An, Kuan Zhu, Guibo Zhu, Ming Tang, Jinqiao Wang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 FANG通过函数感知神经元分组提升LLM结构剪枝的泛化能力,结合FLAP和OBC方法在稀疏性下提升下游任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23184 2025-12-30 cs.AI econ.EM 85%

From Model Choice to Model Belief: Establishing a New Measure for LLM-Based Research

从模型选择到模型信念:为基于大语言模型的研究建立新的度量标准

Hongshen Sun, Juanjuan Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出模型信念作为LLM研究的新度量标准,通过需求估计实验展示其在提高估计精度和降低计算成本方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏