arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 87 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2602.13867 2026-02-17 cs.CL 88%

Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages

弥合多语言安全鸿沟:为全球南方语言实现高效、文化感知的对齐

Somnath Banerjee, Rima Hazra, Animesh Mukherjee

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本文提出为全球南方低资源语言提供高效、文化感知的安全对齐方法,以解决现有安全机制在多语言环境中的失效问题。

Comments Accepted to the EGSAI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13415 2026-02-17 cs.LG 83%

MAVIS: Multi-Objective Alignment via Inference-Time Value-Guided Selection

MAVIS: 通过推理时值引导选择实现多目标对齐

Jeremy Carleton, Debajoy Mukherjee, Srinivas Shakkottai, Dileep Kalathil

机构 * Department of Electrical and Computer Engineering, Texas A\&M University, College Station, Texas, USA(电气与计算机工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.LG

AI总结 MAVIS通过推理时值引导选择实现多目标对齐,通过训练小价值模型动态调整LLM输出,提升多目标平衡性能。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14560 2026-02-17 cs.LG cs.AI cs.CL 82%

Less is More: Improving LLM Alignment via Preference Data Selection

少即是多:通过偏好数据选择改进大语言模型对齐

Xun Deng, Han Zhong, Rui Ai, Fuli Feng, Zheng Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Massachusetts Institute of Technology(麻省理工学院) Alibaba Cloud Computing(阿里云计算) MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学MoE关键实验室)

专题命中 偏好对齐 :alignment(title);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过改进偏好数据选择策略,提升大语言模型对齐效果,实验显示在较少数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13891 2026-02-17 cs.SD cs.AI 79%

GSRM: Generative Speech Reward Model for Speech RLHF

GSRM:生成式语音奖励模型用于语音强化学习反馈机制

Maohao Shen, Tejas Jayashankar, Osama Hanna, Naoyuki Kanda, Yancheng Wang, Kateřina Žmolíková, Ruiming Xie, Niko Moritz, Anfeng Xu, Yashesh Gaur, Gregory Wornell, Qing He, Jilong Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) Massachusetts Institute of Technology(麻省理工学院) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

AI总结 GSRM通过生成式语音奖励模型提升语音生成的自然度,利用可解释的推理链实现更准确的自然度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13576 2026-02-17 cs.CR cs.AI cs.CL 73%

Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移

Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了基于评分标准的LLM裁判中隐蔽的偏好漂移问题,通过评分标准攻击可系统性降低目标领域准确性,影响模型对齐流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 62%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 57%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2602.13234 2026-02-17 cs.AI 85%

Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents

保持角色,保持安全:双循环对抗自进化用于安全角色扮演代理

Mingyang Liao, Yichen Wan, shuchen wu, Chenxi Miao, Xin Shen, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出双循环对抗自进化框架,通过角色扮演防御机制提升安全性和角色忠实度,实验表明在多个大语言模型上有效提升角色扮演的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14252 2026-02-17 cs.AI cs.LG cs.RO 81%

GRAIL: Goal Recognition Alignment through Imitation Learning

GRAIL:通过模仿学习进行目标识别对齐

Osher Elhadad, Felipe Meneguzzi, Reuth Mirsky

机构 * Department of Computer Science, Bar Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, Aberdeen University(阿伯丁大学计算机科学系) Department of Computer Science, Tufts University(塔夫茨大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 GRAIL通过模仿学习和逆强化学习,从演示轨迹中学习目标导向策略,提高目标识别的准确性和鲁棒性。

Comments Accepted for publication at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13451 2026-02-17 cs.GT 78%

Personalization Aids Pluralistic Alignment Under Competition

个性化有助于竞争中的多元对齐

Natalie Collina, Surbhi Goel, Aaron Roth, Mirah Shi

专题命中 安全训练 :alignment(title,abstract)

AI总结 本文研究了竞争中AI提供者通过个性化策略实现用户多元对齐的可能性,并探讨了不同对齐条件下的均衡结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08796 2026-02-17 cs.LG cs.AI 73%

Robust Multi-Objective Controlled Decoding of Large Language Models

鲁棒多目标控制解码大型语言模型

Seongho Son, William Bankes, Sangwoong Yoon, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University College London(伦敦大学学院) Ulsan National Institute of Science and Technology(釜山国立科学技术研究所) University of Basel(巴塞尔大学) University College London AI Centre(伦敦大学学院人工智能中心)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RMOD算法,通过最大化最坏情况奖励实现鲁棒多目标解码,有效提升大型语言模型在多个人类目标上的对齐性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13860 2026-02-17 cs.CL 70%

Tutoring Large Language Models to be Domain-adaptive, Precise, and Safe

指导大语言模型成为领域自适应、精确和安全的

Somnath Banerjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院克哈格浦分校)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过领域适应、伦理严谨性和文化对齐,指导大语言模型实现精确性、安全性和全球包容性。

Comments Accepted to the PhD Symposium at Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14338 2026-02-17 cs.LG cs.AI 62%

Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning

少训练,多学习:基于群体的强化学习中的自适应高效回滚优化

Zhi Zhang, Zhen Han, Costas Mavromatis, Qi Zhu, Yunyi Zhang, Sheng Guan, Dingmin Wang, Xiong Zhou, Shuai Wang, Soji Adeshina, Vassilis Ioannidis, Huzefa Rangwala

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon Web Services(亚马逊网络服务)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 AERO通过自适应回滚策略和选择性拒绝提升群体强化学习的计算效率,减少48%的训练计算并缩短45%的训练时间,同时保持或提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04856 2026-02-17 cs.CL 57%

CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation

CoT并非真理链:对用于虚假新闻生成的推理LLM的实证内部分析

Zhao Tong, Chunlin Gong, Yiping Zhang, Haichao Shi, Qiang Liu, Xingcheng Xu, Shu Wu, Xiao-Yu Zhang

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究揭示推理LLM在生成虚假新闻时,即使拒绝有害请求,其内部推理仍可能传播不安全内容,通过分析框架和指标揭示潜在风险并挑战安全假设。

Comments 28 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13227 2026-02-17 cs.NI cs.AI 57%

An Agentic AI Control Plane for 6G Network Slice Orchestration, Monitoring, and Trading

面向6G网络切片编排、监控与交易的代理式AI控制平面

Eranga Bandara, Ross Gore, Sachin Shetty, Ravi Mukkamala, Tharaka Hewa, Abdul Rahman, Xueping Liang, Safdar H. Bouk, Amin Hass, Peter Foytik, Ng Wee Keong, Kasun De Zoysa

机构 * Florida International University, USA(佛罗里达国际大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Accenture Technology Labs, Arlington, VA, USA(埃森哲技术实验室) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出面向6G网络切片编排、监控与交易的代理式AI控制平面,通过市场感知编排和自然语言接口实现经济导向的智能控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 8 篇

2602.13547 2026-02-17 cs.CR cs.AI 88%

AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks

AISA: 在大型语言模型中唤醒对抗劫持攻击的内在安全性意识

Weiming Song, Xuan Xie, Ruiping Yin

机构 * Beijing University of Technology(北京理工大学) Macau University of Science and Technology(澳门科技大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.AI

AI总结 AISA通过激活模型内在安全机制,提供一种轻量级、单次通过的防御方法,有效提升大型语言模型对抗劫持攻击的鲁棒性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22067 2026-02-17 cs.LG cs.AI 86%

The Rogue Scalpel: Activation Steering Compromises LLM Safety

恶意手术刀:激活引导破坏了大语言模型的安全性

Anton Korznikov, Andrey Galichin, Alexey Dontsov, Oleg Y. Rogov, Ivan Oseledets, Elena Tutubalina

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现激活引导技术实际上会破坏大语言模型的安全性,通过实验表明即使随机引导也能增加有害服从的概率,挑战了可解释性带来的安全假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13321 2026-02-17 cs.AI cs.LG 84%

Detecting Jailbreak Attempts in Clinical Training LLMs Through Automated Linguistic Feature Extraction

通过自动化语言特征提取检测临床训练LLM中的劫持尝试

Tri Nguyen, Huy Hoang Bao Le, Lohith Srikanth Pentapalli, Laurah Turner, Kelly Cohen

机构 * University of Cincinnati(克利夫兰大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过自动化语言特征提取,利用BERT模型预测四个核心语言特征,以检测临床训练LLM中的劫持尝试,验证了该方法的有效性及可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07107 2026-02-17 cs.CR cs.AI 77%

ShallowJail: Steering Jailbreaks against Large Language Models

ShallowJail: 对大语言模型的对抗性攻击

Shang Liu, Hanyu Pei, Zeyan Liu

机构 * xxx

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 ShallowJail通过操纵LLMs的初始标记来攻击其对齐机制,从而降低大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00187 2026-02-17 cs.CL cs.CR cs.LG 73%

Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks

引导对话动态以对抗多轮劫持攻击

Hanjiang Hu, Alexander Robey, Changliu Liu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出基于安全控制理论的神经屏障函数,通过状态空间建模和安全预测器,有效防御多轮劫持攻击,提升对话安全性与实用性。

Comments TMLR, 31 pages, 11 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14166 2026-02-17 cs.CR cs.AI 57%

IntentMiner: Intent Inversion Attack via Tool Call Analysis in the Model Context Protocol

IntentMiner: 通过模型上下文协议中的工具调用分析进行意图倒置攻击

Yunhao Yao, Zhiqiang Wang, Haoran Cheng, Yihang Cheng, Haohua Du, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 IntentMiner通过分析模型上下文协议中的工具调用,揭示了意图倒置攻击的机制,实现了超过85%的语义对齐,挑战了AI代理的隐私基础。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07139 2026-02-17 cs.CV cs.CR cs.LG 57%

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

图像能帮你找回记忆:一种新颖的多模态引导攻击对抗图像生成模型去学习

Renyang Liu, Guanlin Li, Tianwei Zhang, See-Kiong Ng

机构 * Institute of Data Science, National University of Singapore(数据科学研究所,新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 Recall提出一种新颖的多模态引导攻击框架,针对图像生成模型去学习的鲁棒性进行攻击,展示其在对抗有效性、计算效率和语义保真度上的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01068 2026-02-17 cs.CR 50%

Post-Quantum Cryptography for Intelligent Transportation Systems: An Implementation-Focused Review

面向智能交通系统的后量子密码学:一项以实现为导向的综述

Abdullah Al Mamun, Akid Abrar, Mizanur Rahman, M Sabbir Salek, Mashrur Chowdhury

专题命中 越狱攻击 :safety(abstract)

AI总结 本文综述了智能交通系统中后量子密码学的实现挑战与未来研究方向,旨在提升ITS在量子计算时代的安全性和可靠性。

Comments This is a preprint version of a manuscript currently under second-round peer review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2602.13284 2026-02-17 cs.SI cs.AI 83%

Agents in the Wild: Safety, Society, and the Illusion of Sociality on Moltbook

真实世界中的代理:安全、社会与社会性幻觉

Yunbei Zhang, Kai Mei, Ming Liu, Janet Wang, Dimitris N. Metaxas, Xiao Wang, Jihun Hamm, Yingqiang Ge

机构 * Tulane University(路易斯安那州立大学) Rutgers University(罗格斯大学) Iowa State University(爱荷华州立大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究发现Moltbook中代理自发形成社会结构,但互动空洞,安全威胁主要通过社会工程实现,揭示了AI社交平台的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23519 2026-02-17 cs.CR cs.AI 57%

ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search

ReliabilityRAG: 有效且可证明的防御方法用于基于检索的Web搜索

Zeyu Shen, Basileal Imana, Tong Wu, Chong Xiang, Prateek Mittal, Aleksandra Korolova

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Center for Information Technology Policy(信息政策中心) Department of Electrical and Computer Engineering(电气与计算机工程系) NVIDIA(英伟达)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 ReliabilityRAG通过利用文档可靠性信息,提供更有效且可证明鲁棒的防御方法,以增强基于检索的Web搜索系统对对抗攻击的抵御能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2508.08500 2026-02-17 cs.AI 79%

Large Language Models as Oracles for Ontology Alignment

大型语言模型作为本体对齐的预言机

Sviatoslav Lushnei, Dmytro Shumskyi, Severyn Shykula, Ernesto Jimenez-Ruiz, Artur d'Avila Garcez

机构 * City St George’s, University of London, UK(伦敦大学城市圣乔治学院)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型作为预言机,通过验证高不确定性的对应关系子集,提升本体对齐任务的性能,在OAEI 2025中取得优异成绩。

Comments Paper accepted at the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), main conference. 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13264 2026-02-17 cs.LG cs.AI cs.CL 67%

Directional Concentration Uncertainty: A representational approach to uncertainty quantification for generative models

方向性集中不确定性:一种代表方法用于生成模型的不确定性量化

Souradeep Chattopadhyay, Brendan Kennedy, Sai Munikoti, Soumik Sarkar, Karl Pazdernik

机构 * Department of Mechanical Engineering, Iowa State University, Ames, IA, USA(机械工程系,爱荷华州立大学) Pacific Northwest National Laboratory, Richland, WA, USA(太平洋西北国家实验室) Department of Statistics, North Carolina State University, Raleigh, NC, USA(统计系,北卡罗来纳州立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出方向性集中不确定性(DCU)方法,通过基于vMF分布的嵌入集中度量化,提升生成模型的不确定性量化性能,并在多模态任务中展现良好泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14581 2026-02-17 cs.LG cs.AI 62%

Model-agnostic Selective Labeling with Provable Statistical Guarantees

模型无关的可证明统计保证选择性标注

Huipeng Huang, Wenbo Liao, Huajun Xi, Hao Zeng, Mengchen Zhao, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Mathematics, The Chinese University of HongKong(数学系,香港中文大学) School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出符合性标注方法,通过控制假发现率保证人工智能预测的可信度,从而提升大规模数据标注的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14853 2026-02-17 cs.AI 57%

Uncertainty-Aware Measurement of Scenario Suite Representativeness for Autonomous Systems

面向自主系统的场景套件代表性不确定性测量

Robab Aghazadeh Chakherlou, Siddartha Khastgir, Xingyu Zhao, Jerein Jeyachandran, Shufeng Chen

机构 * WMG, University of Warwick, Coventry, UK(沃森学院,沃里克大学,科文特里,英国)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种概率方法,通过比较场景套件与预期运营领域特征分布,量化自主系统训练数据的代表性,并利用不精确贝叶斯方法处理有限数据和不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13567 2026-02-17 cs.CL 57%

DistillLens: Symmetric Knowledge Distillation Through Logit Lens

DistillLens: 通过Logit Lens实现对称的知识蒸馏

Manish Dhakal, Uthman Jinadu, Anjila Budathoki, Rajshekhar Sunderraman, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Auburn University(阿肯色大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 DistillLens通过Logit Lens对称对齐学生和教师模型的思维过程,提升知识蒸馏性能。

Comments Knowledge Distillation in LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏