arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-29 至 2025-12-29 共收录 127 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 25 篇

2507.07413 2025-12-29 cs.CR cs.AI cs.LG 86%

Hybrid LLM-Enhanced Intrusion Detection for Zero-Day Threats in IoT Networks

混合LLM增强的物联网网络零日威胁入侵检测

Mohammad F. Al-Hammouri, Yazan Otoum, Rasha Atwa, Amiya Nayak

机构 * Dept. of Computer Engineering, The Hashemite University(计算机工程系,哈希米大学) School of Computer Science and Technology, Algoma University(计算机科学与技术学院,阿尔戈马大学) College of Computer Science and Engineering, University of Jeddah(计算机科学与工程学院,朱德赫大学) School of Electrical Engineering and Computer Science, University of Ottawa(电气工程与计算机科学学院,渥太华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合传统签名检测与GPT-2语言模型的混合入侵检测框架,以提升物联网网络中零日威胁的检测准确率和减少误报。

Comments 6 pages, IEEE conference

Journal ref Proc. IEEE/ACIS International Conference on Software Engineering, Artificial Intelligence, Networking and Parallel/Distributed Computing (SNPD), 2025, pp. 864-869

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21309 2025-12-29 cs.MA 85%

A Plan Reuse Mechanism for LLM-Driven Agent

面向LLM驱动代理的计划重用机制

Guopeng Li, Ruiqi Wu, Haisheng Tan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AgentReuse机制,通过意图分类和语义相似性评估,实现LLM驱动代理计划重用,有效降低延迟,提升用户体验。

Comments This paper is an English version of A Plan Reuse Mechanism for LLM-Driven Agent published in 2024 in the Journal of Computer Research and Development

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20926 2025-12-29 cs.CG 85%

Uncovering Hierarchical Structure in LLM Embeddings with $δ$-Hyperbolicity, Ultrametricity, and Neighbor Joining

通过δ-超几何性、超度量性和邻接连接揭示LLM嵌入的层次结构

Prakash Chourasia, Sarwan Ali, Murray Patterson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过δ-超几何性、超度量性和邻接连接度量揭示LLM嵌入的层次结构,发现其超几何性和超度量性与机器学习任务性能相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21582 2025-12-29 cs.CV 85%

LLM-Free Image Captioning Evaluation in Reference-Flexible Settings

无需大型语言模型的图像描述评估在参考灵活设置中的应用

Shinnosuke Hirano, Yuiga Wada, Kazuki Matsuda, Seitaro Otsuki, Komei Sugiura

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Pearl是一种无需大型语言模型的图像描述评估指标,适用于基于参考和非参考设置,通过学习图像-描述和描述-描述相似性来提升评估性能。

Comments Accepted for presentation at AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13464 2025-12-29 cs.CL cs.AI 84%

Unveiling the Learning Mind of Language Models: A Cognitive Framework and Empirical Study

揭示语言模型的学习心智:一种认知框架与实证研究

Zhengyu Hu, Jianxun Lian, Zheyuan Xiao, Seraphina Zhang, Tianfu Wang, Nicholas Jing Yuan, Xing Xie, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科学与技术大学计算机科学与工程系) Microsoft Research Asia(微软亚洲研究院) University of Cambridge(剑桥大学) Microsoft(微软)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种认知框架,将学习能力分解为三个维度,并通过实证研究揭示LLMs在不同学习场景下的表现与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21871 2025-12-29 cs.CL cs.AI cs.CR cs.CY 81%

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?

Naen Xu, Jinghuai Zhang, Changjiang Li, Hengyu An, Chunyi Zhou, Jun Wang, Boyu Xu, Yuyuan Li, Tianyu Du, Shouling Ji

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22100 2025-12-29 cs.CL cs.AI 79%

Introducing TrGLUE and SentiTurca: A Comprehensive Benchmark for Turkish General Language Understanding and Sentiment Analysis

引入TrGLUE和SentiTurca:土耳其通用语言理解与情感分析的综合基准

Duygu Altinok

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrGLUE和SentiTurca两个土耳其语综合基准,用于评估自然语言理解和情感分析能力,通过半自动化流程构建高质量数据集,支持研究人员进行模型微调和评估。

Comments under review by Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03688 2025-12-29 cs.CL cs.AI 79%

A Comparison of DeepSeek and Other LLMs

深度学习模型与其它LLM的比较

Tianchen Gao, Jiashun Jin, Zheng Tracy Ke, Gabriel Moryoussef

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了DeepSeek与其他LLM在作者分类和引用分类任务中的性能,发现DeepSeek在多数情况下表现优于其他模型,但成本较低。

Comments 30 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02519 2025-12-29 cs.AI cs.LG 79%

Creative Agents: Empowering Agents with Imagination for Creative Tasks

创意代理:通过想象力赋能代理以完成创意任务

Penglin Cai, Chi Zhang, Yuhui Fu, Haoqi Yuan, Zongqing Lu

机构 * School of Computer Science Peking University(北京大学计算机学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出通过增强想象力的创意代理,首次在Minecraft生存模式中实现多样化建筑创建,利用大语言模型和扩散模型提升创造力表现。

Comments The first two authors contribute equally

Journal ref Proceedings of the 41st Conference on Uncertainty in Artificial Intelligence (UAI 2025), PMLR 244:471-496

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21494 2025-12-29 cs.CL cs.AI 79%

Oogiri-Master: Benchmarking Humor Understanding via Oogiri

Oogiri-Master:通过Oogiri基准测试幽默理解

Soichiro Murakami, Hidetaka Kamigaito, Hiroya Takamura, Manabu Okumura

机构 * CyberAgent Nara Institute of Science and Technology(奈良科学技術大學)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 Oogiri-Master通过Oogiri基准测试,利用大量候选回应和独立评分机制,评估LLMs的幽默理解能力,并揭示语言因素与趣味性之间的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21402 2025-12-29 cs.CV 78%

Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation

理解病毒性:一种基于Rubric的视觉-语言模型框架用于短形式教育娱乐内容评估

Arnav Gupta, Gurekas Singh Sahney, Hardik Rathi, Abhishek Chandwani, Ishaan Gupta, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比里尼)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出基于Rubric的视觉-语言模型框架,用于评估短形式教育娱乐视频的病毒性,通过提取音频视觉特征并训练回归评估器,实现可解释且可扩展的参与度预测。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07148 2025-12-29 cs.CL 77%

TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine

TCM-Eval: 一个专家级动态且可扩展的中医基准测试

Zihao Cheng, Yuheng Lu, Huaiqian Ye, Zeming Liu, Minqi Wang, Jingjing Liu, Zihan Li, Wei Fan, Yuanfang Guo, Ruiji Fu, Shifeng She, Gang Wang, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Zhimingtang Technology Co., Ltd.(北京智明堂科技有限公司) Beijing Zhiyan AI Technology Co., Ltd.(北京智言AI科技有限公司) Guangzhou University of Chinese Medicine(广州中医药大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TCM-Eval通过动态可扩展的基准测试和SI-CoTE方法,开发出ZMT模型,显著超越人类中医从业者水平,推动中医领域LLM研究发展。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13298 2025-12-29 cs.CL 77%

Improving Multi-turn Task Completion in Task-Oriented Dialog Systems via Prompt Chaining and Fine-Grained Feedback

通过提示链和细粒度反馈提升任务导向对话系统多轮任务完成

Moghis Fereidouni, Md Sajid Ahmed, Adib Mosharrof, A. B. Siddique

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RealTOD通过提示链和细粒度反馈提升任务导向对话系统多轮任务完成能力,显著提高API调用准确率

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21849 2025-12-29 cs.CL cs.AI 73%

HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs

HeartBench: 探索大语言模型中拟人智能的核心维度

Jiaxin Liu, Peiyi Tu, Wenyu Chen, Yihong Zhuang, Xinxia Ling, Anji Zhou, Chenxi Wang, Zhuo Han, Zhengkai Yang, Junbo Zhao, Zenan Huang, Yuanyuan Wang

机构 * Ant Group(蚂蚁集团) Xiamen University(厦门大学) Beijing Normal University(北京师范大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HeartBench通过理论驱动的分类体系评估中文大语言模型的情感、文化和伦理维度,揭示其在拟人智能方面的性能上限及改进方向。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21809 2025-12-29 cs.CL cs.CY 70%

On The Conceptualization and Societal Impact of Cross-Cultural Bias

关于跨文化偏见的概念化与社会影响

Vitthal Bhandari

机构 * University of Washington / Seattle(华盛顿大学/西雅图)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了跨文化偏见在NLP中的概念化与社会影响,提出观察结果以帮助研究者更有效地评估偏见的危害。

Comments Term paper for LING 575 (Societal Impacts of Language Technologies)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00846 2025-12-29 cs.CV cs.AI 70%

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21360 2025-12-29 cs.AI cs.SY eess.SY 70%

From Visual Perception to Deep Empathy: An Automated Assessment Framework for House-Tree-Person Drawings Using Multimodal LLMs and Multi-Agent Collaboration

从视觉感知到深度共情:一种利用多模态大语言模型和多智能体协作的房屋-树-人绘画自动评估框架

Shuide Wen, Yu Sun, Beier Ku, Zhi Gao, Lijun Ma, Yang Yang, Can Jiao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用多模态大语言模型和多智能体协作,开发自动评估房屋-树-人绘画测试的框架,以提升投射评估的标准化和效率。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21715 2025-12-29 cs.CL cs.AI 62%

CATCH: A Controllable Theme Detection Framework with Contextualized Clustering and Hierarchical Generation

CATCH:一个具有上下文聚类和层次生成的可控主题检测框架

Rui Ke, Jiahui Xu, Shenghao Yang, Kuang Wang, Feng Jiang, Haizhou Li

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 CATCH提出了一种可控主题检测框架,通过上下文聚类和层次生成机制,解决稀疏语句和用户偏好识别的问题,提升对话系统中主题检测的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21637 2025-12-29 cs.CV 50%

Training-Free Disentangled Text-Guided Image Editing via Sparse Latent Constraints

无需训练的解耦文本引导图像编辑:通过稀疏潜在约束

Mutiara Shabrina, Nova Kurnia Putri, Jefri Satria Ferdiansyah, Sabita Khansa Dewi, Novanto Yudistira

机构 * Department of Informatics Engineering Universitas Brawijaya Malang, Indonesia(信息工程系 乌姆拉大学 马拉邦,印度尼西亚)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种无需训练的解耦文本引导图像编辑方法,通过引入稀疏潜在约束减少属性纠缠问题,提升编辑的可控性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 26 篇

2501.15544 2025-12-29 cs.LG cs.AI 88%

Advancing Generative Artificial Intelligence and Large Language Models for Demand Side Management with Internet of Electric Vehicles

推动生成式人工智能和大语言模型在电动汽车互联网中的需求侧管理

Hanwen Zhang, Ruichen Zhang, Wei Zhang, Dusit Niyato, Yonggang Wen, Chunyan Miao

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用生成式人工智能和大语言模型优化电动汽车互联网中的需求侧管理,通过检索增强生成提升能源效率和用户适应性。

Comments 15 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21859 2025-12-29 cs.CL 88%

TimeBill: Time-Budgeted Inference for Large Language Models

TimeBill: 为大语言模型设计的时间预算推理方法

Qi Fan, An Zou, Yehan Ma

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 TimeBill提出了一种时间预算推理框架,通过细粒度响应长度预测和执行时间估计,提升大语言模型在时间敏感任务中的效率和响应性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18564 2025-12-29 cs.AI 85%

Vox Deorum: A Hybrid LLM Architecture for 4X / Grand Strategy Game AI -- Lessons from Civilization V

Vox Deorum:一种用于4X/大战略游戏AI的混合LLM架构——来自《文明V》的启示

John Chen, Sihan Cheng, Can Gurkan, Ryan Lay, Moez Salahuddin

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Vox Deorum提出了一种混合LLM架构用于4X游戏AI,通过宏观战略推理与子系统协同,展示了LLM在复杂游戏中的应用潜力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21571 2025-12-29 cs.DC cs.LG 85%

nncase: An End-to-End Compiler for Efficient LLM Deployment on Heterogeneous Storage Architectures

nncase:一种面向异构存储架构高效大语言模型部署的端到端编译器

Hui Guo, Qihang Zheng, Chenghai Huo, Dongliang Guo, Haoqi Yang, Yang Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 nncase通过端到端编译框架实现高效大语言模型部署,整合三个核心模块提升异构存储架构下的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21352 2025-12-29 cs.SE cs.AI cs.MA 85%

Multi-Agent LLM Committees for Autonomous Software Beta Testing

多智能体大语言模型委员会用于自主软件Beta测试

Sumanth Bharadwaj Hachalli Karanam, Dhiwahar Adhithya Kennady

机构 * New York University(纽约大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 多智能体大语言模型委员会通过三轮投票协议实现自主软件Beta测试,显著提高任务成功率和漏洞检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05347 2025-12-29 cs.NI 85%

A Queueing Theoretic Perspective on Low-Latency LLM Inference with Variable Token Length

从排队论角度探讨具有可变令牌长度的低延迟LLM推理

Yuqing Yang, Yuedong Xu, Lei Jiao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文从排队论角度研究了LLM推理中可变令牌长度对低延迟的影响,提出数学模型优化最大令牌限制并分析不同批量策略的排队延迟。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20308 2025-12-29 cs.CL cs.SD eess.AS 83%

SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision

SpidR:无需监督学习快速稳定的语言单元用于语音语言模型

Maxime Poli, Mahi Luthra, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Jiayi Shen, Robin Algayres, Yu-An Chung, Mido Assran, Juan Pino, Emmanuel Dupoux

机构 * ENS-PSL, EHESS, CNRS(ENS-PSL、EHESS、CNRS) FAIR at Meta(Meta的FAIR)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 SpidR通过自监督学习高效语音表示,提升无监督语音语言建模性能,减少预训练时间

Comments Published in Transactions on Machine Learning Research. 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22066 2025-12-29 cs.AR cs.LG cs.PF 77%

Prefill vs. Decode Bottlenecks: SRAM-Frequency Tradeoffs and the Memory-Bandwidth Ceiling

预填与解码瓶颈:SRAM频率权衡及内存带宽天花板

Hannah Atmer, Yuan Yao, Thiemo Voigt, Stefanos Kaxiras

机构 * Uppsala University(乌普萨拉大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了SRAM大小和频率对LLM推理能耗与性能的影响,发现高频率和小缓冲区能优化能耗-延迟乘积,平衡低延迟与高能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10436 2025-12-29 cs.CL 77%

RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment

RefactorCoderQA: 评估LLMs在云和边缘部署中多领域编程问题解决方案的基准测试

Shadikur Rahman, Aroosa Hameed, Gautam Srivastava, Syed Muhammad Danish

机构 * York University and Algoma University(约克大学和阿尔戈马大学) Algoma University(阿尔戈马大学) Department of Systems and Computer Engineering, Carleton University(系统与计算机工程系,卡尔顿大学) Department of Math and Computer Science, Brandon University(数学与计算机科学系,布兰登大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 RefactorCoderQA通过云-边缘协作架构和RefactorCoder-MoE模型,在多领域编程任务中提升LLMs的性能,准确率达76.84%。

Comments 12 pages, 5 figures, Submitted to IEEE Transactions on Services Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08653 2025-12-29 cs.LG cs.AI cs.CL cs.NE 75%

Accelerating Training Speed of Tiny Recursive Models with Curriculum Guided Adaptive Recursion

通过课程指导自适应递归加速小型递归模型的训练速度

Kaleem Ullah Qasim, Jiashu Zhang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CGAR通过课程指导自适应递归方法,提升小型递归模型训练效率,实现加速训练和保持模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21008 2025-12-29 cs.CR 75%

GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs

GateBreaker: 对混合专家LLM的门控引导攻击

Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 GateBreaker通过门控引导攻击破坏MoE LLM的安全对齐,发现安全机制集中在少量神经元上,禁用这些神经元显著提高攻击成功率。

Comments Accepted by USENIX Security'26

详情

展开后加载摘要…

URL PDF HTML 收藏