arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-04 至 2026-02-04 共收录 63 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2602.02629 2026-02-04 cs.CR cs.AI cs.LG 81%

Trustworthy Blockchain-based Federated Learning for Electronic Health Records: Securing Participant Identity with Decentralized Identifiers and Verifiable Credentials

基于区块链的可信联邦学习用于电子健康记录:利用去中心化标识符和可验证凭证保障参与者身份

Rodrigo Tertulino, Ricardo Almeida, Laercio Alencar

机构 * Federal Institute of Education, Science, and Technology of Rio Grande do Norte (IFRN)(里约格兰德北教育科学和技术联邦学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于区块链的可信联邦学习框架,利用去中心化标识符和可验证凭证保障医疗数据安全,有效抵御Sybil攻击,提升模型预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03255 2026-02-04 cs.AI 79%

LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios

LPS-Bench: 在长周期规划中评估计算机使用代理的安全意识基准测试

Tianyu Chen, Chujia Hu, Ge Gao, Dongrui Liu, Xia Hu, Wenjie Wang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 LPS-Bench通过评估长周期规划中计算机使用代理的安全意识,揭示现有系统在安全行为维持方面的不足,并提出缓解策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03100 2026-02-04 cs.AI 79%

Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment

Risky-Bench: 探索现实部署中智能体安全风险

Jingnan Zheng, Yanzhen Luo, Jingjun Xu, Bingnan Liu, Yuxin Chen, Chenhang Cui, Gelei Deng, Chaochao Lu, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Southern University of Science and Technology(南方科技大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 Risky-Bench通过基于现实部署的安全原则,系统评估智能体在复杂任务中的安全风险,适用于多种部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15090 2026-02-04 cs.LG cs.GT econ.TH 79%

Emergent Alignment via Competition

通过竞争实现涌现对齐

Natalie Collina, Surbhi Goel, Aaron Roth, Emily Ryu, Mirah Shi

机构 * Department of Computer and Information Sciences, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 通过竞争实现AI与人类价值观的对齐,证明在特定条件下战略竞争可产生与完全对齐模型相当的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20658 2026-02-04 cond-mat.mtrl-sci cs.LG 74%

Trustworthy AI-based crack-tip segmentation using domain-guided explanations

基于领域引导解释的可信AI裂缝尖端分割

Jesco Talies, Eric Breitbarth, David Melching

机构 * Institute for Frontier Materials on Earth and in Space, German Aerospace Center (DLR)(地球和空间前沿材料研究所,德国航空航天中心(DLR))

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 本文提出一种结合可解释AI和领域先验知识的注意力引导训练框架,用于提升裂缝尖端分割任务的模型泛化能力和解释可信度。

Comments This is the Accepted Manuscript version of an article accepted for publication in Machine Learning: Science and Technology. IOP Publishing Ltd is not responsible for any errors or omissions in this version of the manuscript or any version derived from it. The Version of Record is available online at https://doi.org/10.1088/2632-2153/ae3660

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02862 2026-02-04 cs.AI cs.LG 73%

STEER: Inference-Time Risk Control via Constrained Quality-Diversity Search

STEER: 通过受约束的质量多样性搜索实现推理时间的风险控制

Eric Yang, Jong Ha Lee, Jonathan Amar, Elissa Ye, Yugang Jia

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 STEER通过受约束的质量多样性搜索实现推理时间的风险控制,提供可调节的决策保守性调整,提升临床分诊等场景下的行为覆盖和准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03704 2026-02-04 cs.CL cs.AI 62%

Cognitively Diverse Multiple-Choice Question Generation: A Hybrid Multi-Agent Framework with Large Language Models

具有大语言模型的混合多智能体框架的认知多样性多项选择题生成

Yu Tian, Linh Huynh, Katerina Christhilf, Shubham Chakraborty, Micah Watanabe, Tracy Arner, Danielle McNamara

机构 * Arizona State University(亚利桑那州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ReQUESTA通过混合多智能体框架生成认知多样化的多项选择题,提升生成的题目难度、区分度和语义一致性。

Comments This manuscript is under review at Electronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02932 2026-02-04 cs.CL cs.AI 62%

Equal Access, Unequal Interaction: A Counterfactual Audit of LLM Fairness

平等接入,不平等互动:对大语言模型公平性的反事实审计

Alireza Amiri-Margavi, Arshia Gharagozlou, Amin Gholami Davodi, Seyed Pouyan Mousavi Davoudi, Hamidreza Hasani Balyani

机构 * Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡大学) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth分校) Independent Researcher in AI and Statistics(人工智能与统计学独立研究者) Hardware Technology Organization(硬件技术组织)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过反事实提示设计,评估了GPT-4和LLaMA在不同人口身份下的互动质量差异,发现即使接入平等,模型在互动质量上仍存在系统性差异。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02781 2026-02-04 cs.CR cs.AI cs.LG 62%

Evaluating False Alarm and Missing Attacks in CAN IDS

评估CAN入侵检测系统中的误报和遗漏攻击

Nirab Hossain, Pablo Moriano

机构 * Department of Applied Mathematics University of Colorado Boulder(应用数学系科罗拉多大学波德摩尔分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过评估CAN IDS在对抗性攻击下的性能,揭示了其在误报和遗漏攻击方面的脆弱性,强调了对抗鲁棒性在安全关键汽车系统中的重要性。

Comments 8 pages, 2 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19120 2026-02-04 cs.IR cs.AI cs.LG 62%

RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation

RobustExplain: 评估基于LLM的推荐解释代理的鲁棒性

Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu

机构 * Workday

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 RobustExplain提出首个评估框架,用于衡量LLM生成推荐解释的鲁棒性,揭示当前模型鲁棒性较低,较大模型稳定性更高。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00642 2026-02-04 cs.CL 57%

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

LegalOne:一种用于可靠法律推理的基础模型家族

Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) Quancheng Laboratory(清华云城实验室) University of Waterloo, Canada(加拿大滑铁卢大学) China University of Political Science and Law(中国政法大学) MegaTech.AI Inc(MegaTech.AI公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 LegalOne通过三阶段流程提升法律推理能力,结合领域适应、代理推理蒸馏和课程强化学习,在法律任务中取得超越通用LLMs的性能。

Comments 25 pages, v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03285 2026-02-04 cs.AI 57%

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

MeetBench-XL: 一种经过校准的多维评估和学习双策略代理用于实时会议

Yuelin Hu, Jun Xu, Bingcong Lu, Zhengxue Cheng, Hongwei Hu, Ronghua Wu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MeetBench-XL通过多维评估和学习双策略代理提升实时会议AI助手的性能与效率

Comments accepted by AAAI2026 ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01155 2026-02-04 cs.AI cs.SE 57%

Multi-Agent Causal Reasoning System for Error Pattern Rule Automation in Vehicles

多智能体因果推理系统用于车辆中错误模式规则自动化

Hugo Math, Julian Lorenz, Stefan Oelsner, Rainer Lienhart

机构 * BMW Group(宝马集团) Augsburg University(奥格斯堡大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 CAREP通过多智能体系统自动发现车辆错误模式规则,提供透明因果解释,提升故障诊断的自动化与可解释性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03742 2026-02-04 cs.CV 50%

Edge-Optimized Vision-Language Models for Underground Infrastructure Assessment

边缘优化的视觉-语言模型用于地下基础设施评估

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics(卡尼扎罗利文斯顿海湾州环境信息中心) University of New Orleans(新奥尔良大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出边缘优化的视觉-语言模型,用于高效生成地下基础设施缺陷的摘要,结合轻量级分割模型与微调VLM,实现资源受限设备上的实时检测与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12553 2026-02-04 cs.LO cs.SE 50%

Cargo Sherlock: An SMT-Based Checker for Software Trust Costs

Cargo Sherlock: 基于 SMT 的软件信任成本检查器

Muhammad Hassnain, Anirudh Basu, Ethan Ng, Caleb Stanford

专题命中 安全评测 :trustworthy(abstract)

AI总结 Cargo Sherlock 是一种基于 SMT 的软件信任成本检查器,通过结合形式化方法和人为因素,用于检测供应链攻击并评估软件依赖项的信任成本。

Comments 12 pages, 7 figures. To appear at the International Conference on Formal Methods for Software Engineering (FormaliSE), April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2602.02686 2026-02-04 cs.CL cs.AI cs.CR cs.LG 80%

Monotonicity as an Architectural Bias for Robust Language Models

单调性作为提升语言模型鲁棒性的架构偏倚

Patrick Cooper, Alireza Nadali, Ashutosh Trivedi, Alvaro Velasquez

机构 * Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA(计算机科学系,科罗拉多大学波尔德分校,波尔德,科罗拉多州,美国)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过在Transformer模型中引入单调性约束,提升语言模型对对抗攻击的鲁棒性,同时保持预训练性能。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02545 2026-02-04 cs.LG cs.AI 76%

Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization

超越对齐:通过流形重塑策略优化扩展推理能力

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出流形重塑策略优化方法,通过几何干预扩展LLM的推理能力,实验证明其在数学任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02582 2026-02-04 cs.AI cs.CL cs.CY cs.IR cs.LG cs.SE 70%

Uncertainty and Fairness Awareness in LLM-Based Recommendation Systems

大语言模型推荐系统中的不确定性与公平性意识

Chandan Kumar Sah, Xiaoli Lian, Li Zhang, Tony Xu, Syed Shazaib Shah

机构 * Beihang University(北京航空航天大学) McGill University(麦吉尔大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文研究了大语言模型推荐系统中不确定性与公平性的影响,提出了一种新的评估方法并揭示了个性化与公平性之间的权衡。

Comments Accepted at the Second Conference of the International Association for Safe and Ethical Artificial Intelligence, IASEAI26, 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03334 2026-02-04 cs.CY 57%

The Personality Trap: How LLMs Embed Bias When Generating Human-Like Personas

人格陷阱:大语言模型在生成类人人格时嵌入偏见的方式

Jacopo Amidei, Gregorio Ferreira, Mario Muñoz Serrano, Rubén Nieto, Andreas Kaltenbrunner

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文研究了大语言模型在生成类人人格时嵌入WEIRD偏见的问题,揭示了LLMs在生成合成人口时可能带来的刻板印象和风险。

Comments 26 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03155 2026-02-04 cs.HC 50%

Is It Possible to Make Chatbots Virtuous? Investigating a Virtue-Based Design Methodology Applied to LLMs

能否使聊天机器人变得有德性?探讨一种基于德性的设计方法应用于大语言模型

Matthew P. Lad, Louisa Conwill, Megan Levis Scheirer

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨了基于德性的设计方法在大语言模型中的应用,通过伦理设计模式的编目和评估,提出了一种提升LLM伦理性的设计框架,并指出其在准确性和安全性方面的优势及潜在实施挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 13 篇

2602.02598 2026-02-04 physics.soc-ph cs.AI cs.CL cs.CY cs.MA 82%

Social Catalysts, Not Moral Agents: The Illusion of Alignment in LLM Societies

社交催化剂,而非道德主体:LLM社会中的对齐幻觉

Yueqing Hu, Yixuan Jiang, Zehua Jiang, Xiao Wen, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学学院) Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) Mental Health Education Center, North China Electric Power University(华北电力大学心理健康教育中心)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究探讨了锚定智能体在促进合作中的作用,发现其效果源于战略合规而非真实价值对齐,揭示了人工社会中行为修改与真实价值对齐之间的差距。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03124 2026-02-04 cs.CV cs.LG 79%

Feature, Alignment, and Supervision in Category Learning: A Comparative Approach with Children and Neural Networks

特征、对齐与监督在类别学习中的作用:基于儿童与神经网络的比较方法

Fanxiao Wani Qiu, Oscar Leong

机构 * Department of Psychology, University of Southern California(南加州大学心理学系) Department of Statistics and Data Science, University of California, Los Angeles(加州大学洛杉矶分校统计与数据科学系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文通过比较儿童与神经网络在少量半监督类别学习任务中的表现,揭示了监督、特征结构和对齐在学习过程中的相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22513 2026-02-04 cs.AI 79%

Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models

为何自我奖励有效:语言模型迭代对齐的理论保证

Shi Fu, Yingjie Wang, Shengchao Hu, Peng Wang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过理论分析揭示了自我奖励语言模型在迭代对齐中的有效性,证明了其性能随迭代次数呈指数衰减,并为线性softmax模型提供了定制化的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16540 2026-02-04 cs.SD cs.AI eess.AS 79%

Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG

模型是像我们一样听吗?探查音频大语言模型与自然EEG的表征对齐

Haoyun Yang, Xin Xiao, Jiang Zhong, Yu Tian, Dong Xiaohua, Yu Mao, Hao Wu, Kaiwen Wei

机构 * School of Computer Science, Chongqing University(重庆大学计算机科学学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) School of Economics and Business Administration, Chongqing University(重庆大学经济与商业管理学院) School of Artificial Intelligence, Southwest University(西南大学人工智能学院) The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本研究通过比较音频大语言模型与EEG信号,揭示了模型在自然聆听中的表征对齐特性,发现排名依赖分裂、时空对齐模式及情感分离现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20418 2026-02-04 eess.IV cs.CV 71%

Diff4MMLiTS: Advanced Multimodal Liver Tumor Segmentation via Diffusion-Based Image Synthesis and Alignment

Diff4MMLiTS: 通过基于扩散的图像合成与对齐的先进多模态肝肿瘤分割

Shiyun Chen, Li Lin, Pujin Cheng, ZhiCheng Jin, JianJian Chen, HaiDong Zhu, Kenneth K. Y. Wong, Xiaoying Tang

机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(电子与电气工程系,南方科技大学,深圳,中国) Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong SAR, China(电气与电子工程系,香港大学,香港特别行政区,中国) Department of Radiology, Zhongda Hospital, Medical School, Southeast University, Nanjing, China(放射科,中大医院,医学院,东南大学,南京,中国) Jiaxing Research Institute, Southern University of Science and Technology, Jiaxing, China(嘉兴研究所,南方科技大学,嘉兴,中国)

专题命中 其他安全 :alignment(title)

AI总结 Diff4MMLiTS通过基于扩散的图像合成与对齐技术,实现肝肿瘤的多模态分割,无需严格对齐的多模态数据,提升了分割性能。

Comments International Workshop on Machine Learning in Medical Imaging, 668-678

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03690 2026-02-04 cs.LG cs.AI 62%

LLM-Inspired Pretrain-Then-Finetune for Small-Data, Large-Scale Optimization

受大语言模型启发的小数据、大规模优化的预训练-微调方法

Zishi Zhang, Jinhui Han, Ming Hu, Yijie Peng

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种受大语言模型启发的预训练-微调方法,用于解决小数据下的大规模决策优化问题,通过预训练注入领域知识并利用合成数据,微调提升与真实数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18939 2026-02-04 cs.LG cs.AI 62%

Damba-ST: Domain-Adaptive Mamba for Efficient Urban Spatio-Temporal Prediction

Damba-ST: 域自适应Mamba用于高效的都市时空预测

Rui An, Yifeng Zhang, Ziran Liang, Wenqi Fan, Yuxuan Liang, Xuequn Shang, Qing Li

机构 * Northwestern Polytechnical University(西北工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Damba-ST通过域自适应Mamba模型提升都市时空预测的效率与泛化能力,解决跨域泛化难题。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02951 2026-02-04 cs.CV cs.AI cs.CL 62%

Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning

Nüwa: 通过VLM令牌剪枝修复空间完整性

Yihong Huang, Fei Ma, Yihua Shao, Jingcai Guo, Zitong Yu, Laizhong Cui, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) The Hong Kong Polytechnic University(香港理工大学) Great Bay University(大鹏大学) Shenzhen University(深圳大学) Huawei(华为)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Nüwa通过两阶段令牌剪枝框架在保持空间完整性的同时实现高效特征聚合,提升VQA和视觉定位任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02891 2026-02-04 cs.LG cs.CL 62%

TraceNAS: Zero-shot LLM Pruning via Gradient Trace Correlation

TraceNAS: 通过梯度轨迹相关性实现零样本LLM剪枝

Prajna G. Malettira, Manish Nagaraj, Arjun Roy, Shubham Negi, Kaushik Roy

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 TraceNAS通过梯度轨迹相关性实现零样本LLM剪枝,高效发现高保真剪枝模型,减少GPU计算成本并提升模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12387 2026-02-04 cs.LG cond-mat.dis-nn cond-mat.stat-mech math-ph math.MP q-bio.NC stat.ML 57%

Neural Thermodynamics: Entropic Forces in Deep and Universal Representation Learning

神经热力学:深度和通用表征学习中的熵力

Liu Ziyin, Yizhou Xu, Isaac Chuang

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出神经热力学理论,揭示深度学习中熵力与对称性打破对表征学习和优化行为的调控作用。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏