arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2602.01335 2026-02-03 cs.CV cs.AI 57%

Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning

超越像素:通过基于模式的代理推理实现视觉隐喻转移

Yu Xu, Yuxin Zhang, Juan Cao, Lin Gao, Chunyu Wang, Oliver Deussen, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) University of Konstanz(康斯坦茨大学) National Cheng-Kung University(国立成功大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于模式的代理推理框架,实现视觉隐喻转移,通过多代理协作提升隐喻生成的抽象逻辑与视觉创造力。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01161 2026-02-03 cs.CL 57%

Beyond Training for Cultural Awareness: The Role of Dataset Linguistic Structure in Large Language Models

超越文化意识的训练:大型语言模型中数据集语言结构的作用

Reem I. Masoud, Chen Feng, Shunta Asano, Saied Alshahrani, Philip Colin Treleaven, Miguel R. D. Rodrigues

机构 * University College London(伦敦大学学院) Queen’s University Belfast(贝尔法斯特女王大学) The University of Tokyo(东京大学) University of Bisha(比沙大学) King Abdulaziz University(阿卜杜勒阿齐兹国王大学) AI Centre, University College London(伦敦大学学院人工智能中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文研究了数据集语言结构对大型语言模型文化表现的影响,发现词汇导向的成分在不同模型中表现更稳定,而语义或多样性极端成分可能产生中性或有害效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00574 2026-02-03 cs.AI 57%

Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings

通过潜在嵌入学习模态混合的思考链推理

Yifei Shao, Kun Zhou, Ziming Xu, Mohammad Atif Quamar, Shibo Hao, Zhen Wang, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出模态混合CoT方法,通过潜在嵌入结合视觉与文本信息,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00446 2026-02-03 cs.LG cs.CR 57%

Towards Building Non-Fine-Tunable Foundation Models

构建不可微调的基础模型

Ziyao Wang, Nizhang Li, Pingzhi Li, Guoheng Sun, Tianlong Chen, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Macau University of Science and Technology(澳门科学技术大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出PMP框架,通过构建不可微调的基础模型,限制未经授权微调的适应性提升,从而提高模型的安全性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00361 2026-02-03 cs.LG quant-ph 57%

Quantum Generator Kernels

量子生成核

Philipp Altmann, Maximilian Mansky, Maximilian Zorn, Jonas Stein, Claudia Linnhoff-Popien

机构 * LMU Munich(慕尼黑莱布尼茨大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出量子生成核方法,通过可变生成组实现大规模数据在量子空间中的高效嵌入,提升量子机器学习的分类与投影能力。

Comments 28 pages, 4 figures, 8 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00127 2026-02-03 cs.LG 57%

ALIGN: Aligned Delegation with Performance Guarantees for Multi-Agent LLM Reasoning

ALIGN: 多智能体LLM推理中的对齐委托与性能保证

Tong Zhu, Baiting Chen, Jin Zhou, Hua Zhou, Sriram Sankararaman, Xiaowu Dai

机构 * Department of Biostatistics, UCLA(生物统计学系,加州大学洛杉矶分校) Department of Statistics and Data Science, UCLA(统计学与数据科学系,加州大学洛杉矶分校) Department of Computer Science, UCLA(计算机科学系,加州大学洛杉矶分校) Departments of Statistics and Data Science, and of Biostatistics, UCLA(统计学与数据科学系和生物统计学系,加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 ALIGN通过多智能体对齐委托机制,提升大语言模型在复杂推理任务中的性能保障与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00110 2026-02-03 cs.CV cs.LG 57%

Observing Health Outcomes Using Remote Sensing Imagery and Geo-Context Guided Visual Transformer

利用遥感图像和地理上下文引导的视觉变换器观察健康结果

Yu Li, Guilherme N. DeSouza, Praveen Rao, Chi-Ren Shyu

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种结合地理空间信息的视觉变换器模型,通过引导注意力机制提升遥感图像处理效果,有效预测疾病流行率。

Comments Submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09114 2026-02-03 cs.LG 57%

TRACE: Grounding Time Series in Context for Multimodal Embedding and Retrieval

TRACE: 在上下文中对时间序列进行建模以实现多模态嵌入与检索

Jialin Chen, Ziyu Zhao, Gaukhar Nurbek, Aosong Feng, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 TRACE通过在上下文中对时间序列进行建模,实现多模态嵌入与检索,提升下游任务的预测精度和可解释性,同时作为强大的独立编码器优化上下文感知表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07272 2026-02-03 cs.CL q-bio.GN 57%

GENERator: A Long-Context Generative Genomic Foundation Model

生成器:一种长上下文生成基因组基础模型

Wei Wu, Qiuyi Li, Yuanyuan Zhang, Zhihao Zhan, Ruipu Chen, Mingyang Li, Kun Fu, Junyan Qi, Yongzhou Bao, Chao Wang, Yiheng Zhu, Zhiyun Zhang, Jian Tang, Fuli Feng, Jieping Ye, Yuwen Liu, Hui Xiong, Zheng Wang

机构 * Equal Contribution 12pt Senior Authorship 0.15in 1Alibaba Cloud Computing, Beijing, China 0.05in 2Zhongguancun Academy, Beijing, China 0.05in 3Zhongguancun Institute of Artificial Intelligence, Beijing, China 0.05in 4University of Science Technology of China, Hefei, China 0.05in 5State Key Laboratory of Genome Multi-omics Technologies, Shenzhen Branch, Guangdong Laboratory for Lingnan Modern Agriculture, Key Laboratory of Livestock Poultry Multi-Omics of MARA, Agricultural Genomics Institute at Shenzhen, Chinese Academy of Agricultural Sciences, Shenzhen, China 0.05in 6Innovation Group of Pig Genome Design Breeding, Research Centre for Animal Genome, Agricultural Genomics Institute at Shenzhen, Chinese Academy of Agricultural Sciences, Shenzhen, China 0.05in 7The Hong Kong University of Science Technology (Guangzhou), Guangzhou, China 0.05in 8The Hong Kong University of Science Technology , Hong Kong SAR, China 0.05in 9Mila - Qu\'ebec AI Institute, Montr\'eal, Canada 0.05in 10University of Montr\'eal, Montr\'eal, Canada 0.05in 11HEC Montr\'eal, Montr\'eal, Canada 0.05in 12CIFAR AI Chair, Canada 0.05in 13Carnegie Mellon University, Pittsburgh, USA 0.15in to

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 GENErator是一种长上下文生成基因组基础模型,通过大规模预训练实现高效基因组解读与可编程序列设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22949 2026-02-02 cs.CL cs.CR 57%

Autonomous Chain-of-Thought Distillation for Graph-Based Fraud Detection

基于图的欺诈检测的自主链式思维蒸馏

Yuan Li, Jun Hu, Bryan Hooi, Bingsheng He, Cheng Chen

机构 * National University of Singapore(新加坡国立大学) ByteDance Inc.(字节跳动公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 FraudCoT通过自主链式思维推理和高效联合训练策略,提升基于图的欺诈检测性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22851 2026-02-02 cs.CL 57%

When Meanings Meet: Investigating the Emergence and Quality of Shared Concept Spaces during Multilingual Language Model Training

意义交汇:探究多语言语言模型训练中共享概念空间的产生与质量

Felicia Körner, Max Müller-Eberstein, Anna Korhonen, Barbara Plank

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根IT大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过因果可解释方法探讨多语言语言模型训练中共享概念空间的产生与质量,发现早期出现并随训练细化,但语言依赖性显著,且翻译质量提升可能反映行为变化而非能力提升。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02452 2026-02-02 cs.CR cs.AI 57%

XAI-CF -- Examining the Role of Explainable Artificial Intelligence in Cyber Forensics

XAI-CF -- 探讨可解释人工智能在网络安全取证中的作用

Shahid Alam, Zeynep Altiparmak

机构 * Department of Information Security, College of Computer Science and Engineering, University of Ha’il, Ha’il, Saudi Arabia(信息安全系,计算机科学与工程学院,哈伊尔大学,沙特阿拉伯)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了可解释人工智能(XAI)在网络安全取证(CF)中的作用,强调了建立可信任的AI系统以提高公众接受度和法律合规性的重要性,并提出了XAI-CF的定义、挑战及解决方案。

Journal ref Engineering Applications of Artificial Intelligence, 167(3), 2026, 113892

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22439 2026-02-02 cs.CL 57%

Stop Jostling: Adaptive Negative Sampling Reduces the Marginalization of Low-Resource Language Tokens by Cross-Entropy Loss

停止推搡:自适应负采样减少交叉熵损失对低资源语言标记的边缘化

Galim Turumtaev

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出自适应负采样技术,通过减少交叉熵损失对低资源语言标记的边缘化影响,提升模型对低资源语言的表示能力。

Comments Accepted at LoResLM 2025 (COLING 2025 workshop). Oral presentation

Journal ref In Proceedings of the First Workshop on Language Models for Low-Resource Languages (LoResLM 2025), pages 373-386, Abu Dhabi, United Arab Emirates. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22284 2026-02-02 cs.LG 57%

Riemannian Lyapunov Optimizer: A Unified Framework for Optimization

Riemannian Lyapunov Optimizer:一种优化的统一框架

Yixuan Wang, Omkar Sudhir Patil, Warren E. Dixon

机构 * Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) University of Florida(佛罗里达大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 Riemannian Lyapunov Optimizer通过控制理论框架统一优化算法,提供稳定有效的优化器设计方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12243 2026-02-02 cs.CV cs.AI 57%

Less is More: Label-Guided Summarization of Procedural and Instructional Videos

少即是多:基于标签的程序性和教学视频摘要

Shreya Rajpal, Michal Golovanevsky, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Vellore Institute of Technology(维洛雷理工学院) Brown University(布朗大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06777 2026-02-02 cs.CV cs.AI 57%

MolX: Enhancing Large Language Models for Molecular Understanding With A Multi-Modal Extension

MolX: 通过多模态扩展增强大型语言模型的分子理解能力

Khiem Le, Zhichun Guo, Kaiwen Dong, Xiaobao Huang, Bozhao Nan, Roshni Iyer, Xiangliang Zhang, Olaf Wiest, Wei Wang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, IN, USA(诺丁汉大学) University of California, Los Angeles, CA, USA(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MolX通过多模态扩展提升LLM对分子的理解能力,利用SMILES和分子图提取细粒度特征,并结合分子指纹提升性能,有效提升分子相关任务表现。

Comments MLoG-GenAI@KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22055 2026-01-30 cs.CL 57%

$G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA

$G^2$-Reader: 双重演化图式用于多模态文档问答

Yaxin Du, Junru Song, Yifan Zhou, Cheng Wang, Jiahao Gu, Zimeng Chen, Menglan Chen, Wen Yao, Yang Yang, Ying Wen, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligent Game and Decision Laboratory(智能游戏与决策实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 $G^2$-Reader通过双重图式解决多模态文档问答中的结构破坏和检索失效问题,实现66.21%的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22047 2026-01-30 cs.CL 57%

On the Paradoxical Interference between Instruction-Following and Task Solving

关于指令遵循与任务解决之间的悖论性干扰

Yunjia Qi, Hao Peng, Xintong Shi, Amy Xin, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文揭示指令遵循可能干扰LLMs任务解决能力,并提出SUSTAINSCORE指标量化此干扰,通过实验表明添加自我显而易见约束会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21768 2026-01-30 cs.CL 57%

Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention

Zonkey:一种具有可微分分词和概率注意力的分层扩散语言模型

Alon Rozental

机构 * Alon Rozental(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Zonkey是一种通过可微分分词和概率注意力机制实现的分层扩散语言模型,能够从噪声中生成连贯文本并提升领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11479 2026-01-30 cs.AI 57%

Health Facility Location in Ethiopia: Leveraging LLMs to Integrate Expert Knowledge into Algorithmic Planning

埃塞俄比亚卫生设施选址:利用大语言模型整合专家知识到算法规划中

Yohai Trabelsi, Guojun Xiong, Fentabil Getnet, Stéphane Verguet, Milind Tambe

机构 * John A. Paulson School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学) National Data Management and Analytics Center for Health, Ethiopian Public Health Institute(健康数据管理与分析中心,埃塞俄比亚公共卫生研究所) Department of Global Health and Population, Harvard T.H. Chan School of Public Health(全球卫生与人口学院,哈佛T.H. Chan公共卫生学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种结合大语言模型和优化技术的混合框架,用于埃塞俄比亚卫生设施选址,以整合专家知识并提升规划的公平性和数据驱动性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21681 2026-01-30 cs.LG physics.flu-dyn 57%

LLM4Fluid: Large Language Models as Generalizable Neural Solvers for Fluid Dynamics

LLM4Fluid: 大语言模型作为通用神经求解器用于流体动力学

Qisong Xiao, Xinhai Chen, Qinglin Wang, Xiaowei Guo, Binglin Wang, Weifeng Chen, Zhichao Wang, Yunfei Liu, Rui Xia, Hang Zou, Gencheng Liu, Shuai Li, Jie Liu

机构 * National Key Laboratory of Parallel and Distributed Computing(平行与分布式计算国家重点实验室) Laboratory of Digitizing Software for Frontier Equipment(前沿设备数字化软件实验室) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 LLM4Fluid利用大语言模型作为通用神经求解器,通过降阶建模和物理引导解构机制,实现流体动力学的高效预测与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22158 2026-01-30 cs.CL 57%

Context Parametrization with Compositional Adapters

基于组合适配器的上下文参数化

Josip Jukić, Martin Tutek, Jan Šnajder

机构 * TakeLab, University of Zagreb, Croatia(Take实验室,扎格雷布大学,克罗地亚)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 CompAs通过组合结构的适配器参数,提升LLM在长上下文和多任务中的效率与稳定性,提供一种更高效的部署方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20747 2026-01-29 cs.CL cs.HC 57%

Like a Therapist, But Not: Reddit Narratives of AI in Mental Health Contexts

像治疗师,但不是:Reddit中关于心理健康情境下AI的叙述

Elham Aghakhani, Rezvaneh Rezapour

机构 * Drexel University(德雷塞尔大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过分析Reddit上的心理健康相关AI使用叙述,探讨了用户对AI在心理健康领域中的评价与关系契合,揭示了任务契合度与情感联系在用户互动中的不同影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02072 2026-01-29 cs.LG cs.IR 57%

Abex-rat: Synergizing Abstractive Augmentation and Adversarial Training for Classification of Occupational Accident Reports

ABEX-RAT:协同抽象增强与对抗训练用于职业事故报告分类

Jian Chen, Jiabao Dou

机构 * Ningxia Research Institute of Transport Science(宁夏交通科学研究院) Department of Computer Science(计算机科学系)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 ABEX-RAT通过结合抽象增强与对抗训练,高效解决职业事故报告分类中的类别不平衡问题,实现90.32%的宏F1得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19825 2026-01-28 cs.AI cs.DB 57%

Routing End User Queries to Enterprise Databases

将用户查询路由到企业数据库

Saikrishna Sudarshan, Tanay Kulkarni, Manasi Patwardhan, Lovekesh Vig, Ashwin Srinivasan, Tanmay Tulsidas Verlekar

机构 * TCS Research(TCS研究机构) Department of CSIS, BITS Pilani KK Birla Goa Campus(计算机科学与信息系统系,比斯科恩理工学院KK Birla Goa校区)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种基于推理的重新排序策略,通过建模模式覆盖、结构连接性和语义对齐,提升多数据库环境中自然语言查询路由的准确性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19170 2026-01-28 cs.AI 57%

Multi-Agent Procedural Graph Extraction with Structural and Logical Refinement

多代理过程图提取与结构逻辑细化

Wangyang Ying, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Wenchao Yu, Yanjie Fu, Haifeng Chen

机构 * Arizona State University(亚利桑那州立大学) NEC Labs America(NEC美国实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出多代理框架\model{},通过结构和逻辑细化提升过程图提取的准确性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06201 2026-01-28 cs.LG 57%

K2-V2: A 360-Open, Reasoning-Enhanced LLM

K2-V2:一种360开放、推理增强的LLM

K2 Team, Zhengzhong Liu, Liping Tang, Linghao Jin, Haonan Li, Nikhil Ranjan, Desai Fan, Shaurya Rohatgi, Richard Fan, Omkar Pangarkar, Huijuan Wang, Zhoujun Cheng, Suqi Sun, Seungwook Han, Bowen Tan, Gurpreet Gosal, Xudong Han, Varad Pimpalkhute, Shibo Hao, Ming Shan Hee, Joel Hestness, Haolong Jia, Liqun Ma, Aaryamonvikram Singh, Daria Soboleva, Natalia Vassilieva, Renxi Wang, Yingquan Wu, Yuekai Sun, Taylor Killian, Alexander Moreno, John Maggs, Hector Ren, Guowei He, Hongyi Wang, Xuezhe Ma, Yuqi Wang, Mikhail Yurochkin, Eric P. Xing

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 K2-V2是一种通过注入领域知识、推理、长上下文和工具使用能力,提升复杂推理任务性能的360开放LLM,具备强大的推理能力和开源训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24940 2026-01-28 cs.CL 57%

SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens

SemCoT:通过语义对齐的隐式令牌加速链式推理

Yinhan He, Wendy Zheng, Yaochen Zhu, Zaiyi Zheng, Lin Su, Sriram Vasudevan, Qi Guo, Liangjie Hong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) LinkedIn Inc.(领英公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 SemCoT通过语义对齐的隐式令牌优化,提升链式推理的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06297 2026-01-28 cs.LG 57%

LoaQ: Layer-wise Output Approximation Quantization

LoaQ: 层级输出近似量化

Li Lin, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究所,北京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 LoaQ通过引入输出匹配因素,改进了基于层级的后训练量化方法,提升了模型量化质量并具有简洁的闭式解。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18939 2026-01-28 cs.LG 57%

A Few Bad Neurons: Isolating and Surgically Correcting Sycophancy

几个坏神经元:隔离并外科手术性纠正阿谀行为

Claire O'Brien, Jessica Seto, Dristi Roy, Aditya Dwivedi, Sunishchal Dev, Kevin Zhu, Sean O'Brien, Ashwinee Panda, Ryan Lagasse

机构 * Algoverse RAND Meta FAIR University of Maryland(马里兰大学) Lockheed Martin AI Center(洛克希德·马丁人工智能中心)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过隔离并微调最负责特定行为的神经元来实现LLM行为对齐,展示了在减少阿谀行为任务上的有效性。

Comments Accepted to NeurIPS Workshop on CogInterp and NeurIPS Workshop on Reliable ML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏