Concept-Guided LLM Agents for Human-AI Safety Codesign
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
Comments 5 pages
Journal ref Proceedings of the AAAI-make Spring Symposium, 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
Comments 5 pages
Journal ref Proceedings of the AAAI-make Spring Symposium, 2024
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments 10 pages, 2 tables
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments To appear at CHI EA '24
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
Comments In Proceedings of ICLR 2024
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments 9 pages, 8 figures, 2 tables (13 pages, 12 figures, 13 tables including references and appendices)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL
Comments Preprint
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL
Comments Accepted to EMNLP 2023
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG
Comments Paper has 17 pages, 4 figures and 4 tables, along with 71 references
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
有害意图的几何学:通过残差流中的角度偏差实现无训练异常检测
机构 * Independent Researcher(独立研究者)
专题命中 知识编辑与模型理解 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LatentBiopsy方法,通过分析大语言模型残差流激活的几何特性,无需训练即可检测有害提示。该方法基于残差流激活的主成分分析和角度偏差,实现高精度的异常检测,具有低延迟和强鲁棒性。
Comments 20 pages, 10 figures, 3 tables. Training-free harmful-prompt detector via angular deviation in LLM residual streams. Evaluated on six Qwen variants (base / instruct / abliterated). Achieves AUROC over 0.937 (harmful-vs-normative) and 1.000 (harmful-vs-benign-aggressive) with no harmful training data
混沌中的性格演变:一种结合大语言模型的框架用于在环境压力下的迭代囚徒困境中发现角色
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出一种结合大语言模型的框架,在环境压力下通过迭代囚徒困境发现可解释的角色原型,提升策略的鲁棒性和可解释性。
Comments 10 pages, 5 figures. Project assignment; exploratory study on LLM-based adaptive agents
DexterSQL:用于Text-to-SQL生成的深度模式探索与基于规则的修正
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 DexterSQL是基于提示的非微调Text-to-SQL系统,通过深度模式探索器、数据库无关规则创建器、多路径SQL生成三个组件,在BIRD-Dev数据集上提升了开源与闭源大语言模型的Text-to-SQL生成准确率。
注意力路径脆弱性作为大语言模型中的不确定性信号
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 本研究提出 ASMI 作为大语言模型的不确定性信号,通过掩码注意力头测量子网络间的 BALD 互信息,在基于事实的问答任务中优于基线,可有效识别自信但脆弱的预测。
Comments 19 pages, Under review
文化意识被表征但未被解码:追踪18个开源大语言模型(LLM)中的神话知识
机构 * DataSpike ; Metropolia University of Applied Sciences(梅托波利亞應用科學大學) ; Neapolis University Pafos(帕福斯尼阿波利斯大學)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.LG
AI总结 该研究分析18个开源LLM的神话知识表征,发现文化表征存在于模型残差流中,但解码器因提示语言偏差无法解码非主导文化内容,还发布了相关跨文化研究工具与基准。
Comments 45 pages, 23 figures, 18 tables. Dataset: https://huggingface.co/datasets/Aragoner/folkmotif Code: https://github.com/AragonerUA/folkmotif
莫尔:让模型为稳健的跨域知识编辑指引自身方向
机构 * Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)
专题命中 知识编辑与模型理解 :SFT(abstract,abstract_cn);language model(abstract);pretraining(abstract);post-training(abstract)
AI总结 研究针对语言模型训练后知识编辑核心能力退化问题,提出莫尔方法,通过从模型自身解码分布采样估计保留协方差,无需外部数据,可作插入组件。实验表明该方法能在多模型上扩展保留能力,提升准确率,凸显分布对齐对无损编辑的关键作用。
利用机制可解释性对大语言模型进行对抗攻击
机构 * Thales(泰勒斯)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.AI、cs.LG
AI总结 研究利用机制可解释性对大语言模型进行对抗攻击,通过识别接受子空间,用梯度优化使嵌入重新路由,降低计算成本,在多种模型上快速实现高成功率攻击,为攻防研究开辟新方向。
形式化潜在思维:LLM中思维表示的四条公理
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.LG
AI总结 提出独立于下游基准的LLM潜在思维表示公理评估框架,发现当前表示不满足所有四条公理,且编码信息有限。
Comments 44 pages, 27 tables, 14 figures
通过软目标注意力探测在大型语言模型中进行生成前幻觉检测
机构 * Applied AI Institute(应用人工智能研究所)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.LG
AI总结 提出一种基于软目标监督和注意力探测的生成前幻觉风险估计方法,在三个问答基准和五个模型上优于线性探测。
揭示LLM电路发现中的方差
机构 * Laboratory for Information and Inference Systems (LIONS), École Polytechnique Fédérale de Lausanne (EPFL), Lausanne, Switzerland(信息与推理系统实验室(LIONS),洛桑联邦理工学院(EPFL),瑞士洛桑)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.AI、cs.LG
AI总结 本文研究LLM电路发现中的重采样、重述和样本方差,提出CEAP方法减少重采样方差,并分析重述方差源于不同模板激活不同电路,样本方差主要由不忠定义导致。
集成局部和全局熵用于大语言模型的不确定性量化
机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈马德·本·哈利法大学) ; KTH Royal Institute of Technology(瑞典皇家理工学院)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GLU方法,通过融合隐藏状态几何熵(全局)和token级熵(局部)来量化LLM不确定性,有效捕捉自信但错误的失败模式,无需额外训练。
Comments 17 pages, 2 figures
代码不仅仅是文本:代码生成的不确定性估计
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Cambridge(剑桥大学)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 针对代码生成中错误程序的可靠性问题,提出基于词法、算法和功能三个正交轴的不确定性估计方法,在五个代码LLM上将AUROC提升8.1个百分点。
中立性的代价:AI生成的动物故事中的性别表征
机构 * University of Washington(华盛顿大学)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究六种主流LLM在生成动物故事时的性别分配,发现模型常避免指定性别或使用中性语言,但一旦指定则显著偏向男性,女性角色几乎缺席,表明中立策略可能导致边缘视角的抹除。
Comments FAccT(ACM Conference on Fairness, Accountability, and Transparency) 2026
ABLE:基于归因的大模型嵌入表示与映射
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Deep Interdisciplinary Intelligence Lab (DI2 Lab)(深度跨学科智能实验室(DI2 Lab))
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出ABLE框架,利用梯度特征归因和分词器无关的词级对齐构建模型嵌入,实现异构LLM的高效比较,在关系预测、模型路由和基准分数预测上表现优异。
幻觉可从量化LLM中间层隐藏状态线性解码
机构 * University of Macau(澳门大学)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.LG
AI总结 研究开源LLM在4位量化下中间层隐藏状态是否编码线性可分的真实性信号,发现单层线性探针AUROC达0.904-1.000,优于采样方法,且信号近似线性。
SERC: 受LDPC启发的检索增强生成语义纠错方法
机构 * Department of Information Communications Engineering, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学信息通信工程系) ; Division of Computer Engineering, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学计算机工程系) ; Department of Statistics, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学统计学系)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)
AI总结 针对大语言模型幻觉问题,提出受LDPC码启发的语义纠错框架SERC,通过稀疏验证策略高效检测和纠正生成文本中的错误。
Comments 15 pages, 2 figures, 6 tables. To appear in the Proceedings of the 28th International Conference on Pattern Recognition (ICPR 2026). Code available at https://github.com/labhai/SERC
温度缩放分类器:温度缩放的一些基本性质
机构 * Université Côte d’Azur, Inria, CNRS, LJAD, France(法国蔚蓝海岸大学、法国国家科学研究中心、法国国家信息与自动化研究所、里约达实验室) ; Département d’Informatique, École Normale Supérieure - PSL, CNRS, France(法国高等科学研究院信息学院、法国国家科学研究中心、法国)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文通过信息投影和线性缩放子模型等新视角,严格分析了温度缩放对分类器校准和LLM多样性的影响,证明升温普遍增加不确定性但质疑其增加多样性的说法。
探测知识边界:一种用于深度知识提取的交互式智能体框架
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Westlake University(西交利物浦大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 提出一种交互式智能体框架,通过四种自适应探索策略和三级知识处理流水线,系统性地提取和量化大语言模型的知识,发现递归分类法最有效,并揭示了知识缩放定律、Pass@1与Pass@k的权衡以及训练数据对知识轮廓的影响。
Comments Homepage: https://ulab-uiuc.github.io/KnowledgeExtraction/
TRACE: 通过跨层证据进行轨迹修正以减少幻觉
机构 * Independent Researcher(独立研究者)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TRACE算法,通过跨层证据在推理时修正LLM中的幻觉,无需训练或标注,通过内部证据选择修正策略,提升多个基准测试的性能。
Comments 25 pages, 8 figures, 4 tables
机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心) ; Microsoft(微软) ; University College London(伦敦大学学院) ; Mila, University of Montreal(蒙特利尔大学Mila)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.LG