It's How You Ask: Gender-Associated Linguistic Bias in LLMs
提问方式的重要性:大语言模型(LLMs)中与性别相关的语言偏差
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 该研究发现LLMs会因提示中女性常用的语言特征生成更短欠正式的回应,其影响远大于明确性别线索,且事后缓解困难,呼吁关注语言变异以缓解LLM介导职场交流的差异化影响。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
提问方式的重要性:大语言模型(LLMs)中与性别相关的语言偏差
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 该研究发现LLMs会因提示中女性常用的语言特征生成更短欠正式的回应,其影响远大于明确性别线索,且事后缓解困难,呼吁关注语言变异以缓解LLM介导职场交流的差异化影响。
提示嵌入探针(PEP):基于隐藏状态的大语言模型幻觉检测
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出提示嵌入探针(PEP),一种白盒幻觉检测方法,通过少量可学习提示嵌入扩充标准线性探针,在TriviaQA等数据集的Qwen3模型上验证其在生成前、跨模型等场景的有效性,仅需少量参数即可提升检测性能。
Comments 10 pages, 7 figures. Code available at https://github.com/zazamrykh/internal_probing
通过语义等价对抗攻击引出大语言模型的内在幻觉
机构 * Imperial College London(帝国理工学院) ; Safe Intelligence(安全智能研究院)
专题命中 知识编辑与模型理解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出新框架,通过语义等价对抗攻击测试LLMs鲁棒性,发现先进模型易受语义保留扰动影响致忠实度大幅下降,凸显需开发鲁棒接地的LLM架构与训练目标。
Comments To be presented at COLM 2026
DeBERTa-Sentinel:实现透明且可信的AI生成文本检测
机构 * University of Hertfordshire(赫特福德大学) ; James Cook University(詹姆斯库克大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 DeBERTa-Sentinel是基于DeBERTa-v3的透明AI生成文本检测框架,在GLC-AIText数据集上实现优异检测性能,可公开token级解释以支持利益相关者审计。
从预训练语言模型中提取算法:以隐马尔可夫模型为例
机构 * Cornell University(康奈尔大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究预训练语言模型从隐马尔可夫模型预测下一个观测值的能力背后算法,通过三阶段流程,先实证比较缩小候选算法范围,再推导理论联系并验证,最后引入主激活探针揭示低维线性表示及变化,将其上下文行为与内部机制联系起来。
领域知识增强的大语言模型用于欺诈和概念漂移检测
机构 * School of Computing and Augmented Intelligence (SCAI), Arizona State University (ASU)(计算与增强智能学院(SCAI),亚利桑那州立大学) ; Department of Computer Engineering, Tarsus University(计算机工程系,塔鲁斯大学) ; Minerva CQ and HumaConn AI Consulting(Minerva CQ和HumaConn人工智能咨询) ; School of Computing and Augmented Intelligence (SCAI), Arizona State University(计算与增强智能学院(SCAI),亚利桑那州立大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出一种领域知识增强的大语言模型框架,通过集成结构化领域知识和漂移检测单元,实现高准确率的欺诈对话检测和概念漂移分类。
Journal ref Electronics 2026, 15(3), 534
SABER: 一种基于多尺度超图的语义对齐脑网络分析框架
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出SABER框架,通过多尺度超图建模功能子网络与高阶依赖,并引入决策级语义对齐机制,将大语言模型语义直接融入预测,在ABIDE和ADHD-200数据集上取得最优性能,尤其在小样本场景下。
Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2026;
模糊性下的不确定性感知生成与决策
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt(普遍知识处理实验室(UKP实验室),计算机科学系,达姆施塔特技术大学) ; National Research Center for Applied Cybersecurity ATHENE, Germany(应用网络安全国家研究中心ATHENE,德国)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 基于贝叶斯决策理论和风险规避决策,提出不确定性感知算法用于辅导和同行评审任务,通过共形预测提供策略和分数的保证,实验表明贝叶斯方法优于风险规避规则。
Comments Code available under https://github.com/UKPLab/arXiv2026-uncertainty-aware
注意头:多模态大语言模型的拓扑表示对齐
机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ; University of Pisa(比萨大学) ; AMD Silo AI
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出头级表示对齐(HeRA)方法,在注意力头级别强制跨模态对齐,通过对比目标匹配局部拓扑结构,选择对齐最差的头进行训练,有效提升视觉任务性能并减少幻觉。
空货架还是丢钥匙?回忆是参数化事实性的瓶颈
机构 * Google Research(Google研究) ; Technion – Israel Institute of Technology(以色列技术学院)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出行为框架区分LLM事实错误源于知识缺失或访问失败,通过WikiProfile基准测试发现前沿模型编码饱和但回忆是主要瓶颈,思考可恢复大量失败。
子空间感知稀疏自编码器用于有效的机制可解释性
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对稀疏自编码器将特征假设为一维导致特征分裂的问题,提出子空间感知稀疏自编码器(SASA),通过学习解码器子空间、块稀疏门控和核范数正则化,在GPT-2和Mistral-7B上减少特征分裂和吸收,提高单义性和可解释性。
幻觉检测的自动层选择
机构 * University of Washington(华盛顿大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型中幻觉检测的层选择问题,提出无需训练的FEPoID准则,自动识别最优中间层,并结合截断策略提升检测性能。
Comments Accepted at ICML 2026
概念异质性感知表示引导
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型表示非均匀导致全局引导脆弱的问题,提出基于最优传输的输入依赖引导方法CHaRS,通过高斯混合模型和离散最优传输实现更有效的行为控制。
Journal ref ICML 2026
Interpreto:一个用于Transformer的可解释性库
机构 * IRT Saint Exupéry Toulouse(伊尔杜夫圣埃克苏佩里图卢斯) ; IRIT Toulouse(图卢兹IRIT) ; Khoury College of Computer Sciences(科赫里计算机科学学院) ; Ampere(阿姆佩尔) ; MICS, CentraleSupélec(MICS,中央超导学院) ; Scienta Lab(科学实验室) ; Thales Avionics(泰勒斯航空电子) ; ANITI
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.CL、cs.LG
AI总结 Interpreto是一个开源Python库,通过归因方法和基于概念的解释,为HuggingFace语言模型(从早期BERT变体到LLM)提供统一的解释工作流,其端到端基于概念的流水线是主要创新。
Comments Accepted to ACL 2026 System Demonstration. Equal contribution: Poché and Jourdan
关于检索内容表示对RAG管道的影响
机构 * The University of Queensland(昆士兰大学) ; CSIRO(澳大利亚联邦科学与工业研究组织)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 通过控制变量实验,研究检索文档的不同表示(选择、摘要、改写等)对RAG生成准确性的影响,发现答案保留是主要决定因素。
Comments 23 pages, 15 figures, submitted to ACL May 2026 ARR
REC-CBM:面向可信开放评分的基于规则感知的错误修正概念瓶颈模型
机构 * School of Computing and Augmented Intelligence, Arizona State University, USA(计算与增强智能学院,亚利桑那州立大学,美国) ; Mary Lou Fulton Teachers College, Arizona State University, USA(玛丽·卢·福洛顿教师学院,亚利桑那州立大学,美国) ; Department of Computer Science, National Yang Ming Chiao Tung University, TW(国立阳明交通大学计算机科学系,台湾)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出REC-CBM模型,通过规则感知概念编码器、序数成对校准目标和潜在概念错误修正模块,解决开放评分中标准概念瓶颈模型无法建模细粒度规则维度、忽略评分序数语义和概念标注不可靠的问题,在提升评分性能的同时保持可解释性。
创新:幻觉的几乎刻画
机构 * School of Technology and Computer Science, Tata Institute of Fundamental Research, Mumbai, Maharashtra - 400 005, India(技术与计算机科学学院,塔塔基础研究机构,孟买,马哈拉施特拉邦 - 400 005, 印度)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文引入“创新”属性来刻画大语言模型幻觉的必然性,证明创新与幻觉几乎等价,并基于创新率给出新的幻觉率下界。
LEAP:一种用于钙钛矿前驱体添加剂发现的闭环框架
机构 * School of Physics, Renmin University of China(中国人民大学物理学院) ; School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出LEAP框架,结合大语言模型和主动学习,通过文献驱动的机制相关描述符和贝叶斯优化,实现了钙钛矿太阳能电池添加剂的高效发现,实验验证显示其在性能提升方面优于通用模型。
Comments 30 pages; 11 figures
BalanceRAG: 为级联检索增强生成进行联合风险校准
机构 * Beihang University(北航) ; Shenzhen Institute of Advanced Technology(深圳先进技术研究院) ; Zhejiang University of Finance & Economics(浙江财经大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出BalanceRAG,一种用于级联检索增强生成的联合风险校准方法,通过在二维晶格上确定安全操作点,实现风险自适应的阈值校准,从而在控制系统级错误率的同时保留更多示例,并扩展到多风险校准。
ContextRAG: 无提取的分层图构建用于检索增强生成
机构 * HSE University(俄罗斯高等经济大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ContextRAG,一种无需大型语言模型提取实体和关系的图检索增强生成系统,通过残差量化k均值和Formal Concept Analysis方法构建模糊概念图,在130个任务的UltraDomain子集中实现了33.6%的F1分数,显著优于传统方法。
Comments Preprint. 6 tables
超越遗忘:机器去学习引发可控的副作用和能力
机构 * Japan Advanced Institute of Science and Technology(日本先进科学研究所) ; Quantum AI and Cyber Security Institute(量子人工智能与网络安全研究所) ; FPT Corporation(FPT公司) ; Monash University(墨尔本大学) ; RIKEN(理化学研究所)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文探讨了通过去学习引发可控副作用和能力的现象,通过线性表示假设验证了该现象在行为控制和能力增强任务中的有效性。
Comments 36 pages, 19 tables, 9 figures
大型语言模型作为隐式填补器:不确定性应与缺失信息成比例
机构 * TNO - Netherlands Organization for Applied Scientific Research(荷兰应用科学研究院) ; Dept. of Methodology and Statistics, University of Utrecht(乌得勒支大学方法学与统计学系)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文探讨了大型语言模型在不完整上下文下的不确定性衡量,通过实验发现熵比置信度更能反映缺失信息的影响,且在不同证据水平上解释了更多准确性变化。
Comments 9 pages, 3 figures, 2 tables, NeurIPS 2026 position paper
Agent-BRACE: 通过 verbalized 状态不确定性解耦信念与行动以应对长 horizon 任务
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 Agent-BRACE 通过解耦信念状态模型与策略模型,利用强化学习优化,在长 horizon 部分可观测任务中提升性能,实现上下文窗口恒定且任务相关信息保留。
Comments Code: https://github.com/joykirat18/Agent-BRACE
XGRAG:一种用于基于知识图谱检索增强生成的图原生解释框架
机构 * Berlin Technology Centre(柏林技术中心) ; Deutsche Bank(德意志银行)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 XGRAG通过图基扰动策略生成因果解释,提升GraphRAG系统的可解释性,在多个问答数据集上实现解释质量提升。
伪造引用的产生地:追踪领域层面的幻觉到LLM中的特定神经元
机构 * Rutgers University(罗格斯大学)
专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI
AI总结 研究发现LLM生成虚假引用时,作者名错误率最高,领域特定的幻觉神经元通过内部模型信号可检测和缓解。
通过文本语义增强视觉表示:基于文本语义的原型用于异构联邦学习
机构 * State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,计算机科学与工程学院,北京航空航天大学,北京,中国) ; Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) ; Center for AI Business Innovation, Department of Management Science and Systems, School of Management, University at Buffalo, USA(人工智能商业创新中心,管理科学与系统系,管理学院,布法罗大学,美国)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FedTSP,利用预训练语言模型构建语义丰富的原型,以解决异构联邦学习中的数据异质性问题,提升模型收敛速度和泛化能力。
Comments Accepted by CVPR 2026 (Highlight)
RAGognizer: 通过检测头整合实现hallucination-aware微调
机构 * Computer Science Department(计算机科学系)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 RAGognizer通过整合轻量级检测头,实现hallucination-aware微调,提升内部状态分离性并减少生成hallucination。
Comments accepted at IJCNN 2026
从学生视角看AI幻觉:一项主题分析
机构 * Department of Computer and Information Engineering, Center for Cyber Physical Systems, Khalifa University(计算机与信息工程系,跨物理系统中心,哈利法大学) ; Department of Psychology, University Malaysia Sabah(心理学系,马来西亚Sabah大学)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究通过主题分析探讨学生对AI幻觉的认知与应对策略,揭示学生在检测幻觉时的依赖策略及对幻觉成因的误解,强调需在AI素养教育中加强验证意识和准确思维模型。
问题已解决?利用LLMs处理布局丰富文档的信息提取设计空间
机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) ; NEC Laboratories Europe(NEC欧洲实验室)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文通过LayIE-LLM测试套件研究了利用LLMs处理布局丰富文档的信息提取设计空间,证明通用LLMs在优化配置下可媲美专用模型,提供低成本无微调方案。
Comments accepted at EMNLP'25
Token-Guard: 通过自检解码实现token级幻觉控制
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanyang Technological University(南洋理工大学)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 Token-Guard通过自检解码技术,实现对大型语言模型中token级幻觉的有效控制,提升生成准确性与输出可靠性。
Comments Accepted by ICLR 2026 main conference
Journal ref ICLR 2026