PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
Comments 10 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
Comments 10 pages
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments To be published in NAACL 2024
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
Comments ICLR 2024. 52 pages, 30 figures, 23 tables. Code and data at https://functions.baulab.info
专题命中 知识编辑与模型理解 :foundation model(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI、cs.LG
Comments AAAI 2024 Workshop on Synergy of Reinforcement Learning and Large Language Models
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments 37th Conference on Neural Information Processing Systems (NeurIPS 2023). 20 pages, 5 main figures, 7 supplementary figures
用于解释大语言模型的拉盖尔几何
机构 * JMP Statistical Discovery(JMP统计发现公司)
专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,comments);分类 cs.AI
AI总结 研究大语言模型中概念结构的形成,利用拉盖尔几何精确表征概念,通过分解Transformer层揭示隐藏轨迹控制机制,提出无需训练和超参数的几何透镜方法读出概念,开发可视化工具,还实现可操作的可解释性。
Comments Geometric Lens; LLM Interpretability; Code: https://github.com/horsepurve/Geometric-Lens
机构 * University of Edinburgh(爱丁堡大学)
专题命中 知识编辑与模型理解 :language model(title,journal_ref);large language model(title);LLM(abstract);分类 cs.CL
Journal ref First Conference on Language Modeling. COLM 2024. Philadelphia, Pennsylvania, United States
语义冲突的机制视角:使用激活修补来理解大语言模型行为
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究大语言模型在语义冲突下的行为,构建Python代码片段三元组,用行为性能度量和残差流激活修补评估四个LLMs在输出预测和单元测试生成任务中的表现,发现语义冲突影响任务且相关信息集中,展示分析LLMs整合代码信息的框架。
从失败轨迹到可靠的LLM代理:诊断与修复框架缺陷
专题命中 知识编辑与模型理解 :LLM(title,title_cn)
AI总结 提出HarnessFix框架,通过轨迹引导诊断代理失败并修复执行框架,在多个基准上提升15.2%-50.0%性能。
跨层离散概念发现用于解释语言模型
机构 * University of Washington(华盛顿大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出跨层向量量化变分自编码器(CLVQ-VAE),通过离散向量量化瓶颈将残差流中的重复特征压缩为紧凑可解释的概念向量,在三个数据集上优于聚类、单层VQ-VAE和稀疏自编码器基线。
机械论数据归因:追踪可解释LLM单元的训练起源
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出机械论数据归因(MDA)框架,利用影响函数将可解释单元追溯到特定训练样本,通过因果验证表明干预高影响样本可显著调节可解释头的涌现,并发现重复结构数据作为机械催化剂,同时验证了归纳头与上下文学习之间的功能联系。
Comments ICML2026 (Oral)
多语言模型系统表现出稳健的语义崩溃
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究探讨了多语言模型系统在闭环设置中维持开放知识生产的基本限制,发现系统在语义表示上出现系统性收敛,尽管表面上有词汇变化。
Comments 64 pages, 8 figures, 7 tables; includes Supplementary Information
通过测试生成探测基于LLM的代码生成中的隐私泄露
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出一种模拟实际隐私相关代码生成场景的管道,采用测试驱动策略提取生成测试用例中的记忆信息,通过自动构建隐私特征库提高隐私泄露检测效果,实验表明检测到的隐私泄露增加2.56倍。
Comments Preprint
语言模型表示中的修辞问题:一项线性探测研究
机构 * Independent Researcher(独立研究者) ; University of Cincinnati(辛辛那提大学) ; Amazon(亚马逊)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过线性探测研究语言模型对修辞问题的表示,发现修辞信号在模型早期层中出现,并主要由最后一层表示捕捉,且在不同数据集间可转移,但不同数据集训练的探测器在目标数据集上的排名差异较大,反映出修辞问题的多维度编码特性。
Comments 18 pages, 15 figures, accepted to ACL 2026
用ELIA简化语言模型组件分析的结果
机构 * Technische Universität Berlin(柏林技术大学) ; Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ELIA通过交互式界面和AI生成的自然语言解释,简化了语言模型组件分析,帮助非专家理解复杂模型。
Comments EACL 2026 System Demonstrations. GitHub: https://github.com/aaron0eidt/ELIA
SECA:用于诱发LLM幻觉的语义等价且连贯的攻击
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SECA通过现实修改提示诱发LLM幻觉,提高攻击成功率并减少语义错误。
Comments Accepted at NeurIPS 2025. Code is available at https://github.com/Buyun-Liang/SECA
大语言模型推荐系统中的不确定性与公平性意识
机构 * Beihang University(北京航空航天大学) ; McGill University(麦吉尔大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了大语言模型推荐系统中不确定性与公平性的影响,提出了一种新的评估方法并揭示了个性化与公平性之间的权衡。
Comments Accepted at the Second Conference of the International Association for Safe and Ethical Artificial Intelligence, IASEAI26, 14 pages
无需训练的Guess What视觉语言模型:从片段到开放词汇物体检测
机构 * Aerospace and Informatics Domain(航空航天与信息领域) ; National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(空间智能信息处理国家级重点实验室) ; School of Electronic(电子学院)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)
AI总结 本文提出无需训练的Guess What视觉语言模型GW-VLM,通过多尺度视觉语言搜索与上下文概念提示实现开放词汇物体检测的高效检测性能。
LIME-LLM:通过流畅的反事实而非破碎文本来探测模型
机构 * University of North Texas(北卡罗来纳州立大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LIME-LLM通过假设驱动的可控扰动提升NLP模型的可解释性,实现更准确的局部解释效果。
元提示协议:通过对抗反馈循环 orchestrate LLMs
机构 * Zhejiang University(浙江大学)
专题命中 知识编辑与模型理解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 元提示协议通过对抗反馈循环构建可编程自优化系统,解决LLM在关键任务中的确定性保证问题。
Comments 6 pages, 2 figures
机构 * Amazon Web Services, USA(亚马逊网络服务)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Singapore Management University(新加坡管理大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 16 pages, 4 figures
机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医疗校园) ; University of Colorado Boulder(科罗拉多大学博尔德分校) ; University of Wisconsin Madison(威斯康星大学麦迪逊分校)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to EMNLP 2025 Main Conference
机构 * Department of Psychology, Cardiff University(心理学系,卡迪夫大学) ; Department of Computer Science, George Washington University(计算机科学系,乔治华盛顿大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments This preprint is under review
机构 * University of Maryland(马里兰大学) ; Meta
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)
Comments ICCV 2025
机构 * Tsinghua University(清华大学) ; Tencent AI Lab(腾讯AI实验室) ; Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments IJCAI 2025
机构 * Department of Computer Science & Engineering(计算机科学与工程系) ; The Ohio State University(俄亥俄州立大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 18 pages, 9 figures
机构 * Southwest Jiaotong University(西南交通大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
机构 * HumaConn AI Consulting(HumaConn AI咨询公司)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG