arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 289 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 289 篇

2603.20750 2026-06-24 cs.AI 版本更新 87%

Subjective-Graph LLM Agents for Simulating Uncertainty in Classroom Social Perception

主观图LLM智能体用于模拟课堂社会感知中的不确定性

Jinming Yang, Xinyu Jiang, Xinshan Jiao, Xinping Zhang

机构 * Complex Lab, School of Computer Science and Engineering(复杂实验室,计算机科学与工程学院) University of Electronic Science and Technology of China(电子科学与技术大学) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Health and Medical Technology, Chengdu Neusoft University(成都新软大学健康与医疗技术学院)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出基于主观图和可信度通信的多智能体框架,模拟课堂中学术地位的持久扭曲,在12个班级482名学生数据上验证,排名误差从0.066增至0.124。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07195 2026-08-18 cs.CL cs.AI 版本更新 87%

Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Representation Alignment

通过时间异质性建模与表示对齐将大语言模型(LLMs)适配到时间序列预测任务

Yanru Sun, Emadeldeen Eldele, Zongxia Xie, Yucheng Wang, Wenzhe Niu, Qinghua Hu, Chee Keong Kwoh, Min Wu

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出TALON框架,通过异构时间编码器建模时间异质性、表示对齐模块弥合模态差距,在7个真实世界基准上较SOTA方法平均MSE提升最高11%,实现高效且高性能的LLM时间序列预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16462 2026-08-10 cs.CL cs.CY cs.LG 版本更新 87%

Let's Unlearn Stereotypes Before Decision-Making: Assessing the Impact of Intrinsic Bias Mitigation on Downstream Fairness in LLMs

让我们在决策前忘却刻板印象:评估内在偏差缓解对大语言模型下游公平性的影响

Mina Arzaghi, Alireza Dehghanpour Farashah, Florian Carichon, Jean-François Plante, Golnoosh Farnadi

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出公平感知概念忘却(FACU)方法,在保留预测性能的同时缓解LLM内在偏差,可提升下游公平性,结合反事实数据增强效果更佳,为LLM公平性优化提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24539 2026-07-29 cs.CL cs.AI 版本更新 87%

Localizing Persona Representations in LLMs

在大语言模型中定位角色表示

Celia Cintas, Miriam Rateike, Erik Miehling, Elizabeth Daly, Skyler Speakman

机构 * IBM Research Africa(IBM非洲研究院) IBM Research Europe(IBM欧洲研究院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中角色表示的编码位置与方式,运用降维和模式识别方法,发现角色表示差异在解码器层最后三分之一内,特定伦理观点有重叠激活,政治意识形态区域不同,有助于理解LLM信息表示及改进输出调制。

Comments Corrected small naming inconsistencies for Level 0, 1, and 2 analysis

Journal ref Proceedings of the AAAI ACM Conference on AI, Ethics, and Society, 8(1), 630-642, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15334 2026-07-07 cs.CL cs.AI 版本更新 87%

No Reliable Evidence of Self-Reported Sentience in Small Large Language Models

小语言模型中自我报告的感知能力缺乏可靠证据

Caspar Kaiser, Sean Enderby

机构 * University of Warwick, Warwick Business School(沃里克大学,沃里克商学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 通过询问多个开源语言模型关于其自身意识的问题,并利用基于内部激活训练的分类器验证回答,对语言模型是否认为自己有感知能力进行测试,发现模型否认有感知,分类器也无反例,且Qwen模型中越大越确定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19755 2026-06-09 cs.AI cs.LG 版本更新 87%

Explainable AML Triage with LLMs: Evidence Retrieval and Counterfactual Checks

可解释的AML优先级排序与LLMs:证据检索与反事实检查

Dorothy Torres, Wei Cheng, Ke Hu

机构 * School of Science, Technology, Engineering and Mathematics(科学、技术、工程与数学学院) School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种可解释的AML优先级排序框架,结合证据增强的证据捆绑、结构化LLM输出合同和反事实验证,提升审计性和鲁棒性,实验证明其在优先级排序和证据支持方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06324 2026-07-03 cs.SE cs.MA 版本更新 87%

From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws

从失败轨迹到可靠的LLM代理:诊断与修复框架缺陷

Mengzhuo Chen, Junjie Wang, Zhe Liu, Yawen Wang, Haiming Zheng, Qing Wang

专题命中 知识编辑与模型理解 :LLM(title,title_cn)

AI总结 提出HarnessFix框架,通过轨迹引导诊断代理失败并修复执行框架,在多个基准上提升15.2%-50.0%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20040 2026-06-11 cs.LG cs.AI cs.CL 版本更新 87%

Cross-Layer Discrete Concept Discovery for Interpreting Language Models

跨层离散概念发现用于解释语言模型

Ankur Garg, Xuemin Yu, Hassan Sajjad, Samira Ebrahimi Kahou

机构 * University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨层向量量化变分自编码器(CLVQ-VAE),通过离散向量量化瓶颈将残差流中的重复特征压缩为紧凑可解释的概念向量,在三个数据集上优于聚类、单层VQ-VAE和稀疏自编码器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21996 2026-06-09 cs.CL cs.AI cs.LG 版本更新 87%

Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units

机械论数据归因:追踪可解释LLM单元的训练起源

Jianhui Chen, Yuzhang Luo, Liangming Pan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出机械论数据归因(MDA)框架,利用影响函数将可解释单元追溯到特定训练样本,通过因果验证表明干预高影响样本可显著调节可解释头的涌现,并发现重复结构数据作为机械催化剂,同时验证了归纳头与上下文学习之间的功能联系。

Comments ICML2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13538 2026-08-19 cs.CL 版本更新 86%

SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization

SAEVerbalizer:通过表示 verbalization 为稀疏自编码器特征生成解释

Weihan Meng, Hongzhu Guo, Yi Jing, Dewen Liu, Zijun Yao, Xiaozhi Wang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出 SAEVerbalizer 框架,通过微调 LLM 下游层生成 SAE 特征的自然语言解释,解决了传统解释方法的表面性与低效率问题,其 verbalization 能力可泛化、迁移并扩展到不同 LLM 的 SAE 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28823 2026-07-07 cs.CL 版本更新 86%

What are They Thinking? Delineation, Probing, and Tracking of Concepts in LLMs

他们在想什么?LLM中概念的界定、探测与追踪

Mohamed Abdelwahab, Michelle Yu Collins, Sihan Chen, Yi Cheng Zhao, Zafarullah Mahmood, Jiading Zhu, Soliman Ali, Jonathan Rose

机构 * The Edward S. Rogers Sr. Department of Electrical and Computer Engineering(埃德华·S·罗杰斯 Sr. 部门电子与计算机工程系)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出通过线性探针低成本地检测LLM嵌入中的概念,并展示了概念界定、探针训练与跨上下文追踪的方法,为大规模模型监控奠定基础。

Comments Accepted to the 6th Workshop on Trustworthy Natural Language Processing (TrustNLP 2026)

Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01455 2026-06-15 cs.CL 版本更新 86%

Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal

大型语言模型中的可信不确定性:置信度校准与风险控制拒绝的统一框架

Markus Oehri, Giulia Conti, Kaviraj Pather, Alexandre Rossi, Laia Serra, Adrian Parody, Rogvi Johannesen, Aviaja Petersen, Arben Krasniqi

机构 * University of Liechtenstein(列支敦士登大学) University of the Republic of San Marino(圣马尔科共和国大学) University of Mauritius(毛里求斯大学) International University of Monaco(摩纳哥国际大学) University of Andorra(安道尔大学) University of Gibraltar(直布罗陀大学) University of the Faroe Islands(法罗群岛大学) Ilisimatusarfik (University of Greenland)(格陵兰岛研究所(格陵兰大学)) University of Prizren(普里兹伦大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 提出UniCR框架,融合多种不确定性证据为校准的正确概率,并通过原则性拒绝满足用户指定的错误预算,无需微调基础模型,在短问答、代码生成和检索增强长问答中提升校准指标并降低风险-覆盖曲线下面积。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03217 2026-06-10 cs.LG cs.CY 版本更新 86%

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估

Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Purdue University(普渡大学) Meta Apple(苹果公司) Wright State University(怀特州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 知识编辑与模型理解 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24435 2026-08-03 cs.CL cs.AI 版本更新 86%

LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box Settings

LEX-EC:黑盒设置下用于零样本大语言模型人格分类的词汇证据通道审计框架

Brittany Harbison, Ashok K. Goel

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型人格分类可解释性问题,提出LEX-EC框架,结合多种诊断与词汇消融,通过对不同文本体裁分析,展示特质关联与词汇证据关系,联合评估多项指标,将词汇方法应用于黑盒人格标签可解释性。

Comments Appendix and link to Code repo provided; this version also contains a refined Discussion section and a small error regarding Table 1 was corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14180 2026-07-24 cs.CL cs.AI 版本更新 86%

Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model

无外部表达的知识:探索经典中文语言模型的泛化边界

Jiuting Chen, Yuan Lian, Hao Wu, Tianqi Huang, Hiroshi Sasaki, Makoto Kouno, Jongil Choi

机构 * Eaglewood Japan Co., Ltd.(日本鹰木公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过训练纯经典中文语料库的Transformer模型,探讨模型能否区分已知与未知输入,并揭示内部与外部不确定性之间的差异。

Comments 27 pages, 4 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15903 2026-07-07 cs.LG cs.AI 版本更新 86%

Towards Mitigation of Hallucination for LLM-empowered Agents: Progressive Generalization Bound Exploration and Watchdog Monitor

迈向减轻基于大语言模型的智能体幻觉:渐进泛化边界探索与看门狗监测

Siyuan Liu, Wenjing Liu, Zhiwei Xu, Xin Wang, Bo Chen, Tao Li

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Haihe Lab of ITAI College of intelligent Science and Technology, Inner Mongolia University of Technology(内蒙古工业大学智能科学与技术学院海河实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Computer Science, Michigan Technological University(密歇根技术大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型赋能智能体的幻觉问题,提出HalMit黑箱框架,用概率分形采样技术并行生成查询触发异常响应,以识别泛化边界来检测幻觉,提升智能体可靠性。

Journal ref Proceedings of the 28th European Conference on Artificial Intelligence (ECAI 2025), IOS Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新 86%

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07941 2026-08-20 cs.CR 版本更新 86%

Collective Hallucination in Multi-Agent LLMs:Modeling and Defense

多智能体大语言模型中的集体幻觉:建模与防御

Saeid Jamshidi

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种系统级模型描述多智能体LLM中幻觉的传播与放大,并设计交互感知控制方法,通过置信加权聚合、自适应影响调节、外部验证和隔离不可靠智能体来抑制错误传播,在TruthfulQA和TriviaQA上使幻觉降低39%,事实准确率提升至0.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04635 2026-07-31 cs.RO 版本更新 86%

Relational Scene Graphs for Object Grounding of Natural Language Commands

基于关系场景图的对象接地自然语言指令

Julia Kuhn, Francesco Verdoja, Tsvetomila Mihaylova, Ville Kyrki

机构 * School of Electrical Engineering, Aalto University(艾尔沃大学电气工程学院) School of Science, Aalto University(艾尔沃大学科学学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于关系场景图的方法,通过结合LLM和VLM增强自然语言指令中对象接地的准确性。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 86%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11132 2026-06-25 cs.SE 版本更新 86%

Rethinking Technology Stack Selection with AI Coding Proficiency

重新思考基于AI编程能力的技术栈选择

Xiaoyu Zhang, Weipeng Jiang, Shiqing Ma, Qingshuang Bao, Chenhao Lin, Chao Shen, Tianlin Li, Juan Zhai

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出AI编程能力概念,通过170个第三方库和6个LLM的实证研究发现,相似功能的库在LLM生成代码质量上差异高达84%,呼吁将AI编程能力纳入技术选择框架。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17168 2026-08-21 cs.CL 版本更新 85%

RepSelect: Robust LLM Unlearning via Representation Selectivity

RepSelect: 通过表示选择性实现鲁棒的大语言模型遗忘

Filip Sondej, Yushi Yang, Adam Mahdi

机构 * Independent(独立) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 针对现有遗忘方法易被微调或少样本提示逆转的问题,提出RepSelect方法,通过梯度主成分坍塌隔离遗忘集表示,实现深度鲁棒遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10645 2026-07-21 cs.CL cs.MA cs.SI 版本更新 85%

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测

Ilia Karpov

机构 * HSE University(俄罗斯高等经济研究大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL

AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06269 2026-07-07 cs.LG cs.AI 版本更新 85%

Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

利用机制可解释性对大语言模型进行对抗攻击

Thomas Winninger, Boussad Addad, Katarzyna Kapusta

机构 * Thales(泰勒斯)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 研究利用机制可解释性对大语言模型进行对抗攻击,通过识别接受子空间,用梯度优化使嵌入重新路由,降低计算成本,在多种模型上快速实现高成功率攻击,为攻防研究开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01530 2026-08-12 cs.CV 版本更新 85%

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

在视觉语言模型中保留局部化补丁语义

Parsa Esmaeilkhani, Longin Jan Latecki

机构 * Department of Computer and Information Sciences, Temple University, Philadelphia, USA(计算机与信息科学系,特兰普大学,费城,美国)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 为解决视觉语言模型中图像与文本 tokens 信息扩散问题,提出 Logit Lens Loss(LLL)以保留图像 tokens 的局部化语义,提升模型可解释性和分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17431 2026-06-23 cs.CL cs.AI cs.LG 版本更新 85%

Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study

长文本语言模型输出的细粒度不确定性量化:一项比较研究

Dylan Bouchard, Mohit Singh Chauhan, Viren Bajaj, David Skarbrevik

机构 * CVS Health(CVS健康公司) Wellesley, MA(马萨诸塞州韦尔士利)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长文本生成,提出细粒度不确定性量化分类法,通过响应分解、单元级评分和响应级聚合三阶段区分方法,引入FactScore-STEM-Geo数据集,实验发现声明-响应蕴含评分优于复杂方法,声明级评分优于句子级,不确定性感知解码有效提升事实性。

Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11872 2026-08-03 q-bio.GN cs.AI 版本更新 84%

ELISA: An Interpretable Hybrid Generative AI Agent for Expression-Grounded Discovery in Single-Cell Genomics

ELISA:一种可解释的混合生成式AI代理,用于单细胞组学中的表达基础发现

Omar Coser

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI

AI总结 ELISA结合表达嵌入、语义检索和LLM解释,提供交互式单细胞发现,优于CellWhisperer,尤其在基因签名查询中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26431 2026-07-20 cs.CL stat.AP 版本更新 84%

Probing LLMs for Syntactic Structure Beyond Universal Dependencies: A Minimalist Phase Account in English

探究LLM中的最简阶段结构:普遍依赖关系无法表示的内容

Yuanhao Chen, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 通过设计UD距离不变的条件,使用结构探针评估LLM在wh-移位刺激上的表现,发现阶段计数梯度和阶段内凝聚性效应,表明分布预训练能诱导出超越UD的形式句法抽象表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02896 2026-06-29 cs.LG 版本更新 84%

Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

通过梯度上升实现可解释人格控制与提示工程的桥梁

Harshvardhan Saini, Yiming Tang, Dianbo Liu

机构 * Department of Computer Science(计算机科学系) Indian Institute of Technology (ISM), Dhanbad(印度理工学院(ISM),丹巴德) National University of Singapore(新加坡国立大学) CIFAR Fellow(CIFAR研究员)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RESGA和SAEGA方法,利用梯度上升优化随机初始化提示,以实现与识别的人格方向更一致的表示,有效控制LLM中的人格行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17932 2026-06-29 cs.CL 版本更新 84%

Training-free Truthfulness Detection via Sparse MLP Value Vectors

基于稀疏MLP值向量的免训练真实性检测

Runheng Liu, Heyan Huang, Xingchen Xiao, Yanghao Zhou, Zhijing Wu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TruthV方法,利用MLP值向量中稀疏子集的稳定方向性信号,无需训练即可检测LLM生成内容的真实性,在多个基准上超越现有免训练方法。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏