arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-24 至 2026-08-24 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 20 篇

2501.10573 2026-08-24 cs.CL cs.LG 版本更新 92%

The Intrinsic Dimension of Prompts in Internal Representations of Large Language Models

大语言模型内部表示中提示的固有维度

Karthik Viswanathan, Yuri Gardinazzi, Giada Panerai, Alberto Cazzaniga, Matteo Biagetti

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过固有维度视角分析大语言模型提示的内部表示几何,发现其与下一个 token 不确定性等相关,训练的线性探测模型可在生成前区分恶意与良性提示,准确率优于现有安全工具,为 LLM 安全提供了新信号。

Comments 12+14 pages, 18 figures, matches published version on Transactions of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20356 2026-08-24 cs.DB 新提交 89%

Disentangling Structure and Semantics: How Schema Representation Affects LLM-Based SQL Generation

解耦结构与语义:模式表示如何影响基于大语言模型(LLM)的SQL生成

Daniel Yitian Su, Sophie Yiran Su, Qiang Sun, Yihao Ding, Wei Liu

专题命中 知识编辑与模型理解 :LLM(title,title_cn)

AI总结 本文通过6×3析因实验发现,基于LLM的文本转SQL中,语义线索对性能的影响大于结构线索,有意义的标识符可弥补结构缺失,而丰富结构元数据无法改善名称不明确的情况。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20378 2026-08-24 cs.AI 新提交 88%

Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification

真相藏于深处:通过潜在意图验证对抗语义伪装

Md. Hasib Ur Rahman

专题命中 知识编辑与模型理解 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对大语言模型安全对齐的表面性问题,该研究提出潜在意图验证(LIV)方法,利用小型语言模型早期层的有害特征,在不重新训练的情况下,将语义伪装攻击的检测性能提升20%-50%。

Comments 5 pages, 3 figures. Accepted at the 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence, and Networking (QPAIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21277 2026-08-24 cs.LG 新提交 83%

ConceptTS: LLM-Guided Concept Bottlenecks for Interpretable Multivariate Time-Series Forecasting

ConceptTS:用于可解释多变量时间序列预测的大语言模型引导概念瓶颈

Yichen Jiang, Yueqiao Chen, Dongyu Liu

机构 * Stanford University(斯坦福大学) University of California, Davis(加州大学戴维斯分校)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ConceptTS是围绕人类可理解概念的可解释多变量时间序列预测框架,利用大语言模型生成概念与标注规则,在空气质量数据集上达到与黑箱基线相当的准确率,且决策过程可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-24 cs.CV cs.SC 版本更新 82%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Withdrawn by the authors due to premature submission before final review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20347 2026-08-24 cs.CL cs.AI cs.CY 新提交 81%

Who Do Language Models Think Is Competent? A Mechanistic Analysis of Occupational Bias

语言模型认为谁具备胜任能力?职业偏见的机制分析

Keren Fuentes, Aaron Mueller

机构 * Boston University(波士顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过引入因果框架,揭示语言模型对用户专业知识的内部表征存在职业偏见,该偏见会受人口统计学属性影响,且仅靠行为指标无法完全检测到相关失效模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13798 2026-08-24 cs.CV cs.AI cs.LG 版本更新 81%

CFM: Language-aligned Concept Foundation Model for Vision

CFM:面向视觉的语言对齐概念基础模型

Kai Wittenmayer, Sukrut Rao, Amin Parchami-Araghi, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 CFM提出一种语言对齐的概念基础模型,提供细粒度可解释的概念,提升视觉任务的解释能力,实现分类、分割和描述生成的高性能表现。

Comments Accepted as a Spotlight at ECCV 2026. Corrected inaccuracies in equation 3,4 and B.8. 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21236 2026-08-24 cs.CL 新提交 79%

RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models

RARE:在混合专家(MoE)语言模型中解耦表示调控与专家路由

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) AIDX TECH PTE. LTD.(AIDX科技私人有限公司) National University of Singapore(新加坡国立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 针对表示工程直接应用于MoE模型的结构不匹配问题,提出与路由无关的RARE框架,通过投影扰动到路由矩阵零空间并修正路由漂移,在三类调控任务中实现了更优的有效性-效用权衡。

Comments 20 pages, 3 figures. Paper accepted to the Actionable Interpretability Workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20991 2026-08-24 cs.LG 新提交 79%

Trojaning the Alignment: Stealthy Backdoor Attacks against Graph Foundation Models

对齐攻击:针对图基础模型的隐蔽后门攻击

Minhua Lin, Zhicheng Gao, Yilong Wang, Hanqing Lu, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文针对带文本属性图的图基础模型,提出STAG隐蔽特洛伊木马攻击框架,协调图触发器生成器与文本软提示实现后门攻击,经多数据集实验验证其有效性与隐蔽性。

Comments Accepted by ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20659 2026-08-24 cs.CV 新提交 78%

Lift, Associate, and Fuse: A Decision-Centric Framework for 2D-to-3D Foundation Model Transfer

提升、关联与融合:面向2D到3D基础模型迁移的以决策为中心的框架

Wentao Sun, Yiping Chen, John S. Zelek, Jonathan Li

机构 * School of Geospatial Engineering and Science, Sun Yat-sen University(中山大学地理空间工程与科学学院) University of Waterloo(滑铁卢大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 该研究提出以决策为中心的LAF框架,将2D到3D基础模型迁移系统拆分为五个算子,通过对161个系统的审计,为3D感知系统的比较、故障诊断与规范提供了表示无关的方法。

Comments A framework to realize 3D segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-08-24 cs.AI cs.CR 版本更新 77%

When Words Are Safe But Actions Kill: Probing Physical Jailbreak Beyond Textual Jailbreak in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11924 2026-08-24 cs.CL cs.AI cs.LG 版本更新 75%

Explaining Intrinsic Moral Self-Correction with Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 知识编辑与模型理解 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20970 2026-08-24 cs.AI 新提交 70%

Deep Learning Models Also Recall Features

深度学习模型也会回忆特征

Pierre Beckmann

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Idiap Research Institute(Idiap研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出深度学习模型存在特征回忆这一通用操作,定义了该概念、证明其适用于多种架构并与特征组合对比,为理解深度学习提供了新工具,也为机械可解释性研究指明了实证方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20711 2026-08-24 cs.CL 新提交 70%

AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification

AsmEvo:采用功能等价性验证的AMD GPU内核智能体级汇编层优化工具

Ji Liu, Puyuan Yang, Rongzhang Zheng, Fan Wang, Jinglin Wang, Muhammad A. Awad, Mortis Huang, Andy Chang, Zekai Li, Zeping Li, Zihao An, Yue Liu, Yuchen Yang, Jianghui Wang, Chushi Chen, Ziqiong Liu, Fuwei Yang, Dong Li, Wen Heng Chung, Shengcai Liu, Emad Barsoum

机构 * AMD(超威半导体公司)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 AsmEvo是一款针对AMD GPU内核的智能体级汇编层优化工具,通过功能等价性验证优化已编译的AMDGPU代码对象,在多款AMD GPU上实现了显著加速比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20389 2026-08-24 cs.AI 新提交 70%

Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness

表征影响检索:多模态智能体框架中技能发现与路由的案例研究

Kevin Dela Rosa

机构 * Cloudglue USA(美国Cloudglue公司)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究以多模态智能体框架Tinycloud为案例,发现提示内技能的部分暴露会产生词汇竞争,抑制正确技能选择,其为大规模技能路由提供了小规模视角。

Comments 5 pages, 1 figure, 3 tables. Accepted at AgentSearch '26 workshop at SIGIR 2026 (Melbourne, Australia, July 24, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14251 2026-08-24 cs.LG 版本更新 70%

Calibrate-Then-Delegate: Safety Monitoring with Risk and Budget Guarantees via Model Cascades

校准后再委托:通过模型级联实现具有风险和预算保证的安全监控

Edoardo Pona, Milad Kazemi, Mehran Hosseini, Yali Du, David Watson, Osvaldo Simeone, Nicola Paoletti

机构 * King’s College London(伦敦国王学院) University of Manchester(曼彻斯特大学) Northeastern University London(伦敦东北大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出Calibrate-Then-Delegate方法,通过模型级联在保证计算成本的同时实现实例级决策,有效提升安全监控的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20476 2026-08-24 cs.CL 版本更新 70%

When Looks Do Not Lie: Discourse Structure Guided In-Context Learning for Faithful Diagram Generation

用上下文示例能改进教育图表生成吗?如果幻觉破坏了整体效果就不能

Evanfiya Logacheva, Arto Hellas, Tsvetomila Mihaylova, Juha Sorva, Ava Heinonen, Juho Leinonen

机构 * Aalto University(阿尔托大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过基于RST的上下文示例方法改进教育图表生成,发现高复杂度上下文增加幻觉风险,LLMs难以检测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20969 2026-08-24 cs.CV 新提交 50%

Kinematic Knowledge Maps for Pattern Alignment: Structured Latent Representational Learning in Multimodal Gait Analysis

用于模式对齐的运动学知识图谱:多模态步态分析中的结构化潜在表示学习

Chen Dong, He Zonglin, Cheung Kenneth M.C

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本研究提出ScoliDetect框架,通过运动学知识图谱(KKM)实现多模态步态分析,其介导的融合结合三模态对比预训练提升了脊柱侧凸筛查的泛化性与可解释性,外部ROC-AUC达0.972。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20682 2026-08-24 cs.CV 新提交 50%

Aristotelian Manifolds: Leveraging Platonic Perceptual Features for Backpropagation Free Rapid Concept Learning

亚里士多德流形:利用柏拉图式感知特征实现无反向传播的快速概念学习

Michael Karnes, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出基于柏拉图式表征假说的亚里士多德流形框架,将基础模型作为通用感知滤波器,研究不同领域的几何响应特征,建立层选择与特征压缩分类体系,实现无反向传播的基础模型潜在空间利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-24 cs.CV cs.IR 版本更新 50%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Chunyi Peng, Zhipeng Xu, Yukun Yan, Zhenghao Liu, Shi Yu, Sen Mei, Yubo Sun, Yongheng Zhang, Jie Zhou, Yu Gu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏