arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7583 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7583 篇

2311.08412 2023-11-16 cs.RO cs.AI 88%

Exploring Large Language Models as a Source of Common-Sense Knowledge for Robots

Felix Ocker, Jörg Deigmöller, Julian Eggert

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted at ISWC 2023 Posters and Demos: 22nd International Semantic Web Conference, November 6-10, 2023, Athens, Greece

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07605 2023-11-15 cs.SE cs.AI cs.PL 88%

Conceptual Model Interpreter for Large Language Models

Felix Härer

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments ER Forum 2023, 42nd International Conference on Conceptual Modeling (ER 2023), November 6-9, 2023, Lisbon, PT

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01732 2023-11-14 cs.CL 88%

Proto-lm: A Prototypical Network-Based Framework for Built-in Interpretability in Large Language Models

Sean Xie, Soroush Vosoughi, Saeed Hassanpour

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to the Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11877 2023-11-14 cs.CL 88%

The Curious Case of Hallucinatory (Un)answerability: Finding Truths in the Hidden States of Over-Confident Large Language Models

Aviv Slobodkin, Omer Goldman, Avi Caciularu, Ido Dagan, Shauli Ravfogel

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04988 2023-10-24 cs.AI 88%

The Troubling Emergence of Hallucination in Large Language Models -- An Extensive Definition, Quantification, and Prescriptive Remediations

Vipula Rawte, Swagata Chakraborty, Agnibh Pathak, Anubhav Sarkar, S. M Towhidul Islam Tonmoy, Aman Chadha, Amit P. Sheth, Amitava Das

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10760 2023-10-18 cs.CL q-fin.PM q-fin.ST stat.AP 88%

Towards reducing hallucination in extracting information from financial reports using Large Language Models

Bhaskarjit Sarmah, Tianjie Zhu, Dhagash Mehta, Stefano Pasquali

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 4 pages + references. Accepted for publication in Workshop on Generative AI at the 3rd International Conference on AI-ML Systems 2023, Bengaluru, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08027 2023-10-13 cs.CL cs.CV 88%

Exploring Large Language Models for Multi-Modal Out-of-Distribution Detection

Yi Dai, Hao Lang, Kaisheng Zeng, Fei Huang, Yongbin Li

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP2023 Findings Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04782 2023-10-10 cs.CL 88%

Improving the Reliability of Large Language Models by Leveraging Uncertainty-Aware In-Context Learning

Yuchen Yang, Houqiang Li, Yanfeng Wang, Yu Wang

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07411 2023-08-16 cs.AI cs.MA 88%

Exploring the Intersection of Large Language Models and Agent-Based Modeling via Prompt Engineering

Edward Junprung

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16004 2023-06-29 cs.IR cs.AI 88%

Query Understanding in the Age of Large Language Models

Avishek Anand, Venktesh V, Abhijit Anand, Vinay Setty

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

Comments Accepted to GENIR(SIGIR'23)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14507 2023-05-25 cs.CL 88%

Deduction under Perturbed Evidence: Probing Student Simulation Capabilities of Large Language Models

Shashank Sonkar, Richard G. Baraniuk

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07183 2022-12-02 cs.CV cs.LG 88%

Visual Classification via Description from Large Language Models

Sachit Menon, Carl Vondrick

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02941 2022-11-30 cs.LG 88%

Small Language Models for Tabular Data

Benjamin L. Badger

专题命中 知识编辑与模型理解 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12914 2024-07-19 cs.CV 88%

An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation

Zhiyu Tan, Mengping Yang, Luozheng Qin, Hao Yang, Ye Qian, Qiang Zhou, Cheng Zhang, Hao Li

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(comments)

Comments To appear in ECCV-2024, Project page: https://llm-conditioned-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14588 2026-08-18 cs.AI cs.CL cs.MA 新提交 88%

The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines

幻觉滚雪球:将多智能体大语言模型流水线中的错误传播建模为状态转移

Prabhjot Singh, Bhushan Pawar

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究发现多智能体LLM流水线中存在幻觉滚雪球效应,即幻觉会随状态转移而逃逸,且边界门控验证比末端检查更能有效降低幻觉存活率,还提出了最优验证资源分配策略。

Comments 10 pages, 3 figures; accepted at the FAGEN Workshop (Failure Modes in Agentic AI), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05164 2026-08-07 cs.CL cs.LG 新提交 88%

Cross-Architecture Steering Transfer in Language Models: A Systematic Empirical Study

语言模型中的跨架构引导迁移:一项系统实证研究

Ayushi Agarwal

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过系统实证发现,在1.7B参数规模以上,独立训练的大语言模型间存在可利用的跨架构引导迁移,验证了柏拉图式表征假说的功能层面补充,强调了机制可解释性中的规模阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24929 2026-08-05 cs.AI cs.CL cs.IT math.IT 版本更新 88%

LogitScope: A Framework for Analyzing LLM Uncertainty Through Information Metrics

LogitScope:通过信息度量分析大语言模型不确定性框架

Farhan Ahmed, Yuya Jeremy Ong, Chad DeLuca

机构 * IBM Research(IBM研究院) Plastic Labs

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LogitScope通过计算概率分布中的信息度量,分析大语言模型生成过程中的不确定性,揭示模型置信度模式,识别潜在幻觉并暴露高不确定决策点,无需标注数据或语义解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25257 2026-07-29 stat.AP cs.AI cs.LG 新提交 88%

Laplace-PSN-IRT: Uncertainty Quantification for Neural Item Response Theory Models of LLM Benchmarks

拉普拉斯-PSN-IRT:大语言模型基准神经项目反应理论模型的不确定性量化

Juan Francisco, Mandujano Reyes

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型基准神经项目反应理论模型,提出拉普拉斯-PSN-IRT方法,通过近似贝叶斯后验推断增强模型,能恢复校准不确定性,可进行可信区间等分析,实验表明该方法在模型比较、信息稳定性及能力排名恢复等方面表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18037 2026-07-28 cs.AI cs.CL cs.MA 版本更新 88%

ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证

Ander Alvarez, Santhiya Rajan, Samuel Mugel, Román Orús

机构 * Multiverse Computing Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) Centre for Social Innovation(社会创新中心) Donostia International Physics Center(多诺斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21262 2026-07-24 cs.AI cs.CL 版本更新 88%

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents

ARCO: 基于自适应规则与协同进化的多步LLM智能体

Zihang Tian, Jingsen Zhang, Rui Li, Xiaohe Bo, Yuanzi Li, Xu Chen

机构 * Renmin University of China(中国人民大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出ARCO框架,通过同尺度模型的双头结构(生成头与评分头)实现步骤级规则生成与奖励分配,结合轨迹分解约束和策略协同进化,在多个多跳QA任务上取得最优EM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13048 2026-07-16 cs.LG cs.AI stat.ML 新提交 88%

Uncertainty-Aware Sequential Decision Rules for Event-Triggered LLM Invocation in Streaming Systems

流系统中事件触发大语言模型调用的不确定性感知序贯决策规则

Zhaohui Wang

机构 * Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究流系统中何时调用大语言模型的问题,将其转化为基于风险的序贯停止问题,证明了相关理论结果。通过在涡轮风扇退化数据上的实验,验证假设、比较基线,得出次线性遗憾、高诊断质量等结论,表明异常分数驱动的风险函数更优。

Comments 18 pages, 5 figures. Accepted to the ECML PKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12631 2026-07-15 cs.CL cs.AI 新提交 88%

Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?

诱导情绪会影响大语言模型在序列决策中的行为吗?

Minh Khoi Ho, Zihao Zhu, Runchuan Zhu, Levina Li, Zhiwen Fan, Zhangyang Wang, Junyuan Hong

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Texas A&M University(德州农工大学) National University of Singapore(新加坡国立大学) UCLA(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mass General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨诱导情绪对大语言模型在序列决策中行为的影响,采用爱荷华赌博任务结合情绪诱导程序,发现诱导情绪平均不显著影响其决策动态,但愤怒有条件地影响决策,揭示了与人类行为的差异,为相关研究提供工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29031 2026-07-10 cs.CL cs.AI 版本更新 88%

How to Leverage Synthetic Speech for LLM-Based ASR Systems?

如何利用合成语音提升基于LLM的ASR系统?

Yanis Labrak, Dairazalia Sanchez-Cortes, Sergio Burdisso, Séverin Baroudi, Shashi Kumar, Esaú Villatoro-Tello, Srikanth Madikeri, Manjunath K E, Oldřich Plchot, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke

机构 * Idiap Research Institute(Idiap研究 institute) Universite de Toulon(里昂大学) EPFL(瑞士联邦理工学院) University of Zurich(苏黎世大学) Uniphore(Uniphore公司) Brno University of Technology(布拉格技术大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对隐私敏感领域合成语音与真实数据分布差异问题,通过分析SLAM-ASR架构定位差异来源,发现早期到中间层对时间与韵律扰动敏感,并证明卷积房间脉冲响应可缩小差距,结合层选择模块与RIR增强仅用25%真实语音即达到全真实数据基线。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11950 2026-07-09 cs.SE cs.AI cs.CL cs.CR 版本更新 88%

AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection

AnyPoC:用于可扩展LLM基于Bug检测的通用证明-概念测试生成

Zijie Zhao, Chenyuan Yang, Weidong Wang, Yihan Yang, Ziqi Zhang, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 AnyPoC通过多代理框架生成可执行的证明-概念测试,以验证候选Bug报告,提升自动化Bug检测的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02686 2026-07-07 cs.AI cs.LG 新提交 88%

ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability

黑暗中的询问:部分可观测性下的不确定性门控语言模型辅助

Juarez Monteiro, Nathan Gavenski, Guilherme Lima, Francisco Galuppo, Odinaldo Rodrigues, Adriano Veloso

机构 * Kunumi Institute(库努米研究所) King’s College London(伦敦国王学院)

专题命中 知识编辑与模型理解 :LLM(title);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 研究部分可观测性下强化学习智能体,指出普通不确定性门控方法失败原因是上下文问题。提出ASK+,为语言模型提供轨迹感知上下文和结构化推理,证明预测熵信号可行,在多环境中取得更好效果,强调提示设计重要性。

Comments Accepted at the IJCAI-ECAI Joint Workshop on Planning for Complex Real-World Applications and Bridging the Gap Between AI Planning and (Reinforcement) Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26807 2026-06-26 cs.AI cs.CL 新提交 88%

KARLA: Knowledge-base Augmented Retrieval for Language Models

KARLA:基于知识库增强的语言模型检索

Francois Crespin, Fabian M. Suchanek, Nils Holzenberger

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);language model(title);分类 cs.CL、cs.AI

AI总结 提出一种新方法,使LLM在生成过程中自动从知识库提取事实知识,支持知识更新、可追溯性和小模型的高事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15173 2026-05-26 cs.CL cs.AI 88%

Uncovering Autoregressive LLM Knowledge of Thematic Fit in Event Representation

揭示自回归LLM在事件表示中主题适配性的知识

Safeyah Khaled Alshemali, Daniel Bauer, Yuval Marton

机构 * Imperial College London(伦敦帝国学院) Columbia University(哥伦比亚大学) University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过多种提示设计、输入上下文操作、推理和输出形式,研究自回归大语言模型是否具有一致且可表达的事件参数主题适配性知识,并在基准测试上取得新最优结果。

Comments Significant update with massive changes: all experiments rerun with current LLMs; includes new probability estimate analysis and expanded results in Sections 4 and 5. The paper has been accepted to CoNLL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18796 2026-05-20 cs.LG cs.CL 88%

UCCI: Calibrated Uncertainty for Cost-Optimal LLM Cascade Routing

UCCI:用于成本最优LLM级联路由的校准不确定性

Varun Kotte

机构 * Independent Researcher(独立研究者)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出UCCI,一种以校准为核心的路由方法,通过异质回归将token层面的边际不确定性映射到查询级误差概率,并通过约束成本最小化选择升级阈值。在三个显式假设下,阈值策略在校准分数上是成本最优的,异质校准在期望校准误差(ECE)上实现O(n^{-1/3})的样本复杂度。在75000个生产命名实体识别工作负载上,UCCI将推理成本降低了31%(95%CI:[27%, 35%]),同时将ECE从0.12降低到0.03。

Comments 9 pages, 2 figures, 4 tables. Code: https://github.com/varunkotte6/ucci

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16699 2026-05-19 cs.CL cs.AI 88%

Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents

校准后再行动:在大语言模型代理中考虑成本的探索

Wenxuan Ding, Nicholas Tomlin, Greg Durrett

机构 * New York University(纽约大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出Calibrate-Then-Act框架,使LLM代理在不确定环境下显式平衡成本与不确定性,从而更优地决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08898 2026-05-12 cs.CL cs.AI 88%

LLM-Agnostic Semantic Representation Attack

不依赖特定大语言模型的语义表示攻击

Jiawei Lian, Jianhong Pan, Lefan Wang, Yi Wang, Tairan Huang, Shaohui Mei, Lap-Pui Chau

机构 * JC STEM Lab of Machine Learning and Computer Vision(机器学习与计算机视觉的JC STEM实验室) Hong Kong Jockey Club Charities Trust(香港赛马会慈善信托基金) Global STEM Professorship Scheme of the Hong Kong Special Administrative Region (SAR)(香港特别行政区(SAR)的全球STEM教授计划) National Natural Science Foundation of China(中国国家自然科学基金委员会) Northwestern Polytechnical University(西北工业大学) The Hong Kong Polytechnic University(香港理工大学) School of Electronics and Information(电子与信息学院) Department of Electrical and Electronic Engineering(电气与电子工程系) Hong Kong Institute of AI for Science(香港人工智能科学研究院) City University of Hong Kong(香港城市大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义表示攻击(SRA),通过重新定义对抗目标从精确文本到恶意语义,解决传统方法的收敛性、提示自然性和跨模型泛化问题,实现99.71%的攻击成功率。

Comments arXiv admin note: substantial text overlap with arXiv:2509.19360

详情

展开后加载摘要…

URL PDF HTML 收藏