arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-28 至 2026-07-28 共收录 538 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 39 篇

2601.03423 2026-07-28 cs.CL cs.AI 79%

Training-Free Adaptation of New-Generation LLMs using Legacy Clinical Models

无需训练适应新一代语言模型使用遗留临床模型

Sasha Ronaghi, Chloe Stanwyck, Asad Aali, Amir Ronaghi, Miguel Fuentes, Tina Hernandez-Boussard, Emily Alsentzer

机构 * Stanford University(斯坦福大学) MemorialCare(纪念医疗中心)

专题命中 领域大模型 :language model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAPT方法,通过模型融合实现无需训练的临床模型与通用领域模型适应,提升临床任务性能,适用于计算资源有限的医疗机构。

Journal ref Proceedings of the 7th Conference on Health, Inference, and Learning, PMLR 333:354-388, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23718 2026-07-28 cs.IR 新提交 78%

Melo: A Production LLM-Powered Music Recommendation Agent

Melo:一个由大语言模型驱动的音乐推荐代理

Shijia Wang, Da Guo, Qiang Xiao, Fanghui Bi, Weisheng Li, Dongjing Wang, Chuanjiang Luo

专题命中 领域大模型 :LLM(title,abstract)

AI总结 研究基于网易云音乐部署的大语言模型驱动音乐推荐代理Melo,针对实体幻觉和长尾退化故障模式,采用推理时实体基础和反思性重试机制,经测试在播放列表留存和参与度指标上有提升,强调运行时机制对推荐进展的重要性。

Journal ref Proceedings of the 20th ACM Conference on Recommender Systems (RecSys '26), September 27-October 02, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02458 2026-07-28 cs.CY cs.AI cs.ET 版本更新 77%

Statistical realism is not evidence that LLMs can estimate treatment effects in social science experiments

当模拟看起来正确但因果效应出错:大型语言模型作为行为模拟器

Zonghan Li, Feng Ji

机构 * University of Toronto(多伦多大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究评估了大型语言模型在气候心理学干预中的行为模拟能力,发现描述性拟合不等于因果准确性,不同干预逻辑和结果类型导致误差差异,提示依赖描述性拟合可能误导干预效果结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12650 2026-07-28 cs.CV cs.AI 版本更新 77%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23313 2026-07-28 econ.GN q-fin.EC 新提交 75%

Agentic AI Orchestration of Heterogeneous Economic Models for Rapid, Multi-scenario Analysis of Energy Crises

用于能源危机快速多场景分析的异构经济模型的智能人工智能编排

Dana Golden, Brett Indelicato, Lav R. Varshney, Carlos D. Messina, Suzanne Thornsbury

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对能源危机下政策制定者需快速决策但经济模型整合困难的问题,利用大语言模型开发框架,协调多个异构经济模型,通过构建场景、转化输入、执行模型和合成输出,快速评估霍尔木兹海峡关闭等情况,避免单一模型假设主导结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22758 2026-07-28 cs.MA cs.AI 新提交 74%

Spectral Dynamics of Semantic Drift in Clinical Multi-Agent Language Model Networks

临床多智能体语言模型网络中语义漂移的谱动力学

Amritesh Banerjee

专题命中 领域大模型 :language model(title);分类 cs.AI

AI总结 研究临床多智能体语言模型网络中语义漂移的谱动力学,通过映射多智能体通信不确定性轨迹到嵌入空间,揭示结构瓶颈危害。提出动态谱监测技术,经图拉普拉斯算子特征分解确保全局状态扩散,保障自主医疗诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24371 2026-07-28 cs.CL cs.AI 新提交 73%

Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs

医疗保健互操作性的闭环验证修复:临床大语言模型中模式合规性的多模型研究

Jianru Shen

机构 * University of Montana(蒙大拿大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究医疗大语言模型集成到电子健康记录系统面临的模式不合规问题,通过在多场景下部署三个开源模型并评估,发现模式不合规具有一致性,验证 - 修复框架可有效提高合规率,为医疗互操作性提供保障。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22683 2026-07-28 cs.AI cs.CL cs.PL 新提交 73%

Imprompt: A Language Framework for Prompt Programming

Imprompt:一种用于提示编程的语言框架

Chentian Wu, Shengyuan Yang, Adithya Murali

专题命中 领域大模型 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有提示编程框架的问题,提出Imprompt语言框架。通过基础研究、结构化提示阐释、定义编译器、探索类型化概念等方法,实现编译器和类型检查器并评估,为提示编程领域贡献编程语言基础。

Comments 28 pages, 24 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24000 2026-07-28 cs.SE 新提交 71%

Industrial Practice of LLM-Based Test Case Carving and Assertion Generation (Experience Paper)

基于大语言模型的测试用例提取与断言生成的工业实践(经验论文)

Haozhen You, Zhen Dong, Jingjing Wang, Qiang Li, Xin Peng

专题命中 领域大模型 :LLM(title)

AI总结 针对微服务系统回归测试因文档问题面临的挑战,提出NL2Test工具,通过自然语言描述和流量捕获生成可执行API回归测试,经大语言模型和确定性算法完成测试用例提取与断言生成等任务,在工业场景中效果良好,减少人工并提升自动化程度。

Comments 23 pages, 6 figures, Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23975 2026-07-28 cs.AI q-bio.QM 新提交 70%

Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks

柏拉图生物:通过时间再发现和结构基准进行验证优先的生物新奇性筛选

Stefan G. Creadore

机构 * Praxa Labs(普拉克斯实验室)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究开发柏拉图生物,扩展开放架构并结合多种功能,修复评估缺陷。通过Python套件等验证其有效性,评估两个用例,如历史再发现任务及蛋白质结构比较,提供可重复软件契约和筛选基准,为生物研究提供支持。

Comments 16 pages, 6 figures, 3 tables. Companion code and data: https://github.com/Eldergenix/Plato-Scientific-Research-Autonomous-Agent. This fork-specific validation study cites, but does not duplicate, arXiv:2510.26887

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22677 2026-07-28 cs.DL cs.AI 新提交 70%

SetGo: Metadata Readiness for Scientific AI Datasets

SetGo:科学人工智能数据集的元数据就绪性

Sean R. Wilkinson, Polina Shpilker, Wesley Brewer

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对科学AI数据集元数据就绪性评估工具缺失的问题,提出开源工具SetGo,能从六个维度评估修复元数据,揭示通用工具未发现的缺陷,提升公平性分数,还可集成大语言模型支持自动化工作流程。

Comments 6 pages; accepted at SSDBM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21783 2026-07-28 cs.RO cs.LG 70%

Therapist-Robot-Patient Physical Interaction is Worth a Thousand Words: Enabling Intuitive Therapist Guidance via Remote Haptic Control

治疗师-机器人-患者物理互动值得千言万语:通过远程触觉控制实现直观的治疗师指导

Beatrice Luciani, Alex van den Berg, Matti Lang, Alexandre L. Ratschat, Laura Marchal-Crespo

机构 * Department of Cognitive Robotics, Delft University of Technology(认知机器人系,代尔夫特理工大学) Department of Rehabilitation Medicine, Erasmus Medical Center(康复医学系,埃拉斯姆斯医疗中心)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种通过远程触觉控制实现直观治疗师指导的系统,通过实验表明触觉演示能有效提升运动训练效率并减少治疗师负担。

Comments 14 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22606 2026-07-28 cs.CY 新提交 67%

Auditing Institutional Heterogeneity for Generative AI in Patient Education: A Large-Scale Study of 102 US Transplant Handbooks

审核患者教育中生成式人工智能的机构异质性:对102本美国移植手册的大规模研究

Yubo Li, Rema Padman, Ramayya Krishnan

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究针对美国23个移植中心的102本手册及相关患者问题,用结构化输出大语言模型评判器审核。发现机构编辑风格超越器官类型界限,信息差距在特定主题突出,分歧主题聚类,且可由问题框架预测分歧,探讨了对移植护理中部署生成式人工智能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23368 2026-07-28 cs.CV cs.AI cs.CL 新提交 62%

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

用基于树图解析支持的加权班扎夫交互解释生物医学CLIP

Jakub Rymarski, Adam Rempała, Bartłomiej Sobieski, Przemysław Biecek

机构 * University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。

Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22592 2026-07-28 cs.AI cs.CL cs.IR 新提交 62%

Structure Over Scale: Schema-Constrained Causal Graphs for RAG

结构跨越尺度:用于检索增强生成的模式约束因果图

Marc Saouda, Rajprakash Bale, Eren Aldis, Cloves Almeida

机构 * Boston Consulting Group(波士顿咨询集团)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对GraphRAG问题,提出HCG-RAG,用模式约束因果图取代开放式提取,构建紧凑两层图。该方法成本低,答案质量优,在医学等基准测试中表现出色,对比实验显示因果图作为检索过滤器有优势,表明图内容比节点数量更重要。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22750 2026-07-28 cs.AI 新提交 57%

Commitment To Cooperation With Self-Negotiated Contracts

通过自我协商合同实现合作承诺

Tim Wyse, Kaitlin Bustos, Yulia Volkova, Max Kleiman-Weiner

机构 * University of Washington(华盛顿大学)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 研究人工智能代理在多智能体世界中的合作问题,借鉴法律制度和契约,通过在时空博弈\CT中研究基于大型语言模型的代理使用不同合同表示,发现自我协商合同可改善合作结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04705 2026-07-28 cs.CV cs.AI 版本更新 57%

Enhancing MedSAM with a Lightweight Box Predictor for Medical Image Segmentation

通过轻量级框预测器增强 MedSAM 用于医学图像分割

Amirhossein Movahedisefat, Amirreza Fateh, Mohammad Reza Mohammadi

机构 * School of Computer Engineering, Iran University of Science and Technology (IUST)(伊朗科学技术大学计算机工程学院)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 提出一种集成轻量级框预测器的 MedSAM 增强框架,通过单次点击估计边界框以提升点提示的空间引导能力,在仅增加 1.6M 参数下显著提高多模态医学图像分割的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02366 2026-07-28 cs.IR cs.AI 版本更新 57%

TextBridgeGNN: Pre-training Graph Neural Network for Cross-Domain Recommendation via Text-Guided Transfer

TextBridgeGNN: 通过文本引导的迁移预训练图神经网络进行跨域推荐

Yiwen Chen, Yiqing Wu, Huishi Luo, Fuzhen Zhuang, Deqing Wang, Zhao Zhang

机构 * Beihang University(北京航空航天大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 TextBridgeGNN通过多级图传播利用文本建立领域间关系,解决ID嵌入非转移性和异构图结构不兼容问题,提升跨域推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16170 2026-07-28 cs.IR cs.AI 版本更新 57%

EGRA:Toward Enhanced Behavior Graphs and Representation Alignment for Multimodal Recommendation

EGRA:迈向用于多模态推荐的增强行为图和表示对齐

Xiaoxiong Zhang, Xin Zhou, Zhiwei Zeng, Yongjie Wang, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 领域大模型 :prompting(abstract);分类 cs.AI

AI总结 针对多模态推荐现有方法不足,EGRA通过纳入预训练模型生成表示构建的项-项图减轻稀疏性,引入双层动态对齐加权机制提升模态-行为表示对齐,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24255 2026-07-28 cs.IR 新提交 50%

OxygenREC-v2: Internalizing Discrimination into Generative Recommendation

OxygenREC-v2:将歧视内化到生成式推荐中

Guo Tang, Hanye Wu, Changjiang Han, Qingyang Li, Ming Zhang, Xiangyu Qian, Yanchen Qiao, Huanjie Wang, Zhi Ma, Zhen Li, Yaqiang Zang, Pinghua Gong

专题命中 领域大模型 :post-training(abstract)

AI总结 研究针对生成式推荐中纳入行为信号的挑战,提出OxygenREC-v2,通过用记录行为条件生成及监督训练,在预训练和训练后分别采用不同方式,保持统一主干,部署在电商平台,相比OxygenREC-v1提升了用户点击率转化率和商品交易总额。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23993 2026-07-28 cs.CY cs.HC 新提交 50%

On Capturing the Narrative: Social Media Manipulation Wargaming for Cyberliteracy

关于捕捉叙事:用于网络素养的社交媒体操纵模拟演练

Alexandra Vassar, Rahat Masood, Hammond Pearce

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究针对网络错误信息及数字素养教育问题,通过举办“捕捉叙事”多校竞赛,让学生团队构建大语言模型驱动的机器人影响模拟选举,分析竞赛情况及学生反馈,为教育工作者提供建议并提出改进方向。

Comments 7 pages, 1 figure. Paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22607 2026-07-28 cs.CY 新提交 50%

The Clinical Trial Pipeline Reveals the Next Wave of Artificial Intelligence in Healthcare: A Multidimensional Analysis of 8,532 Registered Studies

临床试验管道揭示医疗保健领域人工智能的下一波浪潮:对8532项注册研究的多维分析

Lior Rokach

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究通过对8532项注册研究多维分析,揭示医学人工智能临床试验格局。用关键词搜索和分类器识别试验,从多维度分类,发现虽从回顾转向前瞻,但在规模、专业覆盖等方面有差距,未来进展取决于弥合这些差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 29 篇

2603.01227 2026-07-28 cs.AI 版本更新 92%

The Lattice Representation Hypothesis of Large Language Models

大语言模型的晶格表示假说

Bo Xiong

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出大语言模型的晶格表示假说,通过嵌入几何将概念层次和逻辑运算统一到线性表示中,实验表明LLM嵌入编码概念晶格及其逻辑结构。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05298 2026-07-28 cs.CL cs.MA 90%

Toward Reasonable Parrots: Why Large Language Models Should Argue with Us by Design

走向合理的鹦鹉:为何大型语言模型应通过设计与我们辩论

Elena Musi, Nadin Kokciyan, Khalid Al-Khatib, Davide Ceolin, Emmanuelle Dietz, Klara Gutekunst, Annette Hautli-Janisz, Cristian Manuel Santibañez Yañez, Jodi Schneider, Jonas Scholz, Cor Steging, Jacky Visser, Henning Wachsmuth

机构 * University of Liverpool(利兹大学) University of Edinburgh(爱丁堡大学) University of Groningen(格罗宁根大学) Centrum Wiskunde & Informatica(数学与信息学研究中心) Airbus Central R&T(空客中央研发与技术部) University of Kassel(卡塞尔大学) University of Passau(帕绍大学) Universidad de Católica de la Santísima de Concepción(圣地亚哥圣母大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Dundee(邓迪大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出通过设计使大型语言模型具备辩论能力,以提升人类批判性思维。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24072 2026-07-28 cs.CL 新提交 90%

LLM-Based vs. Lexicon-Based Sentiment Signals for Tail-Risk Detection in Meme Stocks

基于大语言模型与基于词典的情绪信号在表情包股票尾部风险检测中的比较

Paul Kilian, Markus Kleffmann

机构 * IU International University of Applied Sciences(IU国际应用科学大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 比较基于词典和基于大语言模型的情绪分析在表情包股票尾部风险检测中的应用,构建情绪指标并评估与市场回报关系,结果显示基于LLM的指标表征更丰富,但与市场走势关系因资产而异。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24586 2026-07-28 cs.CL cs.AI 新提交 88%

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

D分数:一种用于大语言模型中幻觉检测的谱隐藏状态信号

Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

机构 * Department of Computer Science and Engineering, University of Bologna(博洛尼亚大学计算机科学与工程系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型幻觉检测,提出基于隐藏激活几何结构的D分数,通过单次前向传播计算,用作幻觉分数。经实验验证,该分数是强大的隐藏状态信号,检测时无需外部验证器等,为幻觉检测提供新方法。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23067 2026-07-28 cs.CL cs.AI 新提交 88%

Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models

大语言模型中用于对比解码的注意力引导层选择

Yusuke Sakai, Natthawut Kertkeidkachorn, Kiyoaki Shirai

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中对比解码的层选择问题,提出Attention-JSD等三种基于注意力引导的策略,实验表明这些策略在TruthfulQA上优于原始DoLa,在多答案指标上有显著提升,凸显注意力分布在解决事实性知识上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18037 2026-07-28 cs.AI cs.CL cs.MA 版本更新 88%

ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证

Ander Alvarez, Santhiya Rajan, Samuel Mugel, Román Orús

机构 * Multiverse Computing Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) Centre for Social Innovation(社会创新中心) Donostia International Physics Center(多诺斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22661 2026-07-28 cs.AI 新提交 87%

TRE: Training-Free Hallucination Detection for Diffusion Language Models

TRE:用于扩散语言模型的无训练幻觉检测

Pengcheng Weng, Yanyu Qian, Yue Tan, Yixin Liu

机构 * University of Bern(伯尔尼大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 针对扩散语言模型的幻觉问题,现有方法有局限。本文提出无训练的TRE指标,通过在模型解码过程中沿时空维度提取熵信号来估计幻觉风险,经实验验证其性能有竞争力,具有泛化性、效率和鲁棒性等优点。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09001 2026-07-28 cs.CL 版本更新 87%

Entropy Sentinel: Probing Entropy Traces for LLM Monitoring

熵哨兵:基于STEM解码熵迹的连续LLM准确性监控

Pedro Memoli Buffa, Luciano Del Corro

机构 * Departamento de Matematica, FCEyN Universidad de Buenos Aires(数学系,布宜诺斯艾利斯大学) ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(ELIAS实验室,圣安德烈斯大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出利用输出熵迹作为推理时信号,通过轻量分类器预测实例正确性并聚合为领域级准确性估计,在STEM推理基准上验证了其用于监控和数据采集的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏