arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-23 至 2026-02-23 共收录 131 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 25 篇

2511.09044 2026-02-23 cs.AI 77%

Advancing Autonomous Emergency Response Systems: A Generative AI Perspective

推进自主应急响应系统:生成式AI的视角

Yousef Emami, Radha Reddy, Azadeh Pourkabirian, Miguel Gutierrez Gaitan

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从生成式AI视角探讨自动驾驶在应急响应中的应用,分析了扩散模型增强的强化学习和大型语言模型辅助的上下文学习,以提升系统鲁棒性和适应性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17676 2026-02-23 cs.AI cs.CL cs.LG 75%

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

知识陷阱:由模型规格不准确驱动的理性偏差

Xingcheng Xu, Jingjing Qu, Qiaosheng Zhang, Chaochao Lu, Yanqing Yang, Na Zou, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出主观模型工程,通过设计代理的内部信念结构来实现稳健对齐,揭示安全由认知先验决定而非奖励大小连续函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04581 2026-02-23 cs.CL cs.AI cs.LG 75%

Share Your Attention: Transformer Weight Sharing via Matrix-based Dictionary Learning

分享你的注意力:通过矩阵基字典学习实现变换器权重共享

Magauiya Zhussip, Dmitriy Shopkhoev, Ammar Ali, Stamatios Lefkimmiatis

机构 * MTS AI(MTS人工智能公司) ITMO University(ITMO大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MASA通过矩阵基字典学习实现变换器层间权重共享,减少66.7%的参数同时保持性能,适用于大规模语言模型和视觉变换器。

Comments This work has been accepted and presented at AAAI 2026 in Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07238 2026-02-23 cs.CL cs.AI cs.LG 75%

Beyond Mimicry to Contextual Guidance: Knowledge Distillation for Interactive AI

超越模仿到情境引导:面向交互AI的知识蒸馏

Tong Wang, K. Sudhir

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于情境引导的知识蒸馏方法,通过构建可重用的战略文本引导库,提升交互AI在客户服务中的服务质量与客户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16021 2026-02-23 cs.CY cs.AI cs.CL 74%

Imitating AI agents increase diversity in homogeneous information environments but can reduce it in heterogeneous ones

模仿AI代理在同质信息环境中增加多样性,但在异质环境中可能减少多样性

Emil Bakkensen Johansen, Oliver Baumann

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 研究发现,AI代理在同质信息环境中提升多样性,但可能在异质环境中降低多样性,且多样性主要源于风格差异而非事实丰富。

Comments 53 pages, 13 figures, 4 tables; v2: corrected typographical errors, streamlined language, updated abstract, added supplementary information; v3: restructured appendix, added temperature and embeddings sensitivity checks; v4: additional LLM models introduced, restructured manuscript, additional robustness checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18301 2026-02-23 cs.LG cs.CL 73%

On the Semantic and Syntactic Information Encoded in Proto-Tokens for One-Step Text Reconstruction

关于用于一步文本重建的原生标记所编码的语义和语法信息

Ivan Bondarenko, Egor Palkin, Fedor Tikunov

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了原生标记在一步文本重建中的语义和语法信息编码,通过实验分析了其稳定性及正则化方法,支持了非自回归序列到序列系统的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17695 2026-02-23 cs.LG cs.AI cs.IR 73%

EXACT: Explicit Attribute-Guided Decoding-Time Personalization

EXACT: 显式属性引导的解码时个性化

Xin Yu, Hanwen Xing, Lingzhou Xue

机构 * Department of Statistics, the Pennsylvania State University, PA, USA(统计系,宾夕法尼亚州立大学) University of Southern California, CA, USA(南加州大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 EXACT通过显式属性引导解码时个性化,利用预定义可解释属性提升生成质量,有效缓解上下文偏好变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03725 2026-02-23 cs.LG math.OC 70%

Sign-SGD via Parameter-Free Optimization

基于无参数优化的Sign-SGD

Daniil Medyakov, Sergey Stanko, Gleb Molodtsov, Philip Zmushko, Grigoriy Evseev, Egor Petrov, Aleksandr Beznosikov

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种无参数优化的Sign-SGD方法,通过消除手动学习率选择,提升了大语言模型预训练和微调的效率与性能。

Comments 60 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17886 2026-02-23 cond-mat.mtrl-sci physics.chem-ph 67%

El Agente Sólido: A New Age(nt) for Solid State Simulations

固态代理:固态模拟的新时代

Sai Govind Hari Kumar, Yunheng Zou, Andrew Wang, Jesús Valdés-Hernández, Tsz Wai Ko, Nathan Yue, Olivia Leng, Hanyong Xu, Chris Crebolder, Alán Aspuru-Guzik, Varinia Bernales

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 El Agente Sólido是一种基于多代理框架的自动化固态量子化学模拟工具,结合密度泛函理论与机器学习势能,提升材料发现的效率和可重复性。

Comments 42 pages, 31 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17869 2026-02-23 cs.CV 67%

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解

Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17693 2026-02-23 cs.LG cs.AI cs.CL 67%

A Case Study of Selected PTQ Baselines for Reasoning LLMs on Ascend NPU

在Ascend NPU上对推理LLM的选定PTQ基线进行案例研究

Yuchen Luo, Fangyue Zhu, Ruining Zhou, Mingzhe Huang, Jian Zhu, Fanyu Fan, Wei Shao

机构 * School of Mathematics and Statistics, Wuhan University(武汉大学数学与统计学院) Huawei(华为公司)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在Ascend NPU上不同PTQ方法对推理LLM的影响,发现4位权重量化在大模型中可行,但激进方案存在稳定性问题,而8位量化更稳定,实际部署中动态量化开销限制了加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18104 2026-02-23 cs.SD cs.AI cs.LG eess.AS 62%

MeanVoiceFlow: One-step Nonparallel Voice Conversion with Mean Flows

MeanVoiceFlow: 一步非并行语音转换基于均值流

Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo

机构 * NTT, Inc.(日本NTT公司)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 MeanVoiceFlow是一种基于均值流的一步非并行语音转换模型,通过结构边缘重建损失和条件扩散输入训练,实现从头开始训练的高效语音转换。

Comments Accepted to ICASSP 2026. Project page: https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/meanvoiceflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15316 2026-02-23 cs.AR cs.AI 57%

J3DAI: A tiny DNN-Based Edge AI Accelerator for 3D-Stacked CMOS Image Sensor

J3DAI:一种基于小型DNN的边缘AI加速器,用于三层堆叠CMOS图像传感器

Benoit Tain, Raphael Millet, Romain Lemaire, Michal Szczepanski, Laurent Alacoque, Emmanuel Pluchart, Sylvain Choisnet, Rohit Prasad, Jerome Chossat, Pascal Pierunek, Pascal Vivet, Sebastien Thuries

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 J3DAI是一种基于小型DNN的边缘AI加速器,专为三层堆叠CMOS图像传感器设计,通过高效执行图像分类和分割任务,提升边缘AI的实时性和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17798 2026-02-23 cs.LG 57%

Grassmannian Mixture-of-Experts: Concentration-Controlled Routing on Subspace Manifolds

Grassmannian混合专家:子空间流形上的集中控制路由

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science Iowa State University(计算机科学系爱荷华州立大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 GrMoE通过Grassmannian流形上的浓度控制机制,实现子空间路由的稀疏性优化与负载平衡改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 6 篇

2506.23339 2026-02-23 cs.LG cs.AI physics.chem-ph q-bio.QM 86%

VALID-Mol: a Systematic Framework for Validated LLM-Assisted Molecular Design

VALID-Mol: 一种系统化的验证框架用于验证的LLM辅助分子设计

Malikussaid, Hilal Hudan Nuha, Isman Kurniawan

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VALID-Mol通过整合化学验证与LLM驱动的分子设计,显著提高了有效化学结构的生成率,同时确保合成可行性和目标结合亲和力的提升。

Comments 6 pages, 1 figure, 1 algorithm, 5 tables, to be published in ISPACS 2025, unabridged version exists as arXiv:2506.23339v1

Journal ref Proc. 2025 Int. Symp. on Intell. Signal Process. and Commun. Syst. (ISPACS), 2025, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 82%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01865 2026-02-23 cs.CL cs.AI 81%

Cross-Lingual Interleaving for Speech Language Models

跨语言交织用于语音语言模型

Adel Moumen, Guangzhi Sun, Philip C. Woodland

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨语言交织方法,通过混合多语言语音标记提升SLMs的跨语言理解和生成能力,并发布相关数据集和基准以促进多语言语音模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17826 2026-02-23 cs.AI cs.LG cs.SC 81%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17592 2026-02-23 astro-ph.IM cs.LG 77%

AstroMLab 4: Benchmark-Topping Performance in Astronomy Q&A with a 70B-Parameter Domain-Specialized Reasoning Model

AstroMLab 4: 在天文学问答中通过700亿参数领域专用模型实现基准顶级性能

Tijmen de Haan, Yuan-Sen Ting, Tirthankar Ghosal, Tuan Dung Nguyen, Alberto Accomazzi, Emily Herron, Vanessa Lama, Rui Pan, Azton Wells, Nesar Ramachandra

机构 * Institute of Particle Nuclear Studies (IPNS), High Energy Accelerator Research Organization (KEK), Tsukuba, Ibaraki 305-0801, Japan International Center for Quantum-field Measurement Systems for Studies of the Universe Particles (QUP-WPI), High Energy Accelerator Research Organization (KEK), Tsukuba, Ibaraki 305-0801, Japan Department of Astronomy, The Ohio State University, Columbus, OH, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH, USA National Center for Computational Sciences, Oak Ridge National Laboratory, Oak Ridge, TN, USA Department of Computer Information Science, University of Pennsylvania, Philadelphia, PA, USA Center for Astrophysics, Harvard \& Smithsonian, Cambridge, MA, USA Siebel School of Computing Data Science, University of Illinois at Urbana-Champaign, Urbana-Champaign, IL, USA Computational Science Division, Argonne National Laboratory, Lemont, IL, USA

专题命中 领域大模型 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.LG

AI总结 AstroSage-Llama-3.1-70B通过700亿参数领域专用模型在天文学问答中实现顶级性能,优于GPT-5.2等通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21087 2026-02-23 cs.HC cs.CL 57%

Designing and Evaluating Chain-of-Hints for Scientific Question Answering

设计与评估用于科学问答的提示链

Anubhav Jangra, Smaranda Muresan

机构 * Columbia University(哥伦比亚大学) Barnard College(巴纳德学院)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL

AI总结 本文设计并评估了基于提示链的科学问答系统,通过比较静态与动态提示策略,揭示了用户偏好及自动评估指标的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 11 篇

2602.18171 2026-02-23 cs.CL cs.AI 90%

Click it or Leave it: Detecting and Spoiling Clickbait with Informativeness Measures and Large Language Models

点击或留下它:利用信息度量和大语言模型检测和破坏点击诱饵

Wojciech Michaluk, Tymoteusz Urban, Mateusz Kubita, Soveatin Kuntur, Anna Wroblewska

机构 * Faculty of Mathematics and Information Science(数学与信息科学学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合Transformer嵌入和语言学特征的点击诱饵检测方法,通过XGBoost模型在信息度量基础上达到91%的F1分数,提升预测透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18262 2026-02-23 cs.CL cs.AI cs.LG 87%

Simplifying Outcomes of Language Model Component Analyses with ELIA

用ELIA简化语言模型组件分析的结果

Aaron Louis Eidt, Nils Feldhus

机构 * Technische Universität Berlin(柏林技术大学) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫茨研究所) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ELIA通过交互式界面和AI生成的自然语言解释,简化了语言模型组件分析,帮助非专家理解复杂模型。

Comments EACL 2026 System Demonstrations. GitHub: https://github.com/aaron0eidt/ELIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10587 2026-02-23 cs.CL cs.AI 84%

Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing

拟人化不确定性:语言模型中言语不确定性所缺失的内容

Dennis Ulmer, Alexandra Lorson, Ivan Titov, Christian Hardmeier

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言模型中言语不确定性缺失的问题,提出拟人化不确定性的概念,旨在通过模仿人类语言行为提升模型的可信度和人机协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17671 2026-02-23 cs.HC cs.AI cs.CL 82%

AI Hallucination from Students' Perspective: A Thematic Analysis

从学生视角看AI幻觉:一项主题分析

Abdulhadi Shoufan, Ahmad-Azmi-Abdelhamid Esmaeil

机构 * Department of Computer and Information Engineering, Center for Cyber Physical Systems, Khalifa University(计算机与信息工程系,跨物理系统中心,哈利法大学) Department of Psychology, University Malaysia Sabah(心理学系,马来西亚Sabah大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过主题分析探讨学生对AI幻觉的认知与应对策略,揭示学生在检测幻觉时的依赖策略及对幻觉成因的误解,强调需在AI素养教育中加强验证意识和准确思维模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21022 2026-02-23 cs.CL cs.AI cs.LG cs.RO 75%

ConformalNL2LTL: Translating Natural Language Instructions into Temporal Logic Formulas with Conformal Correctness Guarantees

ConformalNL2LTL:通过符合正确性保证将自然语言指令转换为时序逻辑公式

David Smith Sundarsingh, Jun Wang, Jyotirmoy V. Deshmukh, Yiannis Kantaros

机构 * Department of Electrical and Systems Engineering, Washington University in St Louis(华盛顿大学圣路易斯分校电子与系统工程系) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ConformalNL2LTL通过主辅模型协作和符合预测,将自然语言指令转换为时序逻辑公式并保证正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18346 2026-02-23 cs.CL cs.AI 73%

Vichara: Appellate Judgment Prediction and Explanation for the Indian Judicial System

Vichara:印度司法系统上诉判决预测与解释

Pavithra PM Nair, Preethu Rose Anish

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Vichara通过结构化方法预测和解释印度司法系统中的上诉判决,利用大型语言模型在两个数据集上取得优异表现,尤其在可解释性方面表现突出。

Journal ref AI and Law @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23951 2026-02-23 cs.CL 70%

Unveiling Decision-Making in LLMs for Text Classification : Extraction of influential and interpretable concepts with Sparse Autoencoders

揭示文本分类中大语言模型的决策过程:使用稀疏自编码器提取影响性且可解释的概念

Mathis Le Bail, Jérémie Dentan, Davide Buscaldi, Sonia Vanier

机构 * LIX (École Polytechnique, IP Paris, CNRS)(LIX(巴黎理工学院,IP巴黎,CNRS)) LIPN (Sorbonne Paris Nord)(LIPN(巴黎-索邦大学北校区))

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ClassifSAE模型,通过稀疏自编码器提升文本分类中特征的因果性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18145 2026-02-23 cs.CL 70%

Detecting Contextual Hallucinations in LLMs with Frequency-Aware Attention

基于频率感知注意力的LLM幻觉检测

Siya Qi, Yudong Chen, Runcong Zhao, Qinglin Zhu, Zhanghao Hu, Wei Liu, Yulan He, Zheng Yuan, Lin Gui

机构 * Department of Informatics, King's College London, UK(伦敦国王学院信息学院) Department of Statistics, University of Warwick, UK(沃里克大学统计系) School of Computer Science, The University of Sheffield, UK(谢菲尔德大学计算机科学学院) The Alan Turing Institute, UK(艾伦·图灵研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于频率感知注意力的轻量级幻觉检测方法,通过分析生成过程中注意力的高频成分,有效识别幻觉token,提升了LLM在上下文生成中的可靠性。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15605 2026-02-23 cs.CV 67%

GIFT: A Framework Towards Global Interpretable Faithful Textual Explanations of Vision Classifiers

GIFT: 一种面向视觉分类器全局可解释忠实文本解释的框架

Éloi Zablocki, Valentin Gerard, Amaia Cardiel, Eric Gaussier, Matthieu Cord, Eduardo Valle

机构 * Université Grenoble Alpes(法国格勒诺布尔大学) Sorbonne Université(巴黎索邦大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 GIFT提出一种框架,通过生成局部反事实并转化为文本解释,实现视觉分类器的全局可解释和忠实性。

Comments TMLR 2026 (featured certification)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17691 2026-02-23 cs.LG cs.CL 62%

Tethered Reasoning: Decoupling Entropy from Hallucination in Quantized LLMs via Manifold Steering

tethered Reasoning: 通过流形引导解耦熵与幻觉在量化大语言模型中

Craig Atkinson

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 HELIX 通过几何引导解耦量化大语言模型中的熵与幻觉,通过引导隐藏状态轨迹到预计算的诚实性流形,提高高温度下的输出质量与多样性。

Comments 16 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏