arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12393 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2508.09191 2026-06-18 cs.LG cs.AI 版本更新 90%

From Values to Tokens: An LLM-Driven Framework for Context-aware Time Series Forecasting via Symbolic Discretization

从数值到标记:一种基于符号离散化的LLM驱动上下文感知时间序列预测框架

Xiaoyu Tao, Shilong Zhang, Mingyue Cheng, Daoyu Wang, Tingyue Pan, Bokai Pan, Changqing Zhang, Shijin Wang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) College of Intelligence and Computing(智能科学与计算学院) iFLYTEK Research(iFLYTEK研究院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出TokenCast框架,利用大语言模型通过符号离散化将连续时间序列转化为标记,与上下文文本对齐,实现上下文感知的预测,实验证明有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10113 2026-06-10 cs.CL cs.AI 新提交 90%

Emotion Profiling in LLM-Based Literary Translation: Systematic Shifts Across MT and Post-Editing

基于LLM的文学翻译中的情感特征:机器翻译与译后编辑的系统性转变

Antonio Castaldo, Johanna Monti, Sheila Castilho

机构 * University of Pisa(比萨大学) Dublin City University(都柏林城市大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM翻译的情感特征及译后编辑如何使其接近人类翻译,通过对比《Oryx and Crake》的LLM翻译、译后编辑版本和人类翻译,发现MT系统引入特定情感指纹,削弱作者声音。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21347 2026-06-08 cs.AI cs.LG cs.SE 版本更新 90%

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

Insights Generator: LLM代理的系统级语料库追踪诊断

Akshay Manglik, Apaar Shanker, Kaustubh Deshpande, Jason Qin, Yash Maurya, Veronica Chatrath, Vijay S. Kalmath, Levi Lentz, Yuan Xue

机构 * Scale AI, Inc.

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Insights Generator,一种多智能体系统,通过在语料库中提出和测试假设来生成基于证据的洞察报告,从而系统性地诊断LLM代理的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28598 2026-05-28 cs.CL cs.AI 90%

Evaluating the Realism of LLM-powered Social Agents: A Case Study of Reactions to Spanish Online News

评估基于LLM的社会智能体的真实性:对西班牙在线新闻反应的案例研究

Alejandro Buitrago López, Alberto Ortega Pastor, Javier Pastor-Galindo, José A. Ruipérez-Valiente

机构 * Faculty of Computer Science, University of Murcia(计算机科学系,穆尔西亚大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过比较真实与LLM生成的西班牙新闻评论,研究LLM在仇恨言论、情感和语义对齐三个维度上的真实性,发现现成模型表现不佳,微调可部分改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27380 2026-05-28 cs.CL cs.AI 90%

BioELX: Cross-lingual Biomedical Entity Linking via Alias-based Retrieval and LLM Ranking

BioELX: 基于别名的检索与LLM排序的跨语言生物医学实体链接

Yi Wang, Corina Dima, Liangyu Zhong, Steffen Staab

机构 * University of Stuttgart, Germany(斯图加特大学) Technical University of Berlin, Germany(柏林技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BioELX两阶段框架,通过维基数据多语言别名增强SapBERT检索器,并利用预训练LLM排序器进行上下文感知消歧,无需标注数据即在多个基准上取得最佳性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24764 2026-05-26 cs.IR cs.AI cs.CL 90%

Spectral Retrieval: Multi-Scale Sinc Convolution over Token Embeddings for Localized Retrieval in LLM Multi-Agent Systems

光谱检索:基于多尺度sinc卷积的令牌嵌入局部化检索在LLM多智能体系统中的应用

Andrea Morandi

机构 * Cisco(思科)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出光谱检索方法,通过多尺度sinc卷积对令牌嵌入进行重排序,在无需重新训练的情况下显著提升局部化检索性能,并自然适配于LLM多智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14786 2026-05-15 cs.CR cs.AI cs.HC cs.LG 90%

Known By Their Actions: Fingerprinting LLM Browser Agents via UI Traces

以行为识别LLM浏览器代理:通过UI轨迹指纹化

William Lugoloobi, Samuelle Marro, Jabez Magomere, Joss Wright, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究通过被动JavaScript跟踪器分析LLM代理的行为和交互时间,发现可识别底层模型,F1达96%,并展示分类器在不同模型上的泛化能力及早期身份推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12487 2026-05-13 cs.CL cs.IR cs.LG 90%

Task-Adaptive Embedding Refinement via Test-time LLM Guidance

基于测试时LLM引导的任务自适应嵌入细化

Ariel Gera, Shir Ashury-Tahan, Gal Bloch, Ohad Eytan, Assaf Toledo

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出利用LLM反馈优化查询嵌入表示,提升零样本搜索和分类任务的性能,实验表明在多个基准上提升达25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15461 2026-04-20 cs.LG cs.CL cs.CR 90%

Evaluating LLM Simulators as Differentially Private Data Generators

评估LLM模拟器作为差分隐私数据生成器

Nassima M. Bouzid, Dehao Yuan, Nam H. Nguyen, Mayana Pereira

机构 * Capital One

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究评估LLM模拟器在生成复杂合成数据中的有效性,发现其在欺诈检测中表现良好但存在分布偏移问题,需解决系统性偏差以提升应用潜力。

Comments Submitted to ICLR 2026. 6 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12540 2026-04-15 cs.CL cs.AI 90%

When Does Data Augmentation Help? Evaluating LLM and Back-Translation Methods for Hausa and Fongbe NLP

当数据增强有助于什么?评估LLM和回译方法在豪萨语和丰贝语NLP中的应用

Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) Centre for Text Technology(文本技术中心) North-West University(北开普大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文评估了LLM生成和回译方法在豪萨语和丰贝语中的有效性,发现任务类型而非语言或LLM质量决定增强效果,不同任务对增强结果有不同影响。

Comments 13 pages, 6 tables; previously submitted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10799 2026-04-14 cs.CL cs.AI 90%

Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series

通过优化分词器推动波兰语言建模:Bielik v3 7B和11B系列

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

机构 * SpeakLeash ACK Cyfronet AGH(AGH科技大学计算机中心) Jagiellonian University(雅盖隆大学) Azurro Enelpol

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文探讨了Bielik v3系列模型中通过优化分词器提升波兰语言建模性能的方法,包括专有词汇表、嵌入初始化、多阶段预训练和后训练对齐技术。

Comments arXiv admin note: text overlap with arXiv:2601.11579

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01505 2024-07-02 cs.CL cs.AI 90%

Self-Cognition in Large Language Models: An Exploratory Study

Dongping Chen, Jiawen Shi, Yao Wan, Pan Zhou, Neil Zhenqiang Gong, Lichao Sun

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICML 2024 Large Language Models and Cognition Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04589 2024-01-05 cs.CL cs.AI 90%

TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models

Zhen Yang, Yingxue Zhang, Fandong Meng, Jie Zhou

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Multi-modal, Large Language Models, Tokenizer, Understanding and Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19266 2026-08-21 cs.CR cs.AI 新提交 90%

Incident-Data Robustness Analysis of the OWASP Top 10 for LLM Applications (2026): How a Community-Expert Ranking Holds Up Against a Large-Scale LLM Incident Corpus

2026年面向LLM应用的OWASP Top 10的事件数据鲁棒性分析:社区专家排名如何在大规模LLM事件语料库面前保持有效性

Kyriakos "Rock" Lambros, Steve Wilson

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究以OWASP 2026年LLM应用Top 10专家排名为对象,结合7714条LLM安全事件语料库,用贝叶斯模型分析其鲁棒性,发现两者一致性弱但专家排名仍具鲁棒性,且未推翻官方共识。

Comments 26 pages, 19 figures. Exploratory incident-data analysis by two members of the OWASP GenAI Security Project Top 10 for LLM Applications working group. Analysis predates the official OWASP GenAI LLM Top 10 2026 (published August 2026). Not an official OWASP release and does not supersede the official list or process. Code and data: https://github.com/rocklambros/incident-rank-validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28325 2026-06-30 cs.CY cs.CL 90%

The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing

帝国的数字来世:四种语言模型趋同于同一帝国文字制图

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(犯罪 psychiatry 研究院 / 性犯罪医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神病学系)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 通过构建数字文字表示指数(DSRI)评估300种文字系统的数字支持,发现仅9.7%得到完全支持;四种LLM在172个特征项上出现一致错误模式,表明历史帝国造成的结构性不平等通过共享训练语料库持续影响当代模型。

Comments Part II of the Kotonoha Series. Companion paper: arXiv:2604.10957 (q-bio.PE). 35 pages, 8 figures, 3 tables. 12,000 API calls across 4 LLM families (Anthropic, OpenAI, xAI, DeepSeek); cross-architecture convergence of typological knowledge biases (Spearman rho = 0.85-0.98, all p < 0.002)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16246 2026-08-20 cs.LG cs.AI cs.CL 版本更新 90%

Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining

数据受限语言模型预训练的数据增强

Michael K. Chen, Xikun Zhang, Fan Bai, Zhengding Hu, Zhen Wang

机构 * UC San Diego(加州大学圣地亚哥分校) RMIT University(皇家墨尔本理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对数据受限下标准自回归预训练严重过拟合的问题,提出三类数据增强方法(token级噪声、序列排列、目标偏移预测),有效降低验证损失并支持数百epoch训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 90%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15503 2026-06-15 cs.SE 90%

Guidelines for Empirical Studies in Software Engineering involving Large Language Models

涉及大语言模型的软件工程实证研究指南

Sebastian Baltes, Florian Angermeir, Chetan Arora, Marvin Muñoz Barón, Chunyang Chen, Lukas Böhme, Fabio Calefato, Neil Ernst, Davide Falessi, Brian Fitzgerald, Davide Fucci, Junda He, Christoph Treude, Marcos Kalinowski, Stefano Lambiase, Daniel Russo, Mircea Lungu, Cristina Martinez Montes, Lutz Prechelt, Paul Ralph, Rijnard van Tonder, Stefan Wagner

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对大语言模型在软件工程研究中的非确定性、不透明训练数据和快速演化问题,通过22位研究者的协作,提出七种研究类型分类和八条设计报告指南,以提升实证研究的可重复性和可复现性。

Comments 86 pages, 4 tables, accepted in Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05961 2026-06-05 cs.CY physics.soc-ph 90%

Political Persuasion and Endorsement in Large Language Models

大型语言模型中的政治说服与支持

Alessia Antelmi, Alessia Galdeman, Lucio La Cava, Arianna Pera, Giovanni Da San Martino

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究大型语言模型是否支持包含说服技巧的信息,以及党派角色提示如何调节这种支持,发现无政治条件时模型通常不支持,但党派提示加剧极化。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01800 2026-06-02 cs.CL cs.AI cs.LG 90%

Multilinguality of Large Language Models From a Structural Perspective

从结构视角看大语言模型的多语言性

Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过表示结构分析探索大语言模型的多语言性,发现低资源语言与英语的结构差异大于高、中资源语言,且语言特定后训练改变结构但保留语言间关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22467 2026-04-27 eess.AS 90%

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

DM-ASR:基于说话人识别的多说话人ASR框架

Li Li, Ming Cheng, Weixin Zhu, Yannan Wang, Juan Liu, Ming Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 DM-ASR利用说话人识别作为结构先验,将多说话人ASR任务转化为多轮对话生成过程,通过分解转录为说话人和时间条件查询,提升转录质量与结构化输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17585 2026-04-07 cs.AI cs.CL cs.LG 90%

Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models

Cite Pretrain: 无需检索的知识归因于大语言模型

Yukun Huang, Sanxing Chen, Jian Pei, Manzil Zaheer, Bhuwan Dhingra

机构 * Duke University(杜克大学) Meta

专题命中 预训练与数据 :language model(title,abstract);large language model(title);instruction tuning(abstract);pretraining(abstract)

AI总结 本文提出CitePretrainBench基准,通过修改训练过程使大语言模型在无检索情况下可靠归因于训练期间看到的文档。通过两阶段方法提升模型在短形式和长形式引用任务中的表现,实验显示Active Indexing在多个任务和模型中均取得30.2%的引用精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02031 2026-04-03 cs.LG cs.AI cs.CL 90%

Output Embedding Centering for Stable LLM Pretraining

输出嵌入中心化用于稳定大语言模型预训练

Felix Stollenwerk, Anna Lokrantz, Niclas Hertzberg

机构 * AI Sweden

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出输出嵌入中心化(OEC)方法,通过分析输出嵌入几何特性,解决预训练中的输出logit发散问题,提升训练稳定性。

Comments Additional experiments using logit soft-capping & weight tying

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17220 2026-03-19 cs.CL cs.AI cs.LG 90%

TharuChat: Bootstrapping Large Language Models for a Low-Resource Language via Synthetic Data and Human Validation

TharuChat:通过合成数据和人类验证提升低资源语言的大型语言模型

Prajwal Panth, Agniva Maiti

机构 * School of Computer Engineering KIIT Deemed to be University(计算机工程学院 KIIT 研究生大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Tharu-LLaMA(3B)模型,通过合成数据和人类验证构建TharuChat数据集,解决低资源语言在AI中的代表性问题,提升模型性能并证明生成式AI在保护濒危语言中的可行性。

Comments 6 pages, 1 figure, 2 tables. Preprint. Code and dataset available on Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14757 2026-03-09 astro-ph.CO astro-ph.IM hep-ph physics.data-an 90%

Large Language Models -- the Future of Fundamental Physics?

大语言模型——基础物理学的未来?

Caroline Heneka, Florian Nieser, Ayodele Ore, Tilman Plehn, Daniel Schiller

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文探讨了大语言模型在基础物理学中的应用,展示了Qwen2.5 LLM结合连接网络在宇宙参数回归和光锥生成中的优越性能。

Comments 35 pages, 10 figures, 6 tables. v2: matched published version

Journal ref SciPost Phys. 20, 070 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10735 2026-03-09 cs.AI cs.CL cs.CY cs.LG 90%

Transforming Agency. On the mode of existence of Large Language Models

代理的转变。大型语言模型的存在模式

Xabier E. Barandiaran, Lola S. Almendros

机构 * IAS-Research Centre for Life, Mind, and Society, Dept. Philosophy UPV/EHU, University of the Basque Country(生命、心灵与社会研究所,哲学系,巴斯克大学) Institute for Science and Technology Studies, University of Salamanca (Spain)(科学与技术研究所,萨拉曼卡大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了大型语言模型作为代理的本体特征,指出其缺乏自主代理的必要条件,但能通过文本和计算躯体影响人类代理形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04066 2026-02-16 cs.SE 90%

Exploring the Potential of Large Language Models in Simulink-Stateflow Mutant Generation

探索大型语言模型在Simulink-Stateflow变异体生成中的潜力

Pablo Valle, Shaukat Ali, Aitor Arrieta

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文利用大型语言模型生成高质量的Simulink-Stateflow变异体,显著提高了生成效率和变异体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06876 2026-02-03 cs.CL cs.AI cs.LG 90%

Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging

混合数据还是融合模型?通过模型融合平衡大型语言模型的有用性、诚实性和无害性

Jinluan Yang, Dingnan Jin, Anke Tang, Li Shen, Didi Zhu, Zhengyu Chen, Ziyu Zhao, Daixin Wang, Qing Cui, Zhiqiang Zhang, Jun Zhou, Fei Wu, Kun Kuang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RESM方法,通过改进的参数融合策略提升大型语言模型在有用性、诚实性和无害性方面的平衡对齐效果。

Comments arxiv version of NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08924 2025-12-02 cs.LG cs.AI cs.CL 90%

Escaping Collapse: The Strength of Weak Data for Large Language Model Training

摆脱崩溃:弱数据在大语言模型训练中的力量

Kareem Amin, Sara Babakniya, Alex Bie, Weiwei Kong, Umar Syed, Sergei Vassilvitskii

机构 * Google Research(谷歌研究)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了合成数据在大语言模型训练中的作用,提出通过动态聚焦标注资源提升模型性能,并揭示了提升方法在其中的应用与改进机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01252 2025-11-14 cs.CL cs.AI cs.LG 90%

GPT and Prejudice: A Sparse Approach to Understanding Learned Representations in Large Language Models

Mariam Mahran, Katharina Simbeck

机构 * HTW Berlin University of Applied Sciences(柏林应用科学大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Draft version, subject to revision

详情

展开后加载摘要…

URL PDF HTML 收藏