arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2604.08519 2026-04-10 cs.CL stat.ML 77%

Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts

少而精:训练数据剪枝提升事实记忆

Jiayuan Ye, Vitaly Feldman, Kunal Talwar

机构 * National University of Singapore(新加坡国立大学) Apple(苹果公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文从信息论角度研究训练数据分布对事实准确性的影响,提出基于训练损失的数据选择方案,提升事实记忆能力,实验表明剪枝后模型可更高效记忆事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06203 2026-04-09 cs.CY cs.AI 77%

Front-End Ethics for Sensor-Fused Health Conversational Agents: An Ethical Design Space for Biometrics

传感器融合健康对话代理的前端伦理:生物特征的伦理设计空间

Hansoo Lee, Rafael A. Calvo

机构 * Imperial College London(伦敦帝国理工学院) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了生物特征翻译的伦理设计,提出五个维度分析前端伦理风险,提出适应性披露作为安全机制,确保健康代理支持用户自主性。

Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07189 2026-04-09 cs.CL 77%

Agent-Driven Corpus Linguistics: A Framework for Autonomous Linguistic Discovery

基于代理的语料库语言学:一种自主语言发现的框架

Jia Yu, Weiwei Yu, Pengfei Xiao, Fukun Xing

机构 * Zhejiang International Studies University(浙江外国语学院) Tianjin University(天津大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于代理的语料库语言学框架,通过大语言模型与语料库查询引擎的交互,实现自动化的语言研究,提升研究效率并降低技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19940 2026-04-08 cs.LO cs.AI cs.PL 77%

Cobblestone: A Divide-and-Conquer Approach for Automating Formal Verification

Cobblestone:一种用于自动化形式验证的分而治之方法

Saketh Ram Kasibatla, Arpan Agarwal, Yuriy Brun, Sorin Lerner, Talia Ringer, Emily First

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts(马萨诸塞大学) Cornell University(康奈尔大学) Rutgers University(罗格斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Cobblestone通过大语言模型生成证明并分解问题,有效提升形式验证自动化水平,证明更多定理且成本低。

Comments 11 pages, 13 figures, Appearing at ICSE '26, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27527 2026-03-31 cs.LG 77%

Visualization of Machine Learning Models through Their Spatial and Temporal Listeners

通过空间和时间监听器可视化机器学习模型

Siyu Wu, Lei Shi, Lei Xia, Cenyang Wu, Zipeng Liu, Yingchaojie Feng, Liang Zhou, Wei Chen

机构 * School of Computer Science & Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Medical Technology, Peking University Health Science Center and National Institute of Health Data Science, Peking University(北京大学医学部医学技术研究院与北京大学健康数据科学国家研究所) School of Software, Beihang University(北京航空航天大学软件学院) National University of Singapore(新加坡国立大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种以模型为中心的两阶段框架,通过抽象监听器捕捉模型的空间和时间行为,并将其连接到经典信息可视化流程,分析显示可视化模型结果、定量/名义数据类型和统计图表是主要关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25051 2026-03-30 cs.CL 77%

Approaches to Analysing Historical Newspapers Using LLMs

利用大语言模型分析历史报纸的方法

Filip Dobranić, Tina Munda, Oliver Pejić, Vojko Gorjanc, Uroš Šmajdek, David Bordon, Jakob Lenardič, Tjaša Konovšek, Kristina Pahor de Maiti Tekavčič, Ciril Bohak, Darja Fišer

机构 * Institute of Contemporary History(当代史研究所) Faculty of Arts, University of Ljubljana(卢布尔雅那大学文学院) Faculty of Computer Science, University of Ljubljana(卢布尔雅那大学计算机科学学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文结合主题建模和LLM情感分析,探讨20世纪初斯洛文尼亚历史报纸中集体身份和政治倾向的表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25186 2026-03-27 cs.LG 77%

Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation

基于知识的检索增强生成用于零样本心理数据:隐私保护的合成数据生成

Adam Jakobsen, Sushant Gautam, Hugo Lewi Hammer, Susanne Olofsdotter, Miriam S Johanson, Pål Halvorsen, Vajira Thambawita

机构 * SimulaMet Oslo Metropolitan University(奥斯陆城市大学) Uppsala University(乌普萨拉大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种零样本知识引导框架,利用检索增强生成技术生成隐私保护的合成心理数据,通过对比CTGAN和TVAE模型,证明临床知识增强LLM在生成高质量、隐私保护的合成数据方面具有优势。

Comments Submitted to CBMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11770 2026-03-27 cs.CL cs.CY cs.SI 77%

The Value of Nothing: Multimodal Extraction of Human Values Expressed by TikTok Influencers

nothing的价值:通过TikTok影响者表达的人类价值观多模态提取

Alina Starovolsky-Shitrit, Alon Neduva, Naama Appel Doron, Itamar Gafni, Ella Daniel, Oren Tsur

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文研究通过TikTok影响者上传的视频提取隐含价值观,采用两阶段方法优于直接提取,使用少量样本的大语言模型在两个阶段表现更优,首次公开TikTok视频价值观标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24676 2026-03-27 cs.AI cond-mat.dis-nn cond-mat.stat-mech physics.bio-ph physics.soc-ph 77%

When Is Collective Intelligence a Lottery? Multi-Agent Scaling Laws for Memetic Drift in LLMs

集体智慧何时是一场彩票?LLM中膜etic漂移的多智能体缩放定律

Hidenori Tanaka

机构 * CBS–NTT Program in Physics of Intelligence(物理智能中心-NTT项目) Center for Brain Science(脑科学中心) Harvard University(哈佛大学) Physics of Artificial Intelligence Group(人工智能物理研究组) NTT Research, Inc.(NTT研究公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过QSG模型揭示LLM多智能体系统中集体共识的形成机制,发现共识可能由膜etic漂移驱动,提出基于群体规模、通信带宽等因素的缩放定律。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01924 2026-03-26 cs.GR cs.LG 77%

Gen-C: Populating Virtual Worlds with Generative Crowds

Gen-C:通过生成性人群填充虚拟世界

Andreas Panayiotou, Panayiotis Charalambous, Ioannis Karamouzas

机构 * Department of Computer Science, University of Cyprus(塞浦路斯大学计算机科学系) CYENS - Centre of Excellence(CYENS卓越中心) Department of Computer Science and Engineering, University of California, Riverside(加州大学河滨分校计算机科学与工程系)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Gen-C提出一种生成框架,通过模拟人群与环境的交互生成高阶人群行为,利用大语言模型生成合成数据,采用时间扩展图结构和双变分图自编码器实现环境感知的多代理人群模拟。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22577 2026-03-25 cs.CR cs.AI cs.MA 77%

STRIATUM-CTF: A Protocol-Driven Agentic Framework for General-Purpose CTF Solving

STRIATUM-CTF: 一种基于协议的代理框架用于通用CTF求解

James Hugglestone, Samuel Jacob Chacko, Dawson Stoller, Ryan Schmidt, Xiuwen Liu

机构 * Department of Computer Science, Florida State University, Tallahassee, USA(计算机科学系,佛罗里达州立大学,塔拉萨斯,美国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出STRIATUM-CTF框架,通过Model Context Protocol标准化工具接口,提升CTF求解的自主性和适应性,在真实竞赛中取得第一名。

Comments 8 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21571 2026-03-24 cs.CL 77%

DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing

DATASHI:一个平行的英语-塔希利耶特语语料库用于正字法规范化和低资源语言处理

Nasser-Eddine Monir, Zakaria Baou

机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化技术研究院、LORIA实验室) ISIMA, Université Clermont Auvergne(克莱蒙特奥弗涅大学ISIMA)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 DATASHI提供了一个包含5000对句子的平行语料库,包含1500个经过专家标准化和非标准用户生成的句子,用于研究正字法多样性及规范化,支持NLP任务并为多模态对齐提供基础。

Comments This paper has been accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02401 2026-03-20 cs.LG 77%

BarcodeBERT: Transformers for Biodiversity Analysis

BarcodeBERT:用于生物多样性分析的Transformer模型

Pablo Millan Arias, Niousha Sadjadi, Monireh Safari, ZeMing Gong, Austin T. Wang, Joakim Bruslund Haurum, Iuliia Zarubiieva, Dirk Steinke, Lila Kari, Angel X. Chang, Scott C. Lowe, Graham W. Taylor

机构 * University of Waterloo(滑铁卢大学) Simon Fraser University(西蒙弗雷泽大学) Aalborg University(奥胡斯大学) Pioneer Centre for AI(先锋人工智能中心) University of Guelph(格雷厄姆大学) Vector Institute(向量研究所) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 BarcodeBERT通过领域特定数据自监督预训练,在物种鉴定任务中优于基础模型,尤其在低阶分类如属和种层面表现突出,且比BLAST快55倍。

Comments Main text: 14 pages, Total: 23 pages, 10 figures, formerly accepted at the 4th Workshop on Self-Supervised Learning: Theory and Practice (NeurIPS 2023)

Journal ref Bioinformatics Advances (2026) vbag054

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15248 2026-03-19 cs.CL 77%

The Moralization Corpus: Frame-Based Annotation and Analysis of Moralizing Speech Acts across Diverse Text Genres

道德化语料库:跨多样文本体的基于框架的道德化言语行为标注与分析

Maria Becker, Mirko Sommer, Lars Tapken, Yi Wan Teh, Bruno Brocai

机构 * Department of German Linguistics, Heidelberg University(海德堡大学德语语言学系) Department of Computational Linguistics, Heidelberg University(海德堡大学计算语言学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出道德化语料库,用于分析道德价值观在论证话语中的策略使用,评估大型语言模型在道德化检测与成分提取中的表现,并揭示其高度主观性和情境敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09823 2026-03-17 cs.SD cs.CL eess.AS 77%

Covo-Audio Technical Report

Covo-Audio技术报告

Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen, Meng Yu, Dong Yu, Rilin Chen, Linlin Di, Shulin Feng, Na Hu, Yang Liu, Bang Wang, Shan Yang

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 Covo-Audio是一款7B参数端到端LALM,通过大规模预训练和微调在多种任务中表现优异,包括语音文本建模、对话、语音理解等,并展示了其在实际对话助理中的应用潜力。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25941 2026-03-16 cs.CL 77%

RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline

RECAP:通过代理流水线从LLM训练中重现受版权保护的数据

André V. Duarte, Xuying li, Bin Zeng, Arlindo L. Oliveira, Lei Li, Zhuo Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico/INESC-ID(里斯本技术大学/INESC-ID) Hydrox AI

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RECAP通过代理流水线从LLM输出中提取和验证记忆的训练数据,利用反馈循环和对抗模块提升版权文本提取效果,实验显示其在ROUGE-L评分上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12023 2026-03-13 cs.CR cs.AI 77%

Cascade: Composing Software-Hardware Attack Gadgets for Adversarial Threat Amplification in Compound AI Systems

级联:组合软件硬件攻击工具以在复合AI系统中实现对抗性威胁放大

Sarbartha Banerjee, Prateek Sahu, Anjo Vahldiek-Oberwagner, Jose Sanchez Vicarte, Mohit Tiwari

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过结合传统软件硬件漏洞与LLM算法攻击,实现复合AI系统中的对抗性威胁放大,展示两种新型攻击方法并系统化分析其组合。

Comments 11 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11709 2026-03-13 cs.AI 77%

Scaling Laws for Educational AI Agents

教育AI代理的扩展规律

Mengsong Wu, Hao Hao, Shuzhen Bi, Keqian Li, Wentao Liu, Siyu Song, Hongbo Zhao, Aimin Zhou

机构 * East China Normal University(东华师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出教育AI代理的扩展规律,通过结构化维度如角色定义、技能深度等,构建AgentProfile机制,展示EduClaw平台在K-12学科中实现330+代理的性能扩展,强调结构化能力系统的重要性。

Comments 19 pages, 6 figures, 3 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11388 2026-03-13 cs.AI 77%

Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment

消除拒绝触发:理解并缓解安全对齐中的过度拒绝问题

Zhiyu Xue, Zimo Qi, Guangliang Liu, Bocheng Chen, Ramtin Pedarsani

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Johns Hopkins University(约翰霍普金斯大学) Michigan State University(密歇根州立大学) University of Mississippi(密苏里州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文研究了安全对齐中过度拒绝问题的成因,提出了一种考虑拒绝触发的缓解策略,通过优化训练过程提高模型对良性查询的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11008 2026-03-12 cs.IR cs.CL 77%

A Systematic Study of Pseudo-Relevance Feedback with LLMs

基于大语言模型的伪相关反馈的系统研究

Nour Jedidi, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统研究了基于大语言模型的伪相关反馈方法,发现反馈模型选择和反馈源对PRF效果有重要影响,且从语料库获取反馈在强检索器支持下效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10299 2026-03-12 cs.LG 77%

Regime-aware financial volatility forecasting via in-context learning

基于情境学习的领域感知金融波动预测

Saba Asaad, Shayan Mohajer Hamidi, Ali Bereyhi

机构 * Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种基于情境学习的领域感知金融波动预测方法,通过条件采样策略提升非平稳市场下的预测性能。

Comments 11 pages, 1 figure, Published as a conference paper at ICLR 2026 Workshop on Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18928 2026-03-12 cs.AI 77%

Talking like Piping and Instrumentation Diagrams (P&IDs)

像管道和仪表图(P&IDs)一样交流

Achmad Anggawirya Alimin, Dominik P. Goldstein, Lukas Schulze Balhorn, Artur M. Schweidtmann

机构 * Process Intelligence Research Group(过程智能研究组) Department of Chemical Engineering(化学工程系) Delft University of Technology(代尔夫特理工大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出通过自然语言与P&IDs交互的方法,利用图表示和LLM结合,实现P&IDs信息的检索与解释,提升工程师工作效率。

Journal ref Systems and Control Transactions 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13795 2026-03-10 cs.CV cs.AI 77%

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

Bee:一个高质量语料库和全栈工具包,解锁高级完全开放的多模态大语言模型

Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan Team(腾讯文英团队)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 Bee通过高质量数据集和全栈工具包,提升完全开放多模态大语言模型的性能,达到与半开放模型相当甚至超越的水平。

Comments homepage: https://open-bee.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04259 2026-03-05 cs.CY cs.AI 77%

When AI Fails, What Works? A Data-Driven Taxonomy of Real-World AI Risk Mitigation Strategies

当AI失效时,什么有效?基于数据的现实世界AI风险缓解策略分类

Evgenija Popchanovska, Ana Gjorgjevikj, Maryan Rizinski, Lubomir Chitkushev, Irena Vodenska, Dimitar Trajanov

机构 * Faculty of Computer Science and Engineering(计算机科学与工程系) Ss. Cyril and Methodius University(西里尔和方法ius大学) Department of Computer Science(计算机科学系) Metropolitan College(Metropolitan学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文基于数据提出现实世界AI风险缓解策略的分类体系,通过分析9705篇媒体报道的AI事件,提取并分类了6893篇文本中的缓解措施,引入四个新类别,提升分类体系的适用性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06427 2026-03-05 cs.CL cs.CY 77%

Dutch Metaphor Extraction from Cancer Patients' Interviews and Forum Data using LLMs and Human in the Loop

利用LLM和人机协同从癌症患者访谈和论坛数据中提取荷兰语隐喻

Lifeng Han, David Lindevelt, Sander Puts, Erik van Mulligen, Suzan Verberne

机构 * Biomedical Data Sciences, Leiden University Medical Center(莱顿大学医学中心生物医学数据科学) Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿大学先进计算机科学研究所) Department of Radiation Oncology (MAASTRO), GROW Research Institute for Oncology(肿瘤学研究与生殖学研究所放射肿瘤科)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究利用LLM和人机协同方法,从癌症患者访谈和论坛数据中提取荷兰语隐喻,构建HealthQuote.NL语料库,以支持患者护理和个性化医疗路径设计

Comments Ongoing project report, on behalf of 4D PICTURE https://4dpicture.eu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21150 2026-03-05 cs.LG 77%

CAD-Tokenizer: Towards Text-based CAD Prototyping via Modality-Specific Tokenization

CAD-Tokenizer: 向基于文本的CAD原型设计迈进:通过模态特定的分词

Ruiyu Wang, Shizhao Sun, Weijian Ma, Jiang Bian

机构 * University of Toronto(多伦多大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CAD-Tokenizer通过模态特定的分词策略,提升文本引导的CAD原型设计效率与生成质量。

Comments ICLR2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16597 2026-03-03 cs.CL cs.IR 77%

Scaling Knowledge Graph Construction through Synthetic Data Generation and Distillation

通过合成数据生成与蒸馏扩展知识图谱构建

Prafulla Kumar Choubey, Xin Su, Man Luo, Xiangyu Peng, Caiming Xiong, Tiep Le, Shachar Rosenman, Vasudev Lal, Phil Mui, Ricky Ho, Phillip Howard, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SynthKG和Distill-SynthKG方法,通过合成数据生成和蒸馏技术提升文档级知识图谱构建效率,并设计图检索框架提升检索与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02228 2026-02-23 cs.LG 77%

xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity

xLSTM缩放定律:具有线性时间复杂度的竞争力表现

Maximilian Beck, Kajetan Schweighofer, Sebastian Böck, Sebastian Lehner, Sepp Hochreiter

机构 * ELLIS Unit Linz, Institute for Machine Learning, JKU Linz, Austria(林茨ELLIS单位、机器学习研究所、JKU林茨,奥地利) NXAI GmbH, Linz, Austria(林茨NXAI公司,奥地利)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 xLSTM在保持竞争力的同时,展现出线性时间复杂度和更优的缩放性能,优于Transformer架构。

Comments Accepted at ICLR 2026. Code and data available at https://github.com/NX-AI/xlstm_scaling_laws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17080 2026-02-23 cs.LG math.OC 77%

Adam Improves Muon: Adaptive Moment Estimation with Orthogonalized Momentum

Adam改进Muon:基于正交动量的自适应矩估计

Minxin Zhang, Yuxuan Liu, Hayden Schaeffer

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出NAMO和NAMO-D优化器,通过正交化动量与基于范数的Adam型噪声适应相结合,提升大语言模型训练性能。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17088 2026-02-20 cs.LG 77%

MeGU: Machine-Guided Unlearning with Target Feature Disentanglement

MeGU:基于目标特征解耦的机器引导反学习

Haoyu Wang, Zhuo Huang, Xiaolong Wang, Bo Han, Zhiwei Lin, Tongliang Liu

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 MeGU通过目标特征解耦实现受控反学习,利用多模态大语言模型进行概念感知的重新对齐,以提升反学习效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏