arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2607.11052 2026-07-14 cs.LG cs.CL 新提交 73%

Domain-Aware Scaling Laws Uncover Data Synergy

领域感知缩放定律揭示数据协同效应

Kimia Hamidieh, Lester Mackey, David Alvarez-Melis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Microsoft Research(微软研究院) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型预训练中的数据协同效应,利用开放权重语言模型的观测变化估计领域间协同效应,其框架提高预测精度,恢复稳定估计,经训练模型验证能正确预测性能排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10911 2026-07-14 cs.CL cs.AI cs.DB 新提交 73%

The Nuts and Bolts of Natural Language to SQL Translation: A Systematic Analysis of Model Pipeline Optimisation Approaches and their Interactions

自然语言到SQL翻译的关键要素:模型管道优化方法及其交互的系统分析

Filip Klubicka, Vasudevan Nedumpozhimana, Sneha Rautmare, Bora Caglayan, Mingxue Wang, John D. Kelleher

机构 * Huawei Ireland Research Centre(华为爱尔兰研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究NL2SQL翻译问题,通过集成NatSQL中间表示、增加预处理和微调步骤、开发重排器模型等方法,并结合SmBoP和RASAT架构进行消融及Shapley分析,揭示组件交互对结果的影响,为轻量级模型开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09754 2026-07-14 cs.CV cs.AI cs.LG q-bio.NC 新提交 73%

Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization

通过图谱对齐的时空令牌化实现宽场钙成像的跨主体建模

Mohammad Hosseini, Eray Erturk, Saba Hashemi, Maryam M. Shanechi

机构 * ShanechiLab(沙内奇实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对宽场钙成像建模受限问题,提出多主体模型WiCAT,利用自监督预训练,引入图谱对齐的时空令牌化方案,能跨主体、任务和数据集迁移,实现零样本行为解码及遗漏脑区重建,优于基线模型。

Comments Published at the 43rd International Conference on Machine Learning (ICML) 2026. Code available at: https://github.com/ShanechiLab/WiCAT

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14687 2026-07-14 cs.LG cs.AI 版本更新 73%

SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data

SynthSAEBench: 评估可扩展真实合成数据上的稀疏自编码器

David Chanin, Adrià Garriga-Alonso

机构 * University College London(伦敦大学学院) Decode Research(Decode研究)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 SynthSAEBench通过生成大规模真实合成数据,提供标准化基准模型,用于评估稀疏自编码器架构的改进和失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15138 2026-07-10 cs.CL cs.AI 版本更新 73%

Less Is More: Reducing Token Counts Without Compromising Performance

少即是多:在不影响性能的情况下减少词元数量

Gyeongje Cho, Yeonkyoung So, Sangmin Lee, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何在不影响大语言模型性能的前提下减少词元数量,提出Thunder-Tok子词元分词器,先构建种子词汇表并过滤不完整候选词元,再用基于似然的词元分数修剪,实验证明该方法能有效降低词元生成率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05456 2026-07-08 cs.AI cs.CL q-bio.QM 新提交 73%

Prompt-to-Paper: Agentic AI System for Bioinformatics

从提示到论文:用于生物信息学的智能AI系统

Ramsha Kamran, Maheera Amjad, Zartasha Mustansar, Arsalan Shaukat, Salma Sherbaz, Muhammad U. S. Khan

机构 * School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST)(跨学科工程与科学学院(SINES),国立科技大学(NUST))

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有AI自动生成稿件系统的缺陷,提出Prompt-to-Paper多智能体框架。通过检索增强生成、自主编码实验及八维质量评分等创新,经质量驱动改进循环,在生物信息学案例中验证,有效提升稿件质量,成本低且获较好外部评价。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21876 2026-07-01 cs.LG cs.AI 新提交 73%

Protein contacts are already in the attention: a single-forward-pass alternative to the Categorical Jacobian

蛋白质接触已经存在于注意力中:分类雅可比矩阵的单次前向替代方案

Rome Thorstenson

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出通过选择少量注意力头(仅需10个标记蛋白质)平均即可在一次前向传播中恢复蛋白质接触,在无泄漏数据上优于分类雅可比矩阵,并发现该信号依赖于双向预训练。

Comments 28 pages, 9 figures. Code and data: https://github.com/Rome-1/plm-contact-fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25935 2026-06-25 cs.CL cs.AI 新提交 73%

Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts

HIPE-2026 概述:从多语言历史文本中提取人物-地点关系

Juri Opitz, Maud Ehrmann, Corina Raclé, Andrianos Michail, Matteo Romanello, Simon Clematide

机构 * University of Zurich(苏黎世大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Swiss Federal Institute of Technology Zurich (ETHZ)(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出HIPE-2026评测任务,针对多语言历史文档中的人物-地点关系(at和isAt)进行提取,采用三方面评估框架,比较了多种方法在准确性、效率和跨域泛化上的表现。

Comments Condensed Overview of CLEF-HIPE-2026 Shared Task Results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25010 2026-06-25 cs.LG cs.CL 新提交 73%

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

涌现能力随机地从学习稀疏注意力模式中产生

Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

机构 * New York University(纽约大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究发现,transformer模型的下游能力(如上下文学习)在训练过程中随机涌现,较大模型平均更早获得,且涌现对应于任务相关注意力模式的突然学习。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25008 2026-06-25 cs.LG cs.CL 新提交 73%

Neural Scaling Universality: If Exponents Are Fixed, Time to Understand Coefficients

神经缩放普适性:如果指数固定,是时候理解系数了

Yizhou Liu, Jeff Gore

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文论证神经缩放定律中的幂律指数由通用机制固定,而系数对数据和架构细节敏感,理解系数是近期性能提升的关键。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20936 2026-06-23 cs.CL cs.AI 新提交 73%

Comparing Transformers and Hybrid Models at the Token Level

在词级上比较变换器和混合模型

Yanhong Li, William Merrill

机构 * Allen Institute for AI(艾伦人工智能研究所)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比混合模型与纯变换器在词级上的表现,揭示了混合模型在处理开放类词汇时的优势,以及在语义状态利用和n-gram复制任务中的不同表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07822 2026-06-23 eess.SP cs.AI cs.HC cs.LG 版本更新 73%

Exploration of LLMs, EEG, and behavioral data to measure and support attention and sleep

探索LLMs、EEG和行为数据以测量和支持注意力与睡眠

Akane Sano, Judith Amores, Mary Czerwinski

机构 * Rice University(里士大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探索利用大语言模型(LLMs)结合脑电图(EEG)和活动数据估计注意力状态、睡眠阶段和质量,并生成改善建议和引导想象脚本,发现LLMs能基于行为特征评估睡眠质量,但基于EEG和活动数据的检测需更多训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19253 2026-06-18 cs.CV cs.AI cs.LG cs.RO 新提交 73%

OneCanvas: 3D Scene Understanding via Panoramic Reprojection

OneCanvas: 通过全景重投影实现3D场景理解

Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学) Huawei(华为)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出OneCanvas方法,将多视图补丁特征聚合到全景画布上,利用深度和相机位姿进行重投影,无需复杂几何编码器或大量训练,在SQA3D等基准上达到最先进精度。

Comments Project page: https://baranowskibrt.github.io/onecanvas/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11688 2026-06-11 cs.CL cs.AI 新提交 73%

Goal-Autopilot: A Verifiable Anti-Fabrication Firewall for Unattended Long-Horizon Agents

Goal-Autopilot: 一种可验证的防伪造防火墙,用于无人值守的长周期智能体

Youwang Deng

机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Autopilot执行模型,通过外部化状态到有限状态机并强制门控验证,使智能体无法虚假声称成功,在3,150个单元测试中伪造率降至0.95%,显著低于基线方法。

Comments Preprint. Code: https://github.com/EpistemicaLab/goal-compiled-autopilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08451 2026-06-09 cs.CL cs.AI 新提交 73%

Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models

谄媚作为多语言对齐失败:安全性能如何随语言、主题和模型退化

Arya Shah, Himanshu Beniwal, Mayank Singh, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校) Asian Institute of Technology(亚洲理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多语言模型中谄媚现象,发现低资源语言中谄媚率激增,且与主题无关,归因于分词器生育率,表明对齐方法在非高资源语言中泛化差。

Comments 19 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04058 2026-06-08 cs.LG cs.AI 版本更新 73%

Spectral Scaling Laws of Muon

Muon的谱缩放定律

Gagik Magakyan, Pablo Parrilo, Asuman Ozdaglar

机构 * MIT(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统研究了Muon优化器中动量矩阵奇异值谱随模型大小的缩放行为,发现其遵循幂律,并据此提出层感知的牛顿-舒尔茨迭代配置选择方法以减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03990 2026-06-03 cs.LG cs.CL cs.CV 73%

Neuron Populations Exhibit Divergent Selectivity with Scale

神经元群体随规模表现出分化的选择性

Amil Dravid, Yasaman Bahri, Alexei A. Efros, Yossi Gandelsman

机构 * UC Berkeley(加州大学伯克利分校) TTIC

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 通过分析Rosetta神经元在不同规模模型中的分布与特性,发现其数量遵循次线性幂律增长,且选择性随规模增强,而非Rosetta神经元则保持低选择性,提出一个平衡特征效用与神经元容量的分析模型解释这一极化现象。

Comments Project page and code: https://avdravid.github.io/rosetta-neuron-scaling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03825 2026-06-03 cs.LG cs.CL 73%

Dynamic Short Convolutions Improve Transformers

动态短卷积改进Transformer

Oliver Sieberling, Bharat Runwal, Rameswar Panda, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出动态短卷积作为新的神经网络原语,通过输入依赖的滤波器增强Transformer,在语言建模中相比标准Transformer和静态短卷积变体持续提升性能,并带来计算优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02814 2026-06-03 cs.IR cs.AI cs.CL 73%

Do Neural Retrievers Prefer Certain Documents? Evidence of Learned Relevance Priors

神经检索器是否偏好某些文档?学习到的相关性先验的证据

Francisco Valentini, Edgar Altszyler, Martin Fajcik

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过分析监督双编码器检索器在文档嵌入中编码的查询无关信号,发现模型从标注数据中学习到文档级相关性先验,导致低先验文档即使相关也更难被检索,揭示了监督检索的结构性局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00884 2026-06-02 cs.LG cs.AI 73%

Dive into Waves: Morlet Spectral Transformer for Cross-Subject Emotion Decoding from EEG

深入波动:用于跨被试脑电情绪解码的Morlet谱变换器

Jiaxin Qing, Lexin Li

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对脑电情绪识别中跨被试变异性问题,提出基于Morlet小波标记化、长上下文基线去除和频带特定空间投影的Morlet谱变换器(MST),无需预训练即可在SEED系列数据集上超越大型预训练模型和频域方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00703 2026-06-02 cs.IT cs.AI cs.LG math.IT 73%

Information-Theoretic Lower Bounds for Bit-Constrained Stochastic Optimization via a Reduction to Compressed Gaussian Mean Estimation

通过约化到压缩高斯均值估计的比特约束随机优化的信息论下界

Munsik Kim

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过将强凸二次族优化问题精确约化为交互式压缩高斯均值估计问题,推导出比特约束随机优化的无条件下界,并给出近乎匹配的可实现性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04127 2026-06-02 cs.LG cs.CL cs.CY 73%

Position: the Stochastic Parrot in the Coal Mine. Model Collapse is a Threat to Low-Resource Communities

立场:煤矿中的随机鹦鹉。模型崩溃对低资源社区的威胁

Devon Jarvis, Richard Klein, Benjamin Rosman, Steven James, Stefano Sarao Mannelli

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨模型崩溃(生成模型在先前模型输出上训练导致的性能下降)如何通过降低训练效率、扭曲数据分布,不成比例地影响低资源和边缘化社区,并呼吁采取行动。

Comments 14 pages, 1 figure, 1 table, International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17034 2026-06-02 cs.LG cs.AI cs.CR 73%

Privacy Policy Enforcement Guardrails for Data-Sensitive Retrieval-Augmented Generation

面向数据敏感检索增强生成的隐私策略执行护栏

Osama Zafar, Alexander Nemecek, Yiqian Zhang, Wenbiao Li, Debargha Ganguly, Vikash Singh, Vipin Chaudhary, Erman Ayday

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对RAG系统中上下文数据泄露问题,提出基于双单类密度估计器与融合文本嵌入的隐私策略执行框架,在医学、金融和法律领域实现高AUROC和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00696 2026-06-02 stat.ML cs.CL cs.LG 73%

Adaptive Querying with AI Persona Priors

基于AI人格先验的自适应查询

Kaizheng Wang, Yuhang Wu, Assaf Zeevi

机构 * Department of Industrial Engineering and Operations Research and Data Science Institute, Columbia University(工业工程与运筹学系及数据科学研究所,哥伦比亚大学) Decision, Risk, and Operations Division, Columbia Business School(决策、风险与运营部门,哥伦比亚商学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于AI人格诱导的潜变量模型,利用大语言模型生成响应分布,实现高效贝叶斯设计,用于在有限查询预算下学习用户相关量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02528 2026-06-02 cs.AI cs.LG 73%

Multimodal Function Vectors for Visual Relations

视觉关系的多模态函数向量

Shuhao Fu, Esther Goldberg, Ying Nian Wu, Hongjing Lu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过因果中介分析提取多模态函数向量,操纵注意力头以改善视觉关系推理,并实现零样本和微调性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31238 2026-06-01 cs.CL cs.LG 73%

Scaling Multi-Hop Training Data via Graph-Constrained Path Selection

通过图约束路径选择扩展多跳训练数据

Pengyu Chen, Yonggang Zhang, Mingming Chen, Jun Song, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与发展中心) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对专业文档的组成推理,提出基于图约束路径选择的方法,通过解耦路径发现与语言化,利用图约束过滤无效路径,显著扩展可用语料并提升模型性能。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30526 2026-06-01 cs.LG cs.CL 73%

Measuring, Localizing, and Ablating Alignment Signatures in LLMs

测量、定位和消融LLMs中的对齐特征

Aniket Anand, Janvijay Singh, Zhewei Sun, Dilek Hakkani-Tür, Nick Feamster

机构 * University of Chicago(芝加哥大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 预训练与数据 :language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究通过对比人类文本、基模型和对齐模型生成,发现对齐训练引入AI风格特征,并提出PASTA方法通过消融对齐方向来降低AI检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30376 2026-06-01 cs.LG cs.AI 73%

Unicorn: Scaling High-Dimensional Time Series Forecasting via Universal Correlation Modeling

Unicorn: 通过通用相关性建模实现高维时间序列的规模化预测

Haochen Yuan, Yichen Song, Yunbo Wang, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence(人工智能大规模并行计算实验室) AI Institute(人工智能研究院) School of Computer Science(计算机科学学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出Unicorn框架,通过潜在原型码本解耦相关性建模与特定通道身份,实现跨异构数据集的可扩展多数据集预训练,在少样本迁移场景中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11336 2026-06-01 cs.IR cs.AI cs.CL cs.HC 73%

Much of Geospatial Web Search Is Beyond Traditional GIS

大部分地理空间网络搜索超越了传统GIS

Ilya Ilyankou, Stefano Cavazzi, James Haworth

机构 * SpaceTimeLab(空间时间实验室) Department of Civil, Environmental, and Geomatic Engineering(土木、环境与测绘工程系) UCL(伦敦大学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过密集句子嵌入、SetFit分类器和密度聚类,在MS MARCO语料库中发现18%的查询具有地理空间性质,并构建了88类分类体系,揭示地理搜索以事务性和实用性查询为主,多数超出传统GIS和知识图谱范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23440 2026-05-29 cs.CL cs.AI 73%

SSDAU: Structured Semantic Data Augmentation for Joint Entity and Relation Extraction

SSDAU:面向联合实体关系抽取的结构化语义数据增强

Jiawei He, Mengyu Shi, Jiawei Liu, Dong Sun, Chunrong Fang, Xikai Yang, Zhijie Wang, Lei Ma, Zhenyu Chen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) Amap, Alibaba Group, China(阿里巴巴集团阿地图) University of Alberta, Edmonton, Canada(阿尔伯塔大学) The University of Tokyo, Tokyo, Japan(东京大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出结构化语义数据增强方法SSDAU,通过保留三元组感知语义结构、上下文感知编码和BERTopic过滤,提升联合实体关系抽取的泛化能力,在多个模型和数据集上优于现有方法。

Comments 10 pages, 4 figure

详情

展开后加载摘要…

URL PDF HTML 收藏