arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2303.03846 2023-03-09 cs.CL 87%

Larger language models do in-context learning differently

Jerry Wei, Jason Wei, Yi Tay, Dustin Tran, Albert Webson, Yifeng Lu, Xinyun Chen, Hanxiao Liu, Da Huang, Denny Zhou, Tengyu Ma

专题命中 预训练与数据 :language model(title,abstract);small language model(abstract);instruction tuning(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02657 2022-11-08 q-bio.QM cs.LG q-bio.BM 87%

MolE: a molecular foundation model for drug discovery

Oscar Méndez-Lucio, Christos Nicolaou, Berton Earnshaw

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted at Learning Meaningful Representations of Life workshop, NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-25 cs.CL cs.AI cs.CV 版本更新 87%

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25698 2026-08-25 cs.LG cs.AI 版本更新 87%

How Should LLMs Consume High-Quality Data? Optimal Data Scheduling via Quality-Aware Functional Scaling Laws

LLM应如何消费高质量数据?通过质量感知的功能缩放定律实现最优数据调度

Zhitao Zhu, Xili Wang, Shizhe Wu, Jiawei Fu, Xiaoqing Liu

机构 * Peking University(北京大学) Meituan(美团)

专题命中 预训练与数据 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过引入数据质量维度扩展功能缩放定律,解析求解了联合数据质量和批次大小调度问题,揭示了高质量数据的双重角色,并提出了Drop-Stable-Rampup调度策略,在15B MoE模型上相比WSD和余弦衰减分别提升平均准确率+1.70和+2.98。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16707 2026-08-18 cs.CL cs.AI 新提交 87%

Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors

语义老虎机:上下文内的探索-利用受语义先验的偏置

David Eric Austin, Kaheer Suleman, Jackie Chi Kit Cheung

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Skyfall AI(天空fall人工智能公司) McGill University(麦吉尔大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出语义老虎机框架,发现LLM的探索-利用受语义先验偏置,语义标签对齐奖励可提升性能,负奖励比同等正奖励触发更多探索,为LLM智能体决策可靠性提供了新见解。

Comments 10 pages, 5 figures in main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13277 2026-08-14 cs.CL cs.AI 新提交 87%

Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

训练混合:将小规模支架式预训练运行重组为更大的语言模型

Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

机构 * Google(谷歌公司) School of Computing, Dublin City University(都柏林城市大学计算机学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 本研究提出训练混合(MoT)框架,将Transformer划分为层块在冻结对齐器内独立训练后重组,在13亿参数Gemma模型上验证其可重组为可用语言模型,可复用对齐器实现计算优势,用于研究可复用训练单元。

Comments Accepted at the Workshop on Methods and Opportunities at Small Scale (MOSS), COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08107 2026-08-11 cs.CL cs.AI 新提交 87%

NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs

NeuPAT:面向语言保留多模态大语言模型的神经元感知可塑性分配调优

Jiayue Jin, Jingwei Zhang, Chen Wang, Jing Liu, Longteng Guo

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 NeuPAT是一种轻量架构无关框架,通过选择性保护语言敏感神经元、促进高可塑性神经元适配多模态,在11个语言基准上恢复了普通调优94.5%的语言能力下降,同时保持相当多模态性能,实现了能力保留型多模态大语言模型扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04422 2026-08-11 cs.LG cs.AI 版本更新 87%

Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

全栈FP4:通过量化投影、优化器和注意力进行稳定的语言模型预训练

Siyu Ding, Mingchuan Ma, Jiabo Tong, Xingrun Xing, Ziming Wang, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Sichuan University(四川大学) Beijing Zhongguancun Academy(北京中关村科学院) Zhejiang University(浙江大学) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑科学与类脑研究中心通用人工智能大模型北京市重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑机智能技术重点实验室)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);分类 cs.AI、cs.LG

AI总结 研究针对4位预训练中优化器状态等未充分探索的问题,提出全栈FP4框架。通过模块精度策略解决稳定性瓶颈,如用LoRA-SVD抑制量化噪声,设计优化器变换,采用混合精度方案,实现稳定高效的端到端预训练。

Comments Fix experiment bugs and some statement, update current developed hardware efficiency result on 5090

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05872 2026-08-07 cs.CL cs.AI 新提交 87%

MACRO: Markov Chain Routing of Transformer Layers

MACRO:Transformer层的马尔可夫链路由

Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05050 2026-08-06 cs.CY cs.AI cs.CL 新提交 87%

The Effect of Perceived Race and Gender on Police Language Use: Experimental Evidence from VR Simulations

感知到的种族与性别对警察语言使用的影响:来自VR模拟的实验证据

Sandra C. Sandoval, Navita Goyal, Rashawn Ray, Long Doan, Rachel Rudinger, Hal Daumé

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过VR模拟实验发现,警察对黑人男性虚拟角色的说话恭敬程度更低,还探讨了LLM在ATE估计中的应用,推荐混合效应模型结合iptw方法,认为LLM相关技术需进一步完善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02678 2026-08-05 cs.CR cs.AI cs.LG 新提交 87%

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

DenialRAG:通过嵌入参数化弃权的单文档RAG污染攻击

Abay Zhurekbay, Tao Liu, Fan Li

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DenialRAG单文档RAG污染攻击,通过嵌入参数化弃权引导LLM生成错误答案,经多数据集、多模型及防御评估,其在Mistral-7B上攻击效果最优,凸显RAG污染风险的复杂性。

Comments Submit to ACSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05707 2026-07-03 cs.CL cs.AI 87%

Multimodal In-context Learning for ASR of Low-resource Languages

多模态上下文学习用于低资源语言的语音识别

Zhaolin Li, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过多模态上下文学习提升低资源语言语音识别性能的方法,分析了跨语言迁移学习对模型效率的影响,并提出结合更强声学模型与语音LLM的改进系统。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00010 2026-07-02 cs.IR cs.AI cs.CL 新提交 87%

Prompt Optimization for User Simulation in Conversational Recommender Systems: A Multi-Objective Framework

对话推荐系统中用户模拟的提示优化:一个多目标框架

Nipun B Nair, Tongtong Wu, Weiqing Wang

机构 * Monash University(莫纳什大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多目标框架自动优化LLM提示,以生成更真实、多样化的用户模拟行为,缓解对话推荐系统中的评估与数据获取难题。

Comments to be published in 2026 IEEE 42nd International Conference on Data Engineering Workshops (ICDEW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20764 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 87%

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Sun Yat-Sen University(中山大学) Technical University of Munich(慕尼黑工业大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Institute(慕尼黑数据研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05165 2026-06-04 cs.LG cs.CL 87%

STRIDE: Training Data Attribution via Sparse Recovery from Subset Perturbations

STRIDE: 通过子集扰动的稀疏恢复进行训练数据归因

Rishit Dagli, Abir Harrasse, Luke Zhang, Florent Draye, Amirali Abdullah, Bernhard Schölkopf, Zhijing Jin

机构 * Jinesis AI Lab, University of Toronto & Vector Institute(Jinesis AI实验室,多伦多大学及向量研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所,图宾根,德国) Thoughtworks(Thoughtworks公司) Martian ELLIS Institute, Tübingen, Germany(图宾根ELLIS研究所,德国) EuroSafeAI

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出STRIDE框架,将训练数据归因建模为压缩感知中的稀疏恢复问题,通过激活空间中的轻量级“引导算子”模拟数据子集的影响,实现高效且准确的LLM预训练归因。

Comments project page: https://stride-tda.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23901 2026-05-25 cs.LG cs.AI cs.IT math.IT 87%

LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws

LLMs 作为噪声信道:香农视角下的模型容量与缩放定律

Xu Ouyang, Deyi Liu, Yuhang Cai, Jing Liu, Yuan Yang, Chen Zheng, Thomas Hartvigsen, Yiyuan Ma

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有缩放定律无法解释非单调性能退化的问题,提出基于香农-哈特利定理的香农缩放定律,将LLM训练建模为噪声信道上的信息传输,通过信号噪声比解释模型规模与数据量对性能的影响。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19285 2026-05-20 cs.CL cs.AI cs.CY 87%

Are Rationales Necessary and Sufficient? Tuning LLMs for Explainable Misinformation Detection

理性是否必要且充分?为可解释的虚假信息检测调优大语言模型

Bing Wang, Rui Miao, Ximing Li, Chen Shen, Shaotian Yan, Changchun Li, Kaiyuan Liu, Xiaosong Yuan, Jieping Ye

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Tongyi Lab, Alibaba Group(阿里云实验室) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了如何通过调优大语言模型(LLM)来提升可解释性虚假信息检测的性能,提出了一种新的数据合成管道LONSREX,用于定位必要且充分的理性,以解决现有方法中因粗粒度标签和过度验证行为导致的理性不足和冗余问题。

Comments Accepted by KDD 2026. 12 pages, 8 figures. Code: https://github.com/wangbing1416/LONSREX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13436 2026-05-14 cs.CL cs.LG 87%

Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP

通过子词正则化预训练语言模型:BPE Dropout在低资源NLP中的实证研究

Ruan Visser, Trienko Grobler, Marcel Dunaiski

机构 * Department of Computer Science, Stellenbosch University(斯瓦茨堡大学计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG

AI总结 本文研究了在低资源NLP中预训练时应用BPE Dropout对下游性能的影响,发现随机分词在预训练和微调时均优于仅在微调时应用,尤其在数据较少时表现更佳。

Comments Comments: 12 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12438 2026-05-13 cs.CL cs.AI 87%

A Causal Language Modeling Detour Improves Encoder Continued Pretraining

通过因果语言模型的绕行提升编码器持续预训练

Rian Touchent, Eric de la Clergerie

机构 * Sorbonne Université / INRIA Paris ALMAnaCH Team(索邦大学 / 巴黎INRIA ALMAnaCH团队) INRIA Paris ALMAnaCH Team(巴黎INRIA ALMAnaCH团队)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 本文通过在持续预训练中临时切换到因果语言模型并随后进行短时掩码语言模型衰减,提升了下游任务性能,特别是在生物医学文本上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17408 2026-04-21 cs.AI cs.LG 87%

The Impact of Off-Policy Training Data on Probe Generalisation

偏离策略训练数据对探测泛化的影响

Nathalie Kirch, Samuel Dower, Adrians Skapars, Helen Yannakoudakis, Ekdeep Singh Lubana, Dmitrii Krasheninnikov

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) LASR Labs(LASR实验室) University of Manchester(曼彻斯特大学) Goodfire AI University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了偏离策略训练数据对八个不同LLM行为探测泛化的影响,发现训练策略显著影响探测性能,尤其在涉及响应意图的行为上表现更差,并提出预测泛化失败的测试方法。

Comments 10 pages, ACL 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12407 2026-04-17 cs.CR cs.CL cs.LG 87%

De-Anonymization at Scale via Tournament-Style Attribution

通过竞赛式归因实现大规模去匿名化

Lirui Zhang, Huishuai Zhang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究利用LLM链接匿名文档与其作者,提出大规模去匿名化方法DAS,通过分组筛选和多数投票提升鲁棒性和精度,实验显示在匿名平台存在现实隐私风险。

Comments 14 pages, ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06767 2026-04-09 cs.LG cs.CL 87%

Geometric Properties of the Voronoi Tessellation in Latent Semantic Manifolds of Large Language Models

大型语言模型潜在语义流形中Voronoi分割的几何特性

Marshall Brett

机构 * MARS Labs(MARS实验室)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 研究大型语言模型在潜在语义流形中的Voronoi分割,通过浮点32精度重新计算消除bfloat16量化伪影,验证表达性差距的线性缩放定律,并展示通过边距优化程序重塑Voronoi分割的可行性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06197 2026-04-09 cs.CL cs.AI 87%

Temporally Phenotyping GLP-1RA Case Reports with Large Language Models: A Textual Time Series Corpus and Risk Modeling

利用大语言模型进行GLP-1RA病例报告的时间表表征:一个文本时间序列语料库和风险建模

Sayantan Kumar, Jeremy C. Weiss

机构 * National Library of Medicine(美国国家医学图书馆)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大语言模型处理GLP-1RA病例报告的时间线,构建了包含136个病例的文本时间序列语料库,并通过时间序列分析评估了模型在提取临床事件及其时间点上的性能,发现GPT5在事件覆盖和时间顺序上表现优异,并展示了糖尿病患者使用GLP-1RA降低呼吸并发症风险的证据。

Comments AMIA Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23251 2026-03-25 cs.CL cs.LG 87%

Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Models

人工智能是否正在赶上人类表达?探索英语和阿拉伯语中情感、个性、作者身份和语言风格的模仿

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(计算机与信息科学学院,沙特阿拉伯国王沙德大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文研究六种大语言模型在英语和阿拉伯语中模仿情感和个性的能力,发现AI生成文本可被识别,但分类性能下降,揭示了LLM在情感信号编码上的差异。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20674 2026-02-23 cs.CL cs.AI 87%

PonderLM: Pretraining Language Models to Ponder in Continuous Space

PonderLM:在连续空间中预训练语言模型以进行思考

Boyi Zeng, Shixiang Song, Siyuan Huang, Yixuan Wang, He Li, Ziwei He, Xinbing Wang, Zhiyu Li, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) Shanghai Jiao Tong University(上海交通大学) Institute for Advanced Algorithms Research Shanghai(上海高级算法研究所) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 PonderLM通过在连续空间中引入思考过程,提升语言模型的认知处理能力,实验表明其在多个基准测试中优于现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17869 2026-01-27 cs.CL cs.LG 87%

On the Emergence and Test-Time Use of Structural Information in Large Language Models

关于大型语言模型中结构信息的出现及其测试时使用

Michelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 本研究探讨了大型语言模型如何学习和利用结构信息,发现其在复杂推理任务中表现突出,但测试时组合生成能力仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14780 2026-01-22 cs.CL cs.AI 87%

RECAP: Resistance Capture in Text-based Mental Health Counseling with Large Language Models

RECAP: 在基于文本的心理健康咨询中利用大语言模型进行抗阻捕捉

Anqi Li, Yuqian Chen, Yu Lu, Zhaoming Chen, Yuan Xie, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过捕捉13种细粒度抗阻行为,提高了基于文本的心理健康咨询中抗阻检测的准确性和解释性,优于现有方法。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17103 2026-01-07 cs.CL cs.AI 87%

Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation

用语言锻造时间序列:一种基于大语言模型的合成数据生成方法

Cécile Rousseau, Tobia Boschi, Giandomenico Cornacchia, Dhaval Salwala, Alessandra Pascale, Juan Bernabe Moreno

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SDForger通过大语言模型生成高质量多变量时间序列,利用文本条件化实现高效合成数据生成及多模态建模。

Journal ref NeurIPS 2025, https://openreview.net/forum?id=A2pmvkqOgp

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09323 2025-12-30 cs.CL cs.AI 87%

Leveraging Large Language Models for Rare Disease Named Entity Recognition

利用大语言模型进行罕见疾病命名实体识别

Nan Miles Xi, Yu Deng, Lin Wang

专题命中 预训练与数据 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大语言模型在低资源环境下提升罕见疾病命名实体识别性能,通过结构化提示框架和语义引导方法,实现优于传统模型的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14469 2025-12-02 cs.CL cs.AI 87%

Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations

大语言模型在混合语言扰动下的归因安全故障

Somnath Banerjee, Pratyush Chatterjee, Shanu Kumar, Sayan Layek, Parag Agrawal, Rima Hazra, Animesh Mukherjee

机构 * Microsoft Corporation(微软公司)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在混合语言扰动下存在归因安全故障,提出显著性漂移归因框架并提出翻译基恢复策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏