arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2201.08934 2022-05-10 eess.AS cs.SD 71%

Supervised and Self-supervised Pretraining Based COVID-19 Detection Using Acoustic Breathing/Cough/Speech Signals

Xing-Yu Chen, Qiu-Shi Zhu, Jie Zhang, Li-Rong Dai

专题命中 预训练与数据 :pretraining(title)

Comments Accepted by ICASSP 2022

Journal ref ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2022, pp. 561-565

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05703 2022-04-13 cs.CV 71%

Geometric Synthesis: A Free lunch for Large-scale Palmprint Recognition Model Pretraining

Kai Zhao, Lei Shen, Yingyi Zhang, Chuhan Zhou, Tao Wang, Ruixin Zhang, Shouhong Ding, Wei Jia, Wei Shen

专题命中 预训练与数据 :pretraining(title)

Comments Codes are available at http://kaizhao.net/palmprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.04771 2022-03-22 cs.CV 71%

Multiscale Convolutional Transformer with Center Mask Pretraining for Hyperspectral Image Classification

Sen Jia, Yifan Wang

专题命中 预训练与数据 :pretraining(title)

Comments 8 pages, 26 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.07919 2021-10-18 eess.IV cs.CV 71%

Combining CNNs With Transformer for Multimodal 3D MRI Brain Tumor Segmentation With Self-Supervised Pretraining

Mariia Dobko, Danylo-Ivan Kolinko, Ostap Viniavskyi, Yurii Yelisieiev

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.08658 2019-01-28 cs.CV 71%

Is Pretraining Necessary for Hyperspectral Image Classification?

Hyungtae Lee, Sungmin Eum, Heesung Kwon

专题命中 预训练与数据 :pretraining(title)

Comments IGARSS 2019 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.08317 2018-09-25 cs.CV 71%

Temporal Interpolation as an Unsupervised Pretraining Task for Optical Flow Estimation

Jonas Wulff, Michael J. Black

专题命中 预训练与数据 :pretraining(title)

Comments 16 pages, 7 figures; accepted for publication at the German Conference for Pattern Recognition (GCPR) 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.09532 2018-07-23 q-bio.NC cs.HC 71%

Cross-paradigm pretraining of convolutional networks improves intracranial EEG decoding

Joos Behncke, Robin Tibor Schirrmeister, Martin Völker, Jiří Hammer, Petr Marusič, Andreas Schulze-Bonhage, Wolfram Burgard, Tonio Ball

专题命中 预训练与数据 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.05689 2016-11-15 cs.CV 71%

Unsupervised Network Pretraining via Encoding Human Design

Ming-Yu Liu, Arun Mallya, Oncel C. Tuzel, Xi Chen

专题命中 预训练与数据 :pretraining(title)

Comments 9 pages, 11 figures, WACV 2016: IEEE Conference on Applications of Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18689 2026-08-25 cs.CL cs.AI 版本更新 71%

Aslema at NADI 2026: Data Augmentation for Intent Recognition and Slot Filling

Aslema 参与 NADI 2026:基于少样本的 SLU 增强方法

Tajwaar Shafiq, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI;large language model(comments);language model(comments)

AI总结 Aslema 系统参与 NADI 2026 共享任务 5,通过微调模型及合成数据增强(含文化适配语句生成与语音克隆)提升性能,在官方测试集槽填充排第1、意图识别排第4,将公开脚本与合成数据集。

Comments LLMs, Native, Arabic LLMs, Augmentation, Multilingual, Multimodal, Language Diversity, Contextual Understanding, Minority Languages, Culturally Informed, Foundation Models, Large Language Models, Audio Models, Omni Models, Slot Filling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25140 2026-08-27 cs.CV cs.CL 新提交 70%

RefLAM: A Reference-Grounded Line Annotation Pipeline for Historical Arabic Manuscripts

RefLAM:一种用于历史阿拉伯文手稿的参考依据型行标注流水线

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RefLAM是用于历史阿拉伯文手稿的参考依据型行标注流水线,结合深度学习、MLLM与模糊对齐引擎,可高效生成标注数据,吞吐量较手动标注提升75倍,发布的AraMS-28k可用于HTR模型微调。

Comments 11 pages, 6 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10621 2026-08-27 cs.IR cs.AI 版本更新 70%

STORM: Stepwise Token Optimization with Reward-Guided Beam Search

STORM: 基于奖励引导束搜索的逐步令牌优化

Arthur Satouf, Giulio D'Erasmo, Yuxuan Zong, Habiboulaye Amadou Boubacar, Pablo Piantanida, Benjamin Piwowarski

机构 * MILA – Quebec AI Institute & ILLS(魁北克人工智能研究所与ILLs) Université Paris-Saclay & CentraleSupélec & CNRS(巴黎-萨克雷大学及CentraleSupélec与CNRS) Air Liquide Sorbonne Université & ISIR & CNRS(索邦大学及ISIR与CNRS) Sapienza, University of Rome(罗马大学Sapienza)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出STORM框架,通过检索奖励引导的束搜索在每一步优化令牌选择,实现词汇检索的查询扩展,在多个基准上匹配或超越大模型重写器,并零样本迁移至18种语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04711 2026-08-27 cs.IR cs.AI 版本更新 70%

Addressing Corpus Knowledge Poisoning Attacks on RAG Using Sparse Attention

通过稀疏注意力缓解RAG中的语料知识污染攻击

Sagie Dekel, Moshe Tennenholtz, Oren Kurland

机构 * Faculty of Data and Decision Sciences, Technion - Israel Institute of Technology, Haifa, Israel(数据与决策科学学院,技术Ion-以色列理工学院,海法,以色列)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SDAG方法,通过稀疏注意力机制有效防御RAG中的语料知识污染攻击,显著提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21269 2026-08-27 cs.CL 版本更新 70%

LLMTrace: A Corpus for Classification and Fine-Grained Localization of AI-Written Text

LLMTrace:用于AI生成文本分类与细粒度定位的语料库

Irina Tolstykh, Aleksandra Tsybina, Sergey Yakubson, Maksim Kuprashevich

机构 * Department of R&D, SALUTEDEV LLC(研发部,SALUTEDEV LLC)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对AI文本检测领域缺乏合适训练数据的问题,本文构建了双语语料库LLMTrace,支持全文二元分类与AI生成区间检测,可用于训练评估更精细的AI检测模型。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24764 2026-08-26 cs.AI 新提交 70%

Evidence Blindness in Direct Corpus Interaction: Persistent Navigation with AtlasNav

直接语料库交互中的证据失明:基于AtlasNav的持久导航

Hongyu Guo, Zhiyu Zheng, Zhao Cao

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对直接语料库交互中存在的证据失明问题,提出AtlasNav框架,通过一次性构建语料库图谱实现自适应导航,在BrowseComp-Plus等数据集上提升了准确率并降低了推理成本。

Comments 27 pages, 7 figures. Code, data, and trajectories will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24268 2026-08-26 cs.CL 新提交 70%

ROBE: Reversed-Order-Biased-Experts for Extracting Extreme Long-tail Events from Historical Texts

ROBE:用于从历史文本中提取极长尾事件的逆序偏倚专家模型

Stella Verkijk, Piek Vossen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Huygens Instituut(惠更斯研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对未被大模型预训练覆盖的19世纪前荷兰历史语料库,提出ROBE逆序偏倚专家模型,结合领域合成数据提升,使长尾事件提取的召回、精确率及F1值均优于简单微调编码器模型。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21895 2026-08-25 cs.CR cs.AI 新提交 70%

Breaking the Assumptions: Auditing Input-Side Jailbreak Defenses Against Semantic Attacks

打破假设:针对语义攻击的输入端越狱防御审计

Aaditya Pratap, Harsh Kasyap, Somanath Tripathy

机构 * NCE Chandi IIT (BHU)(印度理工学院(瓦拉纳西)) IIT Patna(巴特那印度理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对本地部署大语言模型的输入端越狱防御开展审计,追溯防御失效的假设根源,在6款14B至35B参数的开源权重模型上,用100条来自40余公开源的越狱提示完成13800条评估记录的测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16053 2026-08-25 cs.CL eess.AS 版本更新 70%

Agentic-DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

DuplexGen:为合成对话语音解耦内容、时序与声学

Pengcheng Wang, Sheng Li, Jiyi Li, Takahiro Shinozaki

机构 * Institute of Science Tokyo(科学东京大学) Hokkaido University(北海道大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 DuplexGen框架通过解耦对话的内容、时序与声学,生成更贴近真实对话的合成语音,构建了带多类标注的医患对话语料库,性能优于传统拼接式合成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09737 2026-08-25 cs.LG 版本更新 70%

System-Prompt Anchoring with Cross-Attention Layers

CALYREX:跨注意力层扩展变换器用于系统提示锚定

Li Lixing

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。

Comments Preprint. 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08793 2026-08-25 cs.CL cs.DB 版本更新 70%

LakeHopper: Knowledge-Aware Adaptation of Column Type Annotators across Data Lakes

LakeHopper: 通过模型适应实现跨数据湖列类型注释

Yushi Sun, Xujia Li, Nan Tang, Quanqing Xu, Chuanhui Yang, Lei Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Ant Group(蚂蚁集团) HKUST(GZ)/HKUST(香港科技大学(广州)/香港科技大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 LakeHopper通过模型适应技术,有效解决跨数据湖列类型注释问题,减少注释需求并提升适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20186 2026-08-21 cs.LG q-bio.NC 新提交 70%

Decoding silent reading from non-invasive EEG

从无创脑电图解码默读内容

Ingo Marquardt, Anthilia Alchanat, Priyanka Jain

机构 * nubrain

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究以默读为替代任务,用CLIP式对比训练的卷积EEG编码器结合因果Transformer,从EEG中成功解码开放词汇单词级信息,发现解码受数据限制而非饱和。

Comments 45 pages (including 12 pages of Supplementary Material), 11 figures (including 2 in Supplementary Material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19376 2026-08-21 cs.CV cs.AI 新提交 70%

Does Marginal Coverage Guarantee Class-Conditional Safety for Zero-Shot VLMs Under Shift?

在分布偏移下,边际覆盖率能否保证零样本视觉语言模型(VLM)的类条件安全性?

Jai Kumar Sharma, Amartya Dutta

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究针对CLIP等零样本VLM,发现边际共形覆盖率无法保证类条件安全性,源域校准无法迁移,目标域类别校准可改善尾部但需类别标签,指出其仅为平均可靠性统计量。

Comments Accepted at the ECCV 2026 Workshop on Uncertainty Quantification for Computer Vision (UNCV). 34 pages (16 main + 18 supplementary), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18613 2026-08-20 cs.AI cs.CR 新提交 70%

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

CTIFoundry:用于网络威胁情报的智能体原生语料库支架

Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Amazon(亚马逊公司) Northwestern University(西北大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 CTIFoundry是用于网络威胁情报的智能体原生语料库支架,在CTIConnect基准测试中可使智能体F1提升0.19至0.28,小型模型在其上表现优于旗舰模型,且无需增加搜索工作量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17286 2026-08-19 cs.LG 新提交 70%

Abra: Scaling Diffusion Image Training

Abra:扩散图像训练的规模化

Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究针对文本到图像扩散模型开展系统缩放定律研究,提出Abra模型,发现其缩放规律可预测且需更多数据,相关规律可延伸至生成质量等多方面指标。

Comments 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16978 2026-08-19 cs.RO cs.LG 新提交 70%

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划

Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

机构 * University of Monastir(莫纳斯提尔大学) St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Silverstream AI(银流人工智能公司) Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30025 2026-08-19 cs.CL 版本更新 70%

ContextClaim: A Context-Driven Paradigm for Verifiable Claim Detection

ContextClaim: 一种基于上下文的可验证声明检测范式

Yufeng Li, Rrubaa Panchendrarajan, Arkaitz Zubiaga

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ContextClaim范式,通过提取实体、检索维基知识并生成上下文摘要,提升可验证声明检测的可靠性,验证其在不同领域和模型设置下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16071 2026-08-18 cs.CL cs.IR 新提交 70%

Skill2Query: Exploiting Skill Structure to Generate Pseudo-Queries for Agent Skill Retrieval

Skill2Query:利用技能结构生成智能体技能检索的伪查询

Lihui Ding, Zihan Guo, Bingwei Lu, Chenyu Zhou, Yuanjian Zhou, Weinan Zhang, Jianghao Lin, Dongdong Ge

机构 * Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 Skill2Query是利用技能知识图谱生成伪查询的框架,可提升多类检索性能,生成的训练数据表现最优,还能提高智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14585 2026-08-18 cs.AI 新提交 70%

Euclid-Omni : A Unified Neuro-Symbolic Framework for Plane Geometry

Euclid-Omni:面向平面几何的统一神经符号框架

Zhaoyu Li, Hangrui Bi, Youyuan Zhang, Wenjie Ma, Zenan Li, Zhaolei Zhang, Xujie Si, Kaiyu Yang

机构 * Apodex University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) ETH Zürich(苏黎世联邦理工学院) Meta FAIR

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Euclid-Omni统一神经符号框架,结合形式几何系统与LLMs、VLMs,核心为符号几何求解器Euclidea,生成合成数据训练模型,在竞赛级几何问题上性能优异且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04155 2026-08-18 cs.HC cs.CL cs.CY 版本更新 70%

SocialCoach: Personalized Social Skill Learning with Agentic Tutoring and Practice

SocialCoach: 基于强化学习的智能辅导与练习的个性化社交技能学习

Tianfu Wang, Max Xiong, Jianxun Lian, Hongyuan Zhu, Zhengyu Hu, Yuxuan Lei, Linxiao Gong, Dapeng Hu, Xiaofang Li, Peiting Tsai, Nicholas Jing Yuan, Qi Zhang

机构 * HKUST (GZ)(香港科技大学(广州)) Duke University(杜克大学) MSRA Beijing(微软研究院北京) Microsoft Beijing(微软北京)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SocialCoach系统,利用多智能体管道构建知识语料库、强化学习优化自适应练习调度,并结合沉浸式实践与反思辅导,以解决社交技能学习中专家辅导稀缺和知行差距问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07372 2026-08-18 cs.SE cs.AI 版本更新 70%

Self-Bootstrapping Automated Program Repair: Using LLMs to Generate and Evaluate Synthetic Training Data for Bug Repair

自bootstrap自动程序修复:利用LLMs生成和评估合成训练数据以修复bug

David de-Fitero-Dominguez, Antonio Garcia-Cabot, Eva Garcia-Lopez

机构 * Departamento de Ciencias de la Computación, Universidad de Alcalá(阿尔卡拉大学计算机科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种利用LLMs生成合成数据提升自动程序修复的方法,通过生成和评估代码bug与修复代码的配对示例,提升修复准确率,实验显示在VulRepair数据集上Top@1和Top@5表现显著提升。

Comments Final published version in the Expert Systems with Applications journal. Volume 319, 5 July 2026, 132154. DOI: https://doi.org/10.1016/j.eswa.2026.132154

Journal ref Expert Systems with Applications (5 July 2026), Volume 319, 132154

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20923 2026-08-18 cs.CL 70%

KaLM-Embedding-V2: Superior Training Techniques and Data Inspire A Versatile Embedding Model

Xinping Zhao, Xinshuo Hu, Zifei Shan, Shouzheng Huang, Yao Zhou, Xin Zhang, Zetian Sun, Zhenyu Liu, Dongfang Li, Xinyuan Wei, Youcheng Pan, Yang Xiang, Meishan Zhang, Haofen Wang, Jun Yu, Baotian Hu, Min Zhang

机构 * Shenzhen Loop Area Institute (SLAI)(深圳环湖区研究所) Tencent(腾讯)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏