arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 23 篇

2604.15416 2026-08-27 cs.LG cs.AI math.OC 版本更新 92%

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models

StoSignSGD:无偏结构随机性修正SignSGD用于训练大语言模型

Dingzhi Yu, Rui Pan, Yuxing Liu, Difan Zou, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出StoSignSGD算法,通过在sign操作中注入结构随机性,解决SignSGD在非光滑目标下的发散问题,理论和实验均证明其在凸和非凸优化中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25657 2026-08-27 cs.AI cs.LG cs.PL cs.SE 新提交 91%

Narcissus: Program Synthesis Using Context-Aware LLM Approximations

Narcissus:使用上下文感知大语言模型近似值的程序合成

Tilman Hinnerichs, Sebastijan Dumancic, Neil Yorke-Smith

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Narcissus是一种程序合成器,通过保留LLM提议的语法树并结合上下文评分与正则化项,在多领域搜索中优于静态引导及修复提议的方法,解决ARC任务的比例显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25904 2026-08-27 cs.CL 新提交 88%

One Form to Transfer Them All: Pretraining Multilingual Language Models Beyond Native Orthography

一种实现跨语言迁移的统一形式:超越原生正字法的多语言语言模型预训练

Muge Zhang, Aaron Jencks, Krishna Badikela, Yulia Tsvetkov, Sachin Kumar

机构 * Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 本文通过系统对比三种输入表示,发现罗马化预训练可实现最强跨语言迁移,且优势随模型规模增大而扩大,提出多语言模型应将罗马化作为预训练核心设计选择的结论。

Comments EMNLP 2026 (Main Conference). 9 pages, 6 figures (plus appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25663 2026-08-27 cs.IR cs.AI cs.DB cs.DL 新提交 88%

Data Citation for Large Language Models: A Challenge

大语言模型的数据引用:一项挑战

Gianmaria Silvello

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文指出大语言模型的数据引用是一项开放挑战,提出训练数据归因、推理时数据引用、知识图谱事实引用三个研究方向,需跨领域协同推进以解决该问题。

Comments 7 pages, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12899 2026-08-27 cs.CL 版本更新 86%

EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue Corpus

EduDial:构建大规模多轮师生对话语料库

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Zhongxiang Dai, Kun Kuang

机构 * East China Normal University(华东师范大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究构建了大规模师生对话语料库EduDial,开发了EduDial-LLM 32B及11维教学能力评估框架,实验显示该模型在主流LLMs中表现最优。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25768 2026-08-27 cs.CL cs.AI 新提交 86%

MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum

MoganBert-TR:采用CLM到MLM课程从头训练的土耳其编码器基础模型

Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从头训练的土耳其编码器基础模型MoganBert-TR,采用CLM到MLM两阶段课程学习,在TrGLUE等任务上优于同类模型,其衍生嵌入模型MoganBert-Embed在MTEB(土耳其)学生模型中排名第一

Comments 32 pages, 4 figures, 18 tables. Model weights, tokenizer, embedding model and evaluation code: this https URL (https://huggingface.co/moganai)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10018 2026-08-27 cs.HC cs.AI 版本更新 85%

Helping the Helper: LLM-Assisted Problem Articulation for Older Adults Seeking Technology Support

通过基础模型赋能老年人数字技术使用

Hasti Sharifi, Homaira Huda Shomee, Melissa Lamar, Sourav Medya, Debaleena Chattopadhyay

机构 * Department of Computer Science University of Illinois Chicago(计算机科学系伊利诺伊大学芝加哥分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过基础模型解决老年人在数字技术使用中的沟通障碍,开发了OATS数据集,提高了解决方案的准确性和用户信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21712 2026-08-27 cs.AI cs.MA 版本更新 84%

ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling

ATHENA:面向基于AutoFormer的电子健康记录建模的知识引导型智能体神经架构搜索

Deyi Li, Qi Xu, Lingyao Li, Tiansheng Wang, Muxuan Liang, Mei Liu

机构 * University of Florida(佛罗里达大学) University of Arizona(亚利桑那大学) University of Houston(休斯顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究提出知识引导型智能体NAS框架ATHENA,通过跨医院复用架构知识,在6项临床预测任务的12项评估中9项优于或匹配基线方法,可减少Transformer型EHR建模的手动架构调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23377 2026-08-27 hep-ex cs.AI 版本更新 83%

Predict before you train: Scaling Laws for particle physics foundation models

训练前预测:粒子物理基础模型的缩放定律

Jan-Lucas Uslu, Benjamin Nachman, Christopher Re

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究粒子物理基础模型训练成本高及缩放回报难测问题,通过在小模型上拟合联合缩放定律预测大模型损失,还将其与下游物理性能关联,发布相关预训练模型、训练方法及代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20365 2026-08-27 cs.CL cs.AI 版本更新 82%

Trilingual Topic Modeling of Sri Lankan Parliamentary Debates

斯里兰卡议会辩论的三语主题建模

Himath Dhanapala, Haren Daishika, Himandhi Kuruppu, Sithija Seneviratne, Ashini Kavindya, Patalee Narasinghe, Sandeepa Weerasekara, Nisansa de Silva, Sandareka Wickramanayake

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对斯里兰卡议会三语辩论语料库因多语言特性难以处理的问题,提出基于LLM的文本提取结合多语言嵌入与密度聚类的端到端框架,辅以BiTopic方法,成功识别三种语言的30个宏观主题,其时间轨迹与重大国家事件吻合,且性能优于传统LDA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18655 2026-08-27 cs.CL 版本更新 81%

TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation

TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展

Milan Gritta, Patrik Lambert, Jihye Back, Amril Nazir

机构 * Tether AI Research(泰瑟人工智能研究院)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);SLM(abstract_cn)

AI总结 针对非洲语言机器翻译的数字鸿沟问题,推出面向19种撒哈拉以南非洲语言的开源资源TranslatePsy-AfriSLM,经质量过滤后构建的小参数模型性能远超更大规模的同类系统。

Comments EMNLP 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25721 2026-08-27 cs.CR cs.CL cs.IR 版本更新 81%

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

通过令牌影响归因追踪中毒检索语料库中的目标答案

Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学) IBM Research(IBM研究院) Hon Hai Research Institute(宏海研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出TRACE框架,通过令牌影响归因识别检索增强生成系统中的语料投毒攻击,无需额外分类器或LLM验证,在三个QA基准和六个LLM上验证了有效性。

Comments This paper has been accepted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26088 2026-08-27 cs.AI cs.LG 新提交 81%

Planetary Prediction Engine: Autonomous Geospatial Prediction via Intelligent Data Selection and Foundation Model Embeddings

行星预测引擎:通过智能数据选择和基础模型嵌入实现自主地理空间预测

Evelyn Ma, Rama Kumar Pasumarthi, Kishwar Shafin, Mandar Sharma, Mimi Sun, Hamed Sadeghi, Dav M. Ebengo, Mbulayi Onesime, Rouslan Solomakhin, John Wamburu, William Ogallo, Aisha Walcott-Bryant, Sanxing Chen, Arbaaz Muslim, Yael Mayer, Ronald Ho, Roy Lee, Ruth Alcantara, Abdoulaye Diack, Monica Bharel, Lambert Rosique, Jeremy Amez-Droz, Christopher Haire, James Manyika, Yossi Matias, Niv Efron, Gautam Prasad, Shravya Shetty

机构 * Google Research(谷歌研究院) Institut National de Recherche Biomédicale(国家生物医学研究院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出行星预测引擎(PPE),一种自主AI系统,可根据自然语言查询完成地理空间预测的端到端工作流程,在多类任务中优于现有模型,降低了行星规模分析的技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25701 2026-08-27 cs.CV 新提交 78%

Skeleton-based Zero-Shot Spatio-Temporal Action Localization via Weakly-Supervised Pretraining

基于骨骼的零样本时空动作定位:弱监督预训练方法

Koshiro Nagano, Fumiaki Sato, Ryo Hachiuma, Kazuki Tsutsukawa, Taiki Sekii

机构 * Konica Minolta, Inc.(柯尼卡美能达公司) Keio University(庆应义塾大学) CyberAgent(CyberAgent公司) NVIDIA(英伟达公司)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 该研究提出基于骨骼的零样本时空动作定位方法,通过弱监督视觉-语言预训练与场景混合判别对比学习,解决标注限制问题,在四个公开数据集上验证了有效性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25418 2026-08-27 cs.CV 新提交 78%

Bootstrapping a 4D LiDAR Annotation Tool from Video Foundation Models

基于视频基础模型引导的4D激光雷达标注工具

Jihun Kim, Hyun-Kurl Jang, Hyemin Yang, Jinnyeong Yang, Hyeokjun Kweon, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 研究针对4D激光雷达标注成本高、难扩展的问题,提出LiDAR-SAM2框架,借助SAM2自动生成标注,大幅降低3D/4D场景理解的标注负担。

Comments ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25478 2026-08-27 cs.CL 新提交 77%

VietAIDetector: An Open-Source Zero-Shot Detector for Vietnamese AI-Generated Text

VietAIDetector:一款开源的越南语AI生成文本零样本检测器

Trieu Hai Nguyen, Van-Dung Hoang

机构 * Nha Trang University(芽庄大学) Ho Chi Minh City University of Technology and Engineering(胡志明市技术与工程大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出开源越南语AI生成文本零样本检测器VietAIDetector,基于越南语专用语言模型,在域外数据集上性能优于英语现有方法,可通过Gradio网页界面交互,支持多类输入并输出检测结果。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-27 cs.CL cs.LG 版本更新 73%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at this https URL (https://github.com/cimeister/tokenizer-intrinsic-evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-08-27 cs.CL cs.LG 版本更新 73%

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments Camera-ready version accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25140 2026-08-27 cs.CV cs.CL 新提交 70%

RefLAM: A Reference-Grounded Line Annotation Pipeline for Historical Arabic Manuscripts

RefLAM:一种用于历史阿拉伯文手稿的参考依据型行标注流水线

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RefLAM是用于历史阿拉伯文手稿的参考依据型行标注流水线,结合深度学习、MLLM与模糊对齐引擎,可高效生成标注数据,吞吐量较手动标注提升75倍,发布的AraMS-28k可用于HTR模型微调。

Comments 11 pages, 6 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10621 2026-08-27 cs.IR cs.AI 版本更新 70%

STORM: Stepwise Token Optimization with Reward-Guided Beam Search

STORM: 基于奖励引导束搜索的逐步令牌优化

Arthur Satouf, Giulio D'Erasmo, Yuxuan Zong, Habiboulaye Amadou Boubacar, Pablo Piantanida, Benjamin Piwowarski

机构 * MILA – Quebec AI Institute & ILLS(魁北克人工智能研究所与ILLs) Université Paris-Saclay & CentraleSupélec & CNRS(巴黎-萨克雷大学及CentraleSupélec与CNRS) Air Liquide Sorbonne Université & ISIR & CNRS(索邦大学及ISIR与CNRS) Sapienza, University of Rome(罗马大学Sapienza)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出STORM框架,通过检索奖励引导的束搜索在每一步优化令牌选择,实现词汇检索的查询扩展,在多个基准上匹配或超越大模型重写器,并零样本迁移至18种语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04711 2026-08-27 cs.IR cs.AI 版本更新 70%

Addressing Corpus Knowledge Poisoning Attacks on RAG Using Sparse Attention

通过稀疏注意力缓解RAG中的语料知识污染攻击

Sagie Dekel, Moshe Tennenholtz, Oren Kurland

机构 * Faculty of Data and Decision Sciences, Technion - Israel Institute of Technology, Haifa, Israel(数据与决策科学学院,技术Ion-以色列理工学院,海法,以色列)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SDAG方法,通过稀疏注意力机制有效防御RAG中的语料知识污染攻击,显著提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21269 2026-08-27 cs.CL 版本更新 70%

LLMTrace: A Corpus for Classification and Fine-Grained Localization of AI-Written Text

LLMTrace:用于AI生成文本分类与细粒度定位的语料库

Irina Tolstykh, Aleksandra Tsybina, Sergey Yakubson, Maksim Kuprashevich

机构 * Department of R&D, SALUTEDEV LLC(研发部,SALUTEDEV LLC)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对AI文本检测领域缺乏合适训练数据的问题,本文构建了双语语料库LLMTrace,支持全文二元分类与AI生成区间检测,可用于训练评估更精细的AI检测模型。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-27 cs.LG cs.RO 版本更新 57%

Temporally Centered SIGReg Improves LeWorldModel Representations for Robot Policy Learning

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Zeyu Ping, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏