arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 799 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 799 篇

2607.20548 2026-07-24 cs.LG cs.AI 新提交 88%

SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales

SOAP、Muon及其他:推动语言模型预训练规模

Mikail Khona, Aditya Vavre, Boxiang Wang, Deyu Fu, Hao Wu, Mike Chrzanowski, Bryan Catanzaro, Dheevatsa Mudigere, Jeff Pool, Michael Lightstone, Mohammad Shoeybi, Mostofa Patwary, Nima Tajbakhsh, Tijmen Blankevoort

机构 * NVIDIA(英伟达)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对高阶优化器在大规模语言模型预训练中的挑战,通过改进预处理梯度方法、统一实证研究不同优化器、引入分层分布式优化器及系统级改进,提升训练效果,最终发布含新兴优化算法的代码库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19992 2026-07-23 cs.CL cs.AI cs.DL cs.HC 新提交 88%

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

TINY_SCHILLER:用于小语言模型的即插即用德语戏剧语料库

Mark Schutera

机构 * Duale Hochschule Baden-Württemberg Ravensburg(巴登-符腾堡双元制应用技术大学 Ravensburg)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对德语文学文本在小语言模型相关应用的空白,提出Tiny_schiller语料库,经特定处理,可通过单文件和一行代码让小语言模型接触德语文学文本,填补了相关研究和应用的空白。

Comments 5 pages. Dataset: https://huggingface.co/datasets/mrkschtr/tiny_schiller ; Code: https://github.com/schutera/tiny_schiller

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09204 2026-07-13 cs.CL cs.LG 新提交 88%

Complexity-Guided Component-wise Initialization for Language Model Pretraining

用于语言模型预训练的复杂度引导的逐组件初始化

Konstantin Garbers, Nicholas Oh

机构 * Peking University(北京大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 研究预训练语言模型中反复出现的谱模式能否用于初始化,通过分析多个检查点构建初始化方案并与其他方法比较,发现预训练权重复用有竞争力,但仅粗略谱匹配非可靠策略,预训练谱是有用诊断,有效复用需保留更多信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05552 2026-07-08 cs.CL cs.AI cs.CY 新提交 88%

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

大语言模型的是非偏差反映答案顺序和措辞,而非道德判断的转变

Haonan Huang

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在道德困境判断中的是非偏差,通过交叉对称化等心理测量方法区分逻辑判断、词汇等因素,发现前沿模型立场与形式无关,部分模型存在顺序和词汇偏差,最小模型可总结伪像,强调跨框架测量模型重视内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13873 2026-06-15 cs.LG cs.CL 新提交 88%

Natively Unlearnable Large Language Models

原生不可学习的大语言模型

Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出NULLs模型,通过共享骨干和稀疏激活的sinks分离数据源贡献,实现无需梯度更新的高效遗忘,在维基百科上验证了单篇文章遗忘的有效性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11081 2026-06-10 cs.LG cs.AI 新提交 88%

Unifying Local Communications and Local Updates for LLM Pretraining

统一大语言模型预训练中的本地通信与本地更新

Pietro Cagnasso, Eugene Belilovsky, Edouard Oyallon

机构 * Concordia University(康考迪亚大学) Mila CNRS, Sorbonne University(法国国家科学研究中心,索邦大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);分类 cs.AI、cs.LG

AI总结 提出GASLoC算法,通过去中心化训练框架统一本地通信与更新,在异构带宽下优于DiLoCo,支持自适应优化器和多本地步骤。

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01104 2026-07-02 cs.LG cs.AI cs.CL 新提交 88%

CausalMix: Data Mixture as Causal Inference for Language Model Training

CausalMix: 数据混合作为语言模型训练的因果推断

Zinan Tang, Yukun Zhang, Shaomian Zheng, Zhuoshi Pan, Qizhi Pei, Dingnan Jin, Jun Zhou, Yujun Wang, Biqing Huang

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20521 2026-06-19 cs.CV 新提交 88%

HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining

HumanScale: 以自我为中心的人类视频在具身预训练中可超越真实机器人数据

Juncheng Ma, Jianxin Bi, Yufan Deng, Xuanran Zhai, Kewei Zhang, Ye Huang, Bo Liang, Shukai Gong, Jiankai Tu, Xiaotian Tang, Jiaxin Li, Kaiqi Chen, Duomin Wang, Yuqi Wang, Bingyi Kang, Eric Huang, Zhiyang Dou, Zhen Dong, Enze Xie, Wojciech Matusik, Tat-Seng Chua, Daquan Zhou

机构 * PKU(北京大学) NUS(新加坡国立大学) MIT(麻省理工学院) UCSB(加州大学圣塔芭芭拉分校) NVIDIA(英伟达)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文通过系统比较发现,经过精心设计的过滤和标注流程,以自我为中心的人类视频在具身基础模型预训练中不仅可行,而且性能优于遥操作真实机器人数据,验证了“预训练于人类视频+少量机器人数据适配”的可扩展范式。

Comments Github: https://github.com/DAGroup-PKU/HumanNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20005 2026-08-21 cs.LG 新提交 88%

Scale-Aware Pretraining of Time Series Foundation Models via Multi-Patch Token Alignment and Hybrid Masking

基于多补丁令牌对齐与混合掩码的时间序列基础模型尺度感知预训练

Taihua Chen, Xiang Ma, Yixin Zhang, Tailin Zhan, Manyu Sun, Lizhen Cui

机构 * School of Software, Shandong University(山东大学软件学院) Joint SDU–NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University(山东大学-南洋理工大学人工智能联合研究中心(C-FAIR)) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文针对时间序列基础模型预训练中处理不同采样频率的问题,提出SATS方法,通过尺度感知令牌对齐与混合掩码策略实现最优性能,同时提升模型效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13515 2026-08-14 cs.CL 新提交 88%

Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining

测量语言模型预训练中与任务无关的训练数据影响

Yuto Nishida, Hirokazu Kiyomaru, Yusuke Oda, Takashi Kodama, Chaoran Liu, Daisuke Kawahara, Yusuke Miyao, Max Müller-Eberstein, Masaru Isonuma

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Waseda University(早稻田大学) The University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根信息技术大学) Tohoku University(东北大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 本文提出无需依赖下游任务或验证集的训练数据影响度量方法,经实验发现预训练中有影响力的数据存在时间变化,早期文献相关数据、后期STEM数据与最终参数轨迹的一致性更强。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13101 2026-08-14 cs.CL eess.AS 新提交 88%

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

CASA:结合语音编码器与大语言模型的内容-语音口语评估

Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo

机构 * Aalto University(阿尔托大学) University of Helsinki(赫尔辛基大学) Walton Institute(沃尔顿研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。

Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12762 2026-08-14 cs.AI 新提交 88%

PROVE-RT: Generating Mechanized Theorem Prover Scripts for Real-Time Systems using LLMs

PROVE-RT:使用大语言模型为实时系统生成机械化定理证明器脚本

Sadat Shahriyar, Shareef Ahmed, Abdullah Al Arafat

机构 * Florida International University(佛罗里达国际大学) University of South Florida(南佛罗里达大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 PROVE-RT是一种LLM辅助框架,通过依赖感知草图、PROSA文档检索等步骤生成PROSA/ROCQ脚本,在1191篇实时系统论文构建的语料库上,其机械化可调度性分析的成功率达44.7%,优于直接提示的LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10214 2026-08-12 cs.AI 新提交 88%

Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

可解码但不可分离:训练数据粒度决定大语言模型的参数模块化

Marcus Armstrong, Navid Ayoobi, Arjun Mukherjee

机构 * University of Houston(休斯顿大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究探讨大语言模型是否存在特定领域参数壳,通过多模型、多领域实验发现训练数据的标记级模块化是参数壳形成的关键,为大语言模型的参数模块化研究提供了核心结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09424 2026-08-11 cs.CL 新提交 88%

Reducing Pretraining-Generation Mismatch in Diffusion Language Models

减少扩散语言模型中的预训练-生成不匹配

Xiaocheng Lu, Huabin Liu, Song Guo, Jianguo Li

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。

Comments 12 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03733 2026-08-05 cs.AI 新提交 88%

Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

面向多模态大语言模型自我改进的故障感知图像自增强

Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18927 2026-07-22 cs.AI 新提交 88%

OntoBook: Ontology-Grounded Synthetic Textbooks for Medical Encoder Pretraining

OntoBook:用于医学编码器预训练的基于本体的合成教科书

Rian Touchent, Éric de la Clergerie

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract,journal_ref);language model(abstract,journal_ref);LLM(abstract)

AI总结 研究提出OntoBook方法,将医学本体结构转为预训练信号,经随机游走、大语言模型重述等三阶段,用生成文本训练法语编码器,在多基准测试中有显著改进,强调目标对齐必要,还发布了相关教科书与模型检查点。

Journal ref Proceedings of Knowledge Graphs and Large Language Models Workshop, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18413 2026-07-22 cs.CL 新提交 88%

Convolution for Large Language Models

大语言模型中的卷积

Yuchuan Tian, Yingte Shu, Wei He, Shuo Zhang, Tianchen Zhao, Chao Xu, Xinghao Chen, Yunhe Wang, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型中,轻量级深度卷积能否在不大幅增模型大小的情况下提供局部归纳偏差。通过实验发现特定位置应用卷积效果最佳,采用特定残差深度卷积设计,在多个模型和数据预算下提升了下游基准平均准确率,支持其作为自注意力补充建模短程交互。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14703 2026-07-17 cs.CV cs.AI 新提交 88%

Pretraining Multiple Instance Learning Networks with Multi-Teacher Distillation from Pathology Slide Foundation Models

基于病理切片基础模型的多教师蒸馏预训练多实例学习网络

Mingxi Fu, Jiawen Li, Renao Yan, Jiali Hu, Qiehe Sun, Tian Guan, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Washington(华盛顿大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Medical Optical Technology R&D Center, Research Institute of Tsinghua(清华研究院医学光学技术研发中心) Jinfeng Laboratory(金凤实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 针对计算病理学中多实例学习存在的问题,提出基于蒸馏的预训练框架,利用两个基础模型作为教师,引入角分散归一化蒸馏损失,将蒸馏权重用于下游适应,实验表明该方法在少样本场景中优势明显,能提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03925 2026-07-07 cs.LG 新提交 88%

NeuroOnline: Bridging Pretraining and Online Adaptation for EEG Foundation Models

NeuroOnline:为脑电图基础模型搭建预训练与在线适应的桥梁

Weibin Li, Wendu Li, Yushan You, Chen Wei, Quanying Liu

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究脑电图基础模型,提出NeuroOnline框架,集成多视图一致性学习和上下文感知表示调制机制,统一表示对齐和动态适应,实验表明其在在线设置中性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13254 2026-06-12 cs.CL 新提交 88%

Evaluating Pluralism in LLMs through Latent Perspectives

通过潜在视角评估LLM中的多元主义

Laura Majer, Jan Šnajder, Martin Tutek

机构 * University of Helsinki(赫尔辛基大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 提出一种领域无关的多层无监督框架,从LLM生成文本中提取潜在视角,评估多元主义差距,发现稀有视角仍被不成比例地低估。

Comments Pluralistic Alignment Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07590 2026-06-09 cs.CV cs.AI 新提交 88%

SlideCheck: Guiding Self-Supervised Pretraining of Pathology Foundation Models via Dataset Distributions

SlideCheck: 通过数据集分布引导病理基础模型的自监督预训练

Mingyi He, Xinyi Guo, Xitong Ling, Weiming Chen, Jiawen Li, Lianghui Zhu, Minxi Ouyang, Mingxi Fu, Yizhi Wang, Tian Guan

机构 * Beijing University of Chemical Technology(北京化工大学) South China Normal University(华南师范大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 提出SlideCheck工具,利用冻结病理基础模型的特征,通过双头MLP评分异常和恶性证据,引导自监督预训练数据筛选,实验表明数据分布影响模型下游性能。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15195 2026-08-18 cs.CV 新提交 88%

Beyond Natural-Image Foundation Models: Benchmarking Satellite Pretraining for Ophthalmic Image Analysis

超越自然图像基础模型:针对眼科图像分析的卫星图像预训练基准测试

Lovre Antonio Budimir, Mingya Alexa Gong, Alyssa Foong Quinney, Ivana Matovinović, Yukun Zhou, Pearse A. Keane, Sven Lončarić, Marinko V. Šarunić

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算机学院) University College London(伦敦大学学院) Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) Department of Computer Science, University College London(伦敦大学学院计算机科学系) NIHR Moorfields Biomedical Research Centre(NIHR穆尔菲尔德生物医学研究中心) Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) Moorfields Eye Hospital NHS Foundation Trust(穆尔菲尔德眼科医院NHS基金会信托)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 本文针对眼科图像分析,对比卫星图像与自然图像预训练的视觉基础模型,发现卫星图像预训练在眼科任务上表现优于自然图像,部分任务可媲美医学专家模型。

Comments Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MEDFMB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16747 2026-08-18 cs.LG cs.AI 新提交 88%

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释

Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks

机构 * Anthropic

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11232 2026-08-13 cs.CL cs.AI 新提交 88%

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试

Ruoxi Zhao, Maziar Raissi

机构 * University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。

Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24717 2026-07-28 cs.CL cs.AI 新提交 88%

DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data

数据编排器:学习编排预训练数据的示例级整理

Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对预训练数据处理未适应各示例需求的问题,提出DataOrchestra框架,统一处理操作并为每个示例编排特定管道,经实验验证该框架在多基准测试中表现良好,在数学持续预训练中有效且能减少计算。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22769 2026-07-28 cs.LG cs.AI 新提交 88%

DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning

DomainPilot:用于高效语言模型微调的域级损失引导两阶段数据混合优化

He Zhang

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);SFT(abstract)

AI总结 研究针对大语言模型训练数据问题,提出DomainPilot框架,通过域级损失引导两阶段数据混合优化,经令牌级监测、缩放与混合定律引导优化,在Qwen3-1.7B模型微调中验证,有效提升指标且不增成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19168 2026-06-18 cs.AI cs.LG 新提交 88%

Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection

超越安全数据:具有正则安全反射的预训练阶段对齐

Jinhan Li, Kexian Tang, Yihan Xu, Zhuorui Ye, Kaifeng Lyu

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出安全反射预训练方法,在预训练语料中插入安全反思,使模型具备自我监控能力,实验表明该方法能有效降低推理和微调攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15396 2026-06-16 cs.CL cs.AI 新提交 88%

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

CHILLGuard:面向细粒度中文大语言模型安全护栏的可扩展数据构建与模型感知偏好对齐

Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen ShenNong Information Technology Co., Ltd.(深圳神农信息技术有限公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对中文场景,提出细粒度风险分类体系(5大类31小类),通过可扩展数据构建管道生成高质量训练数据,并采用模型感知直接偏好优化训练CHILLGuard,在基准上F1分数提升15.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09861 2026-06-10 cs.LG cs.AI 新提交 88%

Time Series as Language: A Universal Tokenizer for General-Purpose Time Series Foundation Models

时间序列作为语言:通用时间序列基础模型的通用分词器

Yunhao Zhang, Ruiying Qi, Jiale Zheng, Jianfeng Zhang, Lujia Pan, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出UniTok通用分词器将时间序列转化为离散令牌,并基于NTP预训练UniTok-FM基础模型,支持零样本预测、提示增强预测以及少样本生成和分类,无需任务特定修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07522 2026-06-09 cs.CL cs.LG cs.SI 新提交 88%

Community-Specific Slang and Entity Detection via Semantic Shift in Fine-Tuned Language Models

通过微调语言模型中的语义偏移检测社区特定俚语和实体

Julia Kruk, Sanchita Porwal, Amitrajit Bhattacharjee, Mansi Phute

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出无监督方法,通过测量词在微调前后的语义偏移幅度,从在线社区文本中自动识别俚语、独特实体和民俗用语。

Comments 6 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏