arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2603.11784 2026-07-07 cs.LG stat.ML 版本更新 77%

Language Generation with Replay: A Learning-Theoretic View of Model Collapse

带重放的语言生成:模型崩溃的学习理论视角

Giorgio Racca, Michal Valko, Amartya Sanyal

机构 * University of Copenhagen(哥本哈根大学) Isara Labs(Isara实验室)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究随着前沿大语言模型训练对数据需求增加,生成文本可能重入训练语料库致模型崩溃的问题。通过语言生成极限框架,引入重放对手,刻画重放何时限制生成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30460 2026-07-01 cs.LG cs.DC 版本更新 77%

HSAP: A Hierarchical Sequence-aware Parallelism for Hybrid-Context Generative Models

HSAP: 一种面向混合上下文生成模型的分层序列感知并行方法

Songxin Zhang, Zejian Xie, Zhuoyang Song, Cong lin, Junyu Lu, Jiaxing Zhang, Bingyi Jing

机构 * Southern University of Science and Technology(南方科技大学) International Digital Economy Academy(国际数字经济学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出一种分层序列感知并行框架,通过JIT编译优化通信策略,解决混合上下文打包序列中的因果注意力计算问题,在多个指标上优于现有方法。

Comments 10 pages, ACL preprint style

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21608 2026-06-30 cs.CL 77%

MixSarc: A Bangla-English Code-Mixed Corpus for Implicit Meaning Identification

MixSarc:一种用于隐含意义识别的孟加拉-英语混合语料库

Kazi Samin Yasar Alam, Md Tanbir Chowdhury, Tamim Ahmed, Ajwad Abrar, Md Rafid Haque

机构 * Department of Computer Science and Engineering, Islamic University of Technology, Dhaka, Bangladesh(伊斯兰科技大学计算机科学与工程系,达卡,孟加拉国) Department of Computer Science, University of Illinois Chicago, Chicago, Illinois, United States of America(伊利诺伊大学芝加哥分校计算机科学系,芝加哥,伊利诺伊州,美国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 MixSarc通过构建首个孟加拉-英语混合语料库,解决隐含意义识别中的多语言切换与文化差异问题,验证了模型在幽默检测上的有效性,但发现讽刺等类别因不平衡和复杂性而表现欠佳。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16028 2026-06-30 cs.CR cs.LG cs.SE 77%

ANVIL: Anomaly-based Vulnerability Identification without Labelled Training Data

ANVIL:无需标记训练数据的基于异常的漏洞识别

Weizhou Wang, Eric Liu, Xiangyu Guo, Xiao Hu, Ilya Grishchenko, David Lie

机构 * University of Toronto(多伦多大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ANVIL,通过将漏洞检测转化为异常检测,利用大语言模型对代码进行掩码重建,结合多种指标提升检测性能,在PrimeVul数据集上优于现有监督检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13491 2026-06-23 cs.IT cs.LG math.IT math.ST stat.TH 版本更新 77%

From Zipf's Law to Neural Scaling through Heaps' Law and Hilberg's Hypothesis

从齐普夫定律到神经缩放:通过希普斯定律和希尔伯格假设

Łukasz Dębowski

机构 * Institute of Computer Science, Polish Academy of Sciences(波兰科学院计算机科学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文系统揭示了神经缩放定律与齐普夫定律之间的演绎关系,通过推导词汇增长的希普斯定律和熵缩放的希尔伯格假设,证明神经缩放定律是齐普夫定律在广泛假设下的推论。

Comments 32 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18663 2026-06-18 cs.CL 新提交 77%

RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories

RegMix-D: 通过代理训练轨迹实现动态数据混合

Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出RegMix-D,通过代理训练轨迹预测多阶段最优混合比例,实现动态数据混合,在13个下游任务上优于RegMix和DoReMi,且代理计算预算仅为RegMix的25%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11875 2026-06-11 cs.CL cs.SD 新提交 77%

I Understand How You Feel: Enhancing Deeper Emotional Support Through Multilingual Emotional Validation in Dialogue System

我理解你的感受:通过对话系统中的多语言情感验证增强深层情感支持

Zi Haur Pang, Yahui Fu, Koji Inoue, Tatsuya Kawahara

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出情感验证在对话系统中的应用,构建多语言语料库M-EDESConv和测试集M-TESC,设计多语言情感感知门控单元MEGUMI进行时机检测,并评估当前LLM在情感验证响应生成中的表现。

Comments This paper has been accepted for presentation at SIGdial Meeting on Discourse and Dialogue 2026 (SIGDIAL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11304 2026-06-11 physics.ins-det cs.LG hep-ex hep-ph 新提交 77%

SPADE: Split-and-Delay Embeddings for Autoregressive High-Granularity Calorimeter Simulation

SPADE: 用于自回归高粒度量热器模拟的分裂与延迟嵌入

Joschka Birk, Frank Gaede, Anna Hallin, Gregor Kasieczka, Martina Mozzanica, Henning Rose

机构 * Institute for Experimental Physics, Universität Hamburg(实验物理研究所,汉堡大学) Deutsches Elektronen-Synchrotron DESY(德国电子同步辐射光源DESY)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 提出SPADE自回归变压器,通过独立嵌入多特征令牌并延迟特征流,利用标准自注意力学习令牌内相关性,在ILD探测器点云簇射生成中优于现有模型。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08729 2026-06-09 cs.RO cs.LG 新提交 77%

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking

IR-SIM:一种用于导航、学习和基准测试的轻量级技能原生模拟器

Ruihua Han, Shuai Wang, Chengyang Li, Rui Gao, Xinyi Wang, Zhe Liu, Guoliang Li, Yupu Lu, Qi Hao, Jia Pan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出轻量级技能原生导航模拟器IR-SIM,通过YAML配置完全定义场景,支持文本提示生成与修改,用于导航算法基准测试和训练数据自动生成,并桥接高保真模拟器和真实部署。

Comments 12 pages, 6 figures, project website: https://github.com/hanruihua/ir-sim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08025 2026-06-09 cs.CL 新提交 77%

Arabic Sentence Segmentation Across Genres and Punctuation Conditions

跨体裁与标点条件下的阿拉伯语句子分割

Mohammed Elkholy, Khalid N. Elmadani, Nizar Habash, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对阿拉伯语标点歧义和不一致导致的句子分割难题,构建跨8种体裁的语料库AraSEG,评估LLM、轻量编码器和依存解析器,发现轻量模型在困难设置下优于LLM,且准确分割能显著提升下游依存解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20329 2026-06-05 cs.CV cs.AI 77%

Image Generators are Generalist Vision Learners

图像生成器是通用视觉学习者

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut

机构 * Google(谷歌)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。

Comments Project Page: http://vision-banana.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04401 2026-06-04 cs.LG 77%

TANDEM: Bi-Level Data Mixture Optimization with Twin Networks

TANDEM: 基于孪生网络的双层数据混合优化

Jiaxing Wang, Deping Xiang, Jin Xu, Mingyang Yi, Guoqiang Gong, Zicheng Zhang, Haoran Li, Pengzhang Liu, Zhen Chen, Ke Zhang, Ju Fan, Qixiang Jiang

机构 * JD.com(京东公司) University of Oxford(牛津大学) Renmin University of China(中国人民大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TANDEM方法,通过孪生网络(代理模型和参考模型)的差异衡量数据效用,优化领域混合比例,在数据受限和监督微调等场景中显著提升大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04025 2026-06-04 cs.SE cs.AI 77%

The Biomimetic Architecture of Software 4.0

软件4.0的仿生架构

Philip Sheldrake, Dirk Scheffler

机构 * Unnamed Labs Amsterdam(阿姆斯特丹无名实验室) Unnamed Labs Karlsruhe(卡尔斯鲁厄无名实验室)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出软件4.0范式,通过自创生异质架构融合人类智能、神经AI与反射符号基底,解决概率-符号阻抗不匹配问题,并介绍实现该架构的编程语言Recognitive。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23420 2026-06-04 cs.AI 77%

Bilevel Autoresearch: Meta-Autoresearching Itself

双层自动研究:元自动研究自身

Yaonan Qu, Meng Lu

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 提出双层自动研究框架,外层循环通过读取内层循环代码和轨迹、识别瓶颈并注入可执行Python搜索机制来改进内层循环,在GPT预训练基准上实现5倍改进。

Comments 16 pages, 5 figures, 3 tables. v2 expands the framing as mechanism-level agentic self-improvement and updates related work and limitations; core method and experiments unchanged. This paper was primarily drafted by AI agents with human oversight and direction

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20213 2026-06-03 cs.SE cs.AI cs.CR 77%

CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming Solutions

CodeHacker: 用于检测竞赛编程解决方案漏洞的自动化测试用例生成

Jingwei Shi, Xinxiang Yin, Jing Huang, Jinman Zhao, Shengyu Tao

机构 * Shanghai University of Finance and Economics(上海金融学院) Northwestern Polytechnical University(西北工业大学) Meituan(美团) University of Toronto(多伦多大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CodeHacker框架,通过多策略对抗测试用例生成(压力测试、反哈希攻击、逻辑特定攻击)和校准阶段,有效暴露程序漏洞,提升测试集真负率并增强RL训练模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01207 2026-06-02 cs.CV cs.LG 77%

Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning

特征对齐决定融合策略:多模态学习中交叉注意力与拼接的比较研究

Zhiqiang Zhou, Xuezhen Xie

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化学工业职业技术学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 通过实验和理论分析,证明特征对齐质量而非数据规模是决定多模态融合策略优劣的关键因素,当特征预对齐时拼接优于交叉注意力。

Comments 8 pages,6 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01062 2026-06-02 cs.AI 77%

DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts

DAG-MoE:从简单混合到专家混合中的结构聚合

Jiarui Feng, Hanqing Zeng, Karish Grover, Ruizhong Qiu, Yinglong Xia, Qiang Zhang, Qifan Wang, Ren Chen, Dongqi Fu, Jiayi Liu, Zhoukai Zhao, Xiangjun Fan, Benyu Zhang, Yixin Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出DAG-MoE框架,通过轻量级模块自动学习选定专家之间的最优聚合结构,以替代标准加权求和聚合,从而在不改变专家或路由器的情况下扩展专家组合空间并实现单层多步推理,在预训练和微调中均优于传统MoE基线。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00683 2026-06-02 cs.CL 77%

OCC-RAG: Optimal Cognitive Core for Faithful Question Answering

OCC-RAG:面向忠实问答的最优认知核心

Maksim Savkin, Mikhail Goncharov, Alexander Gambashidze, Alla Chepurova, Dmitrii Tarasov, Nikita Andriianov, Daria Pugacheva, Vasily Konovalov, Andrey Galichin, Ivan Oseledets

机构 * OCC Team(OCC团队)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);SLM(abstract_cn);分类 cs.CL

AI总结 提出OCC-RAG,一种通过多上下文多跳合成数据训练的小语言模型,在忠实问答任务中匹配或超越2-6倍规模通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12081 2026-06-02 cs.IR cs.LG 77%

From Scaling to Structured Expressivity: Rethinking Transformers for CTR Prediction

从规模到结构化表达能力:重新思考用于CTR预测的Transformer

Bencheng Yan, Yuejie Lei, Zhiyuan Zeng, Zheye Deng, Di Wang, Kaiyi Lin, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对CTR预测中Transformer模型因结构错位导致收益递减的问题,提出Field-Aware Transformer (FAT),通过场感知参数重构和基组合超网络实现结构化表达能力,在理论(Rademacher复杂度标度律)和实验(AUC提升+4.38%,线上CTR+2.33%,RPM+0.66%)上均优于现有方法。

Comments KDD 2026; The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30288 2026-06-01 cs.AI 77%

MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

MIRA: 基于自锚定评分标准的中期训练源感知数据选择

Haowen Wang, Yaxin Du, Jian Yang, Jiajun Wu, Shukai Liu, Yuxuan Zhang, Pingjie Wang, Siheng Chen, Tuney Zheng, Ming Zhou, Xianglong Liu, Bryan Dai

机构 * Beihang University(北洋大学) IQuest Research(IQuest研究院) Shanghai Jiao Tong University(上海交通大学) University of British Columbia(不列颠哥伦比亚大学) Langboat Multilingual-Multimodal-NLP/mira(Langboat多语言-多模态-NLP/mira)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);post-training(abstract);分类 cs.AI

AI总结 针对中期训练中异构数据源的选择问题,提出MIRA框架,通过自锚定评分标准发现和可扩展的学生评分器,在代码中期训练中仅用一半token即可匹配全语料性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28184 2026-05-28 cs.LG 77%

Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

通过最优系数校准在强化学习中联合训练多令牌预测

Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文从优化角度分析多令牌预测与强化学习联合训练失败的原因,提出最优系数校准方法,通过在线跟踪最优系数实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24296 2026-05-27 cs.AI cs.IR 77%

When Does Synthetic Patent Data Help? Volume-Fidelity Trade-offs in Low-Resource Multi-Label Classification

合成专利数据何时有帮助?低资源多标签分类中的数量-保真度权衡

Amirhossein Yousefiramandi, Ciaran Cooney

机构 * Clarivate, Intellectual Property(Clarivate知识产权)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究通过LLM生成合成数据用于多标签专利分类时的数量与保真度权衡,发现低资源场景下数量效应主导,高资源场景下保真度更重要,混合数据策略最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20527 2026-05-14 cs.LG 77%

RMNP: Row-Momentum Normalized Preconditioning for Scalable Matrix-Based Optimization

RMNP:基于行动量归一化的可扩展矩阵优化预条件化

Shenyang Deng, Zhuoli Ouyang, Tianyu Pang, Zihang Liu, Ruochen Jin, Shuhua Yu, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) International Computer Science Institute(国际计算机科学研究所) University of California, Berkeley(加州大学伯克利分校) Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 RMNP通过行归一化替代牛顿-施卢茨迭代,提升预条件化效率,保持优化性能,实验显示其在大语言模型预训练中表现优异。

Comments The 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09189 2026-05-12 cs.LG 77%

Practical Scaling Laws: Converting Compute into Performance in a Data-Constrained World

实用的扩展定律:在数据受限的世界中将计算转化为性能

Christopher M. Bryant, Hao Liu

机构 * Arena Physica

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种新的扩展定律公式,用于在数据受限条件下更准确地预测模型性能,通过分解损失为欠容量、欠训练和过拟合项,改进了传统扩展定律的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20941 2026-04-29 cs.LG 77%

Revisiting the Past: Data Unlearning with Model State History

重访过去:利用模型状态历史的数据遗忘

Keivan Rezaei, Mehrdad Saberi, Abhilasha Ravichander, Soheil Feizi

机构 * Department of Computer Science, University of Maryland(大学马里兰大学计算机科学系) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出MSA算法,通过利用预训练过程中的模型检查点来估计并抵消特定数据点的影响,实验证明其在多个基准、模型和评估指标上表现优异,为更灵活的数据擦除大型语言模型提供有效方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14944 2026-04-21 cs.CL 77%

The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations

GDN-CC数据集:用于AI增强的民主公民咨询的自动语料库澄清

Pierre-Antoine Lequeu, Léo Labat, Laurène Cave, Gaël Lejeune, François Yvon, Benjamin Piwowarski

机构 * Sorbonne Université, CNRS, ISIR, Paris, France(索邦大学,法国国家科学研究中心,ISIR研究所,巴黎,法国) Sorbonne Université, STIH/CERES, Paris, France(索邦大学,STIH/CERES,巴黎,法国) Institut Polytechnique de Paris, CNRS, CREST, Paris, France(巴黎政治学院,法国国家科学研究中心,CREST,巴黎,法国)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文提出GDN-CC数据集,通过自动语料库澄清技术标准化公民贡献,提升话题建模和政治分析效果,并展示小型语言模型在注释任务中的表现。

Comments 31 pages including 22 for references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15350 2026-04-20 cs.LG 77%

The Spectral Geometry of Thought: Phase Transitions, Instruction Reversal, Token-Level Dynamics, and Perfect Correctness Prediction in How Transformers Reason

思维的谱几何:相变、指令反向、令牌级动态以及完美正确性预测在Transformer推理中的表现

Yi Liu

机构 * DeepSeek-R1(深Seek-R1) Qwen(通义千问) Pythia Llama

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.LG

AI总结 研究通过系统谱分析发现,大语言模型在推理与事实回忆时在隐藏激活空间中表现出谱相变现象,揭示了推理的谱压缩、指令调谐的谱反向等七种核心现象,建立了一套关于Transformer推理的谱理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24538 2026-04-17 cs.CL 77%

Dark & Stormy: Modeling Humor in Sentences from the Bulwer-Lytton Fiction Contest

黑暗与暴风雨:从布勒-拉托尔小说竞赛中句子中建模幽默

Venkata S Govindarajan, Laura Biester

机构 * Department of Computer Science, Ithaca College(伊萨卡学院计算机科学系) Department of Computer Science, Middlebury College(梅德福学院计算机科学系)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文通过分析布勒-拉托尔小说竞赛中的新语料库,研究英语中'坏'幽默的特征,发现传统幽默检测模型表现不佳,LLM在生成竞赛风格句子时形式模仿但效果夸大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10952 2026-04-14 cs.LG 77%

UniPROT: Uniform Prototype Selection via Partial Optimal Transport with Submodular Guarantees

UniPROT: 通过部分最优传输与子模性保证的统一原型选择

Prateek Chanda, Prayas Agrawal, Karthik S. Gurumoorthy, Ganesh Ramakrishnan, Bamdev Mishra, Pratik Jawanpuria

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Centre for Machine Intelligence and Data Science, Indian Institute of Technology Bombay(印度理工学院孟买分校机器智能与数据科学中心) Microsoft Research India(微软研究院印度) Walmart Global Tech, India(沃尔玛全球技术印度) Microsoft India(微软印度)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 UniPROT通过部分最优传输和子模性保证,解决原型选择中的类别不平衡问题,提升少数类表现而不影响多数类准确性。

Comments 25 pages, 31 figures. Accepted as a poster at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14410 2026-04-14 cs.CL 77%

BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction Generation

BiT-MCTS:一种基于主题的双向MCTS方法用于中文小说生成

Zhaoyi Li, Xu Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) School of Foreign Languages, Peking University(北京大学外国语学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BiT-MCTS方法,通过主题驱动策略生成结构化小说,提升叙事连贯性和主题深度。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏