arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-19 至 2026-08-19 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 22 篇

2608.18033 2026-08-19 stat.ML cs.LG 新提交 94%

Where A Small Language Model Helps in Invoice Categorisation, Understood Through Embedding Geometry

小型语言模型在发票分类中的作用:通过嵌入几何分析的理解

Emma Ceccherini, Daniel Lawson, Anjulika Salhan

专题命中 预训练与数据 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract)

AI总结 研究通过分析SBERT和DeBERTa的嵌入几何,发现内部微调的SBERT在发票分类中表现优于零-shot LLM,且特定客户发票数据可提升其泛化性能,同时揭示结构化输入对SLM无帮助的反直觉结论。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03570 2026-08-19 cs.CL 版本更新 90%

How Do Large Language Models Learn Concepts During Continual Pre-Training?

大型语言模型在持续预训练中如何学习概念?

Barry Menglong Yao, Sha Li, Yunzhi Yao, Minqian Liu, Zaishuo Xia, Qifan Wang, Lifu Huang

机构 * UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) UCLA(加州大学洛杉矶分校) Meta AI

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);pretraining(abstract)

AI总结 本研究揭示了大型语言模型在持续预训练中概念学习的动态机制,通过分析概念电路揭示了概念获取、遗忘及相互作用的规律,为设计更可解释的训练策略提供依据。

Comments 19 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17268 2026-08-19 cs.LG cs.AI 新提交 90%

Understanding Curriculum Learning in Large Language Models via Cross-Difficulty Optimization Dynamics

基于跨难度优化动力学的大语言模型课程学习理解

Zhikai Ding, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析不同课程调度的优化动力学,提出衡量跨难度知识迁移的Relative Transfer指标,据此推导TDCS方法,经多推理基准实验证明其性能优于代表性调度策略,为课程学习提供统一优化解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17501 2026-08-19 cs.AI cs.LG 新提交 89%

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

SGHA:基于证据的研究问题发现,使用本地语言模型

Sarvesh Gharat, Junpei Komiyama

机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。

Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17521 2026-08-19 cs.CV 新提交 88%

BrainNorm: A Foundation Model that knows Normal via Semantic Atlas Pretraining

BrainNorm:一种通过语义图谱预训练了解正常状态的基础模型

Madhumitha Venkatesh, Shanawaj S Madarkar, Konda Reddy Mopuri

机构 * Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 该研究提出BrainNorm基础模型,经约6.6万例T1w sMRI数据训练,通过语义图谱预训练学习规范表征,在多类下游任务上泛化性能优异,其识别的神经退行性偏差与临床病理吻合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22782 2026-08-19 cs.CV 版本更新 88%

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

Know3D: 通过视觉-语言模型的知识提示3D生成

Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng, Rongfei Jia, Yuan Liu, Ronggang Wang

机构 * Peking University(北京大学) Math Magic(数学魔术) The Hong Kong University of Science and Technology(香港科学与技术大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) Dalian University of Technology(大连理工大学)

专题命中 预训练与数据 :language model(title,abstract);prompting(title);large language model(abstract)

AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。

Comments ECCV2026 page: https://xishuxishu.github.io/Know3D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31156 2026-08-19 cs.LG 版本更新 87%

TabCausal: Pretraining Across Causal Environments for Tabular Causal Discovery

TabCausal: 跨因果环境的表格因果发现预训练

Zi-Rong Li, Si-Yang Liu, Tian-Zuo Wang, Han-Jia Ye

机构 * Nanjing University(南京大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 提出TabCausal,一种通过动态任务构建策略在多样化因果环境中进行大规模预训练的因果发现基础模型,在合成和语义基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-08-19 cs.CL cs.AI cs.LG 版本更新 87%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, Liangxu Zhang, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17957 2026-08-19 cs.LG 新提交 84%

Understanding the Surprising Generalization Properties of Tabular Foundation Models

表格基础模型的出人意料的泛化特性研究

Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini

机构 * Polytechnique Montréal(蒙特利尔理工学院) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Chandar Research Lab(钱达尔研究实验室) University of Toronto(多伦多大学) Layer 6 AI(第六层人工智能公司) Prior Labs(普里奥实验室) ELLIS Institute Tübingen(埃利斯研究所图宾根分部) University of Freiburg(弗赖堡大学) Cohere(科here公司)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究揭示仅在单个真实表格上预训练的TFMs有强迁移性,提出以任务为中心、基于检索的新视角,为TFMs的模型与语料库设计提供了新框架。

Comments This work extends our previous work, Generalization Can Emerge in Tabular Foundation Models From a Single Table (arXiv:2511.09665)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22533 2026-08-19 cs.LG cs.AI quant-ph 版本更新 82%

TabularQGAN: A quantum generative model for tabular data synthesis

TabularQGAN:一种用于表格数据合成的量子生成模型

Pallavi Bhardwaj, Caitlin Jones, Lasse Dierich, Aleksandar Vučković

机构 * SAP SE(SAP公司) BASF Digital Solutions(巴斯夫数字解决方案) QUTAC Quantum Technology and Application Consortium(QUTAC量子技术与应用联盟) Technical University of Munich CIT(慕尼黑技术大学CIT) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Merck KGaA(默克公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出新型量子生成对抗网络TabularQGAN,针对异构表格数据建模,在MIMIC-III等数据集上与经典及LLM方法对比,取得有竞争力甚至领先的合成性能,验证了其泛化能力。

Comments 19 pages,8 figures and 4 tables

Journal ref Sci. Rep. 16, 23555 (2026)1-19

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20817 2026-08-19 cs.CL cs.AI cs.LG 版本更新 82%

Convergent Evolution: How Different Language Models Learn Similar Number Representations

趋同进化:不同语言模型如何学习相似的数字表示

Deqing Fu, Tianyi Zhou, Mikhail Belkin, Vatsal Sharan, Robin Jia

机构 * University of Southern California(南加州大学) UC San Diego(圣地亚哥大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了不同语言模型如何通过不同训练信号学习相似的数字表示,揭示了特征学习中的趋同进化现象。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17187 2026-08-19 stat.ME stat.OT 新提交 80%

Identifying Model Quality Effects on User Engagement: A Within-Version Causal Estimator with Synthetic Data Validation

识别模型质量对用户参与度的影响:一种结合合成数据验证的版本内因果估计器

John Tribbia

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM模型更新与用户参与度的因果识别难题,提出结合合成数据验证的版本内因果估计器,经衰减调整后可准确估计模型质量对参与度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17722 2026-08-19 cs.CR cs.LG 新提交 79%

MemCatalyst: Amplifying Data Auditing on Vision-Language Models via Data Poisoning

MemCatalyst:通过数据投毒增强视觉-语言模型的数据审计

Xukun Luan, Jinyan Liu, Yuhui Gong, Yuanguo Bi, Bing Hu, Xuesong Li, Di Wang

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出MemCatalyst数据投毒工具,通过文本与图像投毒策略增强视觉-语言模型的成员推断审计性能,在黑盒设置下投毒样本可跨架构迁移,仅需少量投毒样本即可提升审计效果且不影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17120 2026-08-19 cs.CL 新提交 79%

Children, but not language models, show accelerating returns in word learning

儿童在词汇学习中表现出加速回报,而语言模型则不然

Michael C. Frank

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究对比儿童与语言模型的词汇学习,发现儿童词汇学习呈加速积累特征,而语言模型则呈现恒定比例回报,且儿童学习所需训练数据远少于语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16900 2026-08-19 physics.soc-ph cs.AI cs.CY quant-ph 新提交 79%

QuantumNovelty: A Skill-Orchestrating Language Agent for Referee-Style Review and Patentability Screening of Quantum Papers and Patents

QuantumNovelty:用于量子论文与专利的评审式审查及可专利性筛选的技能编排语言智能体

Shlomo Kashani

专题命中 预训练与数据 :language agent(title,abstract);分类 cs.AI

AI总结 QuantumNovelty是一款开源技能编排语言智能体,可生成量子计算产物并通过含确定性门的审计层审查,在对抗语料库及真实手稿、专利的测试中表现出审查保守性,属于量子论文与专利审查的决策支持工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17843 2026-08-19 cs.CL cs.AI 新提交 79%

Encoded but Not Actionable: Auditing the Decode-Generate-Steer Gap in Frozen LLMs for Geometric Constraints

已编码但不可执行:审计冻结大语言模型中几何约束的解码-生成-引导差距

Man Liang, Xinzhao Cheng, Faizan Wajid

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究以参数化CAD约束为测试平台,审计6个冻结LLMs的解码-生成-引导差距,发现几何关系可解码性与生成、引导能力存在差异,区分了编码与表达控制失败。

Comments 13 pages, 7 figures, 8 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-19 cs.CL cs.LG 新提交 73%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16185 2026-08-19 cs.CL cs.AI 版本更新 73%

LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents

LENS:基于动态原始文档的潜在证据探索的上下文内搜索

Xingjun Wang, Gongsheng Li, Qi Fan, Yunlin Mao, Luyan Su, Yingda Chen

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对动态原始文档的上下文内搜索问题,提出无索引框架LENS,通过迭代选择候选证据并更新置信度实现预算约束下的证据定位,在多组实验中其证据召回率和答案依据表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17286 2026-08-19 cs.LG 新提交 70%

Abra: Scaling Diffusion Image Training

Abra:扩散图像训练的规模化

Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究针对文本到图像扩散模型开展系统缩放定律研究,提出Abra模型,发现其缩放规律可预测且需更多数据,相关规律可延伸至生成质量等多方面指标。

Comments 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16978 2026-08-19 cs.RO cs.LG 新提交 70%

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划

Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

机构 * University of Monastir(莫纳斯提尔大学) St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Silverstream AI(银流人工智能公司) Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30025 2026-08-19 cs.CL 版本更新 70%

ContextClaim: A Context-Driven Paradigm for Verifiable Claim Detection

ContextClaim: 一种基于上下文的可验证声明检测范式

Yufeng Li, Rrubaa Panchendrarajan, Arkaitz Zubiaga

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ContextClaim范式,通过提取实体、检索维基知识并生成上下文摘要,提升可验证声明检测的可靠性,验证其在不同领域和模型设置下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02625 2026-08-19 cs.LG 版本更新 57%

One Pipeline, Many Transformers: Pattern-Specific Imputation Specialists for Tabular Missing Data

TabImpute: 通用零样本填补表格数据

Jacob Feitelberg, Dwaipayan Saha, Kyuseong Choi, Zaid Ahmad, Anish Agarwal, Raaz Dwivedi

机构 * Industrial Engineering \& Operations Research, Columbia University, New York, USA Department of Statistics, Columbia University, New York, USA Operations Research \& Information Engineering, Cornell Tech, New York, USA

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 TabImpute通过预训练Transformer实现通用零样本表格数据填补,采用高效特征化和合成数据生成提升填补速度与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏