arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-08 至 2025-12-08 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2412.07031 2025-12-08 econ.EM cs.AI 89%

Large Language Models: An Applied Econometric Framework

大语言模型:一个应用计量经济学框架

Jens Ludwig, Sendhil Mullainathan, Ashesh Rambachan

机构 * Center for Applied Artificial Intelligence at the University of Chicago(芝加哥大学应用人工智能中心) Altman Family Fund at MIT(麻省理工学院阿尔特曼家族基金) University of Chicago(芝加哥大学) Massachusetts Institute of Technology(麻省理工学院) NBER(美国国家经济研究局)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一个应用计量经济学框架,利用大语言模型进行文本预测和经济概念测量,强调无训练泄漏和验证样本的重要性,以提高实证分析的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05464 2025-12-08 cs.CL cs.AI 86%

Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment

动态对齐与集体代理:迈向一个可扩展的自我改进框架以实现开放式的LLM对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Jad Tarifi, Nima Asgharbeygi

机构 * Integral AI

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态对齐框架,通过集体代理价值实现LLM的自我改进和可扩展对齐。

Comments 8 pages, 4 figures, to appear in AAAI 2026 AIGOV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05887 2025-12-08 cs.SE cs.LG cs.PL 83%

Bootstrapping Fuzzers for Compilers of Low-Resource Language Dialects Using Language Models

通过语言模型构建编译器低资源语言方言的模糊测试器

Sairam Vaidya, Marcel Böhme, Loris D'Antoni

机构 * University of California San Diego(加州大学圣地亚哥分校) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 通过语言模型构建编译器低资源语言方言的模糊测试器,利用语法和覆盖引导技术生成种子输入,提升测试效率和覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05216 2025-12-08 cs.LG 79%

Coefficient of Variation Masking: A Volatility-Aware Strategy for EHR Foundation Models

方差系数掩码:一种考虑波动性的电子健康记录基础模型策略

Rajna Fani, Rafi Al Attrach, David Restrepo, Yugang Jia, Leo Anthony Celi, Peter Schüffler

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) Technical University of Munich (TUM)(慕尼黑技术大学) MICS CentraleSupélec – Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec研究所) Harvard Medical School(哈佛医学院) Beth Israel Deaconess Medical Center(贝斯以色列医疗中心) Institute of Pathology Technical University of Munich(慕尼黑技术大学病理研究所) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.LG

AI总结 本文提出CV-Masking策略,通过考虑特征波动性改进EHR基础模型的预训练,提升重建性能和下游任务表现。

Comments 16 pages, 9 figures, 1 table, 1 algorithm. Accepted at Machine Learning for Health (ML4H) 2025, Proceedings of the Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01203 2025-12-08 cs.LG 79%

Hypergraph Foundation Model

超图基础模型

Yue Gao, Yifan Feng, Shiquan Liu, Xiangmin Han, Shaoyi Du, Zongze Wu, Han Hu

机构 * School of Software, BNRist, THUIBCS, BLBCI, Tsinghua University(软件学院,BNRist,THUIBCS,BLBCI,清华大学) Institute of Artificial Intelligence and Robotics, College of Artificial Intelligence, Xi’an Jiaotong University(人工智能与机器人研究院,人工智能学院,西安交通大学) College of Mechatronics and Control Engineering, Shenzhen University(机械与控制工程学院,深圳大学) Beijing Institute of Technology(北京理工大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Hyper-FM是一种多领域知识提取的超图基础模型,通过层次化高阶邻居引导的顶点知识嵌入和结构知识提取,提升超图建模能力,并提出超图基础模型的扩展定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07755 2025-12-08 cs.CV cs.AI cs.GR cs.RO 79%

SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models

SAT:多模态语言模型的动态空间能力训练

Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko

机构 * Boston University(波士顿大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) Microsoft Research(微软研究院) New York University(纽约大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 SAT通过模拟数据提升多模态语言模型在动态空间推理中的能力,实验表明其在多个基准测试中优于现有方法。

Comments Accepted to COLM 2025. Project webpage: https://arijitray.com/SAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22143 2025-12-08 cs.CV 78%

3D Question Answering via only 2D Vision-Language Models

仅通过2D视觉-语言模型实现3D问答

Fengyun Wang, Sicheng Yu, Jiawei Wu, Jinhui Tang, Hanwang Zhang, Qianru Sun

机构 * Nanyang Technological University, Singapore Singapore Management University, Singapore National University of Singapore, Singapore Nanjing University of Science \& Technology, Nanjing, China

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出cdViews方法,通过仅使用2D视觉-语言模型,实现3D问答任务的高性能表现。

Comments ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05648 2025-12-08 cs.LG 77%

Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs

超越数据过滤:LLMs中能力移除的知识定位

Igor Shilov, Alex Cloud, Aryo Pradipta Gema, Jacob Goldman-Wetzler, Nina Panickssery, Henry Sleight, Erik Jones, Cem Anil

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出SGTM方法,通过局部化知识并屏蔽梯度来移除LLM中的危险能力,相比数据过滤和梯度路由,在标签噪声下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02098 2025-12-08 cs.CL cs.AI cs.LG 75%

CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation

为你的数据集定制:通过语料检索与增强进行任务特定合成数据集生成

Ingo Ziegler, Abdullatif Köksal, Desmond Elliott, Hinrich Schütze

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Center for Information and Language Processing (CIS), LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CRAFT通过语料检索与增强生成任务特定合成数据集,有效提升问答和摘要任务的模型性能。

Comments Accepted at TACL; Pre-MIT Press publication version. Code and dataset available at: https://github.com/ziegler-ingo/CRAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01790 2025-12-08 cs.LG cs.CR 70%

IF-GUIDE: Influence Function-Guided Detoxification of LLMs

IF-GUIDE:影响函数引导的LLM去毒化

Zachary Coalson, Juhan Bae, Nicholas Carlini, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学) University of Toronto(多伦多大学) Anthropic

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 IF-GUIDE通过影响函数主动识别并抑制训练数据中的有害标记,有效减少大语言模型的显性和隐性毒性。

Comments Accepted at NeurIPS 2025 [Poster]

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05386 2025-12-08 cs.LG cs.AI 62%

Generalization Beyond Benchmarks: Evaluating Learnable Protein-Ligand Scoring Functions on Unseen Targets

超越基准的泛化:在未见目标上评估可学习的蛋白质-配体评分函数

Jakub Kopko, David Graber, Saltuk Mustafa Eyrilmez, Stanislav Mazurenko, David Bednar, Jiri Sedlar, Josef Sivic

机构 * CIIRC, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学布拉格分校电子工程学院智能信息研究中心) Seminar for Applied Mathematics, Department of Mathematics, ETH Zurich(苏黎世联邦理工学院应用数学研讨会) Institute for Computational Life Sciences, Zurich University of Applied Sciences(苏黎世应用科学大学计算生命科学研究所) Loschmidt Laboratories, Faculty of Science, Masaryk University, Brno(马萨里克大学布拉格分校科学学院洛施米特实验室) ICRC, St. Anne’s University Hospital, Brno(布拉格大学医院ICRC)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估了可学习蛋白质-配体评分函数在未见靶标上的泛化能力,揭示了现有基准的不足,并探讨了预训练和简单方法对提升泛化性能的潜在作用。

Comments 15 pages, 6 figures, submitted to NeurIPS 2025 AI4Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏