arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 23 篇

2502.08924 2025-12-02 cs.LG cs.AI cs.CL 90%

Escaping Collapse: The Strength of Weak Data for Large Language Model Training

摆脱崩溃:弱数据在大语言模型训练中的力量

Kareem Amin, Sara Babakniya, Alex Bie, Weiwei Kong, Umar Syed, Sergei Vassilvitskii

机构 * Google Research(谷歌研究)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了合成数据在大语言模型训练中的作用,提出通过动态聚焦标注资源提升模型性能,并揭示了提升方法在其中的应用与改进机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00007 2025-12-02 cs.IR cs.AI cs.CL 90%

Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking

使用检索增强型大语言模型代理进行长期形式的新冠事实核查

Jingyi Huang, Yuyi Yang, Mengmeng Ji, Charles Alba, Sheng Zhang, Ruopeng An

机构 * New York University, USA(纽约大学) Washington University in St. Louis, USA(华盛顿大学圣路易斯分校) Shanghai University of Sports, China(上海体育大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAFE系统,结合大语言模型与检索增强生成技术,有效提升长期新冠虚假信息的事实核查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00872 2025-12-02 cs.CV cs.AI 88%

TAP-CT: 3D Task-Agnostic Pretraining of Computed Tomography Foundation Models

TAP-CT: 3D 任务无关的计算机断层扫描基础模型预训练

Tim Veenboer, George Yiasemis, Eric Marcus, Vivien Van Veldhuizen, Cees G. M. Snoek, Jonas Teuwen, Kevin B. W. Groot Lipman

机构 * Netherlands Cancer Institute(荷兰癌症研究所) University of Amsterdam(阿姆斯特丹大学) Kaiko

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 TAP-CT提出了一种基于ViT和DINOv2的3D CT基础模型预训练方法,通过任务无关的自监督学习实现高效的医学影像处理。

Comments 22 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00602 2025-12-02 cs.MA cs.AI 88%

AgentODRL: A Large Language Model-based Multi-agent System for ODRL Generation

AgentODRL: 基于大语言模型的多智能体系统用于ODRL生成

Wanle Zhong, Keman Huang, Xiaoyong Du

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 AgentODRL通过多智能体系统和大语言模型技术,提升ODRL生成的准确性和效率。

Comments Accepted by AAAI 2026. 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14469 2025-12-02 cs.CL cs.AI 87%

Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations

大语言模型在混合语言扰动下的归因安全故障

Somnath Banerjee, Pratyush Chatterjee, Shanu Kumar, Sayan Layek, Parag Agrawal, Rima Hazra, Animesh Mukherjee

机构 * Microsoft Corporation(微软公司)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在混合语言扰动下存在归因安全故障,提出显著性漂移归因框架并提出翻译基恢复策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01107 2025-12-02 cs.AI econ.EM stat.ML 81%

Foundation Priors

基础先验

Sanjog Misra

机构 * Booth School of Business, University of Chicago(芝加哥大学商学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 本文提出基础先验概念,将生成模型输出视为主观先验,以避免合成数据与真实数据混淆,应用于实证研究和模型改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02857 2025-12-02 cs.LG 81%

Measuring Fingerprints of Web-filtered Text Datasets and Fingerprint Propagation Through Training

测量Web过滤文本数据集的指纹及其通过训练传播

Youssef Mansour, Reinhard Heckel

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究发现预训练数据集的指纹可通过训练传播,揭示数据特征及预训练混合比例等信息。

Journal ref NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00763 2025-12-02 cs.LG cs.AI 79%

Provable Benefit of Sign Descent: A Minimal Model Under Heavy-Tailed Class Imbalance

梯度符号下降的可证明收益:在重尾类不平衡下的最小模型

Robin Yadav, Shuo Xie, Tianhao Wang, Zhiyuan Li

机构 * Toyota Technological Institute at Chicago(丰田技术研究所)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在重尾类不平衡数据下,符号下降算法相较于GD的收敛优势,通过最小模型证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00971 2025-12-02 cs.RO 78%

H-Zero: Cross-Humanoid Locomotion Pretraining Enables Few-shot Novel Embodiment Transfer

H-Zero:跨人形机器人运动预训练实现少样本新躯干转移

Yunfeng Lin, Minghuan Liu, Yufei Xue, Ming Zhou, Yong Yu, Jiangmiao Pang, Weinan Zhang

机构 * ByteDance Seed(字节跳动种子)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 H-Zero通过跨人形机器人预训练实现少样本新躯干转移,提升机器人运动控制的通用性和效率。

Comments in submission, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00591 2025-12-02 cs.CR 78%

TrojanLoC: LLM-based Framework for RTL Trojan Localization

TrojanLoC: 基于LLM的RTL Trojan定位框架

Weihua Xiao, Zeng Wang, Minghao Shao, Raghu Vamshi Hemadri, Ozgur Sinanoglu, Muhammad Shafique, Johann Knechtel, Siddharth Garg, Ramesh Karri

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 TrojanLoC利用LLM直接从RTL代码生成嵌入,实现模块级和行级木马检测与定位,提升RTL级安全分析精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19645 2025-12-02 cs.LG 77%

Tensor-Parallelism with Partially Synchronized Activations

具有部分同步激活的张量并行

Itay Lamprecht, Asaf Karnieli, Yair Hanani, Niv Giladi, Daniel Soudry

机构 * Intel, Israel(英特尔(以色列)) Department of Electrical and Computer Engineering - Technion, Haifa, Israel(技术学院电子与计算机工程系(海法,以色列)) AWS AI Labs(亚马逊AWS人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 CAAT-Net通过部分同步激活减少张量并行通信,提升LLM训练和推断效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00214 2025-12-02 cs.CL 77%

Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis

迈向基于语料库的代理LLM用于多语言语法分析

Matej Klemen, Tjaša Arčon, Luka Terčon, Marko Robnik-Šikonja, Kaja Dobrovoljc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院) University of Ljubljana, Faculty of Arts(卢布尔雅那大学艺术学院) Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于语料库的代理LLM框架,用于多语言语法分析,通过数据驱动推理提升语法探究的可解释性和扩展性。

Comments Pre-print, submission under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00928 2025-12-02 cs.MM 75%

Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation

增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成

Jiajun Cao, Qinggang Zhang, Yunbo Tang, Zhishang Xiang, Chang Yang, Jinsong Su

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01312 2025-12-02 cs.CV 67%

IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval

IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索

Ning Han, Yawen Zeng, Shaohua Long, Chengqing Li, Sijie Yang, Dun Tan, Jianfeng Dong, Jingjing Chen

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Zhejiang Gongshang University(浙江工商大学) Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。

Comments Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07299 2025-12-02 cs.LG cs.AI cs.CL q-bio.GN 67%

Life-Code: Central Dogma Modeling with Multi-Omics Sequence Unification

Life-Code: 多组学序列统一下的中心法则建模

Zicheng Liu, Siyuan Li, Zhiyuan Chen, Chang Yu, Qirong Yang, Yucheng Guo, Yujie Yang, Xiaoming Zhang, Stan Z. Li

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Life-Code通过多组学序列统一和中心法则建模,实现对生物分子相互作用的全面理解。

Comments Preprint V3 (10 pages main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00496 2025-12-02 cs.CL cs.AI 62%

CACARA: Cross-Modal Alignment Leveraging a Text-Centric Approach for Cost-Effective Multimodal and Multilingual Learning

CACARA:基于文本中心方法的跨模态对齐,用于高效多模态和多语言学习

Diego A. B. Moreira, Alef I. Ferreira, Jhessica Silva, Gabriel O. dos Santos, Gustavo Bonil, João Gondim, Marina dos Santos, Helena Maia, Simone Hashiguti, Nádia da Silva, Carolina Scarton, Helio Pedrini, Sandra Avila

机构 * Instituto de Computação, Universidade Estadual de Campinas (UNICAMP), Brasil(计算机学院,Campinas州立大学(UNICAMP)) Instituto de Estudos da Linguagem, Universidade Estadual de Campinas (UNICAMP), Brasil(语言研究学院,Campinas州立大学(UNICAMP)) Instituto de Informática, Universidade Federal de Goiás (UFG), Goiás, Brasil(信息学院,戈亚斯联邦大学(UFG)) Department of Computer Science, University of Sheffield, Sheffield, United Kingdom(计算机科学系,谢菲尔德大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 CACARA通过文本中心方法实现多模态和多语言学习,无需重新训练即可支持100多种语言,提升音频到文本检索性能达14.24个百分点。

Comments 25 pages, 12 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01534 2025-12-02 cs.CV cs.AI 57%

Deep Unsupervised Anomaly Detection in Brain Imaging: Large-Scale Benchmarking and Bias Analysis

深度无监督脑影像异常检测:大规模基准测试与偏差分析

Alexander Frotscher, Christian F. Baumgartner, Thomas Wolfers

机构 * Department of Psychiatry and Psychotherapy, University Hospital Tübingen(图宾根大学精神病学与心理学系) Cluster of Excellence – Machine Learning for Science, University of Tübingen(图宾根大学机器学习科学卓越中心) Department of Psychology, Friedrich Schiller University of Jena(耶拿弗里德里希·席勒大学心理学系) German Center for Mental Health (DZPG), partner site Halle/Jena/Magdeburg(德国心理健康中心(DZPG)哈勒/耶拿/马格德堡分部) University of Lucerne(卢塞恩大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出大规模脑影像无监督异常检测基准测试,揭示了算法间显著差异及系统性偏差,强调了算法改进对临床应用的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01599 2025-12-02 cs.LG 57%

Connecting Neural Models Latent Geometries with Relative Geodesic Representations

将神经模型的潜在几何与相对测地表示连接起来

Hanlin Yu, Berfin Inal, Georgios Arvanitidis, Soren Hauberg, Francesco Locatello, Marco Fumero

机构 * University of Helsinki(赫尔辛基大学) University of Amsterdam(阿姆斯特丹大学) DTU(技术大学) IST Austria(奥地利因斯布鲁克科技大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出通过拉回度量捕捉神经模型潜在空间的内在结构,以实现不同模型间表示的精确转换,用于模型缝合和检索任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01199 2025-12-02 cs.LG q-bio.NC 57%

Know Thyself by Knowing Others: Learning Neuron Identity from Population Context

通过了解他人来认识自己:从群体上下文学习神经元身份

Vinam Arora, Divyansha Lachi, Ian J. Knight, Mehdi Azabou, Blake Richards, Cole L. Hurwitz, Josh Siegle, Eva L. Dyer

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) McGill University(麦吉尔大学) Mila(Mila研究所) Allen Institute for Neural Dynamics(神经动态阿伦研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 NuCLR通过自监督学习从群体上下文中的神经活动区分神经元身份,实现了细胞类型和大脑区域解码的最新成果。

Comments Accepted at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05068 2025-12-02 cs.CV cs.AI cs.CR 57%

ICAS: Detecting Training Data from Autoregressive Image Generative Models

ICAS: 从自回归图像生成模型中检测训练数据

Hongyao Yu, Yixiang Qiu, Yiheng Yang, Hao Fang, Tianqu Zhuang, Jiaxin Hong, Bin Chen, Hao Wu, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院) Shenzhen ShenNong Information Technology Co., Ltd.(深圳深农信息技术有限公司)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 ICAS通过隐含分类和自适应得分聚合策略,从自回归图像生成模型中检测训练数据,揭示了大型模型的脆弱性,并展示了在不同场景下的有效性。

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05400 2025-12-02 cs.CV cs.AI 57%

GARF: Learning Generalizable 3D Reassembly for Real-World Fractures

GARF:学习通用的3D重新组装以应对现实中的断裂

Sihang Li, Zeyu Jiang, Grace Chen, Chenyang Xu, Siqi Tan, Xue Wang, Irving Fang, Kristof Zyskowski, Shannon P. McPherron, Radu Iovita, Chen Feng, Jing Zhang

机构 * New York University(纽约大学) Yale University(耶鲁大学) Max Planck Institute(马克斯·普朗克研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 GARF通过断裂感知预训练和流匹配技术,实现对现实断裂的通用3D重新组装,提升对未知对象和断裂类型的鲁棒性。

Comments 18 pages. Project Page https://ai4ce.github.io/GARF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01827 2025-12-02 cs.CV 50%

CauSight: Learning to Supersense for Visual Causal Discovery

CauSight: 通过因果推理进行视觉因果发现

Yize Zhang, Meiqi Chen, Sirui Chen, Bo Peng, Yanxi Zhang, Tianyu Li, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tongji University(同济大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 CauSight通过因果推理进行视觉因果发现,利用因果图数据集和强化学习方法,实现对视觉因果关系的高效发现。

Comments project page: https://github.com/OpenCausaLab/CauSight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08711 2025-12-02 cs.CV 50%

Harnessing Diffusion-Generated Synthetic Images for Fair Image Classification

利用扩散生成的合成图像实现公平的图像分类

Abhipsa Basu, Aviral Gupta, Abhijnya Bhat, R. Venkatesh Babu

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出利用扩散模型微调技术生成组平衡数据,以提升图像分类的公平性,实验表明其在去偏效果上优于现有方法。

Comments Accepted to AAAI AISI Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏