arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2410.01137 2025-02-25 cs.LG physics.comp-ph 70%

Explain Like I'm Five: Using LLMs to Improve PDE Surrogate Models with Text

Cooper Lorsung, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 22 pages, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12560 2025-02-24 cs.CL 70%

How does a Language-Specific Tokenizer affect LLMs?

Jean Seo, Jaeyoon Kim, SungJoo Byun, Hyopil Shin

机构 * Seoul National University(首尔国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14786 2025-02-21 cs.CV cs.AI 70%

SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier Hénaff, Jeremiah Harmsen, Andreas Steiner, Xiaohua Zhai

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

Comments Model checkpoints are available at https://github.com/google-research/big_vision/tree/main/big_vision/configs/proj/image_text/README_siglip2.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06101 2025-02-20 cs.CL 70%

From Conversation to Automation: Leveraging LLMs for Problem-Solving Therapy Analysis

Elham Aghakhani, Lu Wang, Karla T. Washington, George Demiris, Jina Huh-Yoo, Rezvaneh Rezapour

机构 * Drexel University(德雷塞尔大学) Stevens Institute of Technology(史蒂文斯理工学院) Washington University(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02220 2025-02-19 cs.CR cs.AI 70%

Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks

Xiaoqun Liu, Jiacheng Liang, Luoxi Tang, Muchao Ye, Weicheng Ma, Zhaohan Xi

机构 * Stony Brook University(石溪大学) Binghamton University(宾汉姆顿大学) University of Iowa(爱荷华大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13998 2025-02-18 cs.LG stat.ML 70%

CViT: Continuous Vision Transformer for Operator Learning

Sifan Wang, Jacob H Seidman, Shyam Sankaran, Hanwen Wang, George J. Pappas, Paris Perdikaris

机构 * Institution for Foundation of Data Science, Yale University(耶鲁大学数据科学基础研究院) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

Comments 36 pages, 10 tables, 19figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09927 2025-02-17 cs.CV cs.AI 70%

Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence

Granite Vision Team, Leonid Karlinsky, Assaf Arbelle, Abraham Daniels, Ahmed Nassar, Amit Alfassi, Bo Wu, Eli Schwartz, Dhiraj Joshi, Jovana Kondic, Nimrod Shabtay, Pengyuan Li, Roei Herzig, Shafiq Abedin, Shaked Perek, Sivan Harary, Udi Barzelay, Adi Raz Goldfarb, Aude Oliva, Ben Wieles, Bishwaranjan Bhattacharjee, Brandon Huang, Christoph Auer, Dan Gutfreund, David Beymer, David Wood, Hilde Kuehne, Jacob Hansen, Joseph Shtok, Ken Wong, Luis Angel Bathen, Mayank Mishra, Maksym Lysak, Michele Dolfi, Mikhail Yurochkin, Nikolaos Livathinos, Nimrod Harel, Ophir Azulai, Oshri Naparstek, Rafael Teixeira de Lima, Rameswar Panda, Sivan Doveh, Shubham Gupta, Subhro Das, Syed Zawad, Yusik Kim, Zexue He, Alexander Brooks, Gabe Goodhart, Anita Govindjee, Derek Leist, Ibrahim Ibrahim, Aya Soffer, David Cox, Kate Soule, Luis Lastras, Nirmit Desai, Shila Ofek-koifman, Sriram Raghavan, Tanveer Syeda-Mahmood, Peter Staar, Tal Drory, Rogerio Feris

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08489 2025-02-14 cs.CL 70%

Salamandra Technical Report

Aitor Gonzalez-Agirre, Marc Pàmies, Joan Llop, Irene Baucells, Severino Da Dalt, Daniel Tamayo, José Javier Saiz, Ferran Espuña, Jaume Prats, Javier Aula-Blasco, Mario Mina, Iñigo Pikabea, Adrián Rubio, Alexander Shvets, Anna Sallés, Iñaki Lacunza, Jorge Palomar, Júlia Falcão, Lucía Tormo, Luis Vasquez-Reina, Montserrat Marimon, Oriol Pareras, Valle Ruiz-Fernández, Marta Villegas

机构 * Language Technologies Unit Barcelona Supercomputing Center(巴塞罗那超级计算中心语言技术单元)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05331 2025-02-14 cs.CL 70%

Fine-Tuned LLMs are "Time Capsules" for Tracking Societal Bias Through Books

Sangmitra Madhusudan, Robert Morabito, Skye Reid, Nikta Gohari Sadr, Ali Emami

机构 * Brock University(布洛克大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages (excluding references), accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06877 2025-02-12 cs.LG 70%

WirelessGPT: A Generative Pre-trained Multi-task Learning Framework for Wireless Communication

Tingting Yang, Ping Zhang, Mengfan Zheng, Yuxuan Shi, Liwen Jing, Jianbo Huang, Nan Li

机构 * Pengcheng Laboratory(鹏城实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12504 2025-02-11 cs.CL 70%

Case2Code: Scalable Synthetic Data for Code Generation

Yunfan Shao, Linyang Li, Yichuan Ma, Peiji Li, Demin Song, Qinyuan Cheng, Shimin Li, Xiaonan Li, Pengyu Wang, Qipeng Guo, Hang Yan, Xipeng Qiu, Xuanjing Huang, Dahua Lin

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Code and datasets are available at https://github.com/choosewhatulike/case2code

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04801 2025-02-11 cs.CL 70%

Alpaca against Vicuna: Using LLMs to Uncover Memorization of LLMs

Aly M. Kassem, Omar Mahmoud, Niloofar Mireshghallah, Hyunwoo Kim, Yulia Tsvetkov, Yejin Choi, Sherif Saad, Santu Rana

机构 * University of Windsor(温莎大学) Deakin University(迪肯大学) University of Washington(华盛顿大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12993 2025-02-10 cs.AR cs.CL 70%

CraftRTL: High-quality Synthetic Data Generation for Verilog Code Models with Correct-by-Construction Non-Textual Representations and Targeted Code Repair

Mingjie Liu, Yun-Da Tsai, Wenfei Zhou, Haoxing Ren

机构 * NVIDIA Corporation(英伟达公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02722 2025-02-06 cs.CL 70%

Cross-Lingual Transfer for Low-Resource Natural Language Processing

Iker García-Ferrero

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Doctoral Thesis: University of the Basque Country UPV/EHU

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16925 2025-01-29 cs.CL 70%

Detecting harassment and defamation in cyberbullying with emotion-adaptive training

Peiling Yi, Arkaitz Zubiaga, Yunfei Long

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16790 2025-01-29 stat.ML cs.LG 70%

Exponential Family Attention

Kevin Christian Wibisono, Yixin Wang

机构 * University of Michigan(密歇根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14079 2025-01-27 cs.CL 70%

Enhancing Biomedical Relation Extraction with Directionality

Po-Ting Lai, Chih-Hsuan Wei, Shubo Tian, Robert Leaman, Zhiyong Lu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09913 2025-01-20 cs.AI 70%

Towards A Litmus Test for Common Sense

Hugo Latapie

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09534 2025-01-17 cs.AI 70%

AI in Support of Diversity and Inclusion

Çiçek Güven, Afra Alishahi, Henry Brighton, Gonzalo Nápoles, Juan Sebastian Olier, Marie Šafář, Eric Postma, Dimitar Shterionov, Mirella De Sisto, Eva Vanmassenhove

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08468 2025-01-16 cs.CL cs.SD eess.AS 70%

Selective Attention Merging for low resource tasks: A case study of Child ASR

Natarajan Balaji Shankar, Zilai Wang, Eray Eren, Abeer Alwan

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL

Comments To appear in ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01028 2025-01-16 cs.CL 70%

KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model

Xinshuo Hu, Zifei Shan, Xinping Zhao, Zetian Sun, Zhenyu Liu, Dongfang Li, Shaolin Ye, Xinyuan Wei, Qian Chen, Baotian Hu, Haofen Wang, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tongji University(同济大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Technical Report. 23 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03363 2025-01-16 cs.CL 70%

Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding

Cheng Wang, Yiwei Wang, Bryan Hooi, Yujun Cai, Nanyun Peng, Kai-Wei Chang

机构 * National University of Singapore(新加坡国立大学) University of California, Merced(加州大学默塞德分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Queensland(昆士兰大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16689 2025-01-16 cs.RO cs.CV cs.LG cs.PL 70%

SYNAPSE: SYmbolic Neural-Aided Preference Synthesis Engine

Sadanand Modak, Noah Patton, Isil Dillig, Joydeep Biswas

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted (oral) at AAAI 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07078 2025-01-14 cs.AI cs.DB 70%

ADKGD: Anomaly Detection in Knowledge Graphs with Dual-Channel Training

Jiayang Wu, Wensheng Gan, Jiahao Zhang, Philip S. Yu

机构 * Jinan University(暨南大学) South China Normal University(华南师范大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Preprint. 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01034 2025-01-14 cs.CL cs.SD eess.AS 70%

Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models

Bin Wang, Xunlong Zou, Shuo Sun, Wenyu Zhang, Yingxu He, Zhuohan Liu, Chengwei Wei, Nancy F. Chen, AiTi Aw

机构 * Centre for Frontier AI Research (CFAR), A*STAR(前沿人工智能研究中心(CFAR),新加坡科技研究局)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Open-Source: https://github.com/AudioLLMs/Singlish

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03879 2025-01-08 cs.CV cs.AI 70%

CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds

Keonwoo Kim, Yeongjae Cho, Taebaek Hwang, Minsoo Jo, Sangdo Han

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03783 2025-01-08 cs.SE cs.CL 70%

How to Select Pre-Trained Code Models for Reuse? A Learning Perspective

Zhangqian Bi, Yao Wan, Zhaoyang Chu, Yufei Hu, Junyi Zhang, Hongyu Zhang, Guandong Xu, Hai Jin

机构 * Huazhong University of Science and Technology(华中科技大学) Chongqing University(重庆大学) University of Technology Sydney(悉尼科技大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

Comments Accepted by IEEE SANER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14124 2025-01-07 cs.LG 70%

Mixture of Experts Meets Prompt-Based Continual Learning

Minh Le, An Nguyen, Huy Nguyen, Trang Nguyen, Trang Pham, Linh Van Ngo, Nhat Ho

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Hanoi University of Science and Technology(河内科技大学) VinAI Research(VinAI研究院)

专题命中 预训练与数据 :pretraining(abstract);prompting(abstract);分类 cs.LG

Comments Accepted to NeurIPS 2024, 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01384 2025-01-03 cs.CL cs.HC cs.SD eess.AS 70%

OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios

Xize Cheng, Dongjie Fu, Xiaoda Yang, Minghui Fang, Ruofan Hu, Jingyu Lu, Bai Jionghao, Zehan Wang, Shengpeng Ji, Rongjie Huang, Linjun Li, Yu Chen, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学) Meituan(美团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00888 2025-01-03 cs.CL 70%

Unfolding the Headline: Iterative Self-Questioning for News Retrieval and Timeline Summarization

Weiqi Wu, Shen Huang, Yong Jiang, Pengjun Xie, Fei Huang, Hai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏