arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2412.00324 2025-04-15 cs.DB cs.IR cs.LG 70%

Table Integration in Data Lakes Unleashed: Pairwise Integrability Judgment, Integrable Set Discovery, and Multi-Tuple Conflict Resolution

Daomin Ji, Hui Luo, Zhifeng Bao, Shane Culpepper

机构 * RMIT University(RMIT大学) University of Wollongong(卧龙岗大学) The University of Queensland(昆士兰大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments This paper is accepted by VLDB Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08755 2025-04-15 cs.IR cs.AI cs.HC 70%

Delving into: the quantification of Ai-generated content on the internet (synthetic data)

Dirk HR Spennemann

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 9 pp

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08269 2025-04-14 cs.CV cs.CL 70%

VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering

Qi Zhi Lim, Chin Poo Lee, Kian Ming Lim, Kalaiarasi Sonai Muthu Anbananthen

机构 * Multimedia University(多媒体大学) University of Nottingham Ningbo China(宁波诺丁汉大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06917 2025-04-10 cs.CL 70%

Data Augmentation for Fake Reviews Detection in Multiple Languages and Multiple Domains

Ming Liu, Massimo Poesio

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24206 2025-04-10 cs.CL 70%

Synthetic News Generation for Fake News Classification

Abdul Sittar, Luka Golob, Mateja Smiljanic

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments One of the authors objected to submit the paper because he was not aware of that and he likes to modify the paper before submitting to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05305 2025-04-08 cs.CV cs.AI 70%

URECA: Unique Region Caption Anything

Sangbeom Lim, Junwan Kim, Heeji Yoon, Jaewoo Jung, Seungryong Kim

机构 * Korea University(高丽大学) Yonsei University(延世大学) KAIST AI(韩国科学技术院人工智能)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Project page: https://cvlab-kaist.github.io/URECA Code: https://github.com/cvlab-kaist/URECA

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04711 2025-04-08 cs.AI 70%

Generalising from Self-Produced Data: Model Training Beyond Human Constraints

Alfath Daryl Alhajir, Jennifer Dodgson, Joseph Lim, Truong Ma Phi, Julian Peh, Akira Rafhael Janson Pattirane, Lokesh Poovaragan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00070 2025-04-04 cs.CY cs.AI econ.GN q-fin.EC 70%

Can AI Solve the Peer Review Crisis? A Large Scale Cross Model Experiment of LLMs' Performance and Biases in Evaluating over 1000 Economics Papers

Pat Pataranutaporn, Nattavudh Powdthavee, Chayapatr Achiwaranguprok, Pattie Maes

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01032 2025-04-03 cs.CY cs.AI 70%

Who Owns the Output? Bridging Law and Technology in LLMs Attribution

Emanuele Mezzi, Asimina Mertzani, Michael P. Manis, Siyanna Lilova, Nicholas Vadivoulis, Stamatis Gatirdakis, Styliani Roussou, Rodayna Hmede

机构 * Ethikon Institute(Ethikon研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00388 2025-04-02 cs.CY cs.LG 70%

Using complex prompts to identify fine-grained biases in image generation through ChatGPT-4o

Marinus Ferreira

机构 * Macquarie University(麦考瑞大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Presented at the 74th Annual ICA 2024 Conference, in the stream "Image-as-Data Methods in the Age of Generative Artificial Intelligence", 22 June 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16872 2025-04-02 cs.LG cs.CV 70%

Lie Detector: Unified Backdoor Detection via Cross-Examination Framework

Xuan Wang, Siyuan Liang, Dongping Liao, Han Fang, Aishan Liu, Xiaochun Cao, Yu-liang Lu, Ee-Chien Chang, Xitong Gao

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16855 2025-04-02 cs.CL cs.IR 70%

GME: Improving Universal Multimodal Retrieval by Multimodal LLMs

Xin Zhang, Yanzhao Zhang, Wen Xie, Mingxin Li, Ziqi Dai, Dingkun Long, Pengjun Xie, Meishan Zhang, Wenjie Li, Min Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Soochow University(苏州大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to CVPR 2025, models at https://huggingface.co/Alibaba-NLP/gme-Qwen2-VL-2B-Instruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17081 2025-04-01 cs.SD cs.CL eess.AS 70%

Continuous Speech Tokenizer in Text To Speech

Yixing Li, Ruobing Xie, Xingwu Sun, Yu Cheng, Zhanhui Kang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments NAACL 2025 Findings Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23673 2025-04-01 cs.CL 70%

WHERE and WHICH: Iterative Debate for Biomedical Synthetic Data Augmentation

Zhengyi Zhao, Shubo Zhang, Bin Liang, Binyang Li, Kam-Fai Wong

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23163 2025-04-01 cs.CL 70%

The realization of tones in spontaneous spoken Taiwan Mandarin: a corpus-based survey and theory-driven computational modeling

Yuxin Lu, Yu-Ying Chuang, R. Harald Baayen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21023 2025-03-28 cs.LG 70%

Data Mixture Optimization: A Multi-fidelity Multi-scale Bayesian Framework

Thomson Yen, Andrew Wei Tung Siah, Haozhe Chen, Tianyi Peng, Daniel Guetta, Hongseok Namkoong

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19800 2025-03-26 cs.CL 70%

SemEval-2025 Task 9: The Food Hazard Detection Challenge

Korbinian Randl, John Pavlopoulos, Aron Henriksson, Tony Lindgren, Juli Bakagianni

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Under review for SemEval 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07311 2025-03-25 cs.CL 70%

Sudden Drops in the Loss: Syntax Acquisition, Phase Transitions, and Simplicity Bias in MLMs

Angelica Chen, Ravid Shwartz-Ziv, Kyunghyun Cho, Matthew L. Leavitt, Naomi Saphra

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

Comments ICLR 2024 camera-ready; Code is located at https://github.com/angie-chen55/sudden-drops-in-the-loss/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10156 2025-03-21 cs.AI 70%

Mitigating Sycophancy in Decoder-Only Transformer Architectures: Synthetic Data Intervention

Libo Wang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments The data set, experimental process, code and data results have been uploaded to Github repository, the link is https://github.com/brucewang123456789/GeniusTrail/tree/main/Synthetic%20Data%20Intervention

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15112 2025-03-21 cs.AI 70%

ChatGPT as a Solver and Grader of Programming Exams written in Spanish

Pablo Saborido-Fernández, Marcos Fernández-Pichel, David E. Losada

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09907 2025-03-20 cs.CL 70%

Reddit is all you need: Authorship profiling for Romanian

Ecaterina Ştefănescu, Alexandru-Iulius Jerpelea

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 10 pages, 5 tables and 1 figure, published and presented at The 19th International Conference on Linguistic Resources and Tools for Natural Language Processing (ConsILR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14021 2025-03-19 cs.CV cs.AI cs.HC 70%

MP-GUI: Modality Perception with MLLMs for GUI Understanding

Ziwei Wang, Weizhi Chen, Leyang Yang, Sheng Zhou, Shengchu Zhao, Hanbei Zhan, Jiongchao Jin, Liangcheng Li, Zirui Shao, Jiajun Bu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Paper accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02523 2025-03-14 cs.AI q-fin.PM q-fin.ST stat.ML 70%

Transformer for Times Series: an Application to the S&P500

Pierre Brugiere, Gabriel Turinici

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Journal ref In: Arai, K. (eds) Advances in Information and Communication. FICC 2025. Lecture Notes in Networks and Systems, vol 1285. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06040 2025-03-11 cs.CL 70%

Mitigating Memorization in LLMs using Activation Steering

Manan Suri, Nishit Anand, Amisha Bhaskar

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08904 2025-02-28 cs.AI 70%

MIH-TCCT: Mitigating Inconsistent Hallucinations in LLMs via Event-Driven Text-Code Cyclic Training

Xinxin You, Xien Liu, Qixin Sun, Huan Zhang, Kaiyin Zhou, Shaohui Liu, GuoPing Hu, ShiJin Wang, Si Liu, Ji Wu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06644 2025-02-28 cs.CL 70%

The COVID That Wasn't: Counterfactual Journalism Using GPT

Sil Hamilton, Andrew Piper

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments To appear in the proceedings of the 6th Joint SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature

Journal ref https://aclanthology.org/2022.latechclfl-1.11/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18906 2025-02-27 cs.LG 70%

VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model

Jiani Zheng, Lu Wang, Fangkai Yang, Chaoyun Zhang, Lingrui Mei, Wenjie Yin, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan, Qi Zhang

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

Comments 20pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18782 2025-02-27 cs.CL 70%

Active Few-Shot Learning for Text Classification

Saeed Ahmadnia, Arash Yousefi Jordehi, Mahsa Hosseini Khasheh Heyran, Seyed Abolghasem Mirroshandel, Owen Rambow, Cornelia Caragea

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to NAACL 2025 Main Conference; 18 pages, 8 figures, 13 tables including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17857 2025-02-26 cs.CL 70%

SYNTHEMPATHY: A Scalable Empathy Corpus Generated Using LLMs Without Any Crowdsourcing

Run Chen, Jun Shin, Julia Hirschberg

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09713 2025-02-25 cs.IR cs.AI 70%

Agentic Information Retrieval

Weinan Zhang, Junwei Liao, Ning Li, Kounianhua Du, Jianghao Lin

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 11 pages, perspective paper

详情

展开后加载摘要…

URL PDF HTML 收藏