arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2403.09333 2025-08-12 cs.CV cs.AI 70%

Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring

Yufei Zhan, Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Wuhan AI Research, Wuhan, China(武汉人工智能研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by ICCV 2025. Codes and datasets are released at https://github.com/jefferyZhan/Griffon

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06492 2025-08-11 cs.CV cs.CL 70%

Effective Training Data Synthesis for Improving MLLM Chart Understanding

Yuwei Yang, Zeyu Zhang, Yunzhong Hou, Zhuowan Li, Gaowen Liu, Ali Payani, Yuan-Sen Ting, Liang Zheng

机构 * Australian National University(澳大利亚国立大学) Ohio State University(俄亥俄州立大学) Cisco(思科公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by ICCV 2025 (poster). 26 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05722 2025-08-11 cs.CL 70%

PEACH: A sentence-aligned Parallel English-Arabic Corpus for Healthcare

Rania Al-Sabbagh

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Journal ref Corpora 2024, 19, 3, 395-410

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04251 2025-08-07 cs.LG 70%

T3Time: Tri-Modal Time Series Forecasting via Adaptive Multi-Head Alignment and Residual Fusion

Abdul Monaf Chowdhury, Rabeya Akter, Safaeid Hossain Arib

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01317 2025-08-07 cs.CL 70%

LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points

Xuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng, Hongfei Yan, Jingang Wang, Xunliang Cai

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03644 2025-08-06 cs.CL cs.CV cs.IR 70%

Are We on the Right Way for Assessing Document Retrieval-Augmented Generation?

Wenxuan Shen, Mingjia Wang, Yaochen Wang, Dongping Chen, Junjie Yang, Yao Wan, Weiwei Lin

机构 * South China University of Technology(华南理工大学) Huazhong University of Science and Technology(华中科技大学) University of Maryland(马里兰大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments In submission. Project website: https://double-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18688 2025-08-06 cs.CV cs.AI 70%

Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation

Faraz Waseem, Muhammad Shahzad

机构 * University Of Reading(阅读大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 35 pages, 18 figures, Manuscript submitted to ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02063 2025-08-05 cs.AI 70%

TRACEALIGN -- Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs

Amitava Das, Vinija Jain, Aman Chadha

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01211 2025-08-05 cs.LG 70%

Multi-Operator Few-Shot Learning for Generalization Across PDE Families

Yile Li, Shandian Zhe

专题命中 预训练与数据 :pretraining(abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17544 2025-08-05 cs.CV cs.AI 70%

PRIMAL: Physically Reactive and Interactive Motor Model for Avatar Learning

Yan Zhang, Yao Feng, Alpár Cseke, Nitin Saini, Nathan Bajandas, Nicolas Heron, Michael J. Black

机构 * Meshcapade Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Stanford University(斯坦福大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

Comments ICCV'25 camera ready; main paper and appendix; 19 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00390 2025-08-04 cs.CL 70%

SA-GCS: Semantic-Aware Gaussian Curriculum Scheduling for UAV Vision-Language Navigation

Hengxing Cai, Jinhan Dong, Yijie Rao, Jingcheng Deng, Jingjun Tan, Qien Chen, Haidong Wang, Zhen Wang, Shiyu Huang, Agachai Sumalee, Renxin Zhong

专题命中 预训练与数据 :language model(abstract);post-training(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12829 2025-08-01 cs.CL 70%

LiMe: a Latin Corpus of Late Medieval Criminal Sentences

Alessandra Bassani, Beatrice Del Bo, Alfio Ferrara, Marta Mangini, Sergio Picascia, Ambra Stefanello

机构 * Università degli Studi di Milano, Department of Italian and Supranational Public Law(米兰大学意大利与超国家公共法系) Università degli Studi di Milano, Department of Historical Studies(米兰大学历史学系) Università degli Studi di Milano, Department of Computer Science(米兰大学计算机科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Journal ref Proceedings of the Third Workshop on Language Technologies for Historical and Ancient Languages (LT4HALA) @ LREC-COLING-2024, 41-49

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22606 2025-07-31 cs.AI 70%

MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines

Yaolun Zhang, Xiaogeng Liu, Chaowei Xiao

机构 * University of Wisconsin - Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20156 2025-07-29 cs.CV cs.AI 70%

Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality

Daulet Toibazar, Kesen Wang, Sherif Mohamed, Abdulaziz Al-Badawi, Abdulrahman Alfulayt, Pedro J. Moreno

机构 * Humain Riyadh, KSA(利雅得人类,沙特阿拉伯)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14508 2025-07-28 cs.LG 70%

Less is More: Adaptive Coverage for Synthetic Training Data

Sasan Tavakkol, Max Springer, Mohammadhossein Bateni, Neslihan Bulut, Vincent Cohen-Addad, MohammadTaghi Hajiaghayi

机构 * Google Research(谷歌研究) University of Maryland(马里兰大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04457 2025-07-24 cs.SD cs.CL eess.AS 70%

Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration

Shigeki Karita, Yuma Koizumi, Heiga Zen, Haruko Ishikawa, Robin Scheibler, Michiel Bacchiani

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to IEEE WASPAA2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16844 2025-07-24 cs.LG 70%

TD-Interpreter: Enhancing the Understanding of Timing Diagrams with Visual-Language Learning

Jie He, Vincent Theo Willem Kenbeek, Zhantao Yang, Meixun Qu, Ezio Bartocci, Dejan Ničković, Radu Grosu

机构 * Technische Universität Wien(维也纳技术大学) Shanghai Jiao Tong University(上海交通大学) AIT Austrian Institute of Technology(奥地利技术研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16478 2025-07-23 cs.AI cs.SE 70%

ACT: Bridging the Gap in Code Translation through Synthetic Data Generation & Adaptive Training

Shreya Saxena, Siva Prasad, Zishan Ahmad, Vishal Vaddina

机构 * Phi Labs Quantiphi Analytics

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15092 2025-07-22 cs.CL 70%

A Penalty Goes a Long Way: Measuring Lexical Diversity in Synthetic Texts Under Prompt-Influenced Length Variations

Vijeta Deshpande, Ishita Dasgupta, Uttaran Bhattacharya, Somdeb Sarkhel, Saayan Mitra, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛伊尔分校) Adobe Inc.(Adobe公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11476 2025-07-22 cs.CL 70%

FastMCTS: A Simple Sampling Strategy for Data Synthesis

Peiji Li, Kai Lv, Yunfan Shao, Yichuan Ma, Linyang Li, Xiaoqing Zheng, Xipeng Qiu, Qipeng Guo

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11771 2025-07-17 cs.LG 70%

Scaling laws for activation steering with Llama 2 models and refusal mechanisms

Sheikh Abdur Raheem Ali, Justin Xu, Ivory Yang, Jasmine Xinze Li, Ayse Arslan, Clark Benham

机构 * Trajectory Labs(轨迹实验室) Stanford University(斯坦福大学) Dartmouth College(达特茅斯学院) Cornell University(康奈尔大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10341 2025-07-17 cs.CL 70%

Organize the Web: Constructing Domains Enhances Pre-Training Data Curation

Alexander Wettig, Kyle Lo, Sewon Min, Hannaneh Hajishirzi, Danqi Chen, Luca Soldaini

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at ICML 2025. Project page: https://weborganizer.allen.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11216 2025-07-16 cs.CL 70%

EsBBQ and CaBBQ: The Spanish and Catalan Bias Benchmarks for Question Answering

Valle Ruiz-Fernández, Mario Mina, Júlia Falcão, Luis Vasquez-Reina, Anna Sallés, Aitor Gonzalez-Agirre, Olatz Perez-de-Viñaspre

机构 * Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS)) HiTZ Center – IXA, University of the Basque Country(HiTZ中心–IXA,巴斯克大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22362 2025-07-15 cs.CL 70%

Supposedly Equivalent Facts That Aren't? Entity Frequency in Pre-training Induces Asymmetry in LLMs

Yuan He, Bailan He, Zifeng Ding, Alisia Lupidi, Yuqicheng Zhu, Shuo Chen, Caiqi Zhang, Jiaoyan Chen, Yunpu Ma, Volker Tresp, Ian Horrocks

机构 * Amazon(亚马逊) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Siemens AG(西门子公司) University of Cambridge(剑桥大学) Meta University of Stuttgart(斯图加特大学) Bosch Center for AI(博世人工智能中心) The University of Manchester(曼彻斯特大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08197 2025-07-14 cond-mat.dis-nn cs.AI 70%

Consciousness as a Jamming Phase

Kaichen Ouyang

机构 * Department of Mathematics, University of Science and Technology of China(数学系,中国科学技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18151 2025-07-11 cs.CL 70%

CoAM: Corpus of All-Type Multiword Expressions

Yusuke Ide, Joshua Tanner, Adam Nohejl, Jacob Hoffman, Justin Vasselli, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学) Resolve Research(Resolve研究)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23325 2025-07-10 cs.SD cs.AI eess.AS 70%

XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs

Yitian Gong, Luozhijie Jin, Ruifan Deng, Dong Zhang, Xin Zhang, Qinyuan Cheng, Zhaoye Fei, Shimin Li, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05035 2025-07-08 cs.LG 70%

Beyond Scaling Curves: Internal Dynamics of Neural Networks Through the NTK Lens

Konstantin Nikolaou, Sven Krippendorf, Samuel Tovey, Christian Holm

机构 * Institute of Computational Physics, University of Stuttgart, Stuttgart, Germany(计算物理研究所,斯图加特大学,斯图加特,德国) Cavendish Laboratory(卡文迪许实验室) DAMTP, University of Cambridge, Cambridge, United Kingdom, CB3 0WA(戴维森数学理论物理系,剑桥大学,剑桥,英国,CB3 0WA)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03169 2025-07-08 stat.ML cs.LG 70%

Beyond SEO: A Transformer-Based Approach for Reinventing Web Content Optimisation

Florian Lüttgenau, Imar Colic, Gervasio Ramirez

机构 * Department of Management, London School of Economics and Political Science(伦敦政治经济学院管理系) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02103 2025-07-04 cs.AI q-bio.NC 70%

What Neuroscience Can Teach AI About Learning in Continuously Changing Environments

Daniel Durstewitz, Bruno Averbeck, Georgia Koppe

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Submitted as a Perspective article (10 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏