arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2512.12938 2025-12-16 cs.IR 75%

SPAR: Session-based Pipeline for Adaptive Retrieval on Legacy File Systems

SPAR:基于会话的适应性检索管道

Duy A. Nguyen, Hai H. Do, Minh Doan, Minh N. Do

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SPAR通过轻量级两阶段流程整合LLMs与RAG架构,提升遗留文件系统中检索效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 75%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12107 2025-12-16 cs.CV 75%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08764 2025-12-10 cs.CE 75%

Financial News Summarization: Can extractive methods still offer a true alternative to LLMs?

金融新闻摘要:提取方法是否仍然能为LLM提供真正的替代方案?

Nicolas Reche, Elvys Linhares-Pontes, Juan-Manuel Torres-Moreno

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究评估了提取方法与LLM在金融新闻摘要中的性能,发现LLM虽更连贯但易出错,而提取方法在短文本上更高效且可靠。

Comments 8 pages, 5 tables

Journal ref Advances in Soft Computing. MICAI 2025. Lecture Notes in Computer Science, vol 16221. Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02098 2025-12-08 cs.CL cs.AI cs.LG 75%

CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation

为你的数据集定制:通过语料检索与增强进行任务特定合成数据集生成

Ingo Ziegler, Abdullatif Köksal, Desmond Elliott, Hinrich Schütze

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Center for Information and Language Processing (CIS), LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CRAFT通过语料检索与增强生成任务特定合成数据集,有效提升问答和摘要任务的模型性能。

Comments Accepted at TACL; Pre-MIT Press publication version. Code and dataset available at: https://github.com/ziegler-ingo/CRAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00928 2025-12-02 cs.MM 75%

Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation

增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成

Jiajun Cao, Qinggang Zhang, Yunbo Tang, Zhishang Xiang, Chang Yang, Jinsong Su

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21191 2025-11-27 cs.CV 75%

Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

场景作为标记:多尺度正常分布变换标记器用于通用3D视觉-语言理解

Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala, Rama Chellappa, Cheng Peng, Mei Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软公司)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);prompting(abstract)

AI总结 NDTokenizer3D通过多尺度NDT表示和解码器实现通用3D视觉-语言理解,提升3D场景任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00416 2025-11-25 cs.RO cs.CV 75%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18335 2025-11-25 cs.CL cs.AI cs.LG 75%

OmniStruct: Universal Text-to-Structure Generation across Diverse Schemas

OmniStruct: 跨多样的模式生成的通用文本到结构生成

James Y. Huang, Wenxuan Zhou, Nan Xu, Fei Wang, Qin Liu, Sheng Zhang, Hoifung Poon, Muhao Chen

机构 * University of Southern California(南加州大学) University of California, Davis(加州大学戴维斯分校) Microsoft Research(微软研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OmniStruct提出了一种跨多种模式的通用文本到结构生成方法,通过合成数据训练小型模型,实现与GPT-4o相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16028 2025-11-21 cs.CY 75%

Can Online GenAI Discussion Serve as Bellwether for Labor Market Shifts?

在线生成式AI讨论能否作为劳动力市场转变的风向标?

Shurui Cao, Wenyue Hua, William Yang Wang, Hong Shen, Fei Fang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究在线生成式AI讨论是否能作为劳动力市场转变的早期预测指标,通过分析讨论强度与就业变化的关系,证明其对劳动力动态的预测有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12690 2025-11-18 cs.CL cs.AI cs.LG 75%

Improving Direct Persian-English Speech-to-Speech Translation with Discrete Units and Synthetic Parallel Data

Sina Rashidi, Hossein Sameti

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02124 2025-11-18 cs.AI cs.CL cs.LG 75%

Trainable Dynamic Mask Sparse Attention

Jingze Shi, Yifan Wu, Yiran Peng, Bingheng Wu, Liangdong Wang, Guang Liu, Yuyu Luo

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05029 2025-11-11 cs.LG cs.AI cs.CL 75%

Continual Pre-training of MoEs: How robust is your router?

Benjamin Thérien, Charles-Étienne Joseph, Zain Sarwar, Ashwinee Panda, Anirban Das, Shi-Xiong Zhang, Stephen Rawls, Sambit Sahu, Eugene Belilovsky, Irina Rish

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Concordia University(康科迪亚大学) University of Chicago(芝加哥大学) Capital One(Capital One公司)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25067 2025-11-05 cs.CV 75%

DRIP: Dynamic patch Reduction via Interpretable Pooling

Yusen Peng, Sachin Kumar

专题命中 预训练与数据 :language model(abstract);instruction tuning(abstract);pretraining(abstract)

Comments Need more refinement

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17359 2025-11-04 cs.IR 75%

MLLM-Driven Semantic Identifier Generation for Generative Cross-Modal Retrieval

Tianyuan Li, Lei Wang, Ahtamjan Ahmat, Yating Yang, Bo Ma, Rui Dong, Bangju Han

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract)

Comments We plan to revise the methodology and update the experimental analysis before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24817 2025-10-31 cs.CL cs.AI cs.LG 75%

Towards a Method for Synthetic Generation of Persons with Aphasia Transcripts

Jason M. Pittman, Anton Phillips, Yesenia Medina-Santos, Brielle C. Stark

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21671 2025-10-27 cs.IR 75%

A Data-Centric Approach to Multilingual E-Commerce Product Search: Case Study on Query-Category and Query-Item Relevance

Yabo Yin, Yang Xi, Jialong Wang, Shanqi Wang, Jiateng Hu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18502 2025-10-22 cs.CV cs.AI cs.CL cs.LG 75%

Zero-Shot Vehicle Model Recognition via Text-Based Retrieval-Augmented Generation

Wei-Chia Chang, Yan-Ann Chen

机构 * Yuan Ze University(元智大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by The 38th Conference of Open Innovations Association FRUCT, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17033 2025-10-21 cs.CR 75%

Watermark Robustness and Radioactivity May Be at Odds in Federated Learning

Leixu Huang, Zedian Shao, Teodora Baluta

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 9 pages, 4 figures (not including citation and appendix) submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14919 2025-10-17 cs.CL cs.AI cs.LG 75%

Predicting Task Performance with Context-aware Scaling Laws

Kyle Montgomery, David Park, Jianhong Tu, Michael Bendersky, Beliz Gunel, Dawn Song, Chenguang Wang

机构 * UC Santa Cruz(加州大学圣克ruz分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) Databricks(Databricks公司) Google DeepMind(谷歌DeepMind) UC Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04445 2025-10-17 cs.RO cs.AI cs.CL cs.CV cs.LG 75%

Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos

Yi Chen, Yuying Ge, Weiliang Tang, Yizhuo Li, Yixiao Ge, Mingyu Ding, Ying Shan, Xihui Liu

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG实验室) The Chinese University of Hong Kong(香港中文大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICCV 2025. Project page: https://chenyi99.github.io/moto/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13462 2025-10-16 cs.CR 75%

Who Speaks for the Trigger? Dynamic Expert Routing in Backdoored Mixture-of-Experts Transformers

Xin Zhao, Xiaojun Chen, Bingshan Liu, Haoyu Gao, Zhendong Zhao, Yilong Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05970 2025-10-14 cs.CV 75%

Automatic Synthesis of High-Quality Triplet Data for Composed Image Retrieval

Haiwen Li, Delong Liu, Zhaohui Hou, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments This paper was originally submitted to ACM MM 2025 on April 12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01388 2025-10-03 cs.RO cs.CV 75%

VENTURA: Adapting Image Diffusion Models for Unified Task Conditioned Navigation

Arthur Zhang, Xiangyun Meng, Luca Calliari, Dong-Ki Kim, Shayegan Omidshafiei, Joydeep Biswas, Ali Agha, Amirreza Shaban

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);pretraining(abstract)

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14270 2025-10-03 cs.CL cs.AI cs.LG cs.MM cs.SD eess.AS 75%

SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models

Karan Dua, Puneet Mittal, Ranjeet Gupta, Hitesh Laxmichand Patel

机构 * Oracle AI

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2025

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track) - 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24183 2025-09-30 cs.CL cs.AI cs.LG 75%

Retrieval-augmented GUI Agents with Generative Guidelines

Ran Xu, Kaixin Ma, Wenhao Yu, Hongming Zhang, Joyce C. Ho, Carl Yang, Dong Yu

机构 * Emory University(埃默里大学) Tencent AI Lab(腾讯AI实验室)

专题命中 预训练与数据 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23678 2025-09-30 cs.LG cs.AI cs.CL 75%

Towards a Comprehensive Scaling Law of Mixture-of-Experts

Guoliang Zhao, Yuhan Fu, Shuaipeng Li, Xingwu Sun, Ruobing Xie, An Wang, Weidong Han, Zhen Yang, Weixuan Sun, Yudong Zhang, Cheng-zhong Xu, Di Wang, Jie Jiang

机构 * Tencent Hunyuan(腾讯文元) University of Macau(澳门大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03547 2025-09-25 cs.HC 75%

Guided Reality: Generating Visually-Enriched AR Task Guidance with LLMs and Vision Models

Ada Yi Zhao, Aditya Gunturu, Ellen Yi-Luen Do, Ryo Suzuki

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments To appear at UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19918 2025-09-25 cs.SE 75%

Beyond Language Barriers: Multi-Agent Coordination for Multi-Language Code Generation

Micheline Bénédicte Moumoula, Serge Lionel Nikiema, Albérick Euraste Djire, Abdoul Kader Kabore, Jacques Klein, Tegawendé F. Bissyande

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10538 2025-09-16 cs.LG cs.AI cs.CL cs.CY 75%

DualAlign: Generating Clinically Grounded Synthetic Data

Rumeng Li, Xun Wang, Hong Yu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏