arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-05 至 2025-12-05 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2512.04871 2025-12-05 cs.AI cs.CL cs.LG 91%

STELLA: Guiding Large Language Models for Time Series Forecasting with Semantic Abstractions

STELLA: 通过语义抽象引导大型语言模型进行时间序列预测

Junjie Fan, Hongye Zhao, Linduo Wei, Jiayu Rao, Guijia Li, Jiaxin Yuan, Wenqi Xu, Yong Qi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 STELLA通过动态语义抽象机制,提升大型语言模型在时间序列预测中的表现,实现更精准的长期和短期预测。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17892 2025-12-05 cs.CL 88%

EMMA-500: Enhancing Massively Multilingual Adaptation of Large Language Models

EMMA-500: 提升大规模多语言适应性的大语言模型

Shaoxiong Ji, Zihao Li, Jaakko Paavola, Peiqin Lin, Pinzhen Chen, Dayyán O'Brien, Hengyu Luo, Hinrich Schütze, Jörg Tiedemann, Barry Haddow

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 EMMA-500通过持续预训练提升多语言性能,尤其改善低资源语言的覆盖与跨语言迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00469 2025-12-05 cs.CL 84%

Massively Multilingual Adaptation of Large Language Models Using Bilingual Translation Data

利用双语翻译数据进行大规模多语言大语言模型适应

Shaoxiong Ji, Zihao Li, Jaakko Paavola, Hengyu Luo, Jörg Tiedemann

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出利用双语翻译数据提升大规模多语言大语言模型在500种语言上的适应性能,通过构建MaLA语料库和开发EMMA-500模型,验证了双语数据对语言迁移和低资源语言性能的积极影响。

Comments EMMA-500 Gen 2; refer to Gen 1 in arXiv:2409.17892

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15470 2025-12-05 cs.CV cs.AI 83%

EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining

EgoDTM: 向3D感知的自体视频-语言预训练迈进

Boshen Xu, Yuting Mei, Xinbi Liu, Sipeng Zheng, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能3实验室)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 EgoDTM通过结合大规模3D感知视频预训练和视频-文本对比学习,提升视频-语言模型的3D感知能力,实现更丰富的空间理解。

Comments Code: https://github.com/xuboshen/EgoDTM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04319 2025-12-05 cs.SE cs.AI 70%

MANTRA: a Framework for Multi-stage Adaptive Noise TReAtment During Training

MANTRA: 一个用于训练期间多阶段自适应噪声处理的框架

Zixiao Zhao, Fatemeh H. Fard, Jie JW Wu

机构 * University of British Columbia(不列颠哥伦比亚大学) Michigan Technological University(密歇根技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MANTRA通过多阶段自适应噪声处理框架提升代码预训练模型和LLMs在软件工程任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16717 2025-12-05 cs.CL 70%

Semi-Supervised Synthetic Data Generation with Fine-Grained Relevance Control for Short Video Search Relevance Modeling

半监督合成数据生成与细粒度相关性控制用于短视频搜索相关性建模

Haoran Li, Zhiming Su, Junyan Yao, Enwei Zhang, Yang Ji, Yan Chen, Kan Zhou, Chao Feng, Jiao Ran

专题命中 预训练与数据 :SFT(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出一种半监督合成数据生成方法,通过细粒度相关性控制提升短视频搜索相关性建模效果,实验显示其在推荐系统中提升了CTR、SRR和IUPR

Comments Submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01269 2025-12-05 cs.CL cs.CY 70%

ChatGPT for President! Presupposed content in politicians versus GPT-generated texts

总统用ChatGPT!政治家与GPT生成文本中的预设内容

Davide Garassino, Nicola Brocca, Viviana Masia

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究分析ChatGPT生成文本与政治家演讲在预设使用上的差异,揭示其在政治话语中的潜在风险。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04222 2025-12-05 cs.CV 67%

ReasonX: MLLM-Guided Intrinsic Image Decomposition

ReasonX: 基于多模态大语言模型的内在图像分解

Alara Dirik, Tuanfeng Wang, Duygu Ceylan, Stefanos Zafeiriou, Anna Frühstück

机构 * Imperial College London(伦敦帝国学院) Adobe Research(Adobe研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 ReasonX通过多模态大语言模型提供相对比较监督,提升内在图像分解的泛化能力与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05080 2025-12-05 cs.LG 57%

OMTRA: A Multi-Task Generative Model for Structure-Based Drug Design

OMTRA: 一种基于结构的药物设计多任务生成模型

Ian Dunn, Liv Toft, Tyler Katz, Juhi Gupta, Riya Shah, Ramith Hettiarachchi, David R. Koes

机构 * Department of Computational and Systems Biology, School of Medicine, University of Pittsburgh(计算生物学系,医学院,匹兹堡大学) Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(Ray和Stephanie Lane计算生物学系,计算机科学学院,卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 OMTRA是一种多任务生成模型,用于基于结构的药物设计,通过多模态流匹配模型实现多种相关任务的统一框架,提升了从头设计和对接性能。

Comments Presented at the Machine Learning for Structural Biology Workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19051 2025-12-05 cs.CV cs.AI cs.MM 57%

Multimodal Markup Document Models for Graphic Design Completion

多模态标记文档模型用于图形设计完成

Kotaro Kikuchi, Ukyo Honda, Naoto Inoue, Mayu Otani, Edgar Simo-Serra, Kota Yamaguchi

机构 * Waseda University(早稻田大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 MarkupDM是一种多模态标记文档模型,通过统一处理图形设计任务,实现文本、图像和属性值的完成,展示了其在设计自动化中的广泛适用性。

Comments Accepted by ACM Multimedia 2025, Project page: https://cyberagentailab.github.io/MarkupDM/

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia. 2025. p.11022-11031

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01523 2025-12-05 cs.IR 50%

MetaSynth: Multi-Agent Metadata Generation from Implicit Feedback in Black-Box Systems

MetaSynth: 从黑盒系统中的隐式反馈生成多智能体元数据

Shreeranjani Srirangamsridharan, Ali Abavisani, Reza Yousefi Maragheh, Ramin Giahi, Kai Zhao, Jason Cho, Sushant Kumar

专题命中 预训练与数据 :LLM(abstract)

AI总结 MetaSynth通过多智能体检索增强生成框架,利用黑盒系统中的隐式反馈优化元数据生成,提升了CTR和点击率表现。

Comments IEEE Big Data 2025

详情

展开后加载摘要…

URL PDF HTML 收藏