arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2605.29387 2026-05-29 cs.LG cs.AI stat.ML 73%

On the Optimizer Dependence of Neural Scaling Laws

神经缩放定律的优化器依赖性

Vansh Ramani, Shourya Vir Jain

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Delhi(计算机科学与工程系,印度理工学院德里)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 通过随机特征回归实验,发现优化器类型系统性地影响神经缩放定律中的缩放指数α,预条件优化器产生更陡峭的缩放,并提供了光谱诊断预测高级优化器的收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24911 2026-05-26 cs.LG cs.AI 73%

Factorize to Generalize: Retrieval-Guided Invariant-Dynamic Decomposition for Time Series Forecasting

因式分解以泛化:面向时间序列预测的检索引导不变-动态分解

Jinjin Chi, Lei Feng, Lulu Zhang, Yongcheng Jing, Yiming Wang, Ximing Li, Jialie Shen, Leszek Rutkowski, Dacheng Tao

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) City St George’s, University of London(伦敦大学城圣乔治学院) Systems Research Institute, Polish Academy of Sciences(波兰科学院系统研究所)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出检索引导的不变-动态分解框架,通过分离稳定共享结构与实例特定变化,提升时间序列零样本预测在分布偏移下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06870 2026-05-26 cs.LG cs.AI 73%

QASA: Quality-Aware Semantic Augmentation for Robust Multimodal Sentiment Analysis

QASA: 面向鲁棒多模态情感分析的质量感知语义增强

Jiazhang Liang, Jianheng Dai, Miaosen Luo, Menghua Jiang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出QASA框架,利用扩散模型生成视觉和听觉增强样本,并通过解耦质量感知评分模块分配训练权重,以解决高质量数据稀缺问题,提升多模态情感分析的鲁棒性和泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21540 2026-05-22 cs.SI cs.AI cs.CL cs.CY 73%

Detecting Synthetic Political Narratives in Cross-Platform Social Media Discourse

在跨平台社交媒体讨论中检测合成政治叙述

Despoina Antonakaki, Sotiris Ioannidis

机构 * Institute of Computer Science, Foundation for Research and Technology(计算机科学研究所,希腊研究与技术基金会) Technical University of Crete(希腊克里特技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种跨平台框架,通过四个协调信号(词汇多样性、时间爆发性、修辞重复和语义同质性)组合成合成叙述协调评分SNC(C),以检测合成政治叙述,研究发现IntelSlava在四个事件窗口中排名第一,而Rybar尽管语义同质性高但因语言差异导致表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21486 2026-05-21 cs.LG cond-mat.dis-nn cs.AI stat.ML 73%

Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate

量化超参数迁移与嵌入层学习率的重要性

Dayal Singh Kalra, Maissam Barkeshli

机构 * Department of Physics, University of Maryland, College Park(马里兰大学物理系) Department of Computer Science, University of Maryland, College Park(马里兰大学计算机科学系) Joint Quantum Institute, University of Maryland, College Park(马里兰大学联合量子研究所) Meta Superintelligence Labs, Fundamental AI Research(Meta超智能实验室,基础人工智能研究)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了超参数迁移的量化方法,通过三种指标评估超参数迁移的质量,发现Maximal Update(μP)参数化在训练中通过最大化嵌入层学习率提升了超参数迁移质量,而权重衰减虽改善了缩放定律拟合,但会降低外推鲁棒性。

Comments 10+28 pages, 5+17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20189 2026-05-21 cs.AI cs.LG 73%

SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation

SOLAR:一种自优化的开放式自主代理,用于终身学习和持续适应

Nitin Vetcha, Dianbo Liu

机构 * Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore, Singapore(眼科学系,Yong Loo Lin医学院,新加坡国立大学,新加坡) Department of Computational and Data Sciences, Indian Institute of Science, Bangalore, Karnataka, India(计算与数据科学系,印度科学研究院,班加罗尔,卡纳塔克邦,印度)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOLAR,一种自优化的开放式自主代理,通过参数级元学习实现自我改进,解决了动态真实世界中概念漂移和梯度基适应成本高的问题,展示了在常识、数学、医学、编程、社交和逻辑推理任务上的优越性能。

Comments Accepted at "Association for the Advancement of Artificial Intelligence 2026 Conference" in Streaming Continual Learning Bridge. Published in CEUR Workshop Proceedings (Original version at https://ceur-ws.org/Vol-4183/paper2.pdf)

Journal ref CEUR Workshop Proceedings, Vol. 4183, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18607 2026-05-19 cs.CL cs.LG 73%

Forecasting Downstream Performance of LLMs With Proxy Metrics

通过代理指标预测大语言模型的下游性能

Arkil Patel, Siva Reddy, Marius Mosbach, Dzmitry Bahdanau

机构 * Mila – Quebec AI Institute & McGill University(魁北克AI研究院与麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) ServiceNow Research Periodic Labs(ServiceNow研究周期实验室)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过聚合候选模型的下一个token分布中的token级统计信息(如熵、top-k准确率和专家token排名)来构建代理指标,以更准确地预测大语言模型的下游性能,优于传统的损失和计算量基线方法。

Comments Preprint. 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00901 2026-05-19 cs.LG cs.CL 73%

Provable Knowledge Acquisition and Extraction in One-Layer Transformers

在单层变换器中可证明的知识获取与提取

Ruichen Xu, Kexin Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了单层变换器中知识获取与提取的机制,通过理论分析和实验验证,揭示了预训练和微调过程中知识存储与提取的关系,以及低秩微调如何恢复预训练的事实知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15290 2026-05-18 cs.LG cs.AI 73%

GQA-μP: The maximal parameterization update for grouped query attention

GQA-μP:组查询注意力的最大参数更新

Kyle R. Chickering, Huijuan Wang, Mengxi Wu, Alexander Moreno, Muhao Chen, Xuezhe Ma, Daria Soboleva, Joel Hestness, Zhengzhong Liu, Eric Xing

机构 * UC Davis(加州大学戴维斯分校) MBZUAI IFM(脑科学与人工智能研究院(MBZUAI IFM)) USC(南加州大学) Cerebras(Cerebras公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文基于谱特征学习观点,提出组查询注意力的最大参数更新方法,通过数学分析实现参数转移,解决了新模型架构下的参数更新难题。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13789 2026-05-15 cs.LG cs.AI q-bio.BM 73%

ENSEMBITS: an alphabet of protein conformational ensembles

ENSEMBITS: 蛋白质构象集合的字母表

Kaiwen Shi, Carlos Oliver

机构 * Department of Computer Science, Vanderbilt University(范德比尔特大学计算机科学系) Center for AI in Protein Dynamics, Vanderbilt University(蛋白质动力学中的人工智能中心,范德比尔特大学) Department of Molecular Physiology and Biophysics, Vanderbilt University(分子生理学与生物物理学系,范德比尔特大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Ensembits,首个蛋白质构象集合分词器,通过残差VQ-VAE训练,在动态数据稀疏性挑战中表现优异,提升RMSF预测及多种结构预测任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08715 2026-05-15 cs.CL cs.AI cs.MA 73%

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems

AgentForesight:多智能体系统中在线审计的早期故障预测

Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang

机构 * Rutgers University(新泽西罗格拉大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出AgentForesight框架,通过在线审计实现多智能体系统中早期故障预测,利用AFTraj-2K数据集训练出AgentForesight-7B模型,在性能和定位精度上优于GPT-4.1等模型。

Comments 33 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16060 2026-05-15 cs.LG cs.AI eess.SP 73%

Tokenizing Single-Channel EEG with Time-Frequency Motif Learning

使用时间-频率动机学习对单通道EEG进行分词

Jathurshan Pradeepkumar, Xihao Piao, Zheng Chen, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SANKEN, Osaka University(大阪大学SANKEN)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TFM-Tokenizer,通过学习单通道EEG信号的时间-频率动机词汇,提升EEG分词准确性,实验显示在多个基准上性能提升达11%,且适用于多种基础模型,具备良好的通用性和可扩展性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00270 2026-05-15 cs.LG cs.AI stat.ML 73%

DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks

DUET:通过未见评估任务的反馈优化训练数据混合

Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) Agency for Research, Science, Technology and Research (A*STAR)(研究、科技与研发机构)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出DUET算法,通过结合影响函数与贝叶斯优化,利用未见评估任务的反馈优化训练数据混合,理论证明其能收敛至最优混合,实验显示优于现有方法。

Comments Accepted to ICLR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10616 2026-05-12 cs.LG cs.CL cs.CV 73%

MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image

MulTaBench: 基于文本和图像的多模态表格学习基准测试

Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia Blayer, David Holzmüller, Lennart Purucker, Gaël Varoquaux, Frank Hutter, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) Prior Labs(Prior实验室) NVIDIA SODA Team, INRIA Saclay, Palaiseau(SODA团队,INRIA萨克莱,帕莱索) University of Freiburg(弗赖堡大学) Probabl ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 MulTaBench通过40个数据集评估多模态表格学习,强调任务特定的表示学习,展示目标感知表示在文本和图像模态中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05064 2026-05-12 cs.LG cs.AI 73%

Dynamic Linear Coregionalization for Realistic Synthetic Multivariate Time Series

动态线性共区域化用于真实合成多变量时间序列

Annita Vapsi, Penghang Liu, Saheed Obitayo, Aakriti, Manoj Cherukumalli, Prathamesh Patil, Amit Varshney, Nicolas Marchesotti, Elizabeth Fons, Vamsi K. Potluru, Manuela Veloso

机构 * JPMorganChase(摩根大通)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DynLMC模型,通过引入时变和制度切换相关性及跨通道滞后结构,生成与真实数据相似的多变量时间序列,提升FMTS的迁移能力。

Comments ICLR 2026 Workshop on Time Series in the Age of Large Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04556 2026-05-11 cs.CL cs.LG 73%

Rethinking Weight Tying: Pseudo-Inverse Tying for LM Stable Training and Updates

重新思考权重绑定:用于语言模型稳定训练和更新的伪逆绑定

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(墨尔本大学) Technical University of Munich(慕尼黑技术大学) Chongqing University(重庆大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出伪逆绑定方法,通过同步嵌入和解嵌入作为共享的潜在令牌记忆的耦合投影,提升语言模型训练稳定性与接口一致性,同时改善可解释性探查。

Comments an early-stage version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13879 2026-05-08 cs.CL cs.AI 73%

Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production

暂停呼吸:自适应计算用于自 paced 序列生成

Alexandre Galashov, Matt Jones, Rosemary Ke, Yuan Cao, Vaishnavh Nagarajan, Michael C. Mozer

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CYB损失函数,通过自适应计算机制提升模型表达能力,实验显示在预训练和微调中优于标准交叉熵,降低困惑度并提升下游任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01356 2026-05-05 cs.LG cs.AI 73%

Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

基于模型的主动成本生成:用于在有限违规数据下学习安全策略

Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies Nanjing, China(南京Polixir科技有限公司) Tencent Game AI Center Shenzhen, China(腾讯深圳游戏AI中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PROCO框架,利用大语言模型整合自然语言知识,通过构建保守成本函数和模型基于的模拟,减少约束违规并提升安全性,适用于离线数据中极少或无违规样本的高风险场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27550 2026-05-01 cs.CL cs.AI 73%

APPSI-139: A Parallel Corpus of English Application Privacy Policy Summarization and Interpretation

APPSI-139: 一个平行语料库,用于英语应用隐私政策的摘要与解释

Pengyun Zhu, Qiheng Sun, Long Wen, Yanbo Wang, Yang Cao, Junxu Liu, Deyi Xiong, Jinfei Liu, Zhibo Wang, Kui Ren

机构 * Tianjin University(天津大学) Zhejiang University(浙江大学) North University of China(北方工业大学) Institute of Science Tokyo(东京科学研究所) The Hong Kong Polytechnic University(香港理工大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APPSI-139平行语料库,包含139个隐私政策及15,692个改写语料,结合TCSI-pp-V2框架提升摘要与解释的可读性与可靠性,优于GPT-4o等大模型。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20850 2026-04-24 cs.IR cs.AI cs.CL 73%

Association Is Not Similarity: Learning Corpus-Specific Associations for Multi-Hop Retrieval

关联并非相似性:为多跳检索学习语料特定的关联

Jason Dury

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出AAR方法,通过对比学习在嵌入空间中学习语料特定的关联关系,提升多跳检索的召回率,且无需评估集调优。

Comments 10 pages, 7 appendices, 10 tables. Code: https://github.com/EridosAI/AAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18087 2026-04-21 cs.CL cs.AI cs.CY 73%

Mix and Match: Context Pairing for Scalable Topic-Controlled Educational Summarisation

混合与匹配:用于可扩展主题控制教育摘要的上下文配对

Nathikan Yodthapa, Thanapong Intharah, Sahan Bulathwela

机构 * Visual Intelligence Laboratory, Department of Statistics, Faculty of Science, Khon Kaen University, Khon Kaen 40002, Thailand(科纳坎大学科学学院统计学系视觉智能实验室) Centre for Artificial Intelligence, Department of Computer Science, University College London, London WC1E 6BT, The United Kingdom(伦敦大学学院人工智能中心计算机科学系)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种数据增强策略,通过跨文档上下文配对提升小语言模型的主题控制摘要能力,实验表明增强规模增加可提升模型表现,且在参数和训练数据较少时仍能竞争性地表现优异。

Comments To be published at the International Conference on Artificial Intelligence in Education (AIED'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09378 2026-04-21 cs.LG cs.AI 73%

The Potential of Second-Order Optimization for LLMs: A Study with Full Gauss-Newton

二阶优化在大语言模型中的潜力:基于完整高斯-牛顿方法的探讨

Natalie Abreu, Nikhil Vyas, Sham Kakade, Depen Morwani

机构 * Kempner Institute, Harvard University(哈佛大学凯普纳研究所) Department of Computer Science, Harvard University(哈佛大学计算机科学系)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过完整高斯-牛顿预处理探讨了二阶优化在大语言模型训练中的潜力,发现其在训练迭代次数上比现有优化器提升5.4倍,并表明分层Hessian结构能有效实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07415 2026-04-21 cs.CV cs.CL cs.LG 73%

RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase Extraction

RA-RRG:结合关键短语提取的多模态检索增强放射学报告生成

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司) Department of Artificial Intelligence and Data Science, Sejong University(Sejong大学人工智能与数据科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RA-RRG通过结合多模态检索与大语言模型生成放射学报告,减少幻觉和计算需求,实验显示在CheXbert指标上优于现有模型。

Comments ACL 2026, Findings of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13620 2026-04-16 cs.CL cs.AI 73%

Syn-TurnTurk: A Synthetic Dataset for Turn-Taking Prediction in Turkish Dialogues

Syn-TurnTurk:一种用于土耳其对话中轮询预测的合成数据集

Ahmet Tuğrul Bayrak, Mustafa Sertaç Türkel, Fatma Nur Korkmaz

机构 * Qwen(通义实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Syn-TurnTurk数据集,通过Qwen大语言模型生成土耳其对话数据,用于提升轮询预测的准确性与AUC分数,促进自然的人机交互。

Comments Accepted for publication in IEEE ICASI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13054 2026-04-16 cs.CL cs.AI cs.CV 73%

Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling

先caption,后VQA:知识密度而非任务格式驱动多模态扩展

Hongjian Zou, Yue Ge, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * vivo AI Lab(vivo人工智能实验室) Wuhan University(武汉大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。

Comments 23 pages, 4 figures, 10 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24503 2026-04-14 cs.LG cs.AI 73%

Can Small Training Runs Reliably Guide Data Curation? Rethinking Proxy-Model Practice

小规模训练能否可靠地指导数据整理?重新审视代理模型实践

Jiachen T. Wang, Tong Wu, Kaifeng Lyu, James Zou, Dawn Song, Ruoxi Jia, Prateek Mittal

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了小规模代理模型训练在数据整理中的可靠性问题,指出固定配置协议与全规模模型开发流程的差异,并提出通过降低学习率提升小规模实验的可靠性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL 73%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08578 2026-04-13 cs.LG cs.AI 73%

Structured Exploration and Exploitation of Label Functions for Automated Data Annotation

结构化探索与利用标签函数以实现自动化数据标注

Phong Lam, Ha-Linh Nguyen, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(越南国立大学工程与技术学院信息技术系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EXPONA框架,通过多级标签函数探索与可靠性机制提升自动化标注质量,实现更一致的标签质量和下游性能。

Comments Accepted by KBS Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08398 2026-04-10 cs.LG cs.AI 73%

ADAPTive Input Training for Many-to-One Pre-Training on Time-Series Classification

适应性输入训练用于时间序列分类的多对一预训练

Paul Quinlan, Qingguo Li, Xiaodan Zhu

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADAPT方法,通过适应性输入训练提升时间序列多任务预训练效果,实现跨数据集的高效对齐与泛化,取得分类基准新高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07320 2026-04-09 cs.CL cs.AI 73%

Evaluating In-Context Translation with Synchronous Context-Free Grammar Transduction

基于上下文的翻译评估:同步上下文无关文法转换

Jackson Petty, Jaulie Goe, Tal Linzen

机构 * New York University(纽约大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM在低资源语言翻译中的挑战,通过构建形式文法模型评估翻译性能,发现语法规模、句子长度及语言差异显著影响翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏