arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2509.24255 2026-05-04 cs.HC cs.LG 70%

Understanding Cognitive States from Head & Hand Motion Data

从头和手的运动数据理解认知状态

Kaiang Wen, Mark Roman Miller

机构 * Department of Computer Science(计算机科学系) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文研究通过VR telemetry数据推断决策过程中的瞬时认知状态,提出新数据集和VR原生运动适配器,实现82%的准确率,展示VR运动数据蕴含更丰富的行为信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27300 2026-05-01 cs.AI 70%

METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution

METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化

Jianpeng Chen, Wangzhi Zhan, Dongqi Fu, Junkai Zhang, Zian Jia, Ling Li, Wei Wang, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of California Los Angeles(加州大学洛杉矶分校) Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 70%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25967 2026-04-30 cs.CL 70%

Semantic Label Drift in Cross-Cultural Translation

跨文化翻译中的语义标签漂移

Mohsinul Kabir, Tasnim Ahmed, Md Mezbaur Rahman, Polydoros Giannouris, Sophia Ananiadou

机构 * Department of Computer Science, National Center for Text Mining, The University of Manchester(计算机科学系,文本挖掘国家中心,曼彻斯特大学) School of Computing, Queen’s University, Ontario, Canada(计算学院,加拿大皇后大学) Computer Science, University of Illinois Chicago(计算机科学,伊利诺伊大学芝加哥分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了跨文化翻译中因文化差异导致的语义标签漂移问题,发现现代大语言模型在文化敏感领域易引发标签漂移,并揭示文化相似性对标签保真度的关键影响。

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24819 2026-04-29 cs.SE cs.AI 70%

Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

用数据编程:面向自改进大语言模型的测试驱动数据工程

Chenkai Pan, Xinglong Xu, Yuhang Xu, Yujun Wu, Siyuan Li, Jintao Chen, Conghui He, Jingxuan Wei, Cheng Tan

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过数据编程方法,将数据工程生命周期映射到软件开发生命周期,实现对大语言模型的可靠训练与改进,通过数据修复提升模型性能。

Comments 57 pages, 28 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23824 2026-04-28 cs.CL 70%

Resource-Lean Lexicon Induction for German Dialects

低资源方言词典诱导

Robert Litschko, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich, Germany(MaiNLP,信息与语言处理中心,慕尼黑大学,德国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用统计模型诱导德语方言词典,优于大语言模型,实现跨方言迁移,提供轻量数据驱动方案,实验显示在双语词典诱导和方言信息检索中表现优异。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23602 2026-04-28 cs.AR cs.LG 70%

TimingLLM: A Two-Stage Retrieval-Augmented Framework for Pre-Synthesis Timing Prediction from Verilog

TimingLLM: 一种两阶段检索增强框架,用于从Verilog预合成时间预测

Armin Abdollahi, Negin Ashrafi, Mehdi Kamal, Massoud Pedram

机构 * University of Southern California(美国南加州大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 TimingLLM通过两阶段检索增强框架,利用Verilog直接预测最坏负松弛和总负松弛,提升预合成时间预测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29171 2026-04-27 cs.CV cs.LG 70%

Segmentation of Gray Matters and White Matters from Brain MRI data

从脑部MRI数据中分割灰质和白质

Chang Sun, Rui Shi, Tsukasa Koike, Tetsuro Sekine, Akio Morita, Tetsuya Sakai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Waseda University(早稻田大学) Department of Neurosurgery(神经外科) Teraoka Memorial Hospital(寺田纪念医院) Department of Radiology(放射科) Nippon Medical School Hospital(日本医学大学医院) Tokyo Rosai Hospital(东京罗赛医院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出改进的MedSAM模型用于多类脑组织分割,通过预处理和调整解码器实现高精度分割,实验显示在IXI数据集上Dice分数达0.8751。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21265 2026-04-24 cs.CL 70%

Listen and Chant Before You Read: The Ladder of Beauty in LM Pre-Training

在阅读前聆听与吟唱:在LM预训练中的美感阶梯

Yoshinori Nomura

机构 * Mirage Mountain Technologies Inc.(Mirage Mountain Technologies公司)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 通过在语言前预训练音乐模型,显著加速语言学习。音乐→诗歌→散文的流程在随机初始化下提升了17.5%的困惑度,且在不同模型容量下表现出数据校准原则。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21061 2026-04-24 cs.AI 70%

InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language

InVitroVision:一种多模态AI模型,用于通过自然语言自动描述胚胎发育

Nicklas Neu, Thomas Ebner, Jasmin Primus, Raphael Zefferer, Bernhard Schenkenfelder, Mathias Brunbauer, Florian Kromp

机构 * Software Competence Center Hagenberg GmbH(软件能力中心海根贝格有限公司) Kinderwunsch Zentrum Kepler Universitätsklinikum(儿童愿望中心凯普勒大学诊所) Wunschkind Klinik Dr. Brunbauer(愿望宝宝诊所布兰鲍尔医生)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InVitroVision模型,通过微调多模态视觉语言模型,实现了对胚胎形态和发育的自然语言描述预测,展示了基础视觉语言模型在有限数据下应用于体外受精任务的潜力。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04548 2026-04-24 cond-mat.dis-nn cs.LG stat.ML 70%

Learning Linear Regression with Low-Rank Tasks in-Context

在上下文中学习低秩任务的线性回归

Kaito Takanami, Takashi Takahashi, Yoshiyuki Kabashima

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在上下文中学习如何在高维极限下精确刻画预测分布和泛化误差,并发现有限预训练数据中的统计波动诱导了隐式正则化,揭示了任务结构对泛化误差的相变。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03933 2026-04-24 cs.CL 70%

Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs

再次失去我们的尾巴:(非)自然选择与多语言大语言模型

Eva Vanmassenhove

机构 * Research Centre for Cognitive Science & Artificial Intelligence(认知科学与人工智能研究中心) Department of Computational Cognitive Science(计算认知科学系) Tilburg University(蒂尔堡大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨多语言大语言模型中翻译技术导致语言多样性丧失的问题,指出模型崩溃可能使语言形式、语法特征和文化内涵消失,呼吁保护多语言多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19028 2026-04-22 cs.LG 70%

Learning Posterior Predictive Distributions for Node Classification from Synthetic Graph Priors

从合成图先验学习后验预测分布用于节点分类

Jeongwhan Choi, Jongwoo Kim, Woosung Kang, Noseong Park

机构 * KAIST(韩国科学技术院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出NodePFN,通过学习后验预测分布实现对任意图的通用节点分类,无需图特定训练,利用合成图先验生成多样化的图结构和特征-标签关系。

Comments Accepted to ICLR 2026. OpenReview: https://openreview.net/forum?id=FmxRzlu0rT

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14324 2026-04-21 cs.CV cs.CL 70%

DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

DualToken: 向通过双视觉词汇统一视觉理解和生成迈进

Wei Song, Yuran Wang, Zijia Song, Yadong Li, Zenan Zhou, Long Chen, Jianhua Xu, Jiaqi Wang, Kaicheng Yu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Baichuan Inc.(北川科技) Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DualToken通过双视觉词汇统一视觉理解和生成,解决了视觉理解和生成所需不同表示空间的挑战,提升了ImageNet上的重建质量和零样本准确率,并在下游任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12919 2026-04-21 cs.CL 70%

MetFuse: Figurative Fusion between Metonymy and Metaphor

MetFuse:隐喻与隐喻之间的隐喻融合

Saptarshi Ghosh, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MetFuse数据集,通过将字面句转换为三种隐喻变体,研究隐喻与隐喻融合的机制,实验表明融合数据能提升隐喻和隐喻分类性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18361 2026-04-21 cs.CL 70%

Synthetic Data Generation for Training Diversified Commonsense Reasoning Models

为训练多样化常识推理模型生成合成数据

Tianhui Zhang, Bei Peng, Danushka Bollegala

机构 * University of Liverpool(利物浦大学) University of Sheffield(谢菲尔德大学) Amazon(亚马逊)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出两阶段方法生成首个合成数据集CommonSyn,提升生成多样性和质量,适用于不同规模的大语言模型。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14459 2026-04-17 cs.CL 70%

Filling in the Mechanisms: How do LMs Learn Filler-Gap Dependencies under Developmental Constraints?

填补机制:语言模型如何在发育约束下学习填充-缺口依赖?

Atrey Desai, Sathvik Nair

机构 * University of Maryland(马里兰大学)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 研究通过DAS分析语言模型在不同数据量下的填充-缺口依赖表示,发现有限数据下存在共享但敏感的机制,但语言模型仍需更多数据才能达到人类水平,凸显语言特异性偏见的重要性。

Comments To be published in the 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13313 2026-04-16 cs.LG 70%

Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding

具体丛林:迈向由具体性铺就的对比负样本挖掘以实现组合理解

Eun Woo Im, Dhruv Madhwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出ConcretePlant,通过增强具体性术语的修改来提升对比学习信号,解决负样本生成中的梯度失衡问题,提出Cement损失函数以动态校准惩罚,实现更有效的组合理解。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08639 2026-04-16 cs.CV cs.AI 70%

UNBOX: Unveiling Black-box visual models with Natural-language

UNBOX:通过自然语言揭示黑盒视觉模型

Simone Carnemolla, Chiara Russo, Simone Palazzo, Quentin Bouniot, Daniela Giordano, Zeynep Akata, Matteo Pennisi, Concetto Spampinato

机构 * University of Catania(卡塔尼亚大学) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(海德堡-慕尼黑马克斯·普朗克研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UNBOX在无数据、无梯度、无反向传播约束下,利用大语言模型和扩散模型生成可解释文本描述,揭示模型隐含概念与潜在偏见,通过实验验证其在ImageNet-1K等数据集上的有效性。

Comments Under review at IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11329 2026-04-16 cs.CL 70%

F-Actor: Controllable Conversational Behaviour in Full-Duplex Models

F-Actor:全双工模型中的可控对话行为

Maike Züfle, Ondrej Klejch, Nicholas Sanders, Jan Niehues, Alexandra Birch, Tsz Kin Lam

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Edinburgh(爱丁堡大学) NatWest(国立西敏银行)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出首个可训练的全双工对话语音模型,通过冻结音频编码器仅微调语言模型,在有限资源下实现高效训练,支持通过指令控制说话声音、话题和对话行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-04-15 cs.CV cs.LG 70%

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 8 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23964 2026-04-14 cs.AI 70%

From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments

从像素到数字代理:关于强化学习环境分类和技术趋势的实证研究

Lijing Luo, Yiben Luo, Alexey Gorbatovski, Sergey Kovalchuk, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Yancheng Institute of Technology(盐城工学院) Central University Moscow(莫斯科中央大学) ITMO University(ITMO大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过大规模数据分析,研究强化学习环境从物理模拟到通用代理的演变,揭示领域分为语义优先和领域特定泛化两大生态,并提出设计下一代具身语义模拟器的路线图。

Comments 32 pages main text, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09270 2026-04-14 cs.CL 70%

MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus

MCGA:多任务古典中文文学体裁音频语料库

Yexing Du, Kaiyuan Liu, Bihe Zhang, Youcheng Pan, Bo Yang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Daojing He, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Du xiaoman(杜小满)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MCGA语料库,包含22000个音频样本,涵盖六个任务:ASR、S2TT、SEC、SQA、SU和SR,评估十种MLLM发现其在MCGA测试集上仍面临显著挑战,并引入领域特定的SEC指标和语音与文本一致性度量。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10391 2026-04-14 cs.CV cs.AI 70%

FishRoPE: Projective Rotary Position Embeddings for Omnidirectional Visual Perception

FishRoPE: 用于全方位视觉感知的投影旋转位置嵌入

Rahul Ahuja, Mudit Jain, Bala Murali Manoghar Sai Sudhakar, Venkatraman Narayanan, Pratik Likhar, Varun Ravi Kumar, Senthil Yogamani

机构 * Automated Driving, Qualcomm Technologies, Inc(高通技术公司自动驾驶部门) Automated Driving, Qualcomm India Private Limited(高通印度私人有限公司自动驾驶部门)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出FishRoPE,通过轻量框架将冻结的视觉基础模型适配到鱼眼几何,利用旋转位置嵌入重新参数化注意力机制,实现角分离而非像素距离的处理,提升全方位视觉感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10021 2026-04-14 cs.SD cs.LG 70%

Masked Contrastive Pre-Training Improves Music Audio Key Detection

掩码对比预训练改进音乐音频键检测

Ori Yonay, Tracy Hammond, Tianbao Yang

机构 * Department of Computer Science Engineering, Texas A\&M University

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文通过掩码对比预训练提升音乐音频键检测性能,发现其能有效增强音高敏感性,并在监督学习中实现SOTA表现。

Comments Code and models available at github.com/echo-cipher/keymyna

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09089 2026-04-13 cs.SE cs.AI cs.CR 70%

DeepGuard: Secure Code Generation via Multi-Layer Semantic Aggregation

DeepGuard:通过多层语义聚合实现安全代码生成

Li Huang, Zhongxin Liu, Yifan Wu, Tao Yin, Dong Li, Jichao Bi, Nankun Mu, Hongyu Zhang, Meng Yan

机构 * Chongqing University(重庆大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全全国重点实验室,浙江大学) Peking University(北京大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepGuard通过多层语义聚合提升代码生成的安全性,实验表明其在安全性和功能性上均优于基线模型,有效检测并减少不安全模式。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 70%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12686 2026-04-13 cs.CL 70%

Exploring Cross-lingual Latent Transplantation: Mutual Opportunities and Open Challenges

探索跨语言潜在移植:相互机会与开放挑战

Yangfan Ye, Xiaocheng Feng, Xiachong Feng, Libo Qin, Yichong Huang, Lei Huang, Weitao Ma, Qichen Hong, Zhirui Zhang, Yunfei Lu, Xiaohui Yan, Duyu Tang, Dandan Tu, Bing Qin

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出跨语言潜在移植框架,探讨其对多语言能力和文化适应性的双向影响,揭示注意力模块与前馈模块在多语言理解中的作用,发现当前LLM多语言潜力的严重未利用问题。

Comments IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08156 2026-04-10 cs.CL 70%

Training Data Size Sensitivity in Unsupervised Rhyme Recognition

无监督押韵识别中的训练数据敏感性

Petr Plecháč, Artjoms Šeļa, Silvie Cinková, Mirella De Sisto, Lara Nugues, Neža Kočnik, Antonina Martynenko, Ben Nagy, Luca Giovannini, Robert Kolár

机构 * Institute of Czech Literature, Czech Academy of Sciences(捷克科学院捷克文学研究所) University of Tartu(塔尔图大学) Charles University(查理大学) Tilburg University(蒂尔堡大学) University of Basel(巴塞尔大学) University of Ljubljana(卢布尔雅那大学) Institute of Polish Language, Polish Academy of Sciences(波兰科学院波兰语言研究所) University of Potsdam(波茨坦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了RhymeTagger在不同语言中识别押韵所需训练数据量,分析了语言差异和训练规模对准确率的影响,并对比了大型语言模型在缺乏音系表示时的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08124 2026-04-10 cs.AI 70%

Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search

超越随机探索:训练数据为何对代理搜索有价值

Chuzhan Hao, Wenfeng Feng, Guochao Jiang, Guofeng Quan, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里云)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Hierarchical Experience框架,通过对比分析和多级聚类机制将原始推理轨迹转化为层次经验知识,提升搜索代理的性能和训练稳定性,实现更高效的策略驱动搜索。

Comments 15 pages, ACL2026 Findings Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏