FH-SWF SG at GermEval 2021: Using Transformer-Based Language Models to Identify Toxic, Engaging, & Fact-Claiming Comments
专题命中 预训练与数据 :language model(title);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
专题命中 预训练与数据 :language model(title);分类 cs.CL
Journal ref Lakretz et al. (2021), Cognition
专题命中 预训练与数据 :pretraining(title);分类 cs.AI
Comments Paper is accepted by ICDE2021 industry track
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments 10 pages, 5 figures
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments INTERSPEECH 2021 (under reviewed)
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
专题命中 预训练与数据 :pretraining(title);分类 cs.AI
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments 10 pages, 3 figures
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments Accepted in Empirical Methods in Natural Language Processing (EMNLP), 2020
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments 7 pages
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments To Appear at CogSci 2020
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments 5 pages
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments 7 pages, 6 figures
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments Accepted for presentation at EMNLP-IJCNLP 2019
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments 11 pages, 5 figures
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments submitted to ICASSP2019
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments This manuscript dates from late Winter 2016
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments 6 pages
用于协调异构语音和文本检索器的重排序器
机构 * Korea Institute of Energy Technology(韩国能源技术研究院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对多模态RAG数据库场景,提出STeReO重排序器,构建专用数据集训练后,可有效聚合异构检索结果,显著提升下游问答性能。
Comments Accepted to Interspeech 2026
从声音到症状:面向对话式医疗智能体的实时呼吸信号理解
机构 * Hippocratic AI(希波克拉底人工智能公司)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出面向对话式医疗智能体的HealthCUES系统,可实时检测分析咳嗽等呼吸信号,经内部与外部数据集评估及医疗人员验证,性能优异且具临床实用性。
Comments Accepted for publication at SIGDIAL 2026
TokEval:一个分词器评估套件
机构 * EPFL(洛桑联邦理工学院)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。
Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals
iFlip: 迭代反馈驱动的反事实示例精炼
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。
Comments Camera-ready version accepted to EMNLP 2026 Findings
无域内训练数据的跨域多任务数据到文本生成
机构 * CNRS/LORIA(法国国家科学研究中心/洛林计算机科学与应用实验室) ; Université de Lorraine(洛林大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出数据驱动知识蒸馏(DDKD)及保结构增强方法,在无域内训练数据的跨域多任务数据到文本生成任务中,17亿参数的DDKD性能优于零样本推理与微调,且构建了QUINTD-5数据集。
Comments Accepted by EMNLP Findings 2026