Improving Conversational Recommendation System by Pretraining on Billions Scale of Knowledge Graph
专题命中 预训练与数据 :pretraining(title);分类 cs.AI
Comments Paper is accepted by ICDE2021 industry track
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :pretraining(title);分类 cs.AI
Comments Paper is accepted by ICDE2021 industry track
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments 10 pages, 5 figures
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments INTERSPEECH 2021 (under reviewed)
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
专题命中 预训练与数据 :pretraining(title);分类 cs.AI
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments 10 pages, 3 figures
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments Accepted in Empirical Methods in Natural Language Processing (EMNLP), 2020
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments 7 pages
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments To Appear at CogSci 2020
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments 5 pages
专题命中 预训练与数据 :pretraining(title);分类 cs.LG
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments 7 pages, 6 figures
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments Accepted for presentation at EMNLP-IJCNLP 2019
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments 11 pages, 5 figures
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments submitted to ICASSP2019
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
Comments This manuscript dates from late Winter 2016
专题命中 预训练与数据 :pretraining(title);分类 cs.CL
专题命中 预训练与数据 :language model(title);分类 cs.CL
Comments 6 pages
无域内训练数据的跨域多任务数据到文本生成
机构 * CNRS/LORIA(法国国家科学研究中心/洛林计算机科学与应用实验室) ; Université de Lorraine(洛林大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出数据驱动知识蒸馏(DDKD)及保结构增强方法,在无域内训练数据的跨域多任务数据到文本生成任务中,17亿参数的DDKD性能优于零样本推理与微调,且构建了QUINTD-5数据集。
Comments Accepted by EMNLP Findings 2026
Real-TurnTurk:用于话轮转换预测的多模态土耳其语语料库
机构 * Data Science and Innovation Ata Technology Platforms(阿塔技术平台数据科学与创新部) ; Digital Operations and Data(数字运营与数据部)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究构建多模态土耳其语对话数据集,采用遗传算法优化规则,实现话轮转换预测,填补土耳其语相关自然对话语料库的空白。
Comments Accepted to INTCEC 2026. This is the author's pre-print version. The final authenticated version will be available through the conference proceedings
从关联到因果:通过因果关系与注意力机制提升检索增强生成的检索精度
机构 * Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对RAG检索阶段仅捕捉关联关系的问题,通过建模检索过程的因果结构,提出一种无需训练的注意力式重评分规则,在企业知识库和关键词堆砌语料库上显著提升了检索精度。
Comments 16 pages, 2 figures, 4 tables, 1 algorithm. Code available at https://github.com/Silk-Road/causal-rag-rerank
PatientAct:基于理论的心理健康来访者模拟
机构 * Tsinghua University(清华大学) ; Beijing Normal University(北京师范大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 PatientAct是基于临床理论的来访者模拟框架,通过整合5Ps临床案例 formulation与带信任阈值的动态记忆层,生成高临床合理性的多样化来访者,在40种临床情境中较基线方法显著提升了抗拒质量与行为真实性。
Comments EMNLP 2026 Findings
EnSI-RAG:面向长文档问答的实体结构索引增强检索生成框架
专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对长文档问答的RAG方法缺陷,提出EnSI-RAG框架,构建以实体为中心的索引,在Loong和Oolong数据集上平均准确率达78.24,较基准提升6.62个百分点,验证了其有效性。
Comments 21 pages, preprint
通过任务可交换性实现基于合成数据的有效推断
机构 * Department of Management Science & Engineering(管理科学与工程系) ; Department of Statistics(统计学系)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出任务可交换性条件,确保在科学研究中使用合成数据进行统计推断的有效性,并给出在民意调查和AI评估中的应用。
识别论证图逻辑重构的隐含前提
机构 * University College London(伦敦大学学院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文针对论证图逻辑重构中省略式论证的隐含前提问题,提出神经符号管道方法,结合大型语言模型生成隐含前提并评估,用于证明陈述间的逻辑关系。
Comments Accepted at the 11th International Conference on Computational Models of Argument (COMMA 2026)
TokEval:一个分词器评估套件
机构 * EPFL(洛桑联邦理工学院)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。
Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals
LENS:基于动态原始文档的潜在证据探索的上下文内搜索
专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对动态原始文档的上下文内搜索问题,提出无索引框架LENS,通过迭代选择候选证据并更新置信度实现预算约束下的证据定位,在多组实验中其证据召回率和答案依据表现优于基线方法。