arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Computational Linguistics · 会议 · Natural Language Processing

至 收录 1754
2608.04670 2026-08-06 cs.CL cs.AI 新提交

Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

易完成,难选择:探究大型语言模型在ProverbIT基准上的性能

Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni

AI总结 该研究构建了意大利谚语基准ProverbIT,评估13个前沿LLMs的谚语处理能力,发现LLMs虽能完成谚语任务,但在无正确答案的选择题中性能骤降,暴露其依赖记忆而非深层语义理解的局限。

Journal ref Proceedings of the Eleventh Italian Conference on Computational Linguistics (CLiC-it 2025), pages 722-734

URL PDF HTML 收藏
2606.28867 2026-06-30 cs.CL

Open but Incompatible: A License Compatibility Analysis of Corpora for Low-Resource African Languages

开放但不兼容:低资源非洲语言语料库的许可证兼容性分析

Ernst van Gassen

机构 * Arktos AI Lab(阿克托斯人工智能实验室) Netherlands(荷兰)

AI总结 本文审计了非洲NLP中20多个语料库家族的许可证来源,构建六层兼容性矩阵,通过三个案例语言揭示四种许可证失败模式,并提出预标注尽职调查清单。

Comments 12 pages. Published in Proceedings of Resources for African Indigenous Languages (RAIL) 2026 @ LREC-COLING 2026, pages 128-139

Journal ref Proceedings of Resources for African Indigenous Languages (RAIL) 2026, pages 128-139. ELRA, 2026

URL PDF HTML 收藏
2406.03221 2026-06-15 cs.CL cs.IR

Linking Named Entities in Diderot's Encyclopédie to Wikidata

将狄德罗《百科全书》中的命名实体链接到Wikidata

Pierre Nugues

机构 * Université de Lausanne(洛桑大学)

AI总结 本文通过将《百科全书》中的10300多个条目与Wikidata标识符链接,实现了知识图谱的连接,展示了地理和人文实体的标注方法与应用实例。

Comments 6 pages, 3 figures

Journal ref Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024), pp. 10610--10615

URL PDF HTML 收藏
2402.14521 2026-06-02 cs.CL

Malaysian English News Decoded: A Linguistic Resource for Named Entity and Relation Extraction

马来西亚英语新闻解码:用于命名实体和关系抽取的语言资源

Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

AI总结 针对马来西亚英语与标准英语的差异导致NLP任务困难的问题,构建了包含200篇新闻的MEN数据集,手动标注实体和关系,并通过微调spaCy NER工具验证了定制数据集能显著提升NER性能。

Comments Accepted at LREC-COLING 2024

URL PDF HTML 收藏
2603.05450 2026-05-26 cs.AI cs.CL

Distributed Partial Information Puzzles: Examining Common Ground Construction Under Epistemic Asymmetry

分布式部分信息谜题:在认知不对称下检验共同基础的构建

Yifan Zhu, Mariah Bradford, Kenneth Lai, Timothy Obiso, Videep Venkatesha, James Pustejovsky, Nikhil Krishnaswamy

机构 * Brandeis University(布兰迪斯大学) Colorado State University(科罗拉多州立大学)

AI总结 提出分布式部分信息谜题(DPIP)任务,收集多模态数据集,并评估大语言模型与动态认知逻辑方法在追踪信念状态和共同基础构建上的表现。

Comments 10 pages, 4 figures

Journal ref Proceedings of COLING-LREC 2026

URL PDF HTML 收藏
2605.10241 2026-05-12 cs.CL cs.LG

Building Korean linguistic resource for NLU data generation of banking app CS dialog system

构建韩语语言资源用于银行应用程序CS对话系统NLU数据生成

Jeongwoo Yoon, On-yu Park, Changhoe Hwang, Gwanghoon Yoo, Eric Laporte, Jeesun Nam

机构 * DICORA, Hankuk University of Foreign Studies(DICORA,韩国外国语大学) Université Gustave Eiffel(古斯塔夫·伊费尔大学)

AI总结 本文构建了FIAD语言资源,用于生成韩语NLU任务导向对话系统的数据,通过分析银行应用评论识别出三种韩语请求语句模式,并用LGGs生成标注数据以提升意图和实体识别性能。

Journal ref 29th International Conference on Computational Linguistics (COLING), Workshop on Pattern-based Approaches to NLP in the Age of Deep Learning (Pan-DL), Oct 2022, Gyeongju, South Korea, pp.29-37

URL PDF HTML 收藏
2605.07446 2026-05-11 cs.CL cs.LG

SSP-based construction of evaluation-annotated data for fine-grained aspect-based sentiment analysis

基于SSP的评价标注数据构建用于细粒度方面基于情感分析

Suwon Choi, Shinwoo Kim, Changhoe Hwang, Gwanghoon Yoo, Eric Laporte, Jeesun Nam

机构 * DICORA, Hankuk University of Foreign Studies(DICORA,韩国外国语大学) DICORA, Hankuk University of LIGM, Université Gustave Eiffel(DICORA,韩国立国民大学,古斯塔夫·埃菲尔大学) Hankuk University of Foreign Studies(韩国外国语大学)

AI总结 本文提出构建韩语评价标注语料库EVAD,并用于扩展的方面基于情感分析,通过半自动符号传播方法标注电商评论,提升情感识别性能。

Journal ref 29th International Conference on Computational Linguistics (COLING). Workshop on Pattern-based Approaches to NLP in the Age of Deep Learning (Pan-DL), Oct 2022, Gyeongju, South Korea, pp.38-44

URL PDF HTML 收藏
2605.06426 2026-05-08 cs.CL

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

从1.24亿个词到1021个新词:自动新词检测的大规模流水线

Diego Rossini, Lonneke van der Plas

机构 * Università della Svizzera italiana(瑞士意大利大学)

AI总结 本文提出一个可扩展的模块化流水线,结合规则过滤与LLM分类,通过语法和非语法形态学框架提取1021个新词候选,验证其有效性。

Comments 14 pages, 5 tables. Accepted at NeoLLM 2026 Workshop, co-located with LREC-COLING 2026

URL PDF HTML 收藏
2011.02121 2026-04-29 cs.CL

PheMT: A Phenomenon-wise Dataset for Machine Translation Robustness on User-Generated Contents

PheMT:一种用于用户生成内容机器翻译鲁棒性的现象性数据集

Ryo Fujii, Masato Mita, Kaori Abe, Kazuaki Hanawa, Makoto Morishita, Jun Suzuki, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(日本科学技术研究所) NTT Communication Science Laboratories(NTT通信科学实验室)

AI总结 本文提出PheMT数据集,用于评估机器翻译系统在日英翻译中对特定语言现象的鲁棒性,实验表明现有模型和商用系统均受特定现象影响。

Comments 15 pages, 4 figures, accepted at COLING 2020

Journal ref Proceedings of the 28th International Conference on Computational Linguistics, pages 5929-5943, 2020

URL PDF HTML 收藏
2604.20560 2026-04-23 cs.CL

LLM StructCore: Schema-Guided Reasoning Condensation and Deterministic Compilation

LLM StructCore: 基于模式的推理压缩与确定性编译

Serhii Zabolotnii

机构 * Cherkasy State Business College(切尔卡西州商业学院)

AI总结 本文提出LLM StructCore,通过基于模式的推理压缩和确定性编译,解决临床笔记中填写病例报告表的挑战,采用合同驱动的两阶段设计,提升准确率与稳定性。

Comments 16 pages, 1 figure, 5 tables. Preprint of a paper accepted to the Third Workshop on Patient-oriented Language Processing (CL4Health), co-located with LREC-COLING 2026

URL PDF HTML 收藏
2604.19584 2026-04-22 cs.CL

A Bolu: A Structured Dataset for the Computational Analysis of Sardinian Improvisational Poetry

A Bolu:一种用于撒丁语即兴诗歌计算分析的结构化数据集

Silvio Calderaro, Johanna Monti

机构 * Università di Pisa, Italia(意大利比萨大学) Università di Napoli L'Orientale, Italia(意大利那不勒斯东方大学)

AI总结 本文介绍了A Bolu数据集,用于分析撒丁语即兴诗歌的结构,通过统计分析和计算语言学技术揭示了即兴诗歌创作中的规律,为NLP工具的包容性发展提供支持。

Comments Accepted at the DIALRES Workshop, LREC-COLING 2026

URL PDF HTML 收藏
2604.12477 2026-04-15 cs.CL cs.AI

Mining Large Language Models for Low-Resource Language Data: Comparing Elicitation Strategies for Hausa and Fongbe

从大型语言模型中挖掘低资源语言数据:比较Hausa和Fongbe的引导策略

Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) Centre for Text Technology(文本技术中心) North-West University(北开普大学) South Africa(南非)

AI总结 本文研究通过策略性提示从LLM中提取可用于Hausa和Fongbe两种西非语言的文本数据,发现Hausa需功能性文本和对话,而Fongbe需受限生成提示,GPT-4o Mini在提取目标语言词汇上表现更优。

Comments 11 pages, 5 figures, 6 tables; to appear in LREC-COLING 2026

URL PDF HTML 收藏
2410.15825 2026-03-20 cs.CL

Did somebody say "Gest-IT"? A pilot exploration of multimodal data management

有人提到“Gest-IT”吗?多模态数据管理的初步探索

Ludovica Pannitto, Lorenzo Albanesi, Laura Marion, Federica Maria Martines, Carmelo Caruso, Claudia S. Bianchini, Francesca Masini, Caterina Mauri

机构 * Alma Mater Studiorum - University of Bologna(博洛尼亚大学) University of Poitiers, FoReLLIS Laboratory(波尔多大学FoReLLIS实验室)

AI总结 本文探讨了多模态语料库的构建、管理和分析,通过三层标注方法研究视障人士与正常人对话中的手势变化。

Journal ref Proceedings of the Tenth Italian Conference on Computational Linguistics (CLiC-it 2024)

URL PDF HTML 收藏
2409.11148 2026-03-10 cs.CL cs.AI

Improving the Efficiency of Visually Augmented Language Models

提升视觉增强语言模型的效率

Paula Ontalvilla, Aitor Ormazabal, Gorka Azkune

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心 - Ixa,巴斯克大学)

AI总结 本文提出BLIND-VALM模型,通过使用CLIP获取的视觉 grounding 文本表示,提升视觉增强语言模型的效率和性能。

Comments COLING 2025

URL PDF HTML 收藏
2601.22439 2026-02-02 cs.CL

Stop Jostling: Adaptive Negative Sampling Reduces the Marginalization of Low-Resource Language Tokens by Cross-Entropy Loss

停止推搡:自适应负采样减少交叉熵损失对低资源语言标记的边缘化

Galim Turumtaev

AI总结 本文提出自适应负采样技术,通过减少交叉熵损失对低资源语言标记的边缘化影响,提升模型对低资源语言的表示能力。

Comments Accepted at LoResLM 2025 (COLING 2025 workshop). Oral presentation

Journal ref In Proceedings of the First Workshop on Language Models for Low-Resource Languages (LoResLM 2025), pages 373-386, Abu Dhabi, United Arab Emirates. Association for Computational Linguistics

URL PDF HTML 收藏
2509.23311 2026-01-15 cs.CV cs.AI cs.CL

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

URL PDF HTML 收藏
2601.05548 2026-01-12 cs.CL

Generation-Based and Emotion-Reflected Memory Update: Creating the KEEM Dataset for Better Long-Term Conversation

基于生成和情感反映的记忆更新:创建KEEM数据集以改善长期对话

Jeonghyun Kang, Hongjin Kim, Harksoo Kim

机构 * Konkuk University(韩国庆熙大学)

AI总结 KEEM数据集通过动态生成整合性记忆,结合情感和关键信息,提升长期对话系统对用户状态的理解与回应能力。

Comments COLING 2025 accepted paper (Main)

URL PDF HTML 收藏
2601.05545 2026-01-12 cs.CL

Can Large Language Models Differentiate Harmful from Argumentative Essays? Steps Toward Ethical Essay Scoring

大型语言模型能否区分有害与论辩性文章?迈向道德文章评分的步骤

Hongjin Kim, Jeonghyun Kang, Harksoo Kim

机构 * Konkuk University(韩国康 kuk 大学)

AI总结 本研究提出HED基准,揭示LLMs在识别有害文章方面的能力不足,并强调需开发更注重伦理因素的AES系统。

Comments COLING 2025 accepted paper (Main)

URL PDF HTML 收藏
2512.13552 2026-01-09 cs.CL

PrahokBART: A Pre-trained Sequence-to-Sequence Model for Khmer Natural Language Generation

PrahokBART:一种用于柬埔寨自然语言生成的预训练序列到序列模型

Hour Kaing, Raj Dabre, Haiyue Song, Van-Hien Tran, Hideki Tanaka, Masao Utiyama

机构 * National Institute of Information and Communications Technology(日本信息与通信技术国家研究所)

AI总结 PrahokBART是一种针对柬埔寨语言优化的预训练模型,通过改进语料库质量和引入语言组件,在机器翻译、文本摘要和标题生成任务中超越了现有多语言模型。

Comments Published at COLING 2025, 14 pages

Journal ref https://aclanthology.org/2025.coling-main.87

URL PDF HTML 收藏
2403.20145 2025-12-12 cs.CL

Leveraging language models for summarizing mental state examinations: A comprehensive evaluation and dataset release

利用语言模型进行精神状态检查的摘要:全面评估和数据集发布

Nilesh Kumar Sahu, Manjeet Yadav, Mudita Chaturvedi, Snehil Gupta, Haroon R Lone

机构 * IISER Bhopal India(比哈尔印度IISER)

AI总结 本研究利用语言模型对MSE进行摘要生成,通过开发问卷和收集数据,评估多种模型性能,最终发布数据集和模型供心理健康研究使用。

Comments Appeared in: Proceedings of the 31st International Conference on Computational Linguistics (COLING 2025), Abu Dhabi, UAE. ACL Anthology ID: 2025.coling-main.182. (https://aclanthology.org/2025.coling-main.182/)

URL PDF HTML 收藏
2501.02584 2025-11-21 cs.CV cs.AI cs.CL cs.LG

Efficient Architectures for High Resolution Vision-Language Models

高效高分辨率视觉-语言模型架构

Miguel Carvalho, Bruno Martins

机构 * INESC-ID and Instituto Superior Técnico, University of Lisbon(INESC-ID 和 里斯本大学技术学院)

AI总结 Pheye是一种高效处理高分辨率图像的视觉-语言模型架构,通过减少参数数量实现高效率和强性能,尤其在细粒度图像理解和场景文本处理任务中表现突出。

Comments Accepted at COLING 2025

URL PDF HTML 收藏
2406.15862 2025-11-13 cs.CL

Speech Analysis of Language Varieties in Italy

Moreno La Quatra, Alkis Koudounas, Elena Baralis, Sabato Marco Siniscalchi

Comments Accepted to LREC-COLING 2024 - https://aclanthology.org/2024.lrec-main.1317/

Journal ref Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024), pages 15147-15159, Torino, Italy, May 2024

URL PDF HTML 收藏
2505.17330 2025-11-13 cs.CV cs.AI cs.CL cs.IR cs.LG

FS-DAG: Few Shot Domain Adapting Graph Networks for Visually Rich Document Understanding

Amit Agarwal, Srikant Panda, Kulbhushan Pachauri

机构 * OCI, Oracle USA(Oracle USA)

Comments Proceedings of the 31st International Conference on Computational Linguistics (COLING 2025), Industry Track, pages 100-114

URL PDF HTML 收藏
2511.06860 2025-11-11 cs.CL cs.SD

CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition

Hung-Yang Sung, Chien-Chun Wang, Kuan-Tang Huang, Tien-Hong Lo, Yu-Sheng Tsao, Yung-Chang Hsu, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学) EZAI

Comments Accepted for an oral presentation at the 37th Conference on Computational Linguistics and Speech Processing (ROCLING 2025)

URL PDF HTML 收藏
2405.05583 2025-10-30 cs.CL

OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs

Yuxia Wang, Minghan Wang, Hasan Iqbal, Georgi Georgiev, Jiahui Geng, Preslav Nakov

机构 * MBZUAI Monash University(墨尔本大学) Sofia University(索菲亚大学)

Comments 23 pages, 8 tables, 11 figures, Published In Proceedings of the 31st International Conference on Computational Linguistics 2025

Journal ref In Proceedings of the 31st International Conference on Computational Linguistics 2025, pages 11399-11421, Abu Dhabi, UAE. Association for Computational Linguistics

URL PDF HTML 收藏
2510.18468 2025-10-22 cs.CL

IMB: An Italian Medical Benchmark for Question Answering

Antonio Romano, Giuseppe Riccio, Mariano Barone, Marco Postiglione, Vincenzo Moscato

机构 * University of Naples Federico II, Department of Electrical Engineering(那不勒斯费德里科二世大学电子工程系) Consorzio Interuniversitario Nazionale per l'Informatica (CINI) - ITEM National Lab(国家信息计算联合研究中心(CINI)- ITEM国家实验室) Northwestern University, Department of Computer Science, McCormick School of Engineering(西北大学计算机科学系,工程学院)

Journal ref CLIC-it 2025: Eleventh Italian Conference on Computational Linguistics, Cagliari, Italy, September 24-26, 2025

URL PDF HTML 收藏
2411.14398 2025-10-20 cs.CL

Lightweight Safety Guardrails Using Fine-tuned BERT Embeddings

Aaron Zheng, Mansi Rana, Andreas Stolcke

机构 * Uniphore & UC Berkeley(Uniphore与伯克利大学)

Comments To appear in Proceedings of COLING 2025

Journal ref Proc. 31st Intl. Conf. Computational Linguistics: Industry Track, COLING 2025, pp. 689-696

URL PDF HTML 收藏
2510.13395 2025-10-16 cs.CL

Doing Things with Words: Rethinking Theory of Mind Simulation in Large Language Models

Agnese Lombardi, Alessandro Lenci

机构 * CoLing Lab, Department of Philology, Literature and Linguistics, University of Pisa(帕尔马大学哲学、文学与语言学系语言实验室)

Journal ref roceedings of the Eleventh Italian Conference on Computational Linguistics (CLiC-it 2025)

URL PDF HTML 收藏
2508.16303 2025-08-25 cs.CL

JaParaPat: A Large-Scale Japanese-English Parallel Patent Application Corpus

Masaaki Nagata, Katsuki Chousa, Norihito Yasuda

Comments LREC-COLING 2024

URL PDF HTML 收藏
2508.08125 2025-08-12 cs.CL

Czech Dataset for Complex Aspect-Based Sentiment Analysis Tasks

Jakub Šmíd, Pavel Přibáň, Ondřej Pražák, Pavel Král

机构 * University of West Bohemia, Faculty of Applied Sciences, Department of Computer Science(西波西米亚大学应用科学学院计算机科学系)

Comments Published In Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024). Official version: https://aclanthology.org/2024.lrec-main.374/

URL PDF HTML 收藏